awesomedata/awesome-public-datasets · 上手攻略

  • 仓库:awesomedata/awesome-public-datasets
  • 链接:https://github.com/awesomedata/awesome-public-datasets
  • 分类:skill
  • 作者:Jay
  • 更新:2026-07-09

是什么

awesome-public-datasets 是 GitHub 上规模最大、分类最齐全的高质量公开数据集精选列表。它以主题(Topic)为导向,将来自政府、科研机构、高校、企业的公开数据按领域逐一整理,涵盖农业、生物学、化学、气候、经济、教育、能源、地理信息、政府数据、医疗健康、图像处理、机器学习、自然语言、神经科学、物理、公共领域、社交网络、体育、交通等 30+ 细分领域,目前收录数据集数量在 500+ 以上。

该仓库最初由上海交通大学 OMNILab(现属 BaiYuLan 开源 AI 社区)在陈夏明博士研究期间孵化,至今仍在维护,已积累 76,741 Stars,是数据科学、机器学习、学术研究必备的导航型资源。

⚠️ 注意:README 本身是 .rst(reStructuredText)格式,仓库由 apd-core 自动生成,直接编辑 README 的方式已被废弃,最新贡献需通过 apd-core 的 YAML 文件提交。

解决什么问题

找数据集是数据科学和 AI 项目最常见的痛点之一。Google 一搜一堆,但质量参差不齐,很多链接早已失效。awesome-public-datasets 解决了这个信息筛选问题:

  • 权威来源聚合:每个数据集都标注了原始发布机构(USDA、NCBI、ENCODE、NOAA 等),无需逐一溯源
  • 主题分类导航:按研究领域组织,定位效率远高于关键词搜索
  • 质量信号明确:每个数据集旁标注 ✅(维护正常)或 ⚠️(待修复),帮助快速排除失效资源
  • 学术与产业双覆盖:既有 UCI 经典数据集,也有最新政府开放数据、卫星遥感、基因组等前沿数据源

快速安装

本仓库不需要安装——它是纯导航型仓库,数据集本身不存储在仓库内。

# 直接在 GitHub 阅读(推荐,无需 clone)
# https://github.com/awesomedata/awesome-public-datasets

# 如需本地全文检索,可 clone 后搜索
git clone https://github.com/awesomedata/awesome-public-datasets.git
cd awesome-public-datasets
grep -r "Machine Learning" README.rst   # 按关键词找数据集

核心用法

按主题浏览(GitHub 网页)

  1. 打开 https://github.com/awesomedata/awesome-public-datasets
  2. 向下滚动查看 Table of Contents,点击任意主题(如 NaturalLanguageMachineLearning
  3. 每个条目格式为:[数据集名称](原始链接) [Meta]
  4. 点击 Meta 链接可查看 YAML 元数据文件

查找特定领域数据集

以下是各分类中的代表性数据集(按 Stars/影响力筛选):

分类 代表数据集 链接 备注
Biology 1000 Genomes https://www.internationalgenome.org/data 全球最大基因组计划
Biology ENCODE Project https://www.encodeproject.org DNA 元件百科全书
Biology TCGA (The Cancer Genome Atlas) https://gdc.cancer.gov/access-data/gdc-data-portal 癌症基因组参考
MachineLearning UCI Machine Learning Repository http://archive.ics.uci.edu/ml/ 经典 ML 数据集集
Climate+Weather NOAA Climate Data https://www.ncdc.noaa.gov/ 美国国家气候数据中心
NaturalLanguage IMDb Movie Reviews https://ai.stanford.edu/~amaas/data/sentiment/ 情感分析经典
Finance Lending Club Loan Data https://www.lendingclub.com/info/download-data.action P2P 贷款数据
Government US Government Open Data https://www.data.gov/ 美国政府开放数据平台
Agriculture USDA FoodData Central https://fdc.nal.usda.gov/download-dataset 食品营养成分数据库
Transportation NYC Taxi Trip Data https://www.nyc.gov/site/tlc/about/tlc-trip-record-data.page 纽约出租车数据

通过 apd-core 贡献新数据集

# 1. Clone apd-core 仓库
git clone https://github.com/awesomedata/apd-core.git
cd apd-core/core

# 2. 在对应分类目录下创建 YAML 文件
# 例如添加一个新的生物学数据集:
# core/Biology/My-Dataset.yml

# 3. YAML 格式参考现有文件,包含:
# title: 数据集名称
# url: 原始数据链接
# description: 简短描述
# 提交 PR 到 apd-core

数据下载示例(Python)

import pandas as pd

# 示例:加载 UCI Iris 数据集(经典 ML 数据集)
iris = pd.read_csv(
    "https://raw.githubusercontent.com/uiuc-cse/data-fa14/gh-pages/data/iris.csv"
)
print(iris.head())

# 示例:USDA FoodData Central(需申请 API Key)
# https://fdc.nal.usda.gov/api-guide.html
import requests
API_KEY = "YOUR_API_KEY"
url = f"https://api.nal.usda.gov/fdc/v1/foods/search?api_key={API_KEY}&query=apple"
response = requests.get(url).json()
print(response['foods'][0])

典型适用场景

  • 学术研究开题:快速调研某个领域有哪些公开数据集可用来验证假设
  • 机器学习练手:找到可直接下载的训练/测试数据集,无需自己爬取
  • 数据可视化项目:通过政府/气象/交通等开放数据做 Dashboard 或报道
  • AI 产品 PoC:RAG、知识库构建需要高质量领域数据,先来这里找语料
  • Kaggle 参赛:该列表也是 Kaggle 竞赛数据集的良好补充,覆盖 Kaggle 未收录的垂直领域

坑与注意

  1. ⚠️ 部分数据集链接已失效:标注 ⚠️(FIXME_ICON)的数据集链接可能需要到原始网站重新搜索。建议直接访问数据提供方的官网确认最新 URL。

  2. 数据许可证各不相同:列表中既有完全 CC0 公共领域数据,也有仅供研究使用或需要申请的数据。使用前务必阅读原始数据许可协议,不要默认所有数据都可以商用。

  3. README 是 .rst 格式:在 GitHub 上渲染可能不如 .md 流畅。本地阅读建议用 VS Code + reStructuredText 插件,或直接 clone 后用 Markdown 阅读器浏览。

  4. 数据集需要自行下载:仓库本身不托管数据,只提供链接。需要自己处理下载、解析和存储。

  5. 部分数据集需要申请/注册:高端数据(如基因组数据、部分政府数据)需要填表审批,访问不是即时的。

  6. 数据更新频率不一:学术数据集通常稳定,但某些政府/商业数据链接会随网站改版失效,发现后可通过 apd-core 提交修正。

与同类对比

资源 规模 分类方式 维护状态 特色
awesome-public-datasets 500+ 30+ 主题领域 活跃(apd-core 自动生成) 最全面、学术导向
Kaggle Datasets 数十万 标签+比赛分类 社区驱动,高度活跃 下载量/讨论丰富
Hugging Face Datasets 数万 任务导向 高度活跃 直接 PyTorch/Pandas 加载
Google Dataset Search 亿级 通用搜索 搜索引擎 无分类体系,但覆盖面最广
UCI ML Repository ~600 无主题分类 低频更新 经典 ML 基准,数据集质量高

awesome-public-datasets 的核心优势在于主题分类导航——它是目前最系统的按领域分类的公开数据导航,没有之一。相比 Kaggle,它更适合做学术调研;相比 Hugging Face,它覆盖 Kaggle/HF 之外的政府和科研数据。

一句话推荐结论

无论你是做学术研究、数据科学竞赛还是 AI 产品研发,awesome-public-datasets 都是你找公开数据时的第一个书签——30+ 领域全覆盖,找权威数据源从这里开始。