awesomedata/awesome-public-datasets · 上手攻略
- 仓库:awesomedata/awesome-public-datasets
- 链接:https://github.com/awesomedata/awesome-public-datasets
- 分类:skill
- 作者:Jay
- 更新:2026-07-09
是什么
awesome-public-datasets 是 GitHub 上规模最大、分类最齐全的高质量公开数据集精选列表。它以主题(Topic)为导向,将来自政府、科研机构、高校、企业的公开数据按领域逐一整理,涵盖农业、生物学、化学、气候、经济、教育、能源、地理信息、政府数据、医疗健康、图像处理、机器学习、自然语言、神经科学、物理、公共领域、社交网络、体育、交通等 30+ 细分领域,目前收录数据集数量在 500+ 以上。
该仓库最初由上海交通大学 OMNILab(现属 BaiYuLan 开源 AI 社区)在陈夏明博士研究期间孵化,至今仍在维护,已积累 76,741 Stars,是数据科学、机器学习、学术研究必备的导航型资源。
⚠️ 注意:README 本身是
.rst(reStructuredText)格式,仓库由apd-core自动生成,直接编辑 README 的方式已被废弃,最新贡献需通过 apd-core 的 YAML 文件提交。
解决什么问题
找数据集是数据科学和 AI 项目最常见的痛点之一。Google 一搜一堆,但质量参差不齐,很多链接早已失效。awesome-public-datasets 解决了这个信息筛选问题:
- 权威来源聚合:每个数据集都标注了原始发布机构(USDA、NCBI、ENCODE、NOAA 等),无需逐一溯源
- 主题分类导航:按研究领域组织,定位效率远高于关键词搜索
- 质量信号明确:每个数据集旁标注 ✅(维护正常)或 ⚠️(待修复),帮助快速排除失效资源
- 学术与产业双覆盖:既有 UCI 经典数据集,也有最新政府开放数据、卫星遥感、基因组等前沿数据源
快速安装
本仓库不需要安装——它是纯导航型仓库,数据集本身不存储在仓库内。
# 直接在 GitHub 阅读(推荐,无需 clone)
# https://github.com/awesomedata/awesome-public-datasets
# 如需本地全文检索,可 clone 后搜索
git clone https://github.com/awesomedata/awesome-public-datasets.git
cd awesome-public-datasets
grep -r "Machine Learning" README.rst # 按关键词找数据集
核心用法
按主题浏览(GitHub 网页)
- 打开 https://github.com/awesomedata/awesome-public-datasets
- 向下滚动查看 Table of Contents,点击任意主题(如
NaturalLanguage、MachineLearning) - 每个条目格式为:
[数据集名称](原始链接) [Meta] - 点击 Meta 链接可查看 YAML 元数据文件
查找特定领域数据集
以下是各分类中的代表性数据集(按 Stars/影响力筛选):
| 分类 | 代表数据集 | 链接 | 备注 |
|---|---|---|---|
| Biology | 1000 Genomes | https://www.internationalgenome.org/data | 全球最大基因组计划 |
| Biology | ENCODE Project | https://www.encodeproject.org | DNA 元件百科全书 |
| Biology | TCGA (The Cancer Genome Atlas) | https://gdc.cancer.gov/access-data/gdc-data-portal | 癌症基因组参考 |
| MachineLearning | UCI Machine Learning Repository | http://archive.ics.uci.edu/ml/ | 经典 ML 数据集集 |
| Climate+Weather | NOAA Climate Data | https://www.ncdc.noaa.gov/ | 美国国家气候数据中心 |
| NaturalLanguage | IMDb Movie Reviews | https://ai.stanford.edu/~amaas/data/sentiment/ | 情感分析经典 |
| Finance | Lending Club Loan Data | https://www.lendingclub.com/info/download-data.action | P2P 贷款数据 |
| Government | US Government Open Data | https://www.data.gov/ | 美国政府开放数据平台 |
| Agriculture | USDA FoodData Central | https://fdc.nal.usda.gov/download-dataset | 食品营养成分数据库 |
| Transportation | NYC Taxi Trip Data | https://www.nyc.gov/site/tlc/about/tlc-trip-record-data.page | 纽约出租车数据 |
通过 apd-core 贡献新数据集
# 1. Clone apd-core 仓库
git clone https://github.com/awesomedata/apd-core.git
cd apd-core/core
# 2. 在对应分类目录下创建 YAML 文件
# 例如添加一个新的生物学数据集:
# core/Biology/My-Dataset.yml
# 3. YAML 格式参考现有文件,包含:
# title: 数据集名称
# url: 原始数据链接
# description: 简短描述
# 提交 PR 到 apd-core
数据下载示例(Python)
import pandas as pd
# 示例:加载 UCI Iris 数据集(经典 ML 数据集)
iris = pd.read_csv(
"https://raw.githubusercontent.com/uiuc-cse/data-fa14/gh-pages/data/iris.csv"
)
print(iris.head())
# 示例:USDA FoodData Central(需申请 API Key)
# https://fdc.nal.usda.gov/api-guide.html
import requests
API_KEY = "YOUR_API_KEY"
url = f"https://api.nal.usda.gov/fdc/v1/foods/search?api_key={API_KEY}&query=apple"
response = requests.get(url).json()
print(response['foods'][0])
典型适用场景
- 学术研究开题:快速调研某个领域有哪些公开数据集可用来验证假设
- 机器学习练手:找到可直接下载的训练/测试数据集,无需自己爬取
- 数据可视化项目:通过政府/气象/交通等开放数据做 Dashboard 或报道
- AI 产品 PoC:RAG、知识库构建需要高质量领域数据,先来这里找语料
- Kaggle 参赛:该列表也是 Kaggle 竞赛数据集的良好补充,覆盖 Kaggle 未收录的垂直领域
坑与注意
-
⚠️ 部分数据集链接已失效:标注 ⚠️(FIXME_ICON)的数据集链接可能需要到原始网站重新搜索。建议直接访问数据提供方的官网确认最新 URL。
-
数据许可证各不相同:列表中既有完全 CC0 公共领域数据,也有仅供研究使用或需要申请的数据。使用前务必阅读原始数据许可协议,不要默认所有数据都可以商用。
-
README 是
.rst格式:在 GitHub 上渲染可能不如.md流畅。本地阅读建议用 VS Code + reStructuredText 插件,或直接 clone 后用 Markdown 阅读器浏览。 -
数据集需要自行下载:仓库本身不托管数据,只提供链接。需要自己处理下载、解析和存储。
-
部分数据集需要申请/注册:高端数据(如基因组数据、部分政府数据)需要填表审批,访问不是即时的。
-
数据更新频率不一:学术数据集通常稳定,但某些政府/商业数据链接会随网站改版失效,发现后可通过 apd-core 提交修正。
与同类对比
| 资源 | 规模 | 分类方式 | 维护状态 | 特色 |
|---|---|---|---|---|
| awesome-public-datasets | 500+ | 30+ 主题领域 | 活跃(apd-core 自动生成) | 最全面、学术导向 |
| Kaggle Datasets | 数十万 | 标签+比赛分类 | 社区驱动,高度活跃 | 下载量/讨论丰富 |
| Hugging Face Datasets | 数万 | 任务导向 | 高度活跃 | 直接 PyTorch/Pandas 加载 |
| Google Dataset Search | 亿级 | 通用搜索 | 搜索引擎 | 无分类体系,但覆盖面最广 |
| UCI ML Repository | ~600 | 无主题分类 | 低频更新 | 经典 ML 基准,数据集质量高 |
awesome-public-datasets 的核心优势在于主题分类导航——它是目前最系统的按领域分类的公开数据导航,没有之一。相比 Kaggle,它更适合做学术调研;相比 Hugging Face,它覆盖 Kaggle/HF 之外的政府和科研数据。
一句话推荐结论
无论你是做学术研究、数据科学竞赛还是 AI 产品研发,awesome-public-datasets 都是你找公开数据时的第一个书签——30+ 领域全覆盖,找权威数据源从这里开始。