Awesome Public Datasets完整指南:980+个高质量公开数据集按37个主题分类的开源导航库 📅 发布时间:2026/9/17 20:14:48 👁 浏览次数: Awesome Public Datasets完整指南980个高质量公开数据集按37个主题分类的开源导航库【免费下载链接】awesome-public-datasetsA topic-centric list of HQ open datasets.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-public-datasetsAwesome Public Datasets 是一个按主题组织的高品质公开数据集列表topic-centric list of HQ open datasets把散落在论文附录、政府门户、竞赛网站、博客里的数据集收进一份可搜索的目录里。它的价值在于你只需要按领域翻目录就能直接拿到带链接、带简介、带状态标识的数据源省去逐个搜索和验证链接的功夫。这个仓库到底帮你省了什么时间找数据最耗时的不是下载而是三件事确认数据是否存在、确认数据还活着、确认数据适不适合自己的课题。这个仓库针对这三个痛点做了三件事按主题聚类README.rst 把全部条目组织成 37 个主题分类从 Agriculture、Biology 到 CyberSecurity、TimeSeries覆盖社会科学、自然科学、工程等多个方向而不是按谁上传的或哪个平台托管的来乱堆。每条都带状态图标项目用两个图标标注维护状态——绿色✅ I am well表示链接正常可用黄色⚠️ Please fix me表示条目失效、待修复。目前全库共 984 条数据集条目其中 874 条状态正常、103 条标记为待修复。选数据时优先挑绿色标记的能少走弯路。每条都挂元信息每个条目除了名称和一句话简介还链接到一份 YAML 格式的 Meta 文件记录在 apd-core 核心仓库中里面是该数据集的完整描述。项目起源于上海交通大学 OMNILab作者陈翔鸣在博士期间发起如今归属 BaiYuLan Open AI 社区维护采用 MIT 许可见 LICENSE。先克隆下来按目录翻找仓库结构非常轻核心就是一个大目录文件加一份示例数据awesome-public-datasets/ ├── Datasets/ │ └── titanic.csv.zip # 内置的 Titanic 示例数据 ├── README.rst # 全部 37 个分类 984 条数据集 └── LICENSE克隆仓库git clone https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets然后直接在本地README.rst上搜索比在浏览器里翻网页快得多。找某个领域的数据集grep -i climate README.rst grep -i weather README.rst找带具体数字线索的条目产量、点击量、观测数grep -i 2016 README.rstREADME.rst顶部有 Table of Contents37 个分类各有锚点浏览器打开文件时可以点目录跳转。37个分类里哪些最实用按使用频率和数据体量挑几个值得优先翻的分类Biology生物学全库最大的分类之一收录 1000 Genomes 项目2008–2015 年运行的最大人类基因组计划、Broad 研究所的癌症细胞系百科全书CCLE、Gene Expression OmnibusGEO、NCBI Taxonomy还有适合新手的 Palmer Penguins 数据集——做数据清洗和建模练手的第一份数据。ClimateWeather气候气象Global Climate Data Since 19291929 年至今的全球气候数据、WorldClim 全球气候图层、NOAA 系列数据集、Open-Meteo 开源天气 API。做时间序列分析或环境建模这个分类基本够用。ComputerNetworks计算机网络35 亿个网页的 CommonCrawl 2012 数据、印第安纳大学 10 万用户 535 亿次网页点击记录、CAIDA 互联网流量数据、Merklemap 40 亿条 DNS 记录。网络分析和爬虫研究的标准料仓。Agriculture农业1981–2016 年主要作物历史产量全球数据集、USDA 营养数据库FoodData Central、Open Food Facts 覆盖 170 多个国家 250 万 食品的众包营养库。TimeSeries时序数据3W 石油井罕见事件数据集、MIT 心率时序、Backblaze 硬盘故障率、UC Riverside 时序数据集集合做时序预测和变点检测的入门库。其余分类还包括 Economics、Healthcare、ImageProcessing、MachineLearning、NaturalLanguage、GIS、Sports、eSports 等全列表以 README.rst 为准。仓库里的示例数据和元信息机制仓库自带一份真实的教学数据Datasets/titanic.csv.zip。Titanic 乘客数据集是数据科学课程最经典的入门素材解压后可以直接练数据清洗、特征工程、分类模型训练完整走一遍建模流程不需要自己另外找数据。关于元信息需要理解一个维护机制这个仓库的 README 是由 apd-core 工具自动生成的官方明确提示不要直接修改该文件。数据集的描述、格式、大小等信息以 YAML 文件形式维护在 apd-core 核心仓库中审核通过后自动同步过来。这套机制解释了为什么每条数据后面都跟着一个 Meta 链接——那是溯源入口点进去能看到该数据集的完整元描述。状态标识✅/⚠️也是同一套自动化流程维护的链接失效会被标记出来所以黄色 ⚠️ 条目可以放心跳过。遇到失效链接和贡献新数据怎么做发现某条数据打不开先看它是不是已经挂了 ⚠️ 标。如果是绿色条目但链接失效可以在仓库提 Issue 反馈也可以直接参与修复。想新增一个数据集正确姿势不是改这个仓库的 README而是向 apd-core 核心仓库提交一份 YAML 元信息走社区审核流程后自动同步。官方还维护了一个 Slack 社区用于数据集更新的即时交流。只想消费数据克隆仓库后完全离线可用README.rst就是全部目录配合grep检索即可。两个轻量使用建议给仓库设置 Watch 提醒数据集条目和状态标识会随社区贡献持续更新984 条里 103 条待修复的状态也在滚动变化定期拉取更新能拿到最新可用的数据源列表。把grep当第一搜索入口拿到一个课题先别急着上网搜数据集先在自己的克隆里grep -i 关键词 README.rst大概率这个库里已经有人替你验证过链接了。这个项目没有花哨的界面但一份 RST 文件 984 条带状态标记的目录 自动化审核同步的组合恰好覆盖了找数据这件事的完整链路发现、验证、获取。【免费下载链接】awesome-public-datasetsA topic-centric list of HQ open datasets.项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-public-datasets创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考