外观
数据集与工具档案
本文是《AI 热门概念手册》的工具箱页:练手时该去哪些数据集取料、该用哪套工具链,以及如何避开版权与合规的坑。配合模型与榜单速查一起使用,一份看"数据与工具",一份看"模型怎么选"。
数据决定模型的上限,工具决定你的效率。 大模型项目里,真正拉开差距的往往不是某一行代码,而是"喂了什么数据、用什么工具把数据变成训练信号"。大语言模型的整个流水线——预训练、微调、对齐、评测——每一环都对应着专门的公共数据集。本页把这些数据集按用途归档成速查表,再把常用工具按角色分好类,最后给出选型与合规建议。
使用方法
先按你要做的事(预训练?微调?评测?搭 RAG?)翻到对应小节挑数据;再按「工具档案」选框架与向量库;动工前务必读一遍「版权与合规提示」。站内配套教程:从零搭建 RAG 应用、微调你自己的 LLM、搭建一套 LLM 评估。
数据集档案:按用途分类
预训练语料
预训练语料是所有大模型的"教科书"。它们规模以 TB 计,几乎全部来自网络爬取或书籍/论文聚合,因此在版权上天然灰色——这也是当前多起大模型诉讼的焦点,详见本页「版权与合规提示」。
| 数据集 | 规模 | 用途 | 许可 | 链接 |
|---|---|---|---|---|
| Common Crawl | 每月约数十亿网页,总存储达 PB 级(截至 2025) | 预训练语料"底座",主流模型几乎都经过它;可做领域筛选 | 数据免费下载;内容版权归原网站,需自行判断使用范围 | 官网 |
| The Pile | 约 800GB、由 22 个子数据集组成(含 Books3) | 学术预训练与复现研究的主流选择,结构多样 | 整理版 MIT;部分子集(尤其 Books3)有版权争议 | GitHub |
| RedPajama | v1 约 1.2T token;v2 约 30T token(含 GPT-4 合成与人工过滤样本) | 复现 LLaMA 训练配方;其中 RedPajama-Data-1T 含中文子集 | 整理版 Apache-2.0 / CC-BY-4.0,原始内容版权归原站 | GitHub |
预训练语料的版权底色
Books3 已被权利人起诉(2023 年 Kafka 案),LAION 也被多名艺术家起诉。"网上能下载"不等于"你可以自由商用"。做研究可放宽,做产品务必逐项核查来源。完整风险讨论见AI 安全与治理。
指令微调数据
预训练模型只会"续写",指令微调数据把它变成"会听话"。这一档数据普遍由大模型合成或众包产生,是个人微调最容易上手的入口。
| 数据集 | 规模 | 用途 | 许可 | 链接 |
|---|---|---|---|---|
| Alpaca | 52K 条指令-回答对(由 GPT-3.5 按 seed 任务合成) | 入门级 SFT,"微调一个小助手"的经典起点 | CC BY-NC 4.0;官方版本已下架,社区保留副本 | GitHub |
| ShareGPT | 社区共享的约 9 万条真实用户对话 | 对话式 SFT,覆盖面广 | 无正式许可(抓取用户数据,商用前务必评估) | 官网 |
| OpenAssistant(OASST1) | 约 46K 条多语言众包对话树(含偏好标注) | 对话 SFT 与偏好数据的双用途开源首选 | Apache-2.0 | Hugging Face |
| UltraChat | 约 150 万条合成多轮对话 | 大规模对话 SFT,训练社区主力(如 Zephyr) | CC BY-NC 4.0 | Hugging Face |
偏好数据(对齐用)
偏好数据是对齐(RLHF 与 DPO)的燃料:每行都是"同一条输入下,回答 A 比回答 B 好"的人类判断。它决定模型"愿不愿意"按照人的价值观说话。
| 数据集 | 规模 | 用途 | 许可 | 链接 |
|---|---|---|---|---|
| Anthropic HH-RLHF | 约 16 万条"有帮助/无害"偏好对比 | RLHF/DPO 训练与对齐研究的事实标准 | MIT(以官方标注为准) | Hugging Face |
| OpenAI Summarize from Feedback | 约 9 万条摘要偏好比较 | 摘要任务的 RLHF 与偏好模型训练 | 以官方发布为准 | GitHub |
| Stanford SHP | 约 38 万条"哪条回答更好"社区偏好 | 奖励模型与 DPO 训练(社区常用) | 学术许可(以官方为准) | Hugging Face |
关于"OpenAI 相关"的补充
OpenAI 在 InstructGPT 论文(Ouyang et al., 2022)中使用的 labeler 比较数据并未完整公开;研究界实际可用的主要是上述 Summarize from Feedback,以及第三方重打包的偏好对。别在论文里声称用了"OpenAI 对齐数据"而无法溯源。
评测基准
评测基准是"考卷",用于量化模型能力。LLM 评估与基准页详细讲了方法论,这里给出最常被引用的四张考卷——也是模型发布新闻里出现频率最高的名字。
| 数据集 | 规模 | 用途 | 许可 | 链接 |
|---|---|---|---|---|
| MMLU | 57 个学科约 1.4 万道选择题 | 知识广度通用评测,衡量"通识" | MIT | GitHub |
| GSM8K | 8.5K 道小学数学应用题(测试集约 1.3K) | 数学推理能力评测 | CC BY 4.0 | GitHub |
| HumanEval | 164 道手写编程题(含单元测试) | 代码生成能力评测 | MIT | GitHub |
| C-Eval | 52 个学科 13,948 道中文题 | 中文大模型评测,衡量模型"中文功底" | CC BY-NC-SA 4.0 | GitHub |
评测饱和警示
MMLU 已被头部模型刷到 90% 上下,"会做的题"越来越区分不出差距。看报告时多关注还没饱和的新基准(如 GPQA、LiveBench)以及你业务场景的自建评测集。别只盯一个榜。
检索 / RAG 数据
检索增强生成(RAG)需要"文档集 + 查询"的数据来训练检索器、评估召回质量。这一档数据的特点是带有标准的查询-文档相关性标注,可以直接算出 MRR、NDCG 等指标。
| 数据集 | 规模 | 用途 | 许可 | 链接 |
|---|---|---|---|---|
| MS MARCO | 约 100 万查询 + 880 万篇 passage | 段落检索与排序评测的"标配考卷",BERT 级检索模型都在它上跑 | CC BY 4.0 | 官网 |
| Natural Questions | 约 30 万条真实 Google 搜索问题(配维基段落答案) | 开放域问答与长文检索 | CC BY-SA 3.0 | 官网 |
| KILT | 5 类任务 6 个数据集(ELI5、FEVER、Wizard of Wikipedia 等) | 知识密集型任务统一评测,覆盖问答/事实验证/对话 | 各子集许可不一,以官方为准 | GitHub |
一句话判断
检索数据选 MS MARCO 打底(社区题解最多),做知识密集型问答再看 KILT;如果你的业务是中文文档库,别忘了自建"业务文档 + 人工标注相关性"的评测集,公共数据永远替代不了你的领域。相关知识还可参考知识图谱与知识注入。
多模态数据
多模态模型需要"图像↔文本""语音↔文本"的配对数据。多模态模型页有原理,这里给三类最常用的开源语料。
| 数据集 | 规模 | 用途 | 许可 | 链接 |
|---|---|---|---|---|
| LAION-5B | 58.5 亿图文对(从 Common Crawl 抓取 URL) | 图文对比预训练(CLIP、Stable Diffusion 类模型) | 标注随项目发布;图像版权归原作者,争议较多 | LAION 博客 |
| COCO | 约 33 万张标注图、80 类物体、150 万实例 | 检测/分割/图像字幕,多模态评测标配 | CC BY 4.0 | 官网 |
| Common Voice | 100+ 语言众包语音(截至 2025),总时长持续增长 | 语音识别(ASR)训练与评测 | 每个样本单独声明 CC0 或 CC-BY | 官网 |
工具档案
框架
| 工具 | 出品方 | 一句话定位 | 许可 | 链接 |
|---|---|---|---|---|
| Transformers | Hugging Face | 加载/微调/推理主流模型的统一接口,事实标准 | Apache-2.0 | 文档 |
| LangChain | LangChain 团队 | LLM 应用编排:链、工具调用、RAG、Agent 骨架 | MIT | 官网 |
| LlamaIndex | LlamaIndex 团队 | 以"数据"为中心的 RAG 框架:加载、索引、查询一条龙 | MIT | 官网 |
| vLLM | vLLM 社区 | 高吞吐推理服务(PagedAttention、连续批处理),生产部署首选 | Apache-2.0 | 文档 |
| peft | Hugging Face | LoRA/QLoRA 等参数高效微调,一张消费级显卡即可开工 | Apache-2.0 | 文档 |
| trl | Hugging Face | SFT、DPO、PPO 等训练与对齐流程的开箱即用实现 | Apache-2.0 | 文档 |
向量库
向量库负责"语义相似"的检索,是 RAG 的地基。完整机制见向量数据库与语义检索。
| 工具 | 类型 | 适合场景 | 许可 | 链接 |
|---|---|---|---|---|
| FAISS | 单机检索库 | 原型验证、百万级以内相似度检索,与 Python/GPU 无缝 | MIT | GitHub |
| Milvus | 分布式向量数据库 | 超大规模、多副本、云原生生产部署 | Apache-2.0 | 官网 |
| Qdrant | 向量数据库(Rust) | 性能好、易部署,自带元数据过滤与高可用 | Apache-2.0 | 官网 |
| pgvector | PostgreSQL 扩展 | 把向量装进现有业务库,事务与检索同库管理 | PostgreSQL 许可 | GitHub |
一句话判断
单机原型选 FAISS,要和业务数据同库选 pgvector,认真做产品选 Qdrant 或 Milvus。 别在只有几万条数据时引入分布式向量库——过度设计是最常见的反模式。
标注与评估
| 工具 | 一句话定位 | 许可 | 链接 |
|---|---|---|---|
| Argilla | 面向 LLM 的开源数据标注与反馈平台,可对模型输出做"审核式标注",服务于 SFT 与偏好数据构建 | Apache-2.0 | 文档 |
| promptfoo | 提示词回归测试与红队工具:命令行定义用例、批量跑分、防回归,评估与提示词工程配合使用 | MIT | 官网 |
部署
| 工具 | 一句话定位 | 许可 | 链接 |
|---|---|---|---|
| Ollama | 一行命令本地下载并运行开源模型(含内置 API 与模型库),个人与原型部署最省心 | MIT | 官网 |
| Docker | 容器化打包模型服务与环境,生产环境标配 | Apache-2.0 | 官网 |
选型建议:什么时候用什么
工具不是越多越好,按任务选最小可行组合:
| 你的任务 | 推荐组合 | 配套阅读 |
|---|---|---|
| 跑通概念 Demo / 本地体验开源模型 | Ollama + Transformers | 部署与推理优化实战 |
| 微调自己的小模型 | peft + trl + 一份 SFT 数据(Alpaca/UltraChat) | 微调你自己的 LLM |
| 搭一个 RAG 问答应用 | LlamaIndex 或 LangChain + FAISS/pgvector + bge 嵌入 | 从零搭建 RAG 应用 |
| 上线高吞吐推理服务 | vLLM + Docker | 部署与推理优化实战 |
| 建立评估与回归机制 | promptfoo + 评测基准数据 | 搭建一套 LLM 评估 |
| 构建 SFT / 偏好数据 | Argilla 标注 + 自有业务数据 | 对齐:RLHF 与 DPO |
版权与合规提示
- 许可不等于自由:
CC BY-NC禁止商用、CC BY-SA要求衍生作品同样开放、Apache/MIT 才接近"随便用"。下载数据集第一件事是读 license 字段。 - 抓取型数据高风险:Common Crawl、Books3、ShareGPT、LAION 这类"从网上抓来的"数据,版权归原作者,诉讼几乎都发生在这里。研究可用、生产慎用,商用请走授权数据或合成数据 + 清洗管线。
- 用户数据别乱用:ShareGPT 涉及真实用户对话,直接拿去做商用产品既违反平台条款,也可能违反 GDPR 等隐私法规。
- 做产品时的自查清单:① 数据来源与许可白纸黑字存档;② 敏感个人信息脱敏;③ 商用条款逐条核对(尤其 CC BY-NC 与竞赛数据协议);④ 定期复查,因为许可可能被修改。
合规不是法务部门的事
创业团队常把合规推给法务,但数据选的每一步都已经是合规决策。多花一天读许可,可能省下一年官司。更多风险治理框架见AI 安全与治理。
延伸阅读
- 模型与榜单速查 —— 数据选好了,看看该用哪个模型
- LLM 评估与基准 —— 评测基准背后的方法论与陷阱
- 微调与 PEFT(LoRA) —— 指令数据怎么变成模型能力
- 检索增强生成(RAG) —— 检索数据的用法与管线
- 向量数据库与语义检索 —— 向量库选型的原理依据
- 从零搭建 RAG 应用 与微调你自己的 LLM —— 动手练习入口
- 精选资源清单 与术语表 —— 更多学习材料与术语解释
- 学习路径 —— 把本页工具放进整体学习路线
参考资料
- Common Crawl 官方网站 —— 月度爬虫存档与文档,规模数据以此为准
- The Pile:800GB 开源预训练语料 —— EleutherAI 论文(Gao et al., 2021)
- Stanford Alpaca 项目页 —— 52K 指令数据的原始出处
- Anthropic HH-RLHF 数据集 —— 偏好数据标准参考
- MMLU 论文 —— Measuring Massive Multitask Language Understanding(Hendrycks et al., 2020)
- C-Eval 官网 —— 中文评测基准官方说明
- MS MARCO 官网 —— 检索评测数据的官方文档
- LAION-5B 发布公告 —— 规模与构建方法说明
- Hugging Face Datasets —— 大多数上述数据集的官方托管地
- vLLM 官方文档 —— 推理部署工具的权威说明
本页数据集规模与许可信息以各官方页面截至 2025 年中的说明为准,动手前请再次核对许可条款与版本。