Skip to content

数据集与工具档案

本页速览 大模型数据集与工具档案:按用途分类的数据集速查(预训练、指令微调、偏好、评测、RAG、多模态),以及框架、向量库、标注与部署工具选型建议与版权合规提示。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

数据集与工具档案 ​

本文是《AI 热门概念手册》的工具箱页:练手时该去哪些数据集取料、该用哪套工具链,以及如何避开版权与合规的坑。配合模型与榜单速查一起使用,一份看"数据与工具",一份看"模型怎么选"。

数据决定模型的上限,工具决定你的效率。 大模型项目里,真正拉开差距的往往不是某一行代码,而是"喂了什么数据、用什么工具把数据变成训练信号"。大语言模型的整个流水线——预训练、微调、对齐、评测——每一环都对应着专门的公共数据集。本页把这些数据集按用途归档成速查表,再把常用工具按角色分好类,最后给出选型与合规建议。

使用方法

先按你要做的事(预训练?微调?评测?搭 RAG?)翻到对应小节挑数据;再按「工具档案」选框架与向量库;动工前务必读一遍「版权与合规提示」。站内配套教程:从零搭建 RAG 应用、微调你自己的 LLM、搭建一套 LLM 评估。

数据集档案:按用途分类 ​

预训练语料 ​

预训练语料是所有大模型的"教科书"。它们规模以 TB 计,几乎全部来自网络爬取或书籍/论文聚合,因此在版权上天然灰色——这也是当前多起大模型诉讼的焦点,详见本页「版权与合规提示」。

数据集规模用途许可链接
Common Crawl每月约数十亿网页,总存储达 PB 级(截至 2025)预训练语料"底座",主流模型几乎都经过它;可做领域筛选数据免费下载;内容版权归原网站,需自行判断使用范围官网
The Pile约 800GB、由 22 个子数据集组成(含 Books3)学术预训练与复现研究的主流选择,结构多样整理版 MIT;部分子集(尤其 Books3)有版权争议GitHub
RedPajamav1 约 1.2T token;v2 约 30T token(含 GPT-4 合成与人工过滤样本)复现 LLaMA 训练配方;其中 RedPajama-Data-1T 含中文子集整理版 Apache-2.0 / CC-BY-4.0,原始内容版权归原站GitHub

预训练语料的版权底色

Books3 已被权利人起诉(2023 年 Kafka 案),LAION 也被多名艺术家起诉。"网上能下载"不等于"你可以自由商用"。做研究可放宽,做产品务必逐项核查来源。完整风险讨论见AI 安全与治理。

指令微调数据 ​

预训练模型只会"续写",指令微调数据把它变成"会听话"。这一档数据普遍由大模型合成或众包产生,是个人微调最容易上手的入口。

数据集规模用途许可链接
Alpaca52K 条指令-回答对(由 GPT-3.5 按 seed 任务合成)入门级 SFT,"微调一个小助手"的经典起点CC BY-NC 4.0;官方版本已下架,社区保留副本GitHub
ShareGPT社区共享的约 9 万条真实用户对话对话式 SFT,覆盖面广无正式许可(抓取用户数据,商用前务必评估)官网
OpenAssistant(OASST1)约 46K 条多语言众包对话树(含偏好标注)对话 SFT 与偏好数据的双用途开源首选Apache-2.0Hugging Face
UltraChat约 150 万条合成多轮对话大规模对话 SFT,训练社区主力(如 Zephyr)CC BY-NC 4.0Hugging Face

偏好数据(对齐用) ​

偏好数据是对齐(RLHF 与 DPO)的燃料:每行都是"同一条输入下,回答 A 比回答 B 好"的人类判断。它决定模型"愿不愿意"按照人的价值观说话。

数据集规模用途许可链接
Anthropic HH-RLHF约 16 万条"有帮助/无害"偏好对比RLHF/DPO 训练与对齐研究的事实标准MIT(以官方标注为准)Hugging Face
OpenAI Summarize from Feedback约 9 万条摘要偏好比较摘要任务的 RLHF 与偏好模型训练以官方发布为准GitHub
Stanford SHP约 38 万条"哪条回答更好"社区偏好奖励模型与 DPO 训练(社区常用)学术许可(以官方为准)Hugging Face

关于"OpenAI 相关"的补充

OpenAI 在 InstructGPT 论文(Ouyang et al., 2022)中使用的 labeler 比较数据并未完整公开;研究界实际可用的主要是上述 Summarize from Feedback,以及第三方重打包的偏好对。别在论文里声称用了"OpenAI 对齐数据"而无法溯源。

评测基准 ​

评测基准是"考卷",用于量化模型能力。LLM 评估与基准页详细讲了方法论,这里给出最常被引用的四张考卷——也是模型发布新闻里出现频率最高的名字。

数据集规模用途许可链接
MMLU57 个学科约 1.4 万道选择题知识广度通用评测,衡量"通识"MITGitHub
GSM8K8.5K 道小学数学应用题(测试集约 1.3K)数学推理能力评测CC BY 4.0GitHub
HumanEval164 道手写编程题(含单元测试)代码生成能力评测MITGitHub
C-Eval52 个学科 13,948 道中文题中文大模型评测,衡量模型"中文功底"CC BY-NC-SA 4.0GitHub

评测饱和警示

MMLU 已被头部模型刷到 90% 上下,"会做的题"越来越区分不出差距。看报告时多关注还没饱和的新基准(如 GPQA、LiveBench)以及你业务场景的自建评测集。别只盯一个榜。

检索 / RAG 数据 ​

检索增强生成(RAG)需要"文档集 + 查询"的数据来训练检索器、评估召回质量。这一档数据的特点是带有标准的查询-文档相关性标注,可以直接算出 MRR、NDCG 等指标。

数据集规模用途许可链接
MS MARCO约 100 万查询 + 880 万篇 passage段落检索与排序评测的"标配考卷",BERT 级检索模型都在它上跑CC BY 4.0官网
Natural Questions约 30 万条真实 Google 搜索问题(配维基段落答案)开放域问答与长文检索CC BY-SA 3.0官网
KILT5 类任务 6 个数据集(ELI5、FEVER、Wizard of Wikipedia 等)知识密集型任务统一评测,覆盖问答/事实验证/对话各子集许可不一,以官方为准GitHub

一句话判断

检索数据选 MS MARCO 打底(社区题解最多),做知识密集型问答再看 KILT;如果你的业务是中文文档库,别忘了自建"业务文档 + 人工标注相关性"的评测集,公共数据永远替代不了你的领域。相关知识还可参考知识图谱与知识注入。

多模态数据 ​

多模态模型需要"图像↔文本""语音↔文本"的配对数据。多模态模型页有原理,这里给三类最常用的开源语料。

数据集规模用途许可链接
LAION-5B58.5 亿图文对(从 Common Crawl 抓取 URL)图文对比预训练(CLIP、Stable Diffusion 类模型)标注随项目发布;图像版权归原作者,争议较多LAION 博客
COCO约 33 万张标注图、80 类物体、150 万实例检测/分割/图像字幕,多模态评测标配CC BY 4.0官网
Common Voice100+ 语言众包语音(截至 2025),总时长持续增长语音识别(ASR)训练与评测每个样本单独声明 CC0 或 CC-BY官网

工具档案 ​

框架 ​

工具出品方一句话定位许可链接
TransformersHugging Face加载/微调/推理主流模型的统一接口,事实标准Apache-2.0文档
LangChainLangChain 团队LLM 应用编排:链、工具调用、RAG、Agent 骨架MIT官网
LlamaIndexLlamaIndex 团队以"数据"为中心的 RAG 框架:加载、索引、查询一条龙MIT官网
vLLMvLLM 社区高吞吐推理服务(PagedAttention、连续批处理),生产部署首选Apache-2.0文档
peftHugging FaceLoRA/QLoRA 等参数高效微调,一张消费级显卡即可开工Apache-2.0文档
trlHugging FaceSFT、DPO、PPO 等训练与对齐流程的开箱即用实现Apache-2.0文档

向量库 ​

向量库负责"语义相似"的检索,是 RAG 的地基。完整机制见向量数据库与语义检索。

工具类型适合场景许可链接
FAISS单机检索库原型验证、百万级以内相似度检索,与 Python/GPU 无缝MITGitHub
Milvus分布式向量数据库超大规模、多副本、云原生生产部署Apache-2.0官网
Qdrant向量数据库(Rust)性能好、易部署,自带元数据过滤与高可用Apache-2.0官网
pgvectorPostgreSQL 扩展把向量装进现有业务库,事务与检索同库管理PostgreSQL 许可GitHub

一句话判断

单机原型选 FAISS,要和业务数据同库选 pgvector,认真做产品选 Qdrant 或 Milvus。 别在只有几万条数据时引入分布式向量库——过度设计是最常见的反模式。

标注与评估 ​

工具一句话定位许可链接
Argilla面向 LLM 的开源数据标注与反馈平台,可对模型输出做"审核式标注",服务于 SFT 与偏好数据构建Apache-2.0文档
promptfoo提示词回归测试与红队工具:命令行定义用例、批量跑分、防回归,评估与提示词工程配合使用MIT官网

部署 ​

工具一句话定位许可链接
Ollama一行命令本地下载并运行开源模型(含内置 API 与模型库),个人与原型部署最省心MIT官网
Docker容器化打包模型服务与环境,生产环境标配Apache-2.0官网

选型建议:什么时候用什么 ​

工具不是越多越好,按任务选最小可行组合:

你的任务推荐组合配套阅读
跑通概念 Demo / 本地体验开源模型Ollama + Transformers部署与推理优化实战
微调自己的小模型peft + trl + 一份 SFT 数据(Alpaca/UltraChat)微调你自己的 LLM
搭一个 RAG 问答应用LlamaIndex 或 LangChain + FAISS/pgvector + bge 嵌入从零搭建 RAG 应用
上线高吞吐推理服务vLLM + Docker部署与推理优化实战
建立评估与回归机制promptfoo + 评测基准数据搭建一套 LLM 评估
构建 SFT / 偏好数据Argilla 标注 + 自有业务数据对齐:RLHF 与 DPO

版权与合规提示 ​

  • 许可不等于自由:CC BY-NC 禁止商用、CC BY-SA 要求衍生作品同样开放、Apache/MIT 才接近"随便用"。下载数据集第一件事是读 license 字段。
  • 抓取型数据高风险:Common Crawl、Books3、ShareGPT、LAION 这类"从网上抓来的"数据,版权归原作者,诉讼几乎都发生在这里。研究可用、生产慎用,商用请走授权数据或合成数据 + 清洗管线。
  • 用户数据别乱用:ShareGPT 涉及真实用户对话,直接拿去做商用产品既违反平台条款,也可能违反 GDPR 等隐私法规。
  • 做产品时的自查清单:① 数据来源与许可白纸黑字存档;② 敏感个人信息脱敏;③ 商用条款逐条核对(尤其 CC BY-NC 与竞赛数据协议);④ 定期复查,因为许可可能被修改。

合规不是法务部门的事

创业团队常把合规推给法务,但数据选的每一步都已经是合规决策。多花一天读许可,可能省下一年官司。更多风险治理框架见AI 安全与治理。

延伸阅读 ​

参考资料 ​

本页数据集规模与许可信息以各官方页面截至 2025 年中的说明为准,动手前请再次核对许可条款与版本。