外观
DeepSeek-R1 与推理模型
推理模型(Reasoning Model)是会在生成最终答案之前,先产出一段内部思维链(Chain-of-Thought, CoT)的大语言模型——「想清楚,再回答」。 它把「思考过程」显式地写进生成序列,而不是像普通大语言模型(LLM)那样直接蹦出结论。2025 年 1 月,DeepSeek(深度求索)发布并开源推理模型 DeepSeek-R1,以据称远低于同类的训练成本,在数学、代码等推理任务上对标甚至超越 OpenAI 的 o1。这一事件把「推理模型」从实验室名词变成全球热点,也深刻改写了开源与闭源、成本与能力、训练范式与 Agent 落地的基本盘。
本文以 R1 为切片,讲清楚三件事:推理模型与普通 LLM 到底差在哪、R1 用了哪些「性价比极高」的技术、以及它给行业带来的连锁反应。想先补基础概念,可对照大语言模型(LLM)与提示词工程两页阅读。
一、背景:一个「低成本高性能」的全球现象
1.1 时间线与事件经过
| 时间 | 事件 | 意义 |
|---|---|---|
| 2024-09 | OpenAI 发布 o1-preview / o1-mini | 「推理模型」品类诞生,展示思维链推理 |
| 2024-12 | OpenAI 发布 o3(含 o3-mini 预告) | 推理能力再上台阶,但保持闭源 |
| 2025-01-20 | DeepSeek-R1 正式发布并开源(MIT 许可权重) | 推理能力对标 o1,且开源可用 |
| 2025-02 | 发布 DeepSeek-R1-V(多模态推理)与 167B MoE 推理变体 | 推理能力向多模态与部署扩展 |
R1 发布当天即引爆全球舆论:Hugging Face 权重库下载量短时间飙升,多家云厂商(英伟达、微软、亚马逊等)宣布接入,App Store 免费榜一度登顶。对于一个来自中国初创团队的开源模型,这样的关注度前所未有——业界普遍称之为「AI 领域的斯普特尼克时刻」。
1.2 「深度求索」与「低成本高性能」的叙事
R1 之所以震撼,不在于「能力最强」,而在于性价比。据技术报告与行业估算,R1 的训练成本远低于 OpenAI 同类模型的传闻投入:
- RL 阶段算力:报告称 R1-Zero 的强化学习训练仅使用约 8000 个 V100 GPU 小时,这通常只是大厂一次小实验的开销;
- 整体训练成本估算:参照 DeepSeek-V3 报告的约 278 万 H800 GPU 小时、成本约 557 万美元(业内估算),R1 的完整训练成本被普遍认为在百万美元量级——对比传闻中闭源模型动辄数亿美元的训练投入,差距是两到三个数量级;
- 推理与部署成本:R1 采用 MoE(混合专家)架构,总参数 671B 但每次推理只激活约 37B,配合开源社区快速适配的量化与推理优化(见推理优化与量化),单次推理成本被压到极低。
「算法创新可以部分弥补算力差距」——这句话在 R1 之前只是猜想,在 R1 之后成为行业共识。这也解释了为什么开源模型与榜单速查页面上,DeepSeek 系列自此成为性价比常客。
二、什么是推理模型
2.1 机制:把「思考」变成生成的一部分
普通 LLM 的工作方式是输入 → 直接输出答案:你问它「鸡兔同笼,笼中共有 35 个头、94 只脚,问鸡兔各几只」,它可能直接给结论,答错了也没地方回溯。推理模型则在最终答案之前先生成一段「思考过程」:
用户: 笼中共有 35 个头、94 只脚,鸡和兔各几只?
(模型内部生成的思维链,推理模型可见)
现在我有 35 个头,如果全是鸡则有 35×2=70 只脚。
实际有 94 只脚,多出 94−70=24 只脚。
每把一只鸡换成兔子,头不变,脚多 2 只。
所以兔子数 = 24÷2 = 12,鸡数 = 35−12 = 23。
验证:12×4 + 23×2 = 48+46 = 94 ✓
最终答案: 鸡 23 只,兔 12 只。这段思维链可以自行拆解问题、自我验证、发现并纠正错误,推理能力因此显著强于「一步出答案」。它在训练阶段就被内化(见下节 R1 技术要点),而不是靠用户提示临时激发。
2.2 推理模型 vs 普通 LLM
| 维度 | 普通 LLM(如 GPT-4o、DeepSeek-V3) | 推理模型(如 o1、DeepSeek-R1) |
|---|---|---|
| 回答方式 | 直接生成答案 | 先生成思维链,再输出答案 |
| 推理风格 | 「快思考」(System 1) | 「慢思考」(System 2),可自我纠错 |
| 推理时 token 开销 | 少,低延迟 | 多,高延迟、高成本 |
| 数学 / 代码难题 | 中上,易在复杂步骤出错 | 显著更强,长链路推理可靠 |
| 简单任务 | 快而准 | 可能「杀鸡用牛刀」,过犹不及 |
| 与 CoT 提示的关系 | 需要用户提示「请一步步思考」才触发 | 训练阶段内化,自动产出 CoT |
注意区分两个层次:提示词工程里的思维链(CoT)提示是在推理时「要求」模型逐步思考,是提示层面的引导;而推理模型是在训练层面就把「长思维链」固化成模型行为,不需要用户额外提示。前者是「会背招式」,后者是「练成肌肉记忆」。
一句话判断
你的任务需要多步推理、自我纠错、代码或数学验证吗?需要 → 上推理模型;只是问答、摘要、改写 → 普通 LLM 更快更省。先用便宜模型做路由,别让所有请求都走「慢思考」。
2.3 两条路线的代表
- 闭源代表:OpenAI o1 / o3 系列。o1 开创推理模型品类,o3 进一步强化;OpenAI 刻意隐藏完整思维链,只向用户展示摘要,理由是安全与可监控性;
- 开源代表:DeepSeek-R1。权重全开源(MIT 许可)、思维链完整可见、可私有化部署,成为研究推理模型的「标准解剖样本」。
想系统了解模型家族版图与开源/闭源格局,见模型与榜单速查;想理解 R1 的架构底座,可先读Transformer 与注意力机制。
三、R1 技术拆解:强化学习、蒸馏与 MoE
R1 的技术方案可以概括为三句话:用大规模强化学习把推理「训」出来,用蒸馏把推理能力「传」给小弟,用 MoE 把运行成本「压」下去。
3.1 大规模强化学习(RL)激发推理能力
这是 R1 最核心的贡献。传统对齐里的 RLHF(见对齐:RLHF 与 DPO)是为了让模型「听话」;R1 则把强化学习直接对准推理能力:
- 训练对象:以 DeepSeek-V3-Base 为起点,先做冷启动微调(几千条高质量 CoT 样例),再进入大规模 RL;
- 奖励信号:不依赖昂贵的奖励模型,而是用可验证的规则——数学题答案是否正确、代码能否通过测试(可判定性 reward);
- 算法:采用 GRPO(Group Relative Policy Optimization),在同一问题的多次采样组内做相对比较来估计优势,省去了独立 critic 价值模型,显存与算力大幅降低;
- 两阶段演进:先做出不做冷启动的 R1-Zero(纯 RL,涌现出自发推理与「反思修正」行为),再在其基础上加入冷启动与人类偏好对齐得到 R1,兼顾能力与可读性。
R1 训练流程(简化)
① V3-Base → 冷启动微调(少量高质量 CoT 样例)
② 大规模 RL(规则奖励:数学答案对错 / 代码测试通过)→ R1-Zero 级推理能力
③ 拒绝采样收集新数据 → SFT → 再 RL(加入人类偏好对齐)→ 最终 R1结论一句话:推理能力是可以「训」出来的,奖励信号不一定要靠人工打分,规则可验证性就够了。
3.2 蒸馏:把大模型的推理能力「传」给小模型
R1 团队用 R1 生成的推理数据,去微调一系列更小的开源模型,得到 R1-Distill 系列:
| 蒸馏模型 | 底座 | 参数规模 | 亮点 |
|---|---|---|---|
| R1-Distill-Qwen-1.5B | Qwen2.5-Math | 1.5B | 极轻量,演示用 |
| R1-Distill-Qwen-7B / 14B / 32B | Qwen2.5 | 7B/14B/32B | 性价比甜点区间 |
| R1-Distill-Llama-8B / 70B | Llama 3.1/3.3 | 8B/70B | 生态成熟、部署广泛 |
据技术报告,R1-Distill-Qwen-32B 在 AIME 2024 数学竞赛上 pass@1 达到 72.6%,超过 OpenAI o1-mini——一个 32B 的小模型靠「蒸馏继承」就能打平闭源推理模型。蒸馏背后的原理与注意事项见微调与 PEFT(LoRA):蒸馏传递的是「行为分布」,小模型学的是「大模型怎么思考」,而不是「大模型的全部知识」。
3.3 MoE 架构:671B 参数的「身价」,37B 的「开销」
R1 与 DeepSeek-V3 共用同一底座,是**混合专家(Mixture-of-Experts, MoE)**架构:
| 项 | 数值 | 含义 |
|---|---|---|
| 总参数 | 671B | 知识容量大 |
| 激活参数 | 约 37B | 每次推理只调用约 1/18 的参数 |
| 上下文长度 | 128K tokens | 支持长文档与长思维链 |
| 发布许可 | MIT(权重开源) | 可商用、可二次开发 |
MoE 让「大模型」不再是「贵模型」的代名词:总参数负责能力上限,激活参数决定单次成本。结合量化、投机采样等推理优化手段,R1 可以在消费级显卡(如 4090 + 量化)或单卡 A100 上跑起来,这在同代闭源模型上不可想象。R1 的完整部署实践可参考部署与推理优化实战。
四、推理模型的演进脉络
R1 不是孤例,而是「推理模型」这条演进线上的关键节点:
2024-09 o1(OpenAI,闭源)── 定义品类:思维链 + 推理时 RL
2024-12 o3(OpenAI,闭源)── 更强的代码/数学,智能体任务
2025-01 DeepSeek-R1(开源)── 同档能力,成本骤降,权重开放
2025-02 DeepSeek-R1-V(多模态推理)── 推理从纯文本走向图文
…后续 OpenAI o3-mini / GPT-5 系列、Claude thinking、Gemini 推理模式推理模型家族对比(截至 dataAsOf 2025-06)
| 模型 | 发布时间 | 开源 | 底座架构 | 特点 |
|---|---|---|---|---|
| OpenAI o1 | 2024-09 | 否 | 私有(传闻基于 GPT-4 系) | 品类开创者,数学/代码强 |
| OpenAI o3 | 2024-12 | 否 | 私有 | 强化自适应推理时间,智能体基准大幅领先 |
| DeepSeek-R1 | 2025-01 | 是(MIT) | V3(MoE 671B/37B 激活) | 对标 o1、成本骤降、CoT 全可见 |
| DeepSeek-R1-V | 2025-02 | 是 | V3 + 视觉编码器 | 首个开源多模态推理模型 |
| Claude(thinking 模式) | 2025 | 否 | 私有 | 推理时模式可开关 |
| Gemini 系列推理模式 | 2025 | 部分 | 私有 | 深度整合在 Gemini 产品中 |
R1 在基准上的表现(据技术报告)
| 基准 | R1 | o1 | 备注 |
|---|---|---|---|
| AIME 2024(数学竞赛) | 79.8% pass@1 | 79.2% | 打平 |
| MATH-500 | 97.3% | 96.4% | 逼近天花板 |
| Codeforces(代码竞赛) | 2029 Elo | 约 2027 Elo | 同为专家级 |
| SWE-bench Verified | 49.2% | 48.9%(o1) | 真实软件工程 |
数字本身并不碾压,重点是「用百分之一的成本做到了同样的事」。这也直接引爆了后续的连锁反应。
五、对行业的影响
5.1 推理成本下降 → Agent 应用门槛骤降
Agent(智能体)最需要的就是「会规划、能纠错、多步执行」,而这正是推理模型的强项。此前 Agent 的「思考部分」若交给 o1,成本高且 API 受限;R1 开源后,团队可以私有部署一个推理模型作为 Agent 的大脑,成本降到可控区间。
- 规划能力:R1 的 CoT 天然适合任务拆解(先干什么、再干什么、怎么验证);
- 工具调用:R1 在 Tool Use 基准上表现良好,可接代码解释器、搜索等外部工具;
- 推理时算力:可控制「思考长度」(长思考→难任务,短思考→简单任务),成本与质量可调。
推理模型因此成为 AI 智能体(Agent)落地的重要推手,相关工程实践见从零开发一个 Agent,产品形态参考Manus 与 Agent 应用。可以这样理解:o1 证明了 Agent 的「大脑」可行,R1 让「大脑」便宜到团队都买得起。
别把推理模型当默认答案
推理模型的「强」集中在需要多步推理的任务上。对话、写作、知识问答里它常常是「又慢又贵且不更准」。上线前先跑一轮评测对比普通模型与推理模型,用数据决定路由,而不是拍脑袋。评测方法见搭建一套 LLM 评估。
5.2 开源模型逼近闭源
R1 之前,开源社区与闭源旗舰的差距被普遍认为是「一代以上」;R1 之后,这个差距被压缩到「同一代」:
| 维度 | R1 之前的开源模型 | R1 之后 |
|---|---|---|
| 推理能力 | 明显落后(缺思维链训练) | 数学/代码达到闭源旗舰水平 |
| 可用性 | 能聊、能写,难推理 | 可部署、可商用、CoT 可见 |
| 生态 | 偏研究 | 云厂商与消费级硬件全面支持 |
对开发者而言,这意味着**「用 API 租能力」之外多了「部署开源模型」这条路**,数据安全与成本控制都有了新选项。开源/闭源格局全景见模型与榜单速查。
5.3 「强化学习 + 推理」成为新训练范式
R1 把「后训练(post-training)」的重心从 RLHF 的「符合偏好」转向 RL 的「增强能力」——用可验证的规则奖励去训练思考。这个范式被各家迅速复制:Qwen 团队用类似思路蒸馏出 QwQ、Gemini 和 Claude 推出推理模式、多家创业公司在 RL 后训练上重仓。为什么「训练范式」比「单个模型」更重要?因为它意味着能力增长开始部分脱离对超大规模预训练的依赖,算力不足的团队可以用「更聪明的训练算法」弯道超车。前沿趋势综述见前沿进展,经典论文阅读方法见论文地图。
六、局限与争议
R1 的热度不意味着没有短板。以下是几类绕不开的问题:
6.1 长思维链带来的延迟与成本
推理模型每次回答都要先「想很久」——数学难题可能生成数千甚至上万 token 的思维链:
| 场景 | 普通 LLM | 推理模型 |
|---|---|---|
| 简单问答 | 快,约 1 秒 | 慢,可能 10 秒+ |
| 复杂推理 | 快但可能错 | 慢但更准 |
| 成本(per token) | 低 | 高(token 数多几倍~十几倍) |
经验结论:简单任务别用推理模型。实践中常用「路由」——先让便宜模型判断任务难度,难任务才交给推理模型,这就是推理优化与量化页面讨论的经典套路。
6.2 思维链可验证性争议
- 闭源派:OpenAI 拒绝公开 o1 完整思维链,理由是可监控性与安全(防滥用、防引导越狱),但这让「推理过程」无法被用户审计;
- 开源派:R1 思维链全可见,但也有人质疑「可见的 CoT 未必反映真实推理」——模型可能为迎合奖励而「表演思考」,即所谓 reward hacking(奖励劫持)风险;
- 蒸馏争议:R1 训练数据中大量来自 GPT-4 系列的合成数据(技术报告有说明),引发「开源模型在依赖闭源模型产出的数据」的讨论。
这类「能力 vs 透明 vs 安全」的权衡,正是 AI 安全与治理要回答的问题。
6.3 评测基准饱和
R1 在 MATH-500 达到 97.3%、AIME 2024 接近 80%——这些数字已经逼近「再高也没有区分度」的境地:
- 基准饱和:数学竞赛类基准被迅速打穿,模型间差距难以用旧基准区分;
- 评测迁移:业界转向更难、更贴近真实工作的基准(SWE-bench、FrontierMath、Humanity's Last Exam 等);
- 启示:看模型别只盯「刷榜分数」,要结合任务类型与成本综合评估,方法论见LLM 评估与基准,实操见搭建一套 LLM 评估。
七、案例启示
R1 这个案例给从业者的核心启示有三条:
第一,推理能力可以「训」出来,而非只靠规模。 R1 用规则奖励的强化学习,在不大幅增加预训练投入的情况下把推理能力拉高一个台阶。反过来说,很多团队的痛点可能不是「模型不够大」,而是「后训练没做对」——先检查对齐与 RL 管线,再考虑换更大的模型。
第二,开源生态的价值被严重低估。 R1 的蒸馏系列让中小团队能以极低成本获得推理能力;权重开放又反向加速了推理优化生态(量化、框架、部署工具全面跟进)。对于预算有限的团队,开源模型 + 微调往往比 API 更可控、更便宜。
第三,「算力换成本」的路径被验证。 R1 用「更多思考 token + 更聪明的训练」换「更少的前期投入」,这种把成本从训练期后移到推理期的思路,正在重塑大模型的商业模式——对最终用户而言,花得起的强推理模型意味着大量此前不经济的应用(Agent、代码助手、数据分析)变得可行。
回到开头的判断:R1 的意义不在它刷了多少分,而在它证明「高性能推理」不再是少数巨头烧钱才能拥有的特权。 想进一步了解这场变革在对话产品、代码工具等场景的延伸,可读ChatGPT 与对话式 AI与GitHub Copilot 与代码智能;想搞清楚整条技术脉络的来龙去脉,从演进简史与什么是 AI 热门概念读起最合适。
延伸阅读
- 大语言模型(LLM)——推理模型的基础:预训练、指令微调与对齐
- 提示词工程——CoT 提示:推理模型的「提示层」前身
- 对齐:RLHF 与 DPO——理解 R1 的强化学习与人类偏好对齐
- 微调与 PEFT(LoRA)——蒸馏小模型的原理与操作
- AI 智能体(Agent)——推理模型如何降低 Agent 落地门槛
- LLM 评估与基准——评测饱和与新基准的演进
- 模型与榜单速查——开源/闭源推理模型横向对比
- 前沿进展——「强化学习 + 推理」范式的最新研究
- 部署与推理优化实战——MoE 模型的量化与部署实践
参考资料
- DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning(2025, arXiv:2501.12948)——R1 官方技术报告,含训练细节与基准数据
- DeepSeek-R1 官方 GitHub 仓库——权重下载、许可证与模型卡片
- OpenAI. Introducing OpenAI o1(2024-09 官方博客)——推理模型品类开山之作的官方说明
- OpenAI. OpenAI o3 and o4-mini(2024-12 官方博客)——o3 系列发布与自适应推理时间
- Wei et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models(NeurIPS 2022)——思维链提示的奠基论文
- OpenAI. Learning to Reason with LLMs(2024-09 官方博客)——o1 训练方法(推理时 RL)的官方解读