外观
大语言模型(LLM)
一句话定义
大语言模型(Large Language Model, LLM)是基于 Transformer 架构、在海量文本上预训练、以「预测下一个 token」为学习目标、参数量通常达数十亿以上的语言模型。
它既是「语言」模型,也是「世界」模型:为了预测下一个词,模型被迫从数十亿网页、书籍、代码里提炼出语法规则、事实知识、逻辑关系乃至人设语气。2017 年 Transformer 论文问世、2018 年 GPT 与 BERT 相继出现,2022 年底 ChatGPT 引爆大众市场,LLM 已成为当前生成式 AI 浪潮的核心引擎——什么是 AI 热门概念里的绝大多数热点,都是围绕它展开的。
谁在用 LLM?几乎所有人都在用,只是姿势不同:普通人用对话产品问问题;开发者通过 API 做应用;研究人员继续把它做大、做小、做懂;企业则用它改造客服、写作、代码、搜索等几乎一切业务。可以毫不夸张地说,LLM 是过去十年 AI 领域最重大的单点突破。想看清它在整个技术版图中的位置,可以先读概念边界全景与演进简史。
核心机制:自回归语言建模
LLM 的全部本领,归根结底只有一个操作:给定一段文本,预测下一个 token(词元)最可能是什么。
从 token 到条件概率
原始文本先被切成 token——可以是单词、子词或字符。然后模型把「预测下一个 token」建模为条件概率:
text
P(xₜ | x₁, x₂, …, xₜ₋₁)给定前 t-1 个 token,预测第 t 个 token 的概率分布。整段文本的联合概率,就是每个 token 条件概率的连乘:
text
P(x₁, x₂, …, xₙ) = ∏ₜ P(xₜ | x₁, …, xₜ₋₁)训练目标就是最大化这个对数似然(等价于最小化交叉熵损失):
text
L = -Σₜ log P(xₜ | x₁, …, xₜ₋₁)训练与推理的一体两面
这一机制优美之处在于:训练时它只学「接话」,推理时它也只会「接话」——两者共享同一套代码路径。训练阶段用真实文本做「标准答案」逐步预测(teacher forcing);推理阶段则把自己上一步生成的 token 当作下一步的输入,逐 token 自回归地生成整段内容:
python
# 自回归生成示意:一次只生成一个 token
def generate(model, prompt, max_new_tokens=100):
tokens = tokenize(prompt)
for _ in range(max_new_tokens):
logits = model(tokens) # 模型给出下一个 token 的分布
next_token = sample(logits[-1]) # 从分布中采样(可用温度/top-p 控制)
tokens.append(next_token)
if next_token == EOS: # 遇到结束符就停止
break
return detokenize(tokens)关键结论
LLM 不是一个「按关键词查答案」的系统,而是一个词表上的概率分布生成器。它每次生成都是采样的结果——同一个问题两次回答可能不同,这不是 bug,而是概率模型的固有属性。这一点是理解后面所有能力与缺陷(尤其是幻觉)的出发点。
「预测下一个 token」听起来简单,但要让预测变准,模型必须内化海量知识。Transformer 的自注意力机制让每个 token 都能「看见」上下文中所有其他 token,从而建模长距离依赖——这是 LLM 的物理基础,详见Transformer 与注意力机制。
三阶段训练范式:预训练 → 后训练
LLM 的能力不是一次训练得到的,而是**分阶段「培养」**出来的。现代 LLM 普遍遵循「预训练(pretraining)+ 后训练(post-training)」的范式,后训练又分监督微调与对齐两步:
text
海量文本语料(数万亿 token,来自网页/书籍/代码)
│
▼
┌──────────────────────────────┐
│ ① 预训练 Pretraining │
│ 目标:预测下一个 token │
│ 产出:会「接话」的基座模型 │
└──────────────────────────────┘
│
▼
┌──────────────────────────────┐
│ ② 监督微调 SFT(指令微调) │
│ 数据:人类标注的指令-回答对 │
│ 产出:会把知识组织成「回答」 │
└──────────────────────────────┘
│
▼
┌──────────────────────────────┐
│ ③ 对齐 Alignment(RLHF/DPO)│
│ 数据:人类偏好比较排序 │
│ 产出:安全、诚实、有用的模型 │
└──────────────────────────────┘
│
▼
部署上线推理- 预训练(pretraining):在海量无监督文本上做 next-token prediction,耗时数周、耗资数千万美元,产出「基座模型」(base model)。它已具备语言能力与大量知识,但「只会接话、不会好好回答问题」。
- 监督微调(Supervised Fine-Tuning, SFT):用成千上万条「指令-期望回答」对继续训练,让模型学会用户问什么就答什么。这是把「会接话的婴儿」培养成「会回答问题的助手」的关键一步,机制详见微调与 PEFT(LoRA)。
- 对齐(Alignment):用人类偏好数据(对多个回答排序)通过 RLHF 或 DPO 训练,让模型更乐于拒绝有害请求、诚实承认不知道、减少谄媚,方法与代价详见对齐:RLHF 与 DPO。
必须记住的一句话
预训练决定「能力上限」,后训练决定「行为风格」。 后训练无法凭空造出预训练没学到的知识——它只能把已有能力塑造成用户想要的样子。很多「模型变笨了」的抱怨,根源往往在于对齐阶段过度压制了模型的表达。
如果你打算自己动手复现这套流程(哪怕是小规模),可参考微调你自己的 LLM的实战路线。
涌现能力:规模带来的质变
当模型规模跨过某个临界点(通常数百亿参数之后),一些在训练目标里从未被显式要求的能力突然出现,这就是涌现能力(emergent abilities):
| 能力 | 一句话描述 | 典型触发方式 |
|---|---|---|
| 上下文学习(in-context learning) | 不更新参数,仅靠 prompt 里的几个示例就能学会新任务 | 在提示词里给出 1~5 个输入-输出示例 |
| 指令跟随 | 理解并执行自然语言指令 | 把任务用自然语言描述出来 |
| 推理链(Chain-of-Thought, CoT) | 通过「先分步思考再作答」显著提升数学/逻辑正确率 | 提示词要求「请一步步思考」 |
| 少样本(few-shot) | 只需少量示例就能完成从未见过的任务 | prompt 内嵌示例 |
这些能力与传统小模型的「每任务单独训练」截然不同,也正是 LLM 区别于此前所有 NLP 模型的分水岭。涌现能力的研究证据来自 Wei et al.(2022)《Emergent Abilities of Large Language Models》,详见经典论文精读。
涌现与规模法则的关系
**规模法则(scaling laws)**揭示了「更大模型 + 更多数据 + 更多算力」与「损失下降」之间的可预测幂律关系:Kaplan et al.(2020)发现损失随参数、数据、计算量呈幂律下降;Chinchilla(Hoffmann et al., 2022)进一步给出「计算最优」配比——模型参数每翻倍,训练 token 数也应同步翻倍,也就是今天训练大模型「1 个参数配约 20 个 token」的经验法则。
两者的关系可以概括为一句话:
一句话判断
规模法则负责「可预测的平滑进步」,涌现负责「不可预测的质变跳变」。规模推着损失一路下降,而某些能力在损失曲线的特定位置突然「解锁」——我们无法精确预言它在哪个规模出现,只能靠实验撞出来。这就是前沿团队仍在拼命堆规模的底层动机,最新进展见前沿进展。
这也解释了为什么 2020 年代的「军备竞赛」如此激烈:谁先够到下一个临界规模,谁就先解锁一批新能力。
架构谱系:从 BERT、GPT 到 T5
按 Transformer 的用法不同,语言模型分为三大谱系:
| 谱系 | 代表模型 | 注意力方向 | 预训练目标 | 擅长 | 今天的位置 |
|---|---|---|---|---|---|
| Encoder-only | BERT、RoBERTa | 双向 | 掩码语言建模(MLM) | 理解、表征、分类、检索 | 语义向量/Embedding 的主力 |
| Decoder-only | GPT 系、Llama、Qwen、DeepSeek | 单向(因果) | next-token prediction | 生成、对话、推理 | 绝对主流 |
| Encoder-Decoder | T5、BART | 双向编码 + 自回归解码 | 文本段补全 | 翻译、摘要等转写任务 | 特定任务仍有价值 |
为什么 Decoder-only 笑到了最后?
2018 年 BERT(双向编码器)在理解任务上碾压 GPT-1,业界一度以为「编码器才是正道」;2023 年以后,所有旗舰模型几乎全是 Decoder-only。原因有三:
- 训练与推理目标一致:生成是 LLM 的唯一出口,因果(单向)注意力的 next-token 训练目标与推理时的自回归生成完全同构,没有「编码器负责理解、解码器负责生成」的目标错配。
- 工程效率:因果注意力天然适合推理加速(KV Cache 复用),Decoder-only 的架构更简单、更容易扩展到超大规模。
- 任务统一:翻译、摘要、问答、写代码统统可以表达成「文本进、文本出」的序列到序列任务,一个 Decoder-only 模型通吃,不需要为任务定制头结构。
小知识
T5 的结论与今天的主流相反:它当年发现「encoder-decoder 在转写任务上略好于 decoder-only」。历史证明,Decode 到底的模型靠规模与生态(比如 OpenAI 的 GPT 系列一路做大)后来居上。架构之争的最后赢家,往往由工程可扩展性与生态决定,而不是单点精度。
Transformer 内部的注意力、位置编码、KV Cache 等机制细节,参见Transformer 与注意力机制。
代表模型对比
截至 2025 年中,全球 LLM 格局大致是「美国闭源三巨头 + 开源阵营四方争霸」。以下表格仅用于建立直觉,模型月月更新,最新榜单请查模型与榜单速查。
| 模型 | 发布方 | 发布时间 | 参数量 | 开源 | 特色 |
|---|---|---|---|---|---|
| GPT-4o | OpenAI | 2024-05 | 未公开(传为 MoE) | 闭源 | 原生多模态、低延迟,ChatGPT 主力,见ChatGPT 与对话式 AI |
| Claude 3.5 / 3.7 Sonnet | Anthropic | 2024-06 / 2025-02 | 未公开 | 闭源 | 长上下文、代码与长文写作强、安全对齐突出 |
| Gemini 1.5 Pro / 2.5 Pro | 2024-02 / 2025-03 | 未公开 | 闭源 | 100 万级 token 超长上下文、多模态深度整合 | |
| Llama 3.1 | Meta | 2024-07 | 8B / 70B / 405B | 开源 | 开放权重旗舰,生态最大 |
| Qwen2.5 | 阿里巴巴 | 2024-09 | 0.5B ~ 72B | 开源 | 多语言、中文能力突出,小模型性价比高 |
| DeepSeek-V3 / R1 | 深度求索 | 2024-12 / 2025-01 | 671B(激活约 37B) | 开源 | 极低成本训练、开源推理模型标杆,见DeepSeek-R1 与推理模型 |
| Mistral 7B / Mixtral 8x7B | Mistral AI | 2023-09 / 2023-12 | 7B / 8x7B(MoE) | 开源 | 高效轻量,欧洲开源代表 |
text
读表的三条经验法则
① 参数量不再是唯一指标:MoE 架构让「总参数大、激活参数小」成为常态,
效果与成本要看「激活参数」而非「总参数」。
② 闭源模型强在综合体验,开源模型强在可控与成本:能私有化部署、
数据不出域,还可继续微调。
③ 没有永恒的第一:榜单隔月就换,选型应锚定「你的任务」而非「最强」。关键能力与关键局限
关键能力
- 生成与创作:写文章、改代码、翻译、摘要、头脑风暴。
- 知识问答:覆盖训练语料中的事实知识(但截止到训练日)。
- 推理与规划:通过 CoT 做数学题、逻辑题;作为 Agent 的「大脑」做任务拆解。
- 代码能力:生成、解释、调试代码,催生了GitHub Copilot 与代码智能这类杀手级应用。
关键局限
| 局限 | 具体表现 | 典型对策 |
|---|---|---|
| 幻觉(hallucination) | 自信满满地编造不存在的知识、虚构引用与链接 | RAG 外挂真实语料、评估与人工抽检,见检索增强生成与LLM 评估与基准 |
| 上下文窗口有限 | 注意力计算量随长度平方增长,超长文档「记不住」 | 长窗口模型、摘要分层、RAG 只喂相关片段 |
| 推理成本高 | 每次生成都跑一遍前向,token 越多越贵越慢 | 量化、投机采样、缓存,见推理优化与量化 |
| 知识时效差 | 只学到训练截止日,不知道最新事件 | 接搜索引擎或实时数据源,见Perplexity 与 AI 搜索 |
| 安全隐患 | 越狱、偏见、隐私泄露、被诱导输出有害内容 | 对齐、护栏、内容过滤,见AI 安全与治理 |
最贵的教训
幻觉不会因为模型变大而消失,反而会因「更自信」而更难察觉。 凡是「错了有代价」的场景——医疗、金融、法律、代码上线——都不能让 LLM 裸奔,必须叠加检索、校验与人工把关。相关工程陷阱见常见陷阱与反模式。
应用方式全景:Prompt / RAG / Agent
LLM 出厂只是一台「概率生成机」,要变成业务价值,需要套上不同的「工作方式」。当前主流的三种范式如下:
| 维度 | 直接调用(Prompt) | 外挂知识(RAG) | 自主执行(Agent) |
|---|---|---|---|
| 核心思想 | 把问题写清楚,让模型直接答 | 先检索相关资料再作答 | 让模型规划并调用工具完成任务 |
| 成本 | 最低 | 中(+向量库与检索管道) | 高(多轮调用 + 工具 + 容错) |
| 事实准确性 | 差(幻觉风险最高) | 好(可引用来源) | 中(依赖工具返回的真实结果) |
| 知识时效 | 差(停在训练截止日) | 好(索引可实时更新) | 好(可实时查询/抓取) |
| 私域数据支持 | 否 | 是(知识库索引) | 是 |
| 任务复杂度 | 一次性问答/生成 | 单轮问答为主 | 多步规划、拆解、执行 |
| 典型栈 | API + 提示词 | 向量库 + 检索 + 重排 | 函数调用 + 浏览器/代码执行 |
三种方式的定位
- 直接调用(Prompt):最适合「一次性、开放式、无硬性事实要求」的任务——写文案、头脑风暴、润色、翻译。上手最快,技巧见提示词工程与提示词实战手册。
- RAG(检索增强生成):最适合「答案有正确来源、要求可溯源」的任务——客服问答、企业知识库、实时信息。它把检索能力外挂给 LLM,是当前企业落地的事实标准,从零搭建见从零搭建 RAG 应用,底层语义检索原理见向量数据库与语义检索。
- Agent:最适合「多步骤、要动手干活」的任务——查资料并写报告、自动排程、操作软件。LLM 只负责规划,执行交给工具,见AI 智能体(Agent)、从零开发一个 Agent与Manus 与 Agent 应用。
一句话选型判断
先问三个问题:答案要不要准确来源?知识要不要实时?任务要不要多步执行? 三个都不要→Prompt;要来源/要实时→RAG;要多步执行→Agent。绝大多数真实产品是「RAG 打底 + 关键环节 Agent 化」的组合。
常见误区:LLM 不是数据库,也不是搜索引擎
把 LLM 当数据库查、当搜索引擎用,是新手最常见的两大误解。三者的本质完全不同:
| 维度 | LLM | 数据库 | 搜索引擎 | RAG(LLM+检索) |
|---|---|---|---|---|
| 底层操作 | 概率生成 | 精确查询 | 关键词/相关性匹配 | 检索 + 生成 |
| 返回结果 | 自然语言文本 | 结构化记录 | 网页链接列表 | 带引用的回答 |
| 面对确定事实 | 可能编造 | 一定准确 | 指向来源 | 尽量准确且可溯源 |
| 知识更新 | 训练时 | 即时写入 | 即时爬取 | 更新索引即可 |
- LLM 不是数据库:数据库存的是「确定的事实」,查出来就是真的;LLM 存的是「统计规律」,只保证「看起来像」,不保证「就是真的」。业务真相必须落在数据库里,LLM 负责把它们翻译成自然语言。
- LLM 不是搜索引擎:搜索引擎返回「来源」,由你判断;LLM 返回「结论」,替你判断——当它错了,你连错在哪里都难察觉。想要「搜索引擎的时效 + LLM 的表达」,正是 RAG 的用武之地,也推动了大模型时代的推荐系统与知识图谱与知识注入等结合方向。
LLM 与多模态、扩散模型的关系
LLM 的「文本单模态」是历史局限,不是本质局限:
- 多模态:把文本的 next-token prediction 扩展到「图像、音频、视频的 token」,同一套 Transformer 就能看图、听话、说画,形成了 GPT-4o、Gemini 这样的原生多模态模型,详见多模态模型。
- 扩散模型:图像/视频生成的主力是扩散模型与生成式 AI,它与 LLM 不是替代关系,而是互补——语言负责「理解与规划」,扩散负责「像素渲染」。Sora 等视频模型正是把两者融合进统一框架,见视频生成与图像生成。
总体架构视角
站在 10 万英尺看:LLM 是「会思考的大脑」,RAG 与数据库是「书架」,搜索引擎与工具是「手脚」,多模态与扩散是「五官与画笔」。把它们拼装起来的总体架构,见总体架构解剖。
延伸阅读
- 什么是 AI 热门概念——LLM 在整个 AI 版图中的位置
- AI vs ML vs DL vs GenAI vs Agent——概念边界辨析
- 演进简史——从 n-gram 到 LLM 的四十年
- Transformer 与注意力机制——LLM 的物理基础
- 微调与 PEFT(LoRA)——把基座模型改造成专用模型
- 对齐:RLHF 与 DPO——让模型安全、诚实、有用
- 提示词工程——不训练就改行为
- 检索增强生成(RAG)——LLM 接上知识库的正确姿势
- AI 智能体(Agent)——LLM 从「会说话」到「会干活」
- LLM 评估与基准——怎么知道模型真的行
- 推理优化与量化——把推理成本打下来
- ChatGPT 与对话式 AI——LLM 引爆大众市场的起点
- DeepSeek-R1 与推理模型——开源推理模型的标杆
- 模型与榜单速查——选型前的必查页
- 学习路径——想系统学 LLM 该走哪条路
参考资料
- Vaswani et al. Attention Is All You Need(NeurIPS, 2017) —— Transformer 原始论文,一切现代 LLM 的起点
- Devlin et al. BERT: Pre-training of Deep Bidirectional Transformers(2018) —— Encoder-only 代表
- Raffel et al. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer(T5, 2019) —— Encoder-Decoder 代表
- Brown et al. Language Models are Few-Shot Learners(GPT-3, 2020) —— 少样本与上下文学习的奠基论文
- Kaplan et al. Scaling Laws for Neural Language Models(2020) —— 规模法则的开山之作
- Hoffmann et al. Training Compute-Optimal Large Language Models(Chinchilla, 2022) —— 参数与数据配比的经典结论
- Wei et al. Emergent Abilities of Large Language Models(2022) —— 「涌现能力」概念的提出
- Wei et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models(2022) —— 推理链(CoT)原始论文
- OpenAI. GPT-4 Technical Report(2023) —— 闭源旗舰的技术报告
- Touvron et al. LLaMA: Open and Efficient Foundation Language Models(2023) —— 开源大模型浪潮的开端
- Touvron et al. Llama 2: Open Foundation and Fine-Tuned Chat Models(2023) —— 开源+对齐(RLHF)的完整样本
- DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning(2025) —— 开源推理模型标杆
- OpenAI Platform 文档:Models 概览 —— 官方模型列表与定价
- Hugging Face Open LLM Leaderboard —— 开源模型持续评测榜单