Skip to content

大语言模型(LLM)

本页速览 大语言模型(LLM)是生成式 AI 浪潮的核心引擎。本文讲清它的核心机制(next-token prediction)、三阶段训练范式、涌现能力、架构谱系、代表模型对比、能力边界,以及 Prompt / RAG / Agent 三种应用方式的取舍。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

大语言模型(LLM) ​

一句话定义 ​

大语言模型(Large Language Model, LLM)是基于 Transformer 架构、在海量文本上预训练、以「预测下一个 token」为学习目标、参数量通常达数十亿以上的语言模型。

它既是「语言」模型,也是「世界」模型:为了预测下一个词,模型被迫从数十亿网页、书籍、代码里提炼出语法规则、事实知识、逻辑关系乃至人设语气。2017 年 Transformer 论文问世、2018 年 GPT 与 BERT 相继出现,2022 年底 ChatGPT 引爆大众市场,LLM 已成为当前生成式 AI 浪潮的核心引擎——什么是 AI 热门概念里的绝大多数热点,都是围绕它展开的。

谁在用 LLM?几乎所有人都在用,只是姿势不同:普通人用对话产品问问题;开发者通过 API 做应用;研究人员继续把它做大、做小、做懂;企业则用它改造客服、写作、代码、搜索等几乎一切业务。可以毫不夸张地说,LLM 是过去十年 AI 领域最重大的单点突破。想看清它在整个技术版图中的位置,可以先读概念边界全景与演进简史。

核心机制:自回归语言建模 ​

LLM 的全部本领,归根结底只有一个操作:给定一段文本,预测下一个 token(词元)最可能是什么。

从 token 到条件概率 ​

原始文本先被切成 token——可以是单词、子词或字符。然后模型把「预测下一个 token」建模为条件概率:

text
P(xₜ | x₁, x₂, …, xₜ₋₁)

给定前 t-1 个 token,预测第 t 个 token 的概率分布。整段文本的联合概率,就是每个 token 条件概率的连乘:

text
P(x₁, x₂, …, xₙ) = ∏ₜ P(xₜ | x₁, …, xₜ₋₁)

训练目标就是最大化这个对数似然(等价于最小化交叉熵损失):

text
L = -Σₜ log P(xₜ | x₁, …, xₜ₋₁)

训练与推理的一体两面 ​

这一机制优美之处在于:训练时它只学「接话」,推理时它也只会「接话」——两者共享同一套代码路径。训练阶段用真实文本做「标准答案」逐步预测(teacher forcing);推理阶段则把自己上一步生成的 token 当作下一步的输入,逐 token 自回归地生成整段内容:

python
# 自回归生成示意:一次只生成一个 token
def generate(model, prompt, max_new_tokens=100):
    tokens = tokenize(prompt)
    for _ in range(max_new_tokens):
        logits = model(tokens)             # 模型给出下一个 token 的分布
        next_token = sample(logits[-1])    # 从分布中采样(可用温度/top-p 控制)
        tokens.append(next_token)
        if next_token == EOS:              # 遇到结束符就停止
            break
    return detokenize(tokens)

关键结论

LLM 不是一个「按关键词查答案」的系统,而是一个词表上的概率分布生成器。它每次生成都是采样的结果——同一个问题两次回答可能不同,这不是 bug,而是概率模型的固有属性。这一点是理解后面所有能力与缺陷(尤其是幻觉)的出发点。

「预测下一个 token」听起来简单,但要让预测变准,模型必须内化海量知识。Transformer 的自注意力机制让每个 token 都能「看见」上下文中所有其他 token,从而建模长距离依赖——这是 LLM 的物理基础,详见Transformer 与注意力机制。

三阶段训练范式:预训练 → 后训练 ​

LLM 的能力不是一次训练得到的,而是**分阶段「培养」**出来的。现代 LLM 普遍遵循「预训练(pretraining)+ 后训练(post-training)」的范式,后训练又分监督微调与对齐两步:

text
    海量文本语料(数万亿 token,来自网页/书籍/代码)
                          │
                          ▼
        ┌──────────────────────────────┐
        │  ① 预训练 Pretraining        │
        │  目标:预测下一个 token       │
        │  产出:会「接话」的基座模型   │
        └──────────────────────────────┘
                          │
                          ▼
        ┌──────────────────────────────┐
        │  ② 监督微调 SFT(指令微调)  │
        │  数据:人类标注的指令-回答对  │
        │  产出:会把知识组织成「回答」 │
        └──────────────────────────────┘
                          │
                          ▼
        ┌──────────────────────────────┐
        │  ③ 对齐 Alignment(RLHF/DPO)│
        │  数据:人类偏好比较排序       │
        │  产出:安全、诚实、有用的模型 │
        └──────────────────────────────┘
                          │
                          ▼
                     部署上线推理
  • 预训练(pretraining):在海量无监督文本上做 next-token prediction,耗时数周、耗资数千万美元,产出「基座模型」(base model)。它已具备语言能力与大量知识,但「只会接话、不会好好回答问题」。
  • 监督微调(Supervised Fine-Tuning, SFT):用成千上万条「指令-期望回答」对继续训练,让模型学会用户问什么就答什么。这是把「会接话的婴儿」培养成「会回答问题的助手」的关键一步,机制详见微调与 PEFT(LoRA)。
  • 对齐(Alignment):用人类偏好数据(对多个回答排序)通过 RLHF 或 DPO 训练,让模型更乐于拒绝有害请求、诚实承认不知道、减少谄媚,方法与代价详见对齐:RLHF 与 DPO。

必须记住的一句话

预训练决定「能力上限」,后训练决定「行为风格」。 后训练无法凭空造出预训练没学到的知识——它只能把已有能力塑造成用户想要的样子。很多「模型变笨了」的抱怨,根源往往在于对齐阶段过度压制了模型的表达。

如果你打算自己动手复现这套流程(哪怕是小规模),可参考微调你自己的 LLM的实战路线。

涌现能力:规模带来的质变 ​

当模型规模跨过某个临界点(通常数百亿参数之后),一些在训练目标里从未被显式要求的能力突然出现,这就是涌现能力(emergent abilities):

能力一句话描述典型触发方式
上下文学习(in-context learning)不更新参数,仅靠 prompt 里的几个示例就能学会新任务在提示词里给出 1~5 个输入-输出示例
指令跟随理解并执行自然语言指令把任务用自然语言描述出来
推理链(Chain-of-Thought, CoT)通过「先分步思考再作答」显著提升数学/逻辑正确率提示词要求「请一步步思考」
少样本(few-shot)只需少量示例就能完成从未见过的任务prompt 内嵌示例

这些能力与传统小模型的「每任务单独训练」截然不同,也正是 LLM 区别于此前所有 NLP 模型的分水岭。涌现能力的研究证据来自 Wei et al.(2022)《Emergent Abilities of Large Language Models》,详见经典论文精读。

涌现与规模法则的关系 ​

**规模法则(scaling laws)**揭示了「更大模型 + 更多数据 + 更多算力」与「损失下降」之间的可预测幂律关系:Kaplan et al.(2020)发现损失随参数、数据、计算量呈幂律下降;Chinchilla(Hoffmann et al., 2022)进一步给出「计算最优」配比——模型参数每翻倍,训练 token 数也应同步翻倍,也就是今天训练大模型「1 个参数配约 20 个 token」的经验法则。

两者的关系可以概括为一句话:

一句话判断

规模法则负责「可预测的平滑进步」,涌现负责「不可预测的质变跳变」。规模推着损失一路下降,而某些能力在损失曲线的特定位置突然「解锁」——我们无法精确预言它在哪个规模出现,只能靠实验撞出来。这就是前沿团队仍在拼命堆规模的底层动机,最新进展见前沿进展。

这也解释了为什么 2020 年代的「军备竞赛」如此激烈:谁先够到下一个临界规模,谁就先解锁一批新能力。

架构谱系:从 BERT、GPT 到 T5 ​

按 Transformer 的用法不同,语言模型分为三大谱系:

谱系代表模型注意力方向预训练目标擅长今天的位置
Encoder-onlyBERT、RoBERTa双向掩码语言建模(MLM)理解、表征、分类、检索语义向量/Embedding 的主力
Decoder-onlyGPT 系、Llama、Qwen、DeepSeek单向(因果)next-token prediction生成、对话、推理绝对主流
Encoder-DecoderT5、BART双向编码 + 自回归解码文本段补全翻译、摘要等转写任务特定任务仍有价值

为什么 Decoder-only 笑到了最后? ​

2018 年 BERT(双向编码器)在理解任务上碾压 GPT-1,业界一度以为「编码器才是正道」;2023 年以后,所有旗舰模型几乎全是 Decoder-only。原因有三:

  1. 训练与推理目标一致:生成是 LLM 的唯一出口,因果(单向)注意力的 next-token 训练目标与推理时的自回归生成完全同构,没有「编码器负责理解、解码器负责生成」的目标错配。
  2. 工程效率:因果注意力天然适合推理加速(KV Cache 复用),Decoder-only 的架构更简单、更容易扩展到超大规模。
  3. 任务统一:翻译、摘要、问答、写代码统统可以表达成「文本进、文本出」的序列到序列任务,一个 Decoder-only 模型通吃,不需要为任务定制头结构。

小知识

T5 的结论与今天的主流相反:它当年发现「encoder-decoder 在转写任务上略好于 decoder-only」。历史证明,Decode 到底的模型靠规模与生态(比如 OpenAI 的 GPT 系列一路做大)后来居上。架构之争的最后赢家,往往由工程可扩展性与生态决定,而不是单点精度。

Transformer 内部的注意力、位置编码、KV Cache 等机制细节,参见Transformer 与注意力机制。

代表模型对比 ​

截至 2025 年中,全球 LLM 格局大致是「美国闭源三巨头 + 开源阵营四方争霸」。以下表格仅用于建立直觉,模型月月更新,最新榜单请查模型与榜单速查。

模型发布方发布时间参数量开源特色
GPT-4oOpenAI2024-05未公开(传为 MoE)闭源原生多模态、低延迟,ChatGPT 主力,见ChatGPT 与对话式 AI
Claude 3.5 / 3.7 SonnetAnthropic2024-06 / 2025-02未公开闭源长上下文、代码与长文写作强、安全对齐突出
Gemini 1.5 Pro / 2.5 ProGoogle2024-02 / 2025-03未公开闭源100 万级 token 超长上下文、多模态深度整合
Llama 3.1Meta2024-078B / 70B / 405B开源开放权重旗舰,生态最大
Qwen2.5阿里巴巴2024-090.5B ~ 72B开源多语言、中文能力突出,小模型性价比高
DeepSeek-V3 / R1深度求索2024-12 / 2025-01671B(激活约 37B)开源极低成本训练、开源推理模型标杆,见DeepSeek-R1 与推理模型
Mistral 7B / Mixtral 8x7BMistral AI2023-09 / 2023-127B / 8x7B(MoE)开源高效轻量,欧洲开源代表
text
读表的三条经验法则
① 参数量不再是唯一指标:MoE 架构让「总参数大、激活参数小」成为常态,
   效果与成本要看「激活参数」而非「总参数」。
② 闭源模型强在综合体验,开源模型强在可控与成本:能私有化部署、
   数据不出域,还可继续微调。
③ 没有永恒的第一:榜单隔月就换,选型应锚定「你的任务」而非「最强」。

关键能力与关键局限 ​

关键能力 ​

  • 生成与创作:写文章、改代码、翻译、摘要、头脑风暴。
  • 知识问答:覆盖训练语料中的事实知识(但截止到训练日)。
  • 推理与规划:通过 CoT 做数学题、逻辑题;作为 Agent 的「大脑」做任务拆解。
  • 代码能力:生成、解释、调试代码,催生了GitHub Copilot 与代码智能这类杀手级应用。

关键局限 ​

局限具体表现典型对策
幻觉(hallucination)自信满满地编造不存在的知识、虚构引用与链接RAG 外挂真实语料、评估与人工抽检,见检索增强生成与LLM 评估与基准
上下文窗口有限注意力计算量随长度平方增长,超长文档「记不住」长窗口模型、摘要分层、RAG 只喂相关片段
推理成本高每次生成都跑一遍前向,token 越多越贵越慢量化、投机采样、缓存,见推理优化与量化
知识时效差只学到训练截止日,不知道最新事件接搜索引擎或实时数据源,见Perplexity 与 AI 搜索
安全隐患越狱、偏见、隐私泄露、被诱导输出有害内容对齐、护栏、内容过滤,见AI 安全与治理

最贵的教训

幻觉不会因为模型变大而消失,反而会因「更自信」而更难察觉。 凡是「错了有代价」的场景——医疗、金融、法律、代码上线——都不能让 LLM 裸奔,必须叠加检索、校验与人工把关。相关工程陷阱见常见陷阱与反模式。

应用方式全景:Prompt / RAG / Agent ​

LLM 出厂只是一台「概率生成机」,要变成业务价值,需要套上不同的「工作方式」。当前主流的三种范式如下:

维度直接调用(Prompt)外挂知识(RAG)自主执行(Agent)
核心思想把问题写清楚,让模型直接答先检索相关资料再作答让模型规划并调用工具完成任务
成本最低中(+向量库与检索管道)高(多轮调用 + 工具 + 容错)
事实准确性差(幻觉风险最高)好(可引用来源)中(依赖工具返回的真实结果)
知识时效差(停在训练截止日)好(索引可实时更新)好(可实时查询/抓取)
私域数据支持否是(知识库索引)是
任务复杂度一次性问答/生成单轮问答为主多步规划、拆解、执行
典型栈API + 提示词向量库 + 检索 + 重排函数调用 + 浏览器/代码执行

三种方式的定位 ​

一句话选型判断

先问三个问题:答案要不要准确来源?知识要不要实时?任务要不要多步执行? 三个都不要→Prompt;要来源/要实时→RAG;要多步执行→Agent。绝大多数真实产品是「RAG 打底 + 关键环节 Agent 化」的组合。

常见误区:LLM 不是数据库,也不是搜索引擎 ​

把 LLM 当数据库查、当搜索引擎用,是新手最常见的两大误解。三者的本质完全不同:

维度LLM数据库搜索引擎RAG(LLM+检索)
底层操作概率生成精确查询关键词/相关性匹配检索 + 生成
返回结果自然语言文本结构化记录网页链接列表带引用的回答
面对确定事实可能编造一定准确指向来源尽量准确且可溯源
知识更新训练时即时写入即时爬取更新索引即可
  • LLM 不是数据库:数据库存的是「确定的事实」,查出来就是真的;LLM 存的是「统计规律」,只保证「看起来像」,不保证「就是真的」。业务真相必须落在数据库里,LLM 负责把它们翻译成自然语言。
  • LLM 不是搜索引擎:搜索引擎返回「来源」,由你判断;LLM 返回「结论」,替你判断——当它错了,你连错在哪里都难察觉。想要「搜索引擎的时效 + LLM 的表达」,正是 RAG 的用武之地,也推动了大模型时代的推荐系统与知识图谱与知识注入等结合方向。

LLM 与多模态、扩散模型的关系 ​

LLM 的「文本单模态」是历史局限,不是本质局限:

  • 多模态:把文本的 next-token prediction 扩展到「图像、音频、视频的 token」,同一套 Transformer 就能看图、听话、说画,形成了 GPT-4o、Gemini 这样的原生多模态模型,详见多模态模型。
  • 扩散模型:图像/视频生成的主力是扩散模型与生成式 AI,它与 LLM 不是替代关系,而是互补——语言负责「理解与规划」,扩散负责「像素渲染」。Sora 等视频模型正是把两者融合进统一框架,见视频生成与图像生成。

总体架构视角

站在 10 万英尺看:LLM 是「会思考的大脑」,RAG 与数据库是「书架」,搜索引擎与工具是「手脚」,多模态与扩散是「五官与画笔」。把它们拼装起来的总体架构,见总体架构解剖。

延伸阅读 ​

参考资料 ​