外观
总体架构解剖
一个现代 AI 应用,是一套由基础设施托底、Transformer 架构奠基、三大模型家族供给智能、能力层外接知识与工具、应用层编排体验的五层技术栈。 外行人看到的是 ChatGPT 的对话框,工程师看到的是层层叠叠的抽象;本文把这座"冰山"完整切开,自顶向下逐层解剖,再换到数据流与时间线两个视角重看一遍。读完这一页,你就拿到了整个站点的地图:每一层的核心概念、对应案例、论文与实践入口,全部在这张图上就位。
这一页适合四类读者:想建立全局观的初学者、要画系统设计的架构师、准备面试的求职者、以及想从"会调 API"走向"理解系统"的开发者。无论你从哪进来,先花十分钟通读本文,后面的路会顺得多。
一、全景图:AI 应用的技术栈
先看全貌。下面这张图把「AI 应用」拆成五层,外加一条横贯的工程线:
text
┌────────────────────────── AI 应用技术栈 ──────────────────────────┐
│ │
│ 应用层 Agent 智能体 / 对话 / AI 搜索 / 图像视频创作 / 编程助手 │
│ │
│ 能力层 提示词工程 / RAG 检索 / 向量数据库 / 知识图谱 │
│ │
│ 模型层 大语言模型 (LLM) / 多模态模型 / 扩散模型 │
│ │
│ 架构层 Transformer 与注意力机制 │
│ │
│ 基础设施层 GPU / 推理引擎 / 量化 / 部署 / 数据管道 / 向量索引 │
│ │
│ ─────────────────────────────────────────────────────────────── │
│ 工程层(不参与线上运行时,决定模型"出厂质量"): │
│ 预训练 → 微调与 PEFT → 对齐 → 评估 → 推理优化 │
└────────────────────────────────────────────────────────────────────┘五层是线上运行时的关系:请求从上往下流,答案从下往上返。工程层则是制造侧——它不在一行请求的路径上,却决定了线上模型的智能上限、可信程度和运行成本。用一句话概括:上层消费智能,下层生产智能,工程层打磨智能。
| 层 | 一句话回答"这层是什么" | 深入入口 |
|---|---|---|
| 应用层 | 用户能直接用的产品形态与任务闭环 | Agent 智能体 |
| 能力层 | 让模型能检索、能查证、能被约束的"外挂" | RAG |
| 模型层 | 供给智能的三大家族:文本、多模态、生成 | 大语言模型 |
| 架构层 | 一切现代模型的地基:注意力机制 | Transformer |
| 基础设施层 | 算力、推理、部署、数据管道 | 推理优化与量化 |
| 工程层(制造侧) | 训练、定制、对齐、评估、放量 | 微调与 PEFT |
下面自底向上逐层解剖——从最稳定的地基开始,讲到最后端给用户的应用。
二、自底向上逐层解剖
① 架构层:Transformer 与注意力——一切现代模型的地基
这一层是全栈的地质层。无论你用的是 GPT 还是扩散模型,往上追三代,祖辈都写在 2017 年那篇《Attention Is All You Need》里。Transformer 的核心贡献是把**注意力机制(Attention)**做成了全网络的骨架:模型可以动态决定"看哪里、多看重",不再像 RNN 那样被迫把信息压进一条时序管道。
| Transformer 关键组件 | 干什么 | 为什么缺了它不行 |
|---|---|---|
| 自注意力(Self-Attention) | 每个 token 与序列内所有 token 计算关联权重 | 长程依赖建模的核心手段 |
| 多头注意力(Multi-Head) | 多组注意力头并行,各学各的关系 | 单一注意力表达力不够 |
| 位置编码(Positional Encoding) | 给并行计算的 token 注入顺序信息 | Transformer 本身不分先后 |
| 残差连接与 LayerNorm | 稳定深层网络训练 | 没有它几十层根本训不动 |
注意力机制的计算核心可用一句话概括:对查询(Query)与键(Key)做点积相似度、softmax 归一化成权重,再加权求和值(Value)。完整推导与直觉见 Transformer 与注意力机制。
一句话判断
架构层是五层里最稳定、最不该自己改的一层。主流模型近几年的进步几乎全部来自"Transformer 不动,换数据、换规模、换训练方法"——把地基理解透,比追每月的模型新闻重要得多。
② 模型层:三大模型家族的分工
架构层之上是具体的"模型物种"。2020 年代的主流模型可以归为三个家族,它们输出模态不同、任务分工不同、训练方式也不同:
| 家族 | 核心输入→输出 | 代表方向 | 代表案例 | 深入入口 |
|---|---|---|---|---|
| 大语言模型(LLM) | 文本 → 文本 | 对话、写作、推理、代码 | ChatGPT、DeepSeek-R1 | 大语言模型 |
| 多模态模型 | 文本/图像/音频/视频混合 → 多模态 | 图文理解、视频生成、语音交互 | Sora 视频生成、Whisper 语音 AI | 多模态模型 |
| 扩散模型 | 文本/噪声 → 图像/视频 | 图像生成、图像编辑 | Midjourney | 扩散模型与生成式 AI |
三个家族不是替代关系,而是分工关系:LLM 负责"想",扩散模型负责"画",多模态负责"看和听"。真实产品往往是混合部署——一个多模态前端把用户的图片翻译成文本,交给 LLM 规划,再交给扩散模型产出图像。
不止三大家
模型层之外还有垂直物种:AlphaFold 一类的 AI for Science、大模型时代的推荐系统 都在这张谱系图上占一席。它们的底层架构仍是 Transformer 的变体,只是任务与训练目标不同。
③ 能力层:给模型接上"外脑"与"规则"
模型层解决"会不会",能力层解决"够不够"。单靠一个模型参数记忆,知识会过期、事实会编造、业务规则无法约束——于是业界在模型之外搭了一圈"外设",统称能力层:
| 能力 | 解决什么问题 | 关键组件 | 概念页 | 实践页 |
|---|---|---|---|---|
| 提示词工程 | 用话术激活模型已有能力 | 指令、少样本示例、思维链 | 提示词工程 | 提示词实战手册 |
| RAG 检索增强 | 注入外部事实、缓解幻觉 | 检索器 + 生成器 | RAG | 从零搭建 RAG 应用 |
| 向量数据库 | 给语义检索提供引擎 | 向量化 + 近似最近邻 | 向量数据库与语义检索 | 从零搭建 RAG 应用 |
| 知识图谱 | 注入结构化规则与关系 | 实体、关系、三元组 | 知识图谱与知识注入 | 常见陷阱与反模式 |
一句话判断
能力层是 2024 年以来性价比最高的工程杠杆:"先检索再生成"(RAG)比重训模型便宜两个数量级,见效却立竿见影。Perplexity 类 AI 搜索产品几乎完全靠"LLM + 检索 + 引用"这套组合打天下(见 Perplexity 与 AI 搜索)。
④ 应用层:把能力编排成任务闭环
能力层提供"零件",应用层把它们装配成"产品"。应用层的主角是 Agent 智能体(AI Agent)——它不止回答一个问题,而是把感知、规划、调用工具、执行、自我检查编排成一个任务闭环(详见 Agent 智能体)。当前主流的应用形态大致三类:
| 应用形态 | 能力层组合 | 代表 | 案例页 |
|---|---|---|---|
| 对话式助手 | 提示词 + 对话记忆 | ChatGPT | ChatGPT 与对话式 AI |
| AI 搜索 | 提示词 + RAG + 引用呈现 | Perplexity | Perplexity 与 AI 搜索 |
| 任务型 Agent | 提示词 + 工具调用 + 规划循环 | Manus 等通用 Agent | Manus 与 Agent 应用 |
应用层还有一个被低估的品种——嵌入现有产品的智能:GitHub Copilot 把 LLM 变成 IDE 里的常驻队友。应用层形态千变万化,但骨架一致:上层选好模型,接上能力层外设,再写一层编排逻辑。亲手搭一个最小 Agent 的完整过程,见 从零开发一个 Agent。
⑤ 工程层:让模型可定制、可信、可跑
工程层不在线上请求路径上,却在模型"出厂"之前把三道关:可定制(基础模型未必适合你的业务)、可信(别乱说、别伤人)、可跑(成本与延迟压得住)。
| 工程任务 | 解决什么 | 核心方法 | 概念页 | 实践页 |
|---|---|---|---|---|
| 微调与 PEFT | 让模型适配领域数据 | LoRA、QLoRA 等低秩适配 | 微调与 PEFT | 微调你自己的 LLM |
| 对齐 | 让模型符合人类偏好与价值观 | RLHF、DPO、安全训练 | 对齐:RLHF 与 DPO、AI 安全与治理 | 部署与推理优化实战 |
| 推理优化 | 压延迟、降成本 | 量化、蒸馏、KV Cache、投机采样 | 推理优化与量化 | 部署与推理优化实战 |
| 评估 | 知道模型到底行不行 | 基准测试、人工评估、自动评测 | LLM 评估与基准 | 搭建一套 LLM 评估 |
最容易踩的坑
工程层四个环节环环相扣,先评估、再微调是铁律。很多团队跳过高性价比的"提示词→RAG→微调"递进路线,一上来就烧钱微调,结果只是把幻觉换了个样子。递进顺序与常见翻车现场见 常见陷阱与反模式。
三、数据流视角:一次请求如何穿过各层
静态看层,动态看流。把一次「用户提问 → 得到回答」放大,就能看到五层如何协作:
text
输入 ──▶ 提示词装配 ──▶ 语义检索 ──▶ 模型推理 ──▶ 输出渲染 ──▶ 评估反馈
(能力层) (能力层) (模型+架构) (应用层) (工程层)| 步骤 | 经过的层 | 关键机制 | 深入阅读 |
|---|---|---|---|
| ① 输入规范化 | 应用层 | 会话管理、指令封装 | ChatGPT 与对话式 AI |
| ② 提示词装配 | 能力层 | 指令 + 少样本示例 + 工具定义 | 提示词工程 |
| ③ 语义检索 | 能力层 | 用户问题向量化,在向量库召回相关文档 | 向量数据库与语义检索 |
| ④ 上下文注入 | 能力层 | 检索结果拼进提示词,即 RAG 的精髓 | RAG |
| ⑤ 模型推理 | 模型层 + 架构层 | 自回归解码,逐 token 生成 | 大语言模型 |
| ⑥ 输出渲染 | 应用层 | 流式输出、引用标注、格式校验 | Perplexity 与 AI 搜索 |
| ⑦ 评估反馈 | 工程层 | 离线评测、线上观测、错误回流 | LLM 评估与基准 |
这条链路上,③④ 两步是可选但强烈推荐的——没有检索的裸问答,幻觉率显著更高。完整的端到端搭建过程就是 从零搭建 RAG 应用 那篇实践的主体内容。
四、训练-后训练-推理:模型生命的三个阶段
数据流视角回答"一次请求怎么走",时间线视角回答"一个模型怎么来"。任何现代大模型的诞生都走三段:
| 阶段 | 干什么 | 关键技术与规模 | 概念入口 |
|---|---|---|---|
| 预训练 | 在海量文本上学语言规律 | Transformer + 数据规模 + 算力规模 | Transformer |
| 后训练 | 微调适配 + 对齐价值观 | 指令微调、LoRA、RLHF、DPO | 微调与 PEFT、对齐 |
| 推理 | 部署优化、服务线上流量 | 量化、蒸馏、推理引擎 | 推理优化与量化 |
三阶段有一个鲜明的不对称:预训练烧钱、后训练烧脑、推理烧机。预训练决定智力上限(参数规模与数据),后训练决定行为下限(可不可用、安不安全),推理决定单位成本。DeepSeek-R1 的惊艳之处正在于它展示了"预训练骨架不变,靠强化学习式的后训练逼出推理能力"(见 DeepSeek-R1 与推理模型)。三阶段的完整时间线叙事,见 演进简史。
五、全站内容地图:七个栏目 × 分层图
最后把整个站点钉在这张分层图上。全站 7 个栏目各有分工,对应关系如下:
| 栏目 | 它覆盖分层图的哪几层 | 入口页 |
|---|---|---|
| 导读(guide) | 全部五层 + 工程层的全局视图 | 学习路径、概念边界 |
| 核心知识(concepts) | 五层 + 工程层的 14 个概念逐层展开 | 概念总览 |
| 案例(case-studies) | 应用层为主,兼及模型层 | 10 个经典案例 |
| 论文(papers) | 架构层与模型层的原始文献 | 论文地图、阅读路径 |
| 实践(practice) | 能力层 + 工程层的动手指南 | 从零搭建 RAG 应用、微调你的 LLM |
| 求职(career) | 各层对应的岗位与技能 | 岗位版图、JD 知识点拆解 |
| 资源(resources) | 全层位的术语、数据集、模型速查 | 术语表、模型与榜单速查 |
这一页怎么用
- 想快速建全局观:通读本文即可;
- 想深入某一层:点层名链接进对应概念页;
- 想动手:按 学习路径 选路线,去 从零搭建 RAG 应用 和 从零开发一个 Agent 亲手搭;
- 想考证照:去 面试题库 用这张图自测——能讲清五层各自解决什么问题,就过了大半。
延伸阅读
- 什么是 AI 热门概念——本文的开篇定义与全景总览
- AI vs ML vs DL vs GenAI vs Agent——把本文的层名翻译成概念边界
- 演进简史——这套技术栈为什么长成这样
- 学习路径——三条路线,对号入座
- Transformer 与注意力机制——架构层的完整推导
- RAG 与 Agent 智能体——能力层与应用层的双主角
- 常见陷阱与反模式——各层各自的经典翻车现场
参考资料
- Attention Is All You Need (Vaswani et al., 2017)——Transformer 原始论文,架构层的地基文献
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (Lewis et al., 2020)——RAG 的奠基论文
- Training Language Models to Follow Instructions with Human Feedback (Ouyang et al., 2022)——InstructGPT/RLHF,对齐技术源头
- LoRA: Low-Rank Adaptation of Large Language Models (Hu et al., 2021)——PEFT 最主流方法的原始论文
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (2025)——后训练阶段逼出推理能力的标杆技术报告
- Hugging Face Docs——微调、评估、推理工具链的一手文档