Skip to content

总体架构解剖

本页速览 把一套 AI 应用自顶向下拆成应用、能力、模型、架构、基础设施五层,再沿数据流与训练-后训练-推理两重视角串联。本文是全站内容地图,每层都指向深入页面。

总体架构解剖 ​

一个现代 AI 应用,是一套由基础设施托底、Transformer 架构奠基、三大模型家族供给智能、能力层外接知识与工具、应用层编排体验的五层技术栈。 外行人看到的是 ChatGPT 的对话框,工程师看到的是层层叠叠的抽象;本文把这座"冰山"完整切开,自顶向下逐层解剖,再换到数据流与时间线两个视角重看一遍。读完这一页,你就拿到了整个站点的地图:每一层的核心概念、对应案例、论文与实践入口,全部在这张图上就位。

这一页适合四类读者:想建立全局观的初学者、要画系统设计的架构师、准备面试的求职者、以及想从"会调 API"走向"理解系统"的开发者。无论你从哪进来,先花十分钟通读本文,后面的路会顺得多。

一、全景图:AI 应用的技术栈 ​

先看全貌。下面这张图把「AI 应用」拆成五层,外加一条横贯的工程线:

text
┌────────────────────────── AI 应用技术栈 ──────────────────────────┐
│                                                                    │
│  应用层    Agent 智能体 / 对话 / AI 搜索 / 图像视频创作 / 编程助手   │
│                                                                    │
│  能力层    提示词工程 / RAG 检索 / 向量数据库 / 知识图谱             │
│                                                                    │
│  模型层    大语言模型 (LLM) / 多模态模型 / 扩散模型                 │
│                                                                    │
│  架构层    Transformer 与注意力机制                                 │
│                                                                    │
│  基础设施层  GPU / 推理引擎 / 量化 / 部署 / 数据管道 / 向量索引      │
│                                                                    │
│  ───────────────────────────────────────────────────────────────   │
│  工程层(不参与线上运行时,决定模型"出厂质量"):                   │
│  预训练 → 微调与 PEFT → 对齐 → 评估 → 推理优化                     │
└────────────────────────────────────────────────────────────────────┘

五层是线上运行时的关系:请求从上往下流,答案从下往上返。工程层则是制造侧——它不在一行请求的路径上,却决定了线上模型的智能上限、可信程度和运行成本。用一句话概括:上层消费智能,下层生产智能,工程层打磨智能。

层一句话回答"这层是什么"深入入口
应用层用户能直接用的产品形态与任务闭环Agent 智能体
能力层让模型能检索、能查证、能被约束的"外挂"RAG
模型层供给智能的三大家族:文本、多模态、生成大语言模型
架构层一切现代模型的地基:注意力机制Transformer
基础设施层算力、推理、部署、数据管道推理优化与量化
工程层(制造侧)训练、定制、对齐、评估、放量微调与 PEFT

下面自底向上逐层解剖——从最稳定的地基开始,讲到最后端给用户的应用。

二、自底向上逐层解剖 ​

① 架构层:Transformer 与注意力——一切现代模型的地基 ​

这一层是全栈的地质层。无论你用的是 GPT 还是扩散模型,往上追三代,祖辈都写在 2017 年那篇《Attention Is All You Need》里。Transformer 的核心贡献是把**注意力机制(Attention)**做成了全网络的骨架:模型可以动态决定"看哪里、多看重",不再像 RNN 那样被迫把信息压进一条时序管道。

Transformer 关键组件干什么为什么缺了它不行
自注意力(Self-Attention)每个 token 与序列内所有 token 计算关联权重长程依赖建模的核心手段
多头注意力(Multi-Head)多组注意力头并行,各学各的关系单一注意力表达力不够
位置编码(Positional Encoding)给并行计算的 token 注入顺序信息Transformer 本身不分先后
残差连接与 LayerNorm稳定深层网络训练没有它几十层根本训不动

注意力机制的计算核心可用一句话概括:对查询(Query)与键(Key)做点积相似度、softmax 归一化成权重,再加权求和值(Value)。完整推导与直觉见 Transformer 与注意力机制。

一句话判断

架构层是五层里最稳定、最不该自己改的一层。主流模型近几年的进步几乎全部来自"Transformer 不动,换数据、换规模、换训练方法"——把地基理解透,比追每月的模型新闻重要得多。

② 模型层:三大模型家族的分工 ​

架构层之上是具体的"模型物种"。2020 年代的主流模型可以归为三个家族,它们输出模态不同、任务分工不同、训练方式也不同:

家族核心输入→输出代表方向代表案例深入入口
大语言模型(LLM)文本 → 文本对话、写作、推理、代码ChatGPT、DeepSeek-R1大语言模型
多模态模型文本/图像/音频/视频混合 → 多模态图文理解、视频生成、语音交互Sora 视频生成、Whisper 语音 AI多模态模型
扩散模型文本/噪声 → 图像/视频图像生成、图像编辑Midjourney扩散模型与生成式 AI

三个家族不是替代关系,而是分工关系:LLM 负责"想",扩散模型负责"画",多模态负责"看和听"。真实产品往往是混合部署——一个多模态前端把用户的图片翻译成文本,交给 LLM 规划,再交给扩散模型产出图像。

不止三大家

模型层之外还有垂直物种:AlphaFold 一类的 AI for Science、大模型时代的推荐系统 都在这张谱系图上占一席。它们的底层架构仍是 Transformer 的变体,只是任务与训练目标不同。

③ 能力层:给模型接上"外脑"与"规则" ​

模型层解决"会不会",能力层解决"够不够"。单靠一个模型参数记忆,知识会过期、事实会编造、业务规则无法约束——于是业界在模型之外搭了一圈"外设",统称能力层:

能力解决什么问题关键组件概念页实践页
提示词工程用话术激活模型已有能力指令、少样本示例、思维链提示词工程提示词实战手册
RAG 检索增强注入外部事实、缓解幻觉检索器 + 生成器RAG从零搭建 RAG 应用
向量数据库给语义检索提供引擎向量化 + 近似最近邻向量数据库与语义检索从零搭建 RAG 应用
知识图谱注入结构化规则与关系实体、关系、三元组知识图谱与知识注入常见陷阱与反模式

一句话判断

能力层是 2024 年以来性价比最高的工程杠杆:"先检索再生成"(RAG)比重训模型便宜两个数量级,见效却立竿见影。Perplexity 类 AI 搜索产品几乎完全靠"LLM + 检索 + 引用"这套组合打天下(见 Perplexity 与 AI 搜索)。

④ 应用层:把能力编排成任务闭环 ​

能力层提供"零件",应用层把它们装配成"产品"。应用层的主角是 Agent 智能体(AI Agent)——它不止回答一个问题,而是把感知、规划、调用工具、执行、自我检查编排成一个任务闭环(详见 Agent 智能体)。当前主流的应用形态大致三类:

应用形态能力层组合代表案例页
对话式助手提示词 + 对话记忆ChatGPTChatGPT 与对话式 AI
AI 搜索提示词 + RAG + 引用呈现PerplexityPerplexity 与 AI 搜索
任务型 Agent提示词 + 工具调用 + 规划循环Manus 等通用 AgentManus 与 Agent 应用

应用层还有一个被低估的品种——嵌入现有产品的智能:GitHub Copilot 把 LLM 变成 IDE 里的常驻队友。应用层形态千变万化,但骨架一致:上层选好模型,接上能力层外设,再写一层编排逻辑。亲手搭一个最小 Agent 的完整过程,见 从零开发一个 Agent。

⑤ 工程层:让模型可定制、可信、可跑 ​

工程层不在线上请求路径上,却在模型"出厂"之前把三道关:可定制(基础模型未必适合你的业务)、可信(别乱说、别伤人)、可跑(成本与延迟压得住)。

工程任务解决什么核心方法概念页实践页
微调与 PEFT让模型适配领域数据LoRA、QLoRA 等低秩适配微调与 PEFT微调你自己的 LLM
对齐让模型符合人类偏好与价值观RLHF、DPO、安全训练对齐:RLHF 与 DPO、AI 安全与治理部署与推理优化实战
推理优化压延迟、降成本量化、蒸馏、KV Cache、投机采样推理优化与量化部署与推理优化实战
评估知道模型到底行不行基准测试、人工评估、自动评测LLM 评估与基准搭建一套 LLM 评估

最容易踩的坑

工程层四个环节环环相扣,先评估、再微调是铁律。很多团队跳过高性价比的"提示词→RAG→微调"递进路线,一上来就烧钱微调,结果只是把幻觉换了个样子。递进顺序与常见翻车现场见 常见陷阱与反模式。

三、数据流视角:一次请求如何穿过各层 ​

静态看层,动态看流。把一次「用户提问 → 得到回答」放大,就能看到五层如何协作:

text
输入 ──▶ 提示词装配 ──▶ 语义检索 ──▶ 模型推理 ──▶ 输出渲染 ──▶ 评估反馈
        (能力层)         (能力层)       (模型+架构)   (应用层)      (工程层)
步骤经过的层关键机制深入阅读
① 输入规范化应用层会话管理、指令封装ChatGPT 与对话式 AI
② 提示词装配能力层指令 + 少样本示例 + 工具定义提示词工程
③ 语义检索能力层用户问题向量化,在向量库召回相关文档向量数据库与语义检索
④ 上下文注入能力层检索结果拼进提示词,即 RAG 的精髓RAG
⑤ 模型推理模型层 + 架构层自回归解码,逐 token 生成大语言模型
⑥ 输出渲染应用层流式输出、引用标注、格式校验Perplexity 与 AI 搜索
⑦ 评估反馈工程层离线评测、线上观测、错误回流LLM 评估与基准

这条链路上,③④ 两步是可选但强烈推荐的——没有检索的裸问答,幻觉率显著更高。完整的端到端搭建过程就是 从零搭建 RAG 应用 那篇实践的主体内容。

四、训练-后训练-推理:模型生命的三个阶段 ​

数据流视角回答"一次请求怎么走",时间线视角回答"一个模型怎么来"。任何现代大模型的诞生都走三段:

阶段干什么关键技术与规模概念入口
预训练在海量文本上学语言规律Transformer + 数据规模 + 算力规模Transformer
后训练微调适配 + 对齐价值观指令微调、LoRA、RLHF、DPO微调与 PEFT、对齐
推理部署优化、服务线上流量量化、蒸馏、推理引擎推理优化与量化

三阶段有一个鲜明的不对称:预训练烧钱、后训练烧脑、推理烧机。预训练决定智力上限(参数规模与数据),后训练决定行为下限(可不可用、安不安全),推理决定单位成本。DeepSeek-R1 的惊艳之处正在于它展示了"预训练骨架不变,靠强化学习式的后训练逼出推理能力"(见 DeepSeek-R1 与推理模型)。三阶段的完整时间线叙事,见 演进简史。

五、全站内容地图:七个栏目 × 分层图 ​

最后把整个站点钉在这张分层图上。全站 7 个栏目各有分工,对应关系如下:

栏目它覆盖分层图的哪几层入口页
导读(guide)全部五层 + 工程层的全局视图学习路径、概念边界
核心知识(concepts)五层 + 工程层的 14 个概念逐层展开概念总览
案例(case-studies)应用层为主,兼及模型层10 个经典案例
论文(papers)架构层与模型层的原始文献论文地图、阅读路径
实践(practice)能力层 + 工程层的动手指南从零搭建 RAG 应用、微调你的 LLM
求职(career)各层对应的岗位与技能岗位版图、JD 知识点拆解
资源(resources)全层位的术语、数据集、模型速查术语表、模型与榜单速查

这一页怎么用

延伸阅读 ​

参考资料 ​