外观
JD 知识点拆解
你拿到一份心仪公司的 JD,上面写着「精通 Transformer」「熟悉 RAG」「有 Agent 落地经验」「了解 LoRA 微调」「懂推理优化」……每一条都看得懂,但每一条又都隔着一层雾:到底要会到什么程度?面试官会怎么考?
本文要做的,就是把 JD 里的"技能词"翻译成一张可逐项复习的知识点清单——不是泛泛的"要学好大模型",而是精确到"能画出 self-attention 的计算流程""能讲清 RAG 里 chunk 怎么切、rerank 何时该上""能说出 LoRA 为什么参数少却有效"这样的具体考点。配合文末的五档自评表与补课清单生成方法,你可以用一下午完成"技能体检",得到一张属于自己的学习路线图。
拿到 JD ──① 提取技能词──② 映射到考点──③ 五档自评──④ 生成补课清单──⑤ 每周复测
│ │ │ │
精通/熟悉/了解 本文第二~十一节 本文第十二节 本文第十三节本文适合:投递RAG 应用工程师、Agent 工程师、大模型算法工程师、AI Infra 工程师等岗位的候选人,以及所有想把"我好像都会"变成"我能讲透"的学习者。
一、JD 技能词的真实考点
JD 不是课程大纲,它是公司对"你能独立产出什么"的最低期待。招聘方的潜台词是:
写"熟悉 RAG",不是要求你把 RAG 的概念背下来,而是要求你面对一个企业知识库问答需求时,能独立完成方案选型、动手搭建、量化评估、排查失败。
所以拆解 JD 的第一步,是把技能词映射到"面试官实际会考的能力"。三个常见误区先排掉:
- 误区一:把 JD 当全表。JD 里 10 条要求,公司心里通常只有 3 条是硬性门槛(决定简历关过不过),其余是"理想候选人画像"。优先补门槛项。
- 误区二:把"熟悉"当成"了解"。面试官写"熟悉 X",考查的是你能讲出原理、动手实现、说出权衡,而不是"听说过 X"。自评时请用"能讲透"作为"熟悉"的及格线。
- 误区三:只复习单点,不复习组合拳。面试几乎从来不是单点考:它常给你一个场景("给企业做知识库问答,数据是 10 万份 PDF,你怎么设计?"),要求你同时动用 RAG(架构)+ 向量检索(召回)+ 评测(效果)+ 推理优化(成本)。所以下面十个板块必须连起来看。
二、十大知识点总表:关键词 → 概念 → 考点 → 本站页面
这是全站最核心的一张映射表。左边是 JD 高频关键词,右边是它对应到本站的深度页面。
| JD 关键词 | 核心概念 | 面试会怎么考(典型问题) | 本站深度页面 |
|---|---|---|---|
| Transformer / 注意力 / 位置编码 | Self-Attention、QKV、多头、位置编码 | "Q/K/V 是什么?为什么按 √d_k 缩放?为什么需要位置编码?" | Transformer 与注意力机制 |
| LLM 原理 / 预训练 / 涌现 | Next-token 预测、Scaling Laws、涌现 | "next token prediction 为什么能学到语言?涌现怎么理解?" | 大语言模型(LLM) |
| 提示词 / CoT / 结构化输出 | Prompt 设计、思维链、输出约束 | "Few-shot 和 CoT 各解决什么问题?结构化输出怎么保证?" | 提示词工程 |
| RAG / 向量检索 / 重排 | 索引、chunking、召回、rerank | "RAG 各环节失败怎么排查?什么时候必须上 rerank?" | 检索增强生成(RAG) · 向量数据库与语义检索 |
| Agent / 工具调用 / ReAct | 任务规划、Function Calling、循环 | "Agent 卡死怎么办?工具调用的 schema 怎么设计?" | AI 智能体(Agent) |
| LoRA / 微调 / 数据工程 | PEFT、低秩适配、指令数据 | "LoRA 为什么参数少却有效?微调数据从哪来?" | 微调与 PEFT |
| RLHF / DPO / 对齐 | 奖励模型、PPO、偏好优化 | "RLHF 的奖励模型怎么训?DPO 比 RLHF 简化了什么?" | 对齐:RLHF 与 DPO |
| 量化 / 推理优化 / 部署 | INT8/INT4、KV Cache、服务化 | "量化为什么能加速?精度损失从哪来?KV Cache 干嘛用?" | 推理优化与量化 · 部署与推理优化实战 |
| 评测 / 基准 | 评测集、人工 vs 模型评估、指标 | "怎么评估生成质量?幻觉怎么量化?指标怎么映射业务?" | LLM 评估与基准 |
| 多模态 / 扩散 | 视觉编码器对齐、扩散过程 | "视觉编码器怎么和 LLM 对齐?扩散模型采样怎么加速?" | 多模态模型 · 扩散模型与生成式 AI |
下面十节逐个展开每个知识点的追问方向与推荐阅读页。总览与概念边界可先看什么是 AI 热门概念与概念边界。
三、Transformer / 注意力 / 位置编码
JD 词:「深入理解 Transformer 架构」。这是所有大模型相关岗位的地基题,几乎必考,且考得很细。
面试追问方向:
- Q/K/V 三者的含义与来源:"自己和自己做注意力,为什么叫 self-attention?"
- 缩放因子:为什么点积要除以 √d_k?"点积方差随维度增大,softmax 会饱和"
- 位置编码:为什么需要?旋转位置编码(RoPE)解决了什么?
- 多头注意力的意义:多头是在"看不同子空间的关系",与单头对比讲清。
- 与 CNN/RNN 的对比:并行性、长距离依赖、二次复杂度。
一句话判断:把「注意力计算流程 + 为什么缩放 + 位置编码的必要性」讲成一个 5 分钟故事,是这一板块的及格线。进阶阅读看Transformer 与注意力机制,动手理解可参考ChatGPT 与对话式 AI。
推荐阅读页:Transformer 与注意力机制 · 大语言模型(LLM)
四、LLM 原理 / 预训练 / 涌现
JD 词:「熟悉大语言模型原理」「有大模型训练/应用经验」。核心是回答"大模型是怎么变强的"。
面试追问方向:
- 预训练目标:next-token prediction 为什么能学出语法、知识与推理能力?
- Scaling Laws:参数、数据、算力同步增长时能力如何变化?"更大即更强"的边界在哪?
- 涌现:涌现能力是真能力还是评测产物?你怎么跟不懂的人解释它?
- 上下文学习:少样本/零样本的机制解释有哪些(贝叶斯视角 vs 隐式梯度视角)?
- 幻觉:参数化记忆的本质缺陷,如何缓解(这同时是 RAG 的动机)。
一句话判断:这一板块考的不是背结论,而是你是否建立了"模型 = 压缩的记忆 + 概率的生成"这个心智模型。完整讲解见大语言模型(LLM),演进脉络见演进简史。
推荐阅读页:大语言模型(LLM) · Transformer 与注意力机制 · DeepSeek-R1 与推理模型
五、提示词 / CoT / 结构化输出
JD 词:「熟悉提示词工程」「掌握 CoT」。这个板块看似简单,面试其实最爱"挖深度"。
面试追问方向:
- 提示词的组件:系统提示词、Few-shot 示例、输出格式约束各自解决什么问题?
- CoT:为什么"let's think step by step"有效?CoT 什么时候失效?
- 结构化输出:JSON mode、Function Calling 的 schema 设计,怎么保证解析不失败?
- 提示词 vs 微调:什么情况改提示词、什么情况必须微调?
- 成本与延迟:提示词越长 token 越贵,怎么在效果与成本间取舍?
一句话判断:提示词没有"标准答案",只有"可评测的迭代"——每次修改都要能用数据证明提升,这是区分"会调提示词"和"会做提示词工程"的分水岭。实战手册见提示词实战手册。
推荐阅读页:提示词工程 · 提示词实战手册 · LLM 评估与基准
六、RAG / 向量检索 / 重排
JD 词:「精通 RAG」「熟悉向量检索」。应用线岗位的核心命题,面试浓度最高。
面试追问方向:
- 全链路:离线索引(解析 → 清洗 → chunk → embedding → 入库)与在线检索(query 向量化 → 召回 → rerank → 生成)每一环失败怎么排查?
- Chunking:怎么切?按段落/标题/语义?切多大?为什么 chunk 大小直接影响回答质量?
- 召回 vs 重排:向量召回是"宽进",rerank 是"精排",什么时候必须上 rerank?
- 混合检索:为什么关键词(BM25)+ 向量往往好于纯向量?怎么融合?
- 评测:RAG 评测的双维度——检索质量(命中率/NDCG)与生成质量(引用率/忠实度),怎么搭评测集?
一句话判断:RAG 面试的隐藏考点永远是**"你会不会排查"**——检索为空、召回不相关、生成不引用原文,每个失败模式都有对应解法。系统拆解见检索增强生成(RAG),动手路线见从零搭建 RAG 应用,实战案例见Perplexity 与 AI 搜索。
推荐阅读页:检索增强生成(RAG) · 向量数据库与语义检索 · 从零搭建 RAG 应用 · 知识图谱与知识注入
七、Agent / 工具调用 / ReAct
JD 词:「有 Agent 落地经验」「熟悉工具调用」。2024 年后新增的高频板块,且面试趋势从"懂概念"转向"做过真流程"。
面试追问方向:
- ReAct 循环:推理 → 行动 → 观察,为什么比直接调工具稳定?什么时候失效?
- 工具调用:Function Calling 的 schema 怎么设计?参数校验与错误处理怎么兜底?
- 长任务:多步任务的规划策略(一次规划 vs 逐步决策)?上下文超限怎么办?
- 稳定性:Agent 陷入循环、走偏、幻觉出工具参数,怎么识别与恢复?
- 评估:怎么衡量一个 Agent 好不好(任务完成率、步数、失败率)?这和 RAG 评测有何不同?
一句话判断:Agent 面试最怕"纸上谈兵"——没亲手跑过一个会卡死、会反复重试的 Agent,就讲不出稳定性方案。动手路线见从零开发一个 Agent,产品形态参考Manus 与 Agent 应用。
推荐阅读页:AI 智能体(Agent) · 从零开发一个 Agent · 常见陷阱与反模式
八、LoRA / 微调 / 数据工程
JD 词:「熟悉 LoRA/微调」「有数据工程经验」。微调岗面试的三大支柱:方法、数据、评估。
面试追问方向:
- LoRA 原理:为什么低秩假设成立?rank 怎么选?LoRA 与全参微调的权衡?
- QLoRA:4-bit 量化 + LoRA 的组合,为什么能在一张消费级显卡上微调?
- 微调 vs RAG:什么时候该微调、什么时候该 RAG?怎么组合?
- 数据工程:指令数据从哪来(人工/合成/蒸馏)?怎么清洗、去重、配比、质检?
- 过拟合与遗忘:微调后模型忘了通用能力怎么办?评测怎么覆盖?
一句话判断:微调岗 70% 的工作是数据工程,30% 是训练——面试官问"你微调过什么",真正想知道的是"你如何造数据、如何证明微调有效"。完整路线见微调与 PEFT与微调你自己的 LLM。
推荐阅读页:微调与 PEFT · 微调你自己的 LLM · 数据集与工具档案
九、RLHF / DPO / 对齐
JD 词:「熟悉 RLHF」「了解对齐」。基础模型团队高频词,应用岗作为加分项出现。
面试追问方向:
- RLHF 三段式:SFT → 奖励模型 → PPO。奖励模型怎么训(偏好对排序)?
- PPO 为什么贵:需要加载四个模型(策略/参考/奖励/价值),KL 约束干嘛用?
- DPO:把 RLHF 的"训练奖励模型 + 强化学习"压缩成直接偏好优化,简化了什么、牺牲了什么?
- 对齐的陷阱:奖励黑客(reward hacking)、过度优化,怎么缓解?
- 对齐 vs 安全:对齐是让模型"按人的意图做事",AI 安全是"确保不造成伤害",两者的关系?
一句话判断:对齐板块的考点全在**"为什么"**——理解了"RLHF 昂贵是因为在线采样 + 四个模型",就理解了 DPO 存在的意义。原理详解见对齐:RLHF 与 DPO。
推荐阅读页:对齐:RLHF 与 DPO · AI 安全与治理 · 大语言模型(LLM)
十、量化 / 推理优化 / 部署
JD 词:「熟悉推理优化」「了解模型部署」。AI Infra 岗的主战场,也是应用岗的加分项。
面试追问方向:
- 量化:INT8/INT4 为什么能加速?精度损失从哪来(分布压缩、异常值)?怎么校准?
- KV Cache:生成阶段为什么比预填充慢?KV Cache 的显存开销怎么算?怎么管理?
- 连续批处理:为什么比静态批处理吞吐高?PagedAttention 解决了什么?
- 部署:服务化的延迟预算、QPS 估算、显存规划怎么做?灰度发布怎么保证效果不回退?
- 蒸馏:怎么用小模型学大模型?什么时候蒸馏比量化更划算?
一句话判断:推理优化面试的三个关键词是延迟、吞吐、成本——每个方案都要能回答"它优化了哪个指标、代价是什么"。深度讲解见推理优化与量化,动手路线见部署与推理优化实战。
推荐阅读页:推理优化与量化 · 部署与推理优化实战 · Transformer 与注意力机制
十一、评测 / 基准 / 多模态与扩散
1. 评测 / 基准
JD 词:「熟悉 LLM 评测」「搭建过评测体系」。这是横跨所有岗位的能力,也是简历区分度最高的一项。
面试追问方向:
- 评测类型:人工评估 vs 模型评估(LLM-as-judge)vs 自动化指标,各自成本与偏差?
- 评测集设计:考什么(事实性/指令遵循/推理/安全)、样本怎么选、覆盖什么边界?
- 指标映射:离线指标怎么对应业务目标(回答准确率 vs 用户留存)?
- 幻觉量化:引用率、忠实度怎么算?检索失败和生成失败怎么分开归因?
- 基准的局限:MMLU、HumanEval 考不出什么?
一句话判断:"你如何证明你的改动有效"是面试里最值钱的一句话——评测能力就是把这句话变成方法论。完整拆解见LLM 评估与基准,动手见搭建一套 LLM 评估。
推荐阅读页:LLM 评估与基准 · 搭建一套 LLM 评估
2. 多模态与扩散
JD 词:「多模态经验」「熟悉扩散模型」。多模态理解与生成是独立赛道,也是传统 CV/NLP 岗的新叠加项。
面试追问方向(理解线):
- 视觉编码器与 LLM 怎么对齐(投影层、Q-Former、Adapter 各自的取舍)?
- 多模态幻觉:模型"看见"了不存在的物体,成因与评测方法?
- 跨模态检索:图文检索的对比学习怎么组织正负样本?
面试追问方向(生成线):
- 扩散过程:前向加噪 + 反向去噪,训练目标是什么?
- 采样加速:DDIM、DPM-Solver 为什么能减少步数?质量与速度的权衡?
- 条件控制:ControlNet、LoRA 在生成里怎么注入条件?
一句话判断:多模态岗位看对齐(理解线)或生成质量与可控性(生成线),选准一条线深挖,比两条都懂皮毛强。理解线见多模态模型,生成线见扩散模型与生成式 AI与图像生成案例、视频生成案例。
推荐阅读页:多模态模型 · 扩散模型与生成式 AI · 语音 AI 案例
十二、JD 里没写但面试会考:隐藏考点
以下考点很少出现在 JD 字面里,却是面试的隐性分水岭——它们决定你从"会背书"变成"能干活"。
| 隐藏考点 | 为什么 JD 不写但会考 | 备考入口 |
|---|---|---|
| 工程与部署全链路 | 面试官默认"懂概念"的人很多,"能把东西跑上线"的人很少 | 部署与推理优化实战 · 常见陷阱与反模式 |
| 评估设计能力 | JD 写"熟悉评测",实际考"你会不会为这个场景设计评测" | 搭建一套 LLM 评估 · LLM 评估与基准 |
| 数据工程功底 | 几乎所有岗位入职第一个月都在处理数据,JD 却不直接写 | 数据集与工具档案 |
| 成本意识 | token 成本、GPU 成本是业务决策的核心,JD 极少写透 | 推理优化与量化 |
| 安全与合规 | 生成式 AI 的内容安全、数据合规越来越是硬约束 | AI 安全与治理 |
| 场景组合拳 | 面试常给综合场景题(知识库问答、Agent 工作流),考多板块联动 | 从零搭建 RAG 应用 · 从零开发一个 Agent |
| 行业与产品理解 | "这个方案落地给谁用、怎么算 ROI"是区分级别的考题 | 模块导读与岗位版图 · AI 产品经理 |
组合拳是隐藏考点的最大形态
2025 年的面试题几乎都是场景题:"给企业做客服知识库,10 万份文档、要求可溯源、晚上高峰 500 QPS,你怎么设计?" 这道题同时考 RAG 架构(第六节)、评测(第十一节)、推理优化(第十节)、成本(隐藏考点)。逐板块复习完,一定要做一次"组合拳模拟"——把多节知识串成一个系统方案讲出来。
十三、五档自评表与补课清单生成
1. 五档自评标准
| 档位 | 含义 | 判定标准(对着镜子给自己打分) |
|---|---|---|
| 1 没听过 | 完全陌生 | 这个词都没见过 |
| 2 听说过 | 有点印象 | 见过/听过,但讲不出定义 |
| 3 了解 | 知道概念 | 能给出定义和一个例子,但说不出原理与权衡 |
| 4 熟悉 | 能动手用 | 能独立实现 / 调参 / 排查,知道优缺点与适用场景 |
| 5 能讲透 | 能教别人 | 能在 5 分钟内讲清原理 + 推导 + 权衡 + 反例,经得起追问 |
2. 十大板块自评表(可打印)
| 考点 | 没听过 | 听说过 | 了解 | 熟悉 | 能讲透 |
|---|---|---|---|---|---|
| Transformer:注意力 / QKV / 位置编码 | □ | □ | □ | □ | □ |
| LLM 原理:预训练 / Scaling Laws / 涌现 | □ | □ | □ | □ | □ |
| 提示词:CoT / 结构化输出 / 与微调取舍 | □ | □ | □ | □ | □ |
| RAG:chunking / 召回 / rerank / 评测 | □ | □ | □ | □ | □ |
| 向量数据库:相似度 / 索引 / 混合检索 | □ | □ | □ | □ | □ |
| Agent:ReAct / 工具调用 / 稳定性 | □ | □ | □ | □ | □ |
| 微调:LoRA / QLoRA / 数据工程 | □ | □ | □ | □ | □ |
| 对齐:RLHF / DPO / 奖励黑客 | □ | □ | □ | □ | □ |
| 推理优化:量化 / KV Cache / 部署 | □ | □ | □ | □ | □ |
| 评测:评测集 / 指标 / 业务映射 | □ | □ | □ | □ | □ |
| 多模态 / 扩散:对齐 / 采样 / 可控性 | □ | □ | □ | □ | □ |
| 隐藏考点:工程全链路 / 成本 / 安全 | □ | □ | □ | □ | □ |
打印与勾选方法
按板块逐行打勾,勾选你当前真实水平对应的档位。诚实是前提——目标是把"能讲透"以下的行全部暴露出来,而不是让表看起来好看。拿不准时往低一档勾。
3. 生成个人补课清单
自评表打完之后,用四步把它变成一张可执行的周计划:
| 步骤 | 动作 | 要点 |
|---|---|---|
| 第一步 | 按档位归类 | 1~2 档 = A 类(先搞清"是什么");3 档 = B 类(补原理与权衡);4 档 = C 类(写 5 分钟讲稿) |
| 第二步 | 按板块排优先级 | 先补目标岗位的硬性要求板块(见JD 清单),再补加分项板块 |
| 第三步 | 套用周计划模板 | 每周 3 个 A 类 + 2 个 B 类 + 1 篇讲稿,A/B/C 随进度动态调整 |
| 第四步 | 三个执行原则 | 讲得出来才算会(录音回听卡壳处);手推 > 看推(自己动笔推导);每周复测(周日重新打分) |
4. 四个执行原则
- 原则一:讲得出来才算会。每个考点复习完,用手机录一段 5 分钟自讲,回听找出"卡壳处"——卡壳处就是没懂的地方。
- 原则二:手推 > 看推。数学类考点(注意力缩放、LoRA 更新规则、量化误差)务必自己动笔推导,"看懂"和"会推"在面试里是两回事。
- 原则三:项目 > 概念。至少把一个项目完整跑完(推荐从零搭建 RAG 应用或从零开发一个 Agent),把概念落到工程上。
- 原则四:每周复测。周日晚上重新打分,把"升档"的考点划掉,把"原地踏步"的标注出来追问原因。
补充一句
补课清单的目标不是"把表涂满",而是把目标岗位 JD 里的门槛项全部升到 4 档以上。岗位不需要的板块(比如投 RAG 应用岗不必强求预训练 5 档),卡在 4 档即可,把时间投到刀刃上。
十四、延伸阅读
站内联动
- 模块导读与岗位版图 · JD 清单 · 简历分析 · 面试题库 —— career 模块完整四件套
- 学习路径 —— 从 JD 和面试题倒推学习的完整主线
- 十大板块的深度正文:Transformer 与注意力机制 · 大语言模型(LLM) · 提示词工程 · 检索增强生成(RAG) · 向量数据库与语义检索 · AI 智能体(Agent) · 微调与 PEFT · 对齐:RLHF 与 DPO · 推理优化与量化 · LLM 评估与基准 · 多模态模型 · 扩散模型与生成式 AI
- 动手实践:从零搭建 RAG 应用 · 从零开发一个 Agent · 搭建一套 LLM 评估 · 微调你自己的 LLM · 部署与推理优化实战
- 随查随用:术语表 · 数据集与工具档案 · 模型与榜单速查
参考资料
- Vaswani et al. Attention Is All You Need (NeurIPS 2017) —— Transformer 原始论文,注意力机制的权威出处
- Kaplan et al. Scaling Laws for Neural Language Models (2020) —— 缩放定律原始论文
- Wei et al. Chain-of-Thought Prompting (NeurIPS 2022) —— 思维链原始论文
- Lewis et al. Retrieval-Augmented Generation (NeurIPS 2020) —— RAG 原始论文
- Yao et al. ReAct: Synergizing Reasoning and Acting (ICLR 2023) —— ReAct 原始论文
- Hu et al. LoRA: Low-Rank Adaptation (ICLR 2022) —— LoRA 原始论文
- Ouyang et al. Training language models to follow instructions with human feedback (2022) —— InstructGPT / RLHF 关键论文
- Rafailov et al. Direct Preference Optimization (NeurIPS 2023) —— DPO 原始论文
- Ho et al. Denoising Diffusion Probabilistic Models (NeurIPS 2020) —— 扩散模型奠基论文
- Radford et al. Learning Transferable Visual Models From Natural Language Supervision (CLIP) (2021) —— 图文对齐代表性论文
- Hugging Face LLM 课程 —— 大模型微调、RAG、评估的免费实战课程