Skip to content

术语表

本页速览 AI 热门概念领域核心术语表:模型架构、训练优化、应用范式、数据检索、生成模型、评估与安全六大类 80+ 术语的准确一句话定义,附面试高频缩写速查表。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

术语表 ​

本页收录 AI 热门概念领域的核心术语,按主题分为六组:模型与架构、训练与优化、应用范式、数据与检索、生成模型、评估与安全,另附一张「面试高频缩写」速查表。每条术语给出中文名、英文原名与一句话定义;容易混淆的术语对在文末单独做了辨析。

使用建议

术语不必按顺序读。建议先读 什么是 AI 热门概念 建立全景,遇到生词时再回来查。每行的「相关页面」列指向该术语在本站的深入讨论页,加粗的术语是本栏目核心概念。

一、模型与架构 ​

这一组回答"大模型是什么形状":从基础单元到整体架构。把握一条主线——词被切成 token,token 变成向量,向量在 Transformer 的注意力机制中互相"看",逐 token 生成下一个。

术语英文一句话解释相关页面
大语言模型Large Language Model, LLM基于 Transformer、在海量文本上预训练的生成式模型,规模增大后涌现出理解、推理与对话能力大语言模型
TransformerTransformer2017 年提出的完全基于注意力机制、抛弃循环结构的序列架构,是 GPT/BERT 乃至一切现代 LLM 的地基Transformer 与注意力机制
注意力机制Attention处理序列时按"相关性权重"聚合信息的机制,核心公式为 softmax(Q·Kᵀ/√d)·V,让每个词都能"看见"上下文Transformer 与注意力机制
词元Token模型处理文本的基本单位(约 0.7 个英文词或 1 个汉字),上下文窗口与 API 计费都以 token 计大语言模型
嵌入Embedding把离散 token 映射为稠密向量的表示,语义相近的词向量距离更近Transformer 与注意力机制
混合专家Mixture of Experts, MoE把一个大模型拆成多个"专家"子网络、每个 token 只激活其中少数几个的稀疏架构,用同样算力撑起更大参数量大语言模型
仅解码器架构Decoder-only只用 Transformer 解码器、带因果掩码(每个 token 只能看前面)的自回归架构,GPT 系列采用,最适合文本生成Transformer 与注意力机制
键值缓存KV Cache推理时把已生成 token 的 K/V 向量缓存下来、避免每步重复计算,以显存换速度的推理优化核心手段推理优化与量化
位置编码Positional Encoding给并行计算的 Transformer 补充 token 顺序信息的机制,当前主流是旋转位置编码(RoPE)Transformer 与注意力机制
上下文窗口Context Window模型单次能接收的 token 总数,决定了"能一次性读多长内容",当前主流模型在 8K~1M 量级大语言模型
上下文学习In-Context Learning, ICL不更新权重、仅凭提示词里的示例与指令就让模型适配新任务的能力,规模越大越显著,是 GPT-3 以来"提示即编程"的基础大语言模型
涌现能力Emergent Ability模型规模跨过阈值后突然出现的、小模型不具备的能力(多步推理、指令跟随等),与规模定律相伴而生大语言模型
规模定律Scaling Law模型性能随参数量、数据量、算力按幂律增长的实证规律,是"大力出奇迹"路线的理论依据大语言模型
原生多模态Native Multimodal从预训练起就把文本/图像/音频统一处理的多模态模型设计,而非后期拼接多个单模态模型多模态模型
深度推理模型Reasoning Model在作答前先生成内部思维链、并经强化学习专门训练的模型(如 o1、DeepSeek-R1),"想清楚再回答"DeepSeek-R1 与推理模型
推理预算Reasoning Budget允许推理模型花费的思考量(思维链长度/步数上限),预算越大越聪明但越慢越贵,可像采样参数一样调节DeepSeek-R1 与推理模型
温度Temperature控制采样随机性的参数:越高输出越多样,越低越确定,接近 0 时近似贪心解码提示词工程
多智能体Multi-Agent多个 Agent 分工协作(编排、辩论、各自带工具)完成复杂任务的系统形态,协调成本与收益并存AI 智能体
世界模型World Model让模型学习环境/世界的内部表征并预测下一步状态的范式,视频生成与具身智能的关键方向前沿进展
通用人工智能AGI在几乎所有认知任务上达到或超过人类水平的假想智能,多数热门概念被视为通往它的路径什么是 AI 热门概念

一句话判断

看到参数规模先问"是稠密还是 MoE":MoE 的"总参数量"不等于"激活参数量",实际算力看激活参数。例如总参数 1.8T 的模型若只激活 37B,单次推理成本只相当于 37B 模型。

二、训练与优化 ​

这一组回答"大模型是怎么练出来的":预训练学通识 → 微调学技能 → 对齐改价值观,外加把模型变小变快的两件套(LoRA、量化)。

术语英文一句话解释相关页面
预训练Pretraining在海量无标注语料上自监督学习(预测下一个 token)的阶段,产出"通识基础",耗资最大大语言模型
监督微调Supervised Fine-Tuning, SFT用"指令-回答"或"输入-输出"对在预训练模型上继续训练,让模型学会跟随指令、格式化输出微调与 PEFT
RLHFReinforcement Learning from Human Feedback先用人类偏好数据训练奖励模型、再用强化学习(PPO)优化策略,ChatGPT 走红的关键对齐技术对齐:RLHF 与 DPO
DPODirect Preference Optimization直接把偏好数据写成损失函数、一步训练完成对齐,省掉奖励模型与 PPO 的稳定性难题,开源社区主流对齐:RLHF 与 DPO
LoRALow-Rank Adaptation冻结原权重、只训练低秩适配矩阵的微调方法,可训练参数量减少万倍,单卡即可微调微调与 PEFT
QLoRAQuantized LoRA把底座模型 4-bit 量化后再做 LoRA 微调,让消费级显卡也能微调 7B~13B 模型微调与 PEFT
知识蒸馏Knowledge Distillation用大模型(教师)的输出或 logits 教小模型(学生),让"学生"逼近"教师"效果,降本增效的常用手段微调与 PEFT
量化Quantization把权重从 FP32 压缩到 FP16/INT8/INT4,显存减半、推理加速、精度损失小,部署优化首选推理优化与量化
参数高效微调Parameter-Efficient Fine-Tuning, PEFT只训练少量新参数(LoRA、Adapter、Prefix 等)完成微调的方法总称,目标是用最小成本适配下游任务微调与 PEFT
指令微调Instruction Tuning用大量"指令-回答"样例微调模型,本质是 SFT 的一种,让基础模型学会"被使唤"而不是只会续写对齐:RLHF 与 DPO
后训练Post-training预训练之后的所有训练阶段总称(SFT、对齐、推理增强等),决定"通识模型"变成"好用的产品模型"大语言模型
ORPOOdds Ratio Preference Optimization2024 年提出的免奖励模型对齐方法,把 SFT 与偏好优化合并为一步,显存与训练时间都更省对齐:RLHF 与 DPO
IPOIdentity Preference OptimizationDPO 的改进变体,用恒等算子修正过拟合正则,提升偏好优化的稳定性与泛化对齐:RLHF 与 DPO
智能体强化学习Agentic RL把强化学习用于 Agent 的规划/工具调用/长程任务,让 Agent 在环境中试错学习,2025 年训练推理模型的利器前沿进展
推测解码Speculative Decoding用小模型"草稿"先生成候选、大模型一次验证多步的加速技巧,推理速度可提升 2~3 倍且输出不变推理优化与量化

一句话判断

知识类问题用 RAG,行为风格问题用微调——用微调去"喂知识"是常见误区:新知识难学、易过拟合,而检索出的旧知识根本进不了模型权重。选对齐方法时,数据量小(几千条)且想省事,直接 DPO;追求与人类偏好高度一致、预算充足,再上 RLHF。

三、应用范式 ​

这一组回答"大模型拿来怎么用":不训练权重,靠设计输入、挂外部知识、接工具,把模型从"聊天机器"变成"干活程序"。

术语英文一句话解释相关页面
提示词Prompt输入给模型的指令文本,通过措辞、结构、示例约束输出,是成本最低的"模型调参方式"提示词工程
少样本学习Few-shot在提示词里给几个输入输出示例再让模型作答,不更新权重即可适配新任务提示词工程
思维链Chain-of-Thought, CoT提示模型"先一步步推理再给出答案",把中间步骤显式写出来,显著提升数学/逻辑类任务表现提示词工程
检索增强生成Retrieval-Augmented Generation, RAG先检索知识再交给模型生成的范式,弥补模型知识过时、幻觉与不掌握私有数据三大短板检索增强生成
图检索增强生成GraphRAG在知识图谱/图结构上做检索的 RAG 变体,擅长回答跨实体、需要全局聚合的问题知识图谱与知识注入
AI 智能体Agent能感知环境、自主规划、调用工具并多步迭代完成任务的大模型应用形态,LLM 是其"大脑"AI 智能体
函数调用Function Calling模型在生成文本的同时输出结构化的函数调用(参数),由程序执行后把结果回填,让模型"能用工具"AI 智能体
ReActReasoning + Acting让模型"思考 → 行动 → 观察结果 → 再思考"循环的智能体设计范式,推理与行动交替进行AI 智能体
模型上下文协议Model Context Protocol, MCPAnthropic 2024 年开源的工具/数据接入标准协议,让同一套 Agent 工具生态跨模型复用,2025 年成为事实标准AI 智能体
智能体控制框架Agent Harness封装"模型-工具-循环"运行时的外壳(框架/协议),让 LLM 安全地与应用环境交互,是 Agent 工程化的关键组件AI 智能体
智能体技能Agent Skill把可复用的能力(提示词+工具+流程)打包成独立模块,供 Agent 按需调用,类似"给 Agent 装插件"AI 智能体
自我反思Self-Reflection / Self-Verification / Self-Critique让模型检查并修正自己输出的一组技巧(复盘思路、验证答案、批评初稿),显著提升长任务可靠性AI 智能体
自检索增强生成Self-RAGRAG 变体:让模型自己决定"何时检索、检索什么、采不采纳",按需检索而非每次必检,更省更准检索增强生成
智能体工作流Agentic Workflow用多个 LLM 步骤/多个 Agent 编排成固定流水线完成任务(检索→生成→审查→发布),介于单次调用与自主 Agent 之间AI 智能体
思维图Graph of Thoughts, GoT把推理过程建模为图(可分支、合并、回溯)的提示范式,是思维链(线性)与思维树(树状)的推广提示词工程
氛围编程Vibe Coding用自然语言描述意图、让 AI 写代码、人只做审查与微调的编程方式,2025 年流行的热词GitHub Copilot 与代码智能
电脑操控Computer Use让模型像人一样操作屏幕/鼠标/键盘完成任务的能力(Claude Computer Use、OpenAI Operator 等)Manus 与 Agent 应用
结对编程助手CopilotAI 编程助手的代名词(源自 GitHub Copilot),覆盖行级补全、对话生成到自主改代码GitHub Copilot 与代码智能

提示工程 / RAG / 微调的分工

三者是 LLM 落地的"三件套",解决不同问题:提示工程改"输入"(零成本,简单任务);RAG 加"知识"(事实/私有/实时问题);微调改"行为"(风格/格式/领域语感)。同一个应用通常三者叠加使用:先用提示词搭骨架,缺知识挂 RAG,行为仍不对再微调。

四、数据与检索 ​

这一组回答 RAG 与语义搜索背后的工程细节:文档如何切、向量如何存、检索如何又快又准。

术语英文一句话解释相关页面
分块Chunking把长文档切成有语义边界的片段再入库,块大小直接影响检索质量(太小丢上下文、太大噪声多)向量数据库与语义检索
嵌入Embedding在检索语境下指"文本→稠密向量"的映射,语义相近的文本向量距离近,是语义检索的基石向量数据库与语义检索
向量数据库Vector Database专门存储向量并支持"按向量相似度查询"的数据库(Milvus、Qdrant、Chroma 等),RAG 的存储层向量数据库与语义检索
近似最近邻Approximate Nearest Neighbor, ANN牺牲少量精度换取百万/亿级向量亚秒级查询的检索技术,向量数据库底层的核心算法族向量数据库与语义检索
分层可导航小世界Hierarchical Navigable Small World, HNSW目前最流行的 ANN 算法之一,用多层图结构做"先粗后细"的跳转,速度快、精度高、可调内存向量数据库与语义检索
重排序Rerank先用向量/关键词粗召回几百条、再用更强的交叉编码器精排前几条,两段式提升检索精度向量数据库与语义检索
混合检索Hybrid Search关键词(BM25)与向量检索并行、再融合排序,兼顾精确匹配与语义理解,工程上比纯向量更稳向量数据库与语义检索
BM25BM25词法检索的经典打分函数,基于词频与文档长度归一化,RAG 混合检索中的"关键词腿"向量数据库与语义检索
知识图谱Knowledge Graph以"实体-关系-实体"三元组组织的结构化知识网络,为 RAG 提供可推理、可聚合的语义结构知识图谱与知识注入
余弦相似度Cosine Similarity两个向量夹角的余弦值,衡量方向而非长度,是向量检索最常用的相似度度量向量数据库与语义检索
神经符号融合Neuro-symbolic把神经网络(学感知/统计)与符号系统(推逻辑/规则,如知识图谱)结合的技术路线,取两者之长知识图谱与知识注入
数据治理Data Governance对训练/使用数据的质量、合规、隐私、版权的管理制度与技术手段,大模型时代成为企业级刚需AI 安全与治理

一句话判断

检索系统要"粗召回 + 精排序"双阶段:ANN 只负责把候选从千万级压到几百条,最终交给 Rerank 排序——只靠向量相似度直接出结果的 RAG,精度通常不够用。数据量小(百万以下)时直接用 FAISS 等库,不必上重型向量数据库。

五、生成模型 ​

这一组回答"图、视频、音频是怎么生成的":扩散模型先加噪再学去噪,配以文本条件控制,是目前文生图/文生视频的事实标准。

术语英文一句话解释相关页面
扩散模型Diffusion Model先给数据逐步加噪到纯噪声、再学习逐步去噪还原数据分布的一类生成模型,当前文生图/文生视频的霸主扩散模型与生成式 AI
去噪扩散概率模型Denoising Diffusion Probabilistic Model, DDPM2020 年提出、把扩散过程写成可训练去噪网络的奠基性工作,后续扩散模型的共同起点扩散模型与生成式 AI
潜在扩散模型Latent Diffusion Model, LDM在低维潜在空间而非像素空间做扩散,大幅降低算力,Stable Diffusion 的技术底座(2022)扩散模型与生成式 AI
ControlNetControlNet给扩散模型引入额外条件(线稿、骨架、深度图)精确控制生成结构的 2023 年工作,让"指哪打哪"成为可能扩散模型与生成式 AI
文生图Text-to-Image输入文本提示、输出图像的生成任务,代表性产品有 Midjourney、Stable Diffusion、DALL·EMidjourney 与图像生成
文生视频Text-to-Video输入文本或图像、生成连贯视频片段的生成任务,代表产品 Sora 于 2024 年发布Sora 与视频生成
CLIPContrastive Language-Image Pre-trainingOpenAI 2021 年提出的图文对齐模型,把图像与文本映射到同一向量空间,是文生图"文本条件"的基础扩散模型与生成式 AI
变分自编码器Variational Autoencoder, VAE学习压缩-重建的生成模型,LDM 用它把像素图压缩到潜在空间,2013 年提出扩散模型与生成式 AI
无分类器引导Classifier-Free Guidance, CFG同时用"带条件"与"无条件"的预测差值来放大文本约束的采样技巧,让生成结果更贴提示词扩散模型与生成式 AI
多模态模型Multimodal Model同时处理文本、图像、音频、视频的模型,把"看懂""听懂""生成"合进一个模型多模态模型
具身智能Embodied AI让 AI 拥有"身体"(机器人)并在物理世界感知、交互、学习的范式,被视为通往 AGI 的另一条路径多模态模型
端侧大模型On-device LLM量化压缩后可在手机/PC/边缘设备本地运行的模型,离线、隐私、低延迟,是云端之外的部署形态推理优化与量化
AI 科学家AI Scientist自动化做科研的 Agent 系统(读文献→提假设→做实验→写论文),AI for Science 的前沿方向前沿进展

一句话判断

看扩散模型的进化要抓两条线:算力(像素空间 → 潜在空间)和控制(文本 → ControlNet 精确条件 → 视频)。如今"生成质量"的差距已收窄,竞争焦点转向可控性、一致性(多帧角色不变)与效率。

六、评估与安全 ​

这一组回答"模型到底行不行、安不安全":靠基准做横向比较,靠红队与防线对抗攻击与幻觉。

术语英文一句话解释相关页面
基准Benchmark用固定题目集与评分规则衡量模型能力的标准化测试,是模型横向比较的公共尺子LLM 评估与基准
MMLUMassive Multitask Language Understanding覆盖 57 个学科、约 1.4 万道选择题的通用知识基准,2021 年发布后成为主流模型的必考科目LLM 评估与基准
幻觉Hallucination模型一本正经地编造不存在的事实或逻辑,根源是它学的是"像话的序列"而非"事实数据库"AI 安全与治理
红队Red Teaming让测试者故意攻击模型(诱导越狱、挖偏见、试边界)以暴露漏洞的对抗性测试方法AI 安全与治理
越狱Jailbreak通过精心构造的提示词(角色扮演、虚构场景、多语言混杂)绕过模型安全对齐限制的攻击手法AI 安全与治理
提示注入Prompt Injection攻击者把恶意指令藏进模型会读到的内容(网页、文档、工具输出),诱导模型违背原定任务AI 安全与治理
水印Watermark在 AI 生成内容中嵌入人眼/人耳难察觉但机器可检测的标记,用于追溯内容是否由模型生成AI 安全与治理
困惑度Perplexity语言模型对数据意外程度的度量(越小越自信),是预训练阶段常用的内部指标LLM 评估与基准
GSM8KGrade School Math 8K8.5K 道小学到初中数学应用题基准,检验模型的算术与多步推理能力LLM 评估与基准
HumanEvalHumanEvalOpenAI 提出的 164 道编程题基准,用 pass@k 指标衡量代码生成能力LLM 评估与基准

关于基准的三个提醒

一是刷榜:厂商会用测试集相关数据训练导致"分数虚高",看结果要核对模型是否在训练时见过这些题;二是饱和:主流模型在 MMLU 上已接近 90%,单一基准区分度下降,要看组合榜单;三是脱离实际:基准分数高不等于真实业务好用,最终以你自己任务的评测为准。完整的搭建方法见 搭建一套 LLM 评估。

附录:面试高频缩写速查 ​

面试与日常阅读中缩写满天飞。下表收录出现频率最高的一批,先记全称、再记含义——很多八股题就是在考你能否把缩写展开。

缩写英文全称一句话含义
AGIArtificial General Intelligence通用人工智能:像人一样跨领域学习与推理的假想智能
ASIArtificial Superintelligence超级人工智能:在几乎所有领域远超人类顶尖水平的假想智能
GPTGenerative Pre-trained Transformer生成式预训练 Transformer,OpenAI 模型系列名
BERTBidirectional Encoder Representations from Transformers双向编码器表示的预训练模型,2018 年 NLP 里程碑
RAGRetrieval-Augmented Generation检索增强生成:先检索再生成的知识注入范式
RLHFReinforcement Learning from Human Feedback基于人类反馈的强化学习,主流对齐技术
DPODirect Preference Optimization直接偏好优化:免奖励模型的简化对齐方法
SFTSupervised Fine-Tuning监督微调:用标注数据继续训练模型
PEFTParameter-Efficient Fine-Tuning参数高效微调:只训练少量参数完成适配
LoRALow-Rank Adaptation低秩适配:冻结原权重只练低秩矩阵的微调方法
QLoRAQuantized LoRA4-bit 量化 + LoRA 的组合,消费级显卡可微调
CoTChain-of-Thought思维链:让模型先逐步推理再作答
MoEMixture of Experts混合专家:稀疏激活的巨型模型架构
MCPModel Context Protocol模型上下文协议:Agent 工具接入的开放标准
KVKey-Value Cache键值缓存:推理加速的缓存机制
ANNApproximate Nearest Neighbor近似最近邻:大规模向量检索的核心技术
HNSWHierarchical Navigable Small World分层可导航小世界:主流 ANN 算法之一
MMLUMassive Multitask Language Understanding多任务语言理解基准(57 学科)
CLIPContrastive Language-Image Pre-training图文对比预训练模型,文生图文本条件的基础
RoPERotary Position Embedding旋转位置编码:主流 LLM 的位置编码方案
GQAGrouped Query Attention分组查询注意力:降低推理显存的注意力变体
TTSText-to-Speech文本转语音:让机器说话
ASRAutomatic Speech Recognition自动语音识别:让机器听懂语音
SOTAState of the Art最先进水平:某任务当前最佳成绩

易混淆辨析 ​

预训练 / 微调 / 对齐

预训练学的是"语言通识"(海量文本、自监督、最贵);**微调(SFT)**学的是"任务技能"(指令数据、便宜、针对性);**对齐(RLHF/DPO)**改的是"价值观与偏好"(让输出更符合人类期待、更安全)。三者是流水线:预训练 → SFT → 对齐。

LoRA / QLoRA / 全量微调

全量微调更新所有参数(效果上限高但贵);LoRA 冻结原权重、只练低秩适配矩阵(可训练参数量减少万倍);QLoRA 在 LoRA 基础上把底座 4-bit 量化(显存再省约 3/4)。小团队默认 QLoRA 起步,效果不足再升 LoRA、全量。

RAG / GraphRAG / 微调(知识注入三选一)

RAG 检索"文本片段",适合事实问答;GraphRAG 检索"图结构",适合跨实体聚合类问题(如"整个数据集里最相关的主题是什么");微调则不该用来塞知识。判断口诀:能检索到的知识别微调,要推理的关系上图谱。

越狱 / 提示注入 / 幻觉

三者同属"模型说了不该说的",但性质不同:越狱是用户主动构造提示绕过安全对齐;提示注入是恶意指令藏在"模型会读的数据"里被动触发;幻觉是模型本身编造事实,无关攻击。前两者是安全对抗,后者是能力局限。

Embedding(检索)vs Embedding(模型内部)

同一个词两种语境:在模型内部,它是词表到稠密向量的查表映射;在检索系统里,它是"文本→语义向量"的编码器产物。理解关键相同——语义相近则向量相近。

延伸阅读 ​

参考资料 ​

  • Vaswani et al., Attention Is All You Need, arXiv:1706.03762, 2017 —— Transformer 原始论文
  • Brown et al., Language Models are Few-Shot Learners(GPT-3), arXiv:2005.14165, 2020
  • Ouyang et al., Training language models to follow instructions with human feedback(InstructGPT), arXiv:2203.02155, 2022 —— RLHF 的代表性实现
  • Hu et al., LoRA: Low-Rank Adaptation of Large Language Models, arXiv:2106.09685, 2021
  • Dettmers et al., QLoRA: Efficient Finetuning of Quantized LLMs, arXiv:2305.14314, 2023
  • Rafailov et al., Direct Preference Optimization, arXiv:2305.18290, 2023
  • Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, arXiv:2005.11401, 2020
  • Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models, arXiv:2210.03629, 2022
  • Ho et al., Denoising Diffusion Probabilistic Models, arXiv:2006.11239, 2020
  • Rombach et al., High-Resolution Image Synthesis with Latent Diffusion Models(LDM), arXiv:2112.10752, 2022
  • Malkov & Yashunin, Efficient and robust approximate nearest neighbor search using Hierarchical Navigable Small World graphs, arXiv:1603.09320, 2016
  • Hendrycks et al., Measuring Massive Multitask Language Understanding(MMLU), arXiv:2009.03300, 2021
  • 模型上下文协议官方文档 —— modelcontextprotocol.io