外观
术语表
本页收录 AI 热门概念领域的核心术语,按主题分为六组:模型与架构、训练与优化、应用范式、数据与检索、生成模型、评估与安全,另附一张「面试高频缩写」速查表。每条术语给出中文名、英文原名与一句话定义;容易混淆的术语对在文末单独做了辨析。
使用建议
术语不必按顺序读。建议先读 什么是 AI 热门概念 建立全景,遇到生词时再回来查。每行的「相关页面」列指向该术语在本站的深入讨论页,加粗的术语是本栏目核心概念。
一、模型与架构
这一组回答"大模型是什么形状":从基础单元到整体架构。把握一条主线——词被切成 token,token 变成向量,向量在 Transformer 的注意力机制中互相"看",逐 token 生成下一个。
| 术语 | 英文 | 一句话解释 | 相关页面 |
|---|---|---|---|
| 大语言模型 | Large Language Model, LLM | 基于 Transformer、在海量文本上预训练的生成式模型,规模增大后涌现出理解、推理与对话能力 | 大语言模型 |
| Transformer | Transformer | 2017 年提出的完全基于注意力机制、抛弃循环结构的序列架构,是 GPT/BERT 乃至一切现代 LLM 的地基 | Transformer 与注意力机制 |
| 注意力机制 | Attention | 处理序列时按"相关性权重"聚合信息的机制,核心公式为 softmax(Q·Kᵀ/√d)·V,让每个词都能"看见"上下文 | Transformer 与注意力机制 |
| 词元 | Token | 模型处理文本的基本单位(约 0.7 个英文词或 1 个汉字),上下文窗口与 API 计费都以 token 计 | 大语言模型 |
| 嵌入 | Embedding | 把离散 token 映射为稠密向量的表示,语义相近的词向量距离更近 | Transformer 与注意力机制 |
| 混合专家 | Mixture of Experts, MoE | 把一个大模型拆成多个"专家"子网络、每个 token 只激活其中少数几个的稀疏架构,用同样算力撑起更大参数量 | 大语言模型 |
| 仅解码器架构 | Decoder-only | 只用 Transformer 解码器、带因果掩码(每个 token 只能看前面)的自回归架构,GPT 系列采用,最适合文本生成 | Transformer 与注意力机制 |
| 键值缓存 | KV Cache | 推理时把已生成 token 的 K/V 向量缓存下来、避免每步重复计算,以显存换速度的推理优化核心手段 | 推理优化与量化 |
| 位置编码 | Positional Encoding | 给并行计算的 Transformer 补充 token 顺序信息的机制,当前主流是旋转位置编码(RoPE) | Transformer 与注意力机制 |
| 上下文窗口 | Context Window | 模型单次能接收的 token 总数,决定了"能一次性读多长内容",当前主流模型在 8K~1M 量级 | 大语言模型 |
| 上下文学习 | In-Context Learning, ICL | 不更新权重、仅凭提示词里的示例与指令就让模型适配新任务的能力,规模越大越显著,是 GPT-3 以来"提示即编程"的基础 | 大语言模型 |
| 涌现能力 | Emergent Ability | 模型规模跨过阈值后突然出现的、小模型不具备的能力(多步推理、指令跟随等),与规模定律相伴而生 | 大语言模型 |
| 规模定律 | Scaling Law | 模型性能随参数量、数据量、算力按幂律增长的实证规律,是"大力出奇迹"路线的理论依据 | 大语言模型 |
| 原生多模态 | Native Multimodal | 从预训练起就把文本/图像/音频统一处理的多模态模型设计,而非后期拼接多个单模态模型 | 多模态模型 |
| 深度推理模型 | Reasoning Model | 在作答前先生成内部思维链、并经强化学习专门训练的模型(如 o1、DeepSeek-R1),"想清楚再回答" | DeepSeek-R1 与推理模型 |
| 推理预算 | Reasoning Budget | 允许推理模型花费的思考量(思维链长度/步数上限),预算越大越聪明但越慢越贵,可像采样参数一样调节 | DeepSeek-R1 与推理模型 |
| 温度 | Temperature | 控制采样随机性的参数:越高输出越多样,越低越确定,接近 0 时近似贪心解码 | 提示词工程 |
| 多智能体 | Multi-Agent | 多个 Agent 分工协作(编排、辩论、各自带工具)完成复杂任务的系统形态,协调成本与收益并存 | AI 智能体 |
| 世界模型 | World Model | 让模型学习环境/世界的内部表征并预测下一步状态的范式,视频生成与具身智能的关键方向 | 前沿进展 |
| 通用人工智能 | AGI | 在几乎所有认知任务上达到或超过人类水平的假想智能,多数热门概念被视为通往它的路径 | 什么是 AI 热门概念 |
一句话判断
看到参数规模先问"是稠密还是 MoE":MoE 的"总参数量"不等于"激活参数量",实际算力看激活参数。例如总参数 1.8T 的模型若只激活 37B,单次推理成本只相当于 37B 模型。
二、训练与优化
这一组回答"大模型是怎么练出来的":预训练学通识 → 微调学技能 → 对齐改价值观,外加把模型变小变快的两件套(LoRA、量化)。
| 术语 | 英文 | 一句话解释 | 相关页面 |
|---|---|---|---|
| 预训练 | Pretraining | 在海量无标注语料上自监督学习(预测下一个 token)的阶段,产出"通识基础",耗资最大 | 大语言模型 |
| 监督微调 | Supervised Fine-Tuning, SFT | 用"指令-回答"或"输入-输出"对在预训练模型上继续训练,让模型学会跟随指令、格式化输出 | 微调与 PEFT |
| RLHF | Reinforcement Learning from Human Feedback | 先用人类偏好数据训练奖励模型、再用强化学习(PPO)优化策略,ChatGPT 走红的关键对齐技术 | 对齐:RLHF 与 DPO |
| DPO | Direct Preference Optimization | 直接把偏好数据写成损失函数、一步训练完成对齐,省掉奖励模型与 PPO 的稳定性难题,开源社区主流 | 对齐:RLHF 与 DPO |
| LoRA | Low-Rank Adaptation | 冻结原权重、只训练低秩适配矩阵的微调方法,可训练参数量减少万倍,单卡即可微调 | 微调与 PEFT |
| QLoRA | Quantized LoRA | 把底座模型 4-bit 量化后再做 LoRA 微调,让消费级显卡也能微调 7B~13B 模型 | 微调与 PEFT |
| 知识蒸馏 | Knowledge Distillation | 用大模型(教师)的输出或 logits 教小模型(学生),让"学生"逼近"教师"效果,降本增效的常用手段 | 微调与 PEFT |
| 量化 | Quantization | 把权重从 FP32 压缩到 FP16/INT8/INT4,显存减半、推理加速、精度损失小,部署优化首选 | 推理优化与量化 |
| 参数高效微调 | Parameter-Efficient Fine-Tuning, PEFT | 只训练少量新参数(LoRA、Adapter、Prefix 等)完成微调的方法总称,目标是用最小成本适配下游任务 | 微调与 PEFT |
| 指令微调 | Instruction Tuning | 用大量"指令-回答"样例微调模型,本质是 SFT 的一种,让基础模型学会"被使唤"而不是只会续写 | 对齐:RLHF 与 DPO |
| 后训练 | Post-training | 预训练之后的所有训练阶段总称(SFT、对齐、推理增强等),决定"通识模型"变成"好用的产品模型" | 大语言模型 |
| ORPO | Odds Ratio Preference Optimization | 2024 年提出的免奖励模型对齐方法,把 SFT 与偏好优化合并为一步,显存与训练时间都更省 | 对齐:RLHF 与 DPO |
| IPO | Identity Preference Optimization | DPO 的改进变体,用恒等算子修正过拟合正则,提升偏好优化的稳定性与泛化 | 对齐:RLHF 与 DPO |
| 智能体强化学习 | Agentic RL | 把强化学习用于 Agent 的规划/工具调用/长程任务,让 Agent 在环境中试错学习,2025 年训练推理模型的利器 | 前沿进展 |
| 推测解码 | Speculative Decoding | 用小模型"草稿"先生成候选、大模型一次验证多步的加速技巧,推理速度可提升 2~3 倍且输出不变 | 推理优化与量化 |
一句话判断
知识类问题用 RAG,行为风格问题用微调——用微调去"喂知识"是常见误区:新知识难学、易过拟合,而检索出的旧知识根本进不了模型权重。选对齐方法时,数据量小(几千条)且想省事,直接 DPO;追求与人类偏好高度一致、预算充足,再上 RLHF。
三、应用范式
这一组回答"大模型拿来怎么用":不训练权重,靠设计输入、挂外部知识、接工具,把模型从"聊天机器"变成"干活程序"。
| 术语 | 英文 | 一句话解释 | 相关页面 |
|---|---|---|---|
| 提示词 | Prompt | 输入给模型的指令文本,通过措辞、结构、示例约束输出,是成本最低的"模型调参方式" | 提示词工程 |
| 少样本学习 | Few-shot | 在提示词里给几个输入输出示例再让模型作答,不更新权重即可适配新任务 | 提示词工程 |
| 思维链 | Chain-of-Thought, CoT | 提示模型"先一步步推理再给出答案",把中间步骤显式写出来,显著提升数学/逻辑类任务表现 | 提示词工程 |
| 检索增强生成 | Retrieval-Augmented Generation, RAG | 先检索知识再交给模型生成的范式,弥补模型知识过时、幻觉与不掌握私有数据三大短板 | 检索增强生成 |
| 图检索增强生成 | GraphRAG | 在知识图谱/图结构上做检索的 RAG 变体,擅长回答跨实体、需要全局聚合的问题 | 知识图谱与知识注入 |
| AI 智能体 | Agent | 能感知环境、自主规划、调用工具并多步迭代完成任务的大模型应用形态,LLM 是其"大脑" | AI 智能体 |
| 函数调用 | Function Calling | 模型在生成文本的同时输出结构化的函数调用(参数),由程序执行后把结果回填,让模型"能用工具" | AI 智能体 |
| ReAct | Reasoning + Acting | 让模型"思考 → 行动 → 观察结果 → 再思考"循环的智能体设计范式,推理与行动交替进行 | AI 智能体 |
| 模型上下文协议 | Model Context Protocol, MCP | Anthropic 2024 年开源的工具/数据接入标准协议,让同一套 Agent 工具生态跨模型复用,2025 年成为事实标准 | AI 智能体 |
| 智能体控制框架 | Agent Harness | 封装"模型-工具-循环"运行时的外壳(框架/协议),让 LLM 安全地与应用环境交互,是 Agent 工程化的关键组件 | AI 智能体 |
| 智能体技能 | Agent Skill | 把可复用的能力(提示词+工具+流程)打包成独立模块,供 Agent 按需调用,类似"给 Agent 装插件" | AI 智能体 |
| 自我反思 | Self-Reflection / Self-Verification / Self-Critique | 让模型检查并修正自己输出的一组技巧(复盘思路、验证答案、批评初稿),显著提升长任务可靠性 | AI 智能体 |
| 自检索增强生成 | Self-RAG | RAG 变体:让模型自己决定"何时检索、检索什么、采不采纳",按需检索而非每次必检,更省更准 | 检索增强生成 |
| 智能体工作流 | Agentic Workflow | 用多个 LLM 步骤/多个 Agent 编排成固定流水线完成任务(检索→生成→审查→发布),介于单次调用与自主 Agent 之间 | AI 智能体 |
| 思维图 | Graph of Thoughts, GoT | 把推理过程建模为图(可分支、合并、回溯)的提示范式,是思维链(线性)与思维树(树状)的推广 | 提示词工程 |
| 氛围编程 | Vibe Coding | 用自然语言描述意图、让 AI 写代码、人只做审查与微调的编程方式,2025 年流行的热词 | GitHub Copilot 与代码智能 |
| 电脑操控 | Computer Use | 让模型像人一样操作屏幕/鼠标/键盘完成任务的能力(Claude Computer Use、OpenAI Operator 等) | Manus 与 Agent 应用 |
| 结对编程助手 | Copilot | AI 编程助手的代名词(源自 GitHub Copilot),覆盖行级补全、对话生成到自主改代码 | GitHub Copilot 与代码智能 |
提示工程 / RAG / 微调的分工
三者是 LLM 落地的"三件套",解决不同问题:提示工程改"输入"(零成本,简单任务);RAG 加"知识"(事实/私有/实时问题);微调改"行为"(风格/格式/领域语感)。同一个应用通常三者叠加使用:先用提示词搭骨架,缺知识挂 RAG,行为仍不对再微调。
四、数据与检索
这一组回答 RAG 与语义搜索背后的工程细节:文档如何切、向量如何存、检索如何又快又准。
| 术语 | 英文 | 一句话解释 | 相关页面 |
|---|---|---|---|
| 分块 | Chunking | 把长文档切成有语义边界的片段再入库,块大小直接影响检索质量(太小丢上下文、太大噪声多) | 向量数据库与语义检索 |
| 嵌入 | Embedding | 在检索语境下指"文本→稠密向量"的映射,语义相近的文本向量距离近,是语义检索的基石 | 向量数据库与语义检索 |
| 向量数据库 | Vector Database | 专门存储向量并支持"按向量相似度查询"的数据库(Milvus、Qdrant、Chroma 等),RAG 的存储层 | 向量数据库与语义检索 |
| 近似最近邻 | Approximate Nearest Neighbor, ANN | 牺牲少量精度换取百万/亿级向量亚秒级查询的检索技术,向量数据库底层的核心算法族 | 向量数据库与语义检索 |
| 分层可导航小世界 | Hierarchical Navigable Small World, HNSW | 目前最流行的 ANN 算法之一,用多层图结构做"先粗后细"的跳转,速度快、精度高、可调内存 | 向量数据库与语义检索 |
| 重排序 | Rerank | 先用向量/关键词粗召回几百条、再用更强的交叉编码器精排前几条,两段式提升检索精度 | 向量数据库与语义检索 |
| 混合检索 | Hybrid Search | 关键词(BM25)与向量检索并行、再融合排序,兼顾精确匹配与语义理解,工程上比纯向量更稳 | 向量数据库与语义检索 |
| BM25 | BM25 | 词法检索的经典打分函数,基于词频与文档长度归一化,RAG 混合检索中的"关键词腿" | 向量数据库与语义检索 |
| 知识图谱 | Knowledge Graph | 以"实体-关系-实体"三元组组织的结构化知识网络,为 RAG 提供可推理、可聚合的语义结构 | 知识图谱与知识注入 |
| 余弦相似度 | Cosine Similarity | 两个向量夹角的余弦值,衡量方向而非长度,是向量检索最常用的相似度度量 | 向量数据库与语义检索 |
| 神经符号融合 | Neuro-symbolic | 把神经网络(学感知/统计)与符号系统(推逻辑/规则,如知识图谱)结合的技术路线,取两者之长 | 知识图谱与知识注入 |
| 数据治理 | Data Governance | 对训练/使用数据的质量、合规、隐私、版权的管理制度与技术手段,大模型时代成为企业级刚需 | AI 安全与治理 |
一句话判断
检索系统要"粗召回 + 精排序"双阶段:ANN 只负责把候选从千万级压到几百条,最终交给 Rerank 排序——只靠向量相似度直接出结果的 RAG,精度通常不够用。数据量小(百万以下)时直接用 FAISS 等库,不必上重型向量数据库。
五、生成模型
这一组回答"图、视频、音频是怎么生成的":扩散模型先加噪再学去噪,配以文本条件控制,是目前文生图/文生视频的事实标准。
| 术语 | 英文 | 一句话解释 | 相关页面 |
|---|---|---|---|
| 扩散模型 | Diffusion Model | 先给数据逐步加噪到纯噪声、再学习逐步去噪还原数据分布的一类生成模型,当前文生图/文生视频的霸主 | 扩散模型与生成式 AI |
| 去噪扩散概率模型 | Denoising Diffusion Probabilistic Model, DDPM | 2020 年提出、把扩散过程写成可训练去噪网络的奠基性工作,后续扩散模型的共同起点 | 扩散模型与生成式 AI |
| 潜在扩散模型 | Latent Diffusion Model, LDM | 在低维潜在空间而非像素空间做扩散,大幅降低算力,Stable Diffusion 的技术底座(2022) | 扩散模型与生成式 AI |
| ControlNet | ControlNet | 给扩散模型引入额外条件(线稿、骨架、深度图)精确控制生成结构的 2023 年工作,让"指哪打哪"成为可能 | 扩散模型与生成式 AI |
| 文生图 | Text-to-Image | 输入文本提示、输出图像的生成任务,代表性产品有 Midjourney、Stable Diffusion、DALL·E | Midjourney 与图像生成 |
| 文生视频 | Text-to-Video | 输入文本或图像、生成连贯视频片段的生成任务,代表产品 Sora 于 2024 年发布 | Sora 与视频生成 |
| CLIP | Contrastive Language-Image Pre-training | OpenAI 2021 年提出的图文对齐模型,把图像与文本映射到同一向量空间,是文生图"文本条件"的基础 | 扩散模型与生成式 AI |
| 变分自编码器 | Variational Autoencoder, VAE | 学习压缩-重建的生成模型,LDM 用它把像素图压缩到潜在空间,2013 年提出 | 扩散模型与生成式 AI |
| 无分类器引导 | Classifier-Free Guidance, CFG | 同时用"带条件"与"无条件"的预测差值来放大文本约束的采样技巧,让生成结果更贴提示词 | 扩散模型与生成式 AI |
| 多模态模型 | Multimodal Model | 同时处理文本、图像、音频、视频的模型,把"看懂""听懂""生成"合进一个模型 | 多模态模型 |
| 具身智能 | Embodied AI | 让 AI 拥有"身体"(机器人)并在物理世界感知、交互、学习的范式,被视为通往 AGI 的另一条路径 | 多模态模型 |
| 端侧大模型 | On-device LLM | 量化压缩后可在手机/PC/边缘设备本地运行的模型,离线、隐私、低延迟,是云端之外的部署形态 | 推理优化与量化 |
| AI 科学家 | AI Scientist | 自动化做科研的 Agent 系统(读文献→提假设→做实验→写论文),AI for Science 的前沿方向 | 前沿进展 |
一句话判断
看扩散模型的进化要抓两条线:算力(像素空间 → 潜在空间)和控制(文本 → ControlNet 精确条件 → 视频)。如今"生成质量"的差距已收窄,竞争焦点转向可控性、一致性(多帧角色不变)与效率。
六、评估与安全
这一组回答"模型到底行不行、安不安全":靠基准做横向比较,靠红队与防线对抗攻击与幻觉。
| 术语 | 英文 | 一句话解释 | 相关页面 |
|---|---|---|---|
| 基准 | Benchmark | 用固定题目集与评分规则衡量模型能力的标准化测试,是模型横向比较的公共尺子 | LLM 评估与基准 |
| MMLU | Massive Multitask Language Understanding | 覆盖 57 个学科、约 1.4 万道选择题的通用知识基准,2021 年发布后成为主流模型的必考科目 | LLM 评估与基准 |
| 幻觉 | Hallucination | 模型一本正经地编造不存在的事实或逻辑,根源是它学的是"像话的序列"而非"事实数据库" | AI 安全与治理 |
| 红队 | Red Teaming | 让测试者故意攻击模型(诱导越狱、挖偏见、试边界)以暴露漏洞的对抗性测试方法 | AI 安全与治理 |
| 越狱 | Jailbreak | 通过精心构造的提示词(角色扮演、虚构场景、多语言混杂)绕过模型安全对齐限制的攻击手法 | AI 安全与治理 |
| 提示注入 | Prompt Injection | 攻击者把恶意指令藏进模型会读到的内容(网页、文档、工具输出),诱导模型违背原定任务 | AI 安全与治理 |
| 水印 | Watermark | 在 AI 生成内容中嵌入人眼/人耳难察觉但机器可检测的标记,用于追溯内容是否由模型生成 | AI 安全与治理 |
| 困惑度 | Perplexity | 语言模型对数据意外程度的度量(越小越自信),是预训练阶段常用的内部指标 | LLM 评估与基准 |
| GSM8K | Grade School Math 8K | 8.5K 道小学到初中数学应用题基准,检验模型的算术与多步推理能力 | LLM 评估与基准 |
| HumanEval | HumanEval | OpenAI 提出的 164 道编程题基准,用 pass@k 指标衡量代码生成能力 | LLM 评估与基准 |
关于基准的三个提醒
一是刷榜:厂商会用测试集相关数据训练导致"分数虚高",看结果要核对模型是否在训练时见过这些题;二是饱和:主流模型在 MMLU 上已接近 90%,单一基准区分度下降,要看组合榜单;三是脱离实际:基准分数高不等于真实业务好用,最终以你自己任务的评测为准。完整的搭建方法见 搭建一套 LLM 评估。
附录:面试高频缩写速查
面试与日常阅读中缩写满天飞。下表收录出现频率最高的一批,先记全称、再记含义——很多八股题就是在考你能否把缩写展开。
| 缩写 | 英文全称 | 一句话含义 |
|---|---|---|
| AGI | Artificial General Intelligence | 通用人工智能:像人一样跨领域学习与推理的假想智能 |
| ASI | Artificial Superintelligence | 超级人工智能:在几乎所有领域远超人类顶尖水平的假想智能 |
| GPT | Generative Pre-trained Transformer | 生成式预训练 Transformer,OpenAI 模型系列名 |
| BERT | Bidirectional Encoder Representations from Transformers | 双向编码器表示的预训练模型,2018 年 NLP 里程碑 |
| RAG | Retrieval-Augmented Generation | 检索增强生成:先检索再生成的知识注入范式 |
| RLHF | Reinforcement Learning from Human Feedback | 基于人类反馈的强化学习,主流对齐技术 |
| DPO | Direct Preference Optimization | 直接偏好优化:免奖励模型的简化对齐方法 |
| SFT | Supervised Fine-Tuning | 监督微调:用标注数据继续训练模型 |
| PEFT | Parameter-Efficient Fine-Tuning | 参数高效微调:只训练少量参数完成适配 |
| LoRA | Low-Rank Adaptation | 低秩适配:冻结原权重只练低秩矩阵的微调方法 |
| QLoRA | Quantized LoRA | 4-bit 量化 + LoRA 的组合,消费级显卡可微调 |
| CoT | Chain-of-Thought | 思维链:让模型先逐步推理再作答 |
| MoE | Mixture of Experts | 混合专家:稀疏激活的巨型模型架构 |
| MCP | Model Context Protocol | 模型上下文协议:Agent 工具接入的开放标准 |
| KV | Key-Value Cache | 键值缓存:推理加速的缓存机制 |
| ANN | Approximate Nearest Neighbor | 近似最近邻:大规模向量检索的核心技术 |
| HNSW | Hierarchical Navigable Small World | 分层可导航小世界:主流 ANN 算法之一 |
| MMLU | Massive Multitask Language Understanding | 多任务语言理解基准(57 学科) |
| CLIP | Contrastive Language-Image Pre-training | 图文对比预训练模型,文生图文本条件的基础 |
| RoPE | Rotary Position Embedding | 旋转位置编码:主流 LLM 的位置编码方案 |
| GQA | Grouped Query Attention | 分组查询注意力:降低推理显存的注意力变体 |
| TTS | Text-to-Speech | 文本转语音:让机器说话 |
| ASR | Automatic Speech Recognition | 自动语音识别:让机器听懂语音 |
| SOTA | State of the Art | 最先进水平:某任务当前最佳成绩 |
易混淆辨析
预训练 / 微调 / 对齐
预训练学的是"语言通识"(海量文本、自监督、最贵);**微调(SFT)**学的是"任务技能"(指令数据、便宜、针对性);**对齐(RLHF/DPO)**改的是"价值观与偏好"(让输出更符合人类期待、更安全)。三者是流水线:预训练 → SFT → 对齐。
LoRA / QLoRA / 全量微调
全量微调更新所有参数(效果上限高但贵);LoRA 冻结原权重、只练低秩适配矩阵(可训练参数量减少万倍);QLoRA 在 LoRA 基础上把底座 4-bit 量化(显存再省约 3/4)。小团队默认 QLoRA 起步,效果不足再升 LoRA、全量。
RAG / GraphRAG / 微调(知识注入三选一)
RAG 检索"文本片段",适合事实问答;GraphRAG 检索"图结构",适合跨实体聚合类问题(如"整个数据集里最相关的主题是什么");微调则不该用来塞知识。判断口诀:能检索到的知识别微调,要推理的关系上图谱。
越狱 / 提示注入 / 幻觉
三者同属"模型说了不该说的",但性质不同:越狱是用户主动构造提示绕过安全对齐;提示注入是恶意指令藏在"模型会读的数据"里被动触发;幻觉是模型本身编造事实,无关攻击。前两者是安全对抗,后者是能力局限。
Embedding(检索)vs Embedding(模型内部)
同一个词两种语境:在模型内部,它是词表到稠密向量的查表映射;在检索系统里,它是"文本→语义向量"的编码器产物。理解关键相同——语义相近则向量相近。
延伸阅读
- 什么是 AI 热门概念 —— 全站概念的起点与全景图
- 概念边界:AI vs ML vs DL vs GenAI —— 大模型相关术语的上位概念关系
- 演进简史 —— 术语背后的技术发展时间线
- 总体架构解剖 —— 各术语在一套真实 LLM 系统中的位置
- 学习路径:三条路线 —— 结合本表构建知识体系
- 精选资源清单 —— 本表每个术语的深入学习资料
- 模型与榜单速查 —— 各家模型与基准分数的对照表
- 论文精读:从这里开始 —— 术语对应的原始论文入口
参考资料
- Vaswani et al., Attention Is All You Need, arXiv:1706.03762, 2017 —— Transformer 原始论文
- Brown et al., Language Models are Few-Shot Learners(GPT-3), arXiv:2005.14165, 2020
- Ouyang et al., Training language models to follow instructions with human feedback(InstructGPT), arXiv:2203.02155, 2022 —— RLHF 的代表性实现
- Hu et al., LoRA: Low-Rank Adaptation of Large Language Models, arXiv:2106.09685, 2021
- Dettmers et al., QLoRA: Efficient Finetuning of Quantized LLMs, arXiv:2305.14314, 2023
- Rafailov et al., Direct Preference Optimization, arXiv:2305.18290, 2023
- Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, arXiv:2005.11401, 2020
- Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models, arXiv:2210.03629, 2022
- Ho et al., Denoising Diffusion Probabilistic Models, arXiv:2006.11239, 2020
- Rombach et al., High-Resolution Image Synthesis with Latent Diffusion Models(LDM), arXiv:2112.10752, 2022
- Malkov & Yashunin, Efficient and robust approximate nearest neighbor search using Hierarchical Navigable Small World graphs, arXiv:1603.09320, 2016
- Hendrycks et al., Measuring Massive Multitask Language Understanding(MMLU), arXiv:2009.03300, 2021
- 模型上下文协议官方文档 —— modelcontextprotocol.io