外观
大模型时代的推荐系统
大模型时代的推荐系统,指以大型语言模型(LLM)为基座,对传统"用户 × 物品"匹配范式进行重构的新一代推荐系统——它不再只是基于稀疏的历史交互打分排序,而是把语义理解、多模态内容理解、对话式交互和智能体式的自主探索纳入同一条推荐链路。它的出发点是:推荐系统本身就是机器学习在互联网商业中最成功的应用之一;而大模型的到来,正在把这一成熟范式从"预估点击率"推向"理解用户到底想要什么"。
为什么要写这个案例?第一,推荐系统的技术栈极其完整——协同过滤、矩阵分解、因子分解机、双塔、精排,几乎每一步都是深度学习在工业界落地的教科书,是理解 ML 应用全景的最佳窗口(见概念边界)。第二,2023 年以来 LLM 的爆发式进展正在重构推荐:用户开始用自然语言提问,平台开始让模型真正理解内容,行业出现了"推荐即对话""推荐即生成"的新形态。这不是遥远的未来,而是正在发生的迁移。本文先回顾传统技术栈,再重点讲清 LLM 进入推荐的四种方式,然后落到工业落地的难点与融合趋势。
一、推荐系统:传统 ML 最成功的商业应用
推荐系统(recommender system)自动地从海量候选中筛选、排序并呈现用户最可能喜欢的物品。它支撑着电商、短视频、音乐、新闻、视频平台的核心流量与收入:
- 短视频/视频:信息流推荐直接决定用户时长与留存;
- 电商:推荐贡献了各大平台可观的成交额;
- 音乐/新闻:个性化列表就是产品本体。
为什么传统推荐系统是"ML 商业化教科书"?因为它同时具备三个条件:目标可定义(点击、转化、时长)、数据海量(用户行为日志)、反馈闭环(行为实时回流)。这种"数据-模型-反馈"飞轮是许多 AI 产品梦寐以求而不可得的,推荐系统天生拥有。也正因为如此,它的每一次技术跃迁——从协同过滤到深度模型——都直接转化为商业指标,行业有强烈动力持续投入。
二、传统技术栈:从协同过滤到双塔与精排
在进入 LLM 之前,先把传统推荐的技术栈完整回顾一遍。它们至今仍是工业系统的地基,理解它们,才能理解 LLM 要替换或增强的到底是什么。
| 代际 | 方法/代表模型 | 核心思想 | 已知局限 |
|---|---|---|---|
| 1 | 协同过滤(ItemCF/UserCF,1994-2003) | 人以群分、物以类聚;只用交互矩阵 | 稀疏、冷启动、无内容理解 |
| 2 | 矩阵分解(SVD/SVD++,Netflix Prize 时代) | 用户/物品隐因子向量点积 | 特征利用不足,难加边信息 |
| 3 | 因子分解机(FM,2010)与 DeepFM(2017) | 二阶特征交叉 + 深度网络 | 仍以离散特征、人工特征为主 |
| 4 | 双塔召回(YouTube DNN 2016;Google Two-Tower 2019) | 用户塔 × 物品塔映射到向量空间,ANN 检索 | 双塔信息瓶颈,表征简单 |
| 5 | 精排模型(DIN/DIEN/MMoE 等) | 行为序列建模、多目标学习 | 延迟预算高、可解释性差 |
把这五代表格连起来看,传统推荐有几个共同特征:离散特征 + 稀疏 embedding、判别式打分(预估 CTR/CVR)、两阶段漏斗(召回→精排)。它们擅长"把历史行为外推一英寸",却不擅长"理解内容本身":一件商品的标题、一部电影的剧情、一首歌的歌词,在传统链路里只是 ID 和离散标签,语义被 embedding 压缩成难以言说的向量。这正是 LLM 进入推荐的入口——用大语言模型的语义理解,补齐传统模型的结构性短板。
三、LLM 进入推荐的四种方式
1. 特征与内容理解:让模型"读懂"物品
第一种方式也最基础:用 LLM 把物品的文本/图像描述转成高质量语义表示,喂给推荐链路。
- 电商商品:用 LLM 从标题、详情、评论里抽取标签、主题、卖点,生成稠密语义 embedding;
- 视频/新闻:用 LLM 总结标题与正文,用多模态模型理解封面与字幕;
- 冷启动物品:新上架商品没有交互,但可以用 LLM 生成的语义向量直接参与召回——显著缓解传统冷启动问题。
这些 embedding 存入向量数据库后,可以直接做语义召回:用户看/搜/聊到"露营烧烤",系统不再只靠 ID 关联,而是靠语义相近检索出户外炉具、折叠桌椅。相比传统双塔,"LLM 语义向量"的核心优势是把长尾、冷门、新内容从"无人交互"中解放出来——传统方法里它们永远没有曝光机会,语义方法里它们第一次有了被理解的可能。
2. 对话式推荐:从"浏览-点击"到"对话-问答"
第二种方式改变交互形态:用户不再从列表里挑,而是直接对系统说话。"我想找一部和《沙丘》类似、但节奏更快、非好莱坞大片的科幻片""预算 300 以内、送长辈的茶叶"。LLM 理解这些自然语言需求后,结合检索或召回给出答案——这就是对话式推荐(conversational recommendation),它在体验上与ChatGPT 这类对话式 AI同构。
学术与工业的实践路线主要有两种:
| 路线 | 做法 | 代表 |
|---|---|---|
| LLM 作为理解层 | LLM 解析对话意图 → 结构化条件(品类/价位/口味)→ 交给传统召回排序 | Chat-REC 等 |
| LLM 作为对话外壳 | 用检索增强生成(RAG)把召回结果与用户历史注入 prompt,由 LLM 组织推荐语与追问 | 各类导购助手 |
对话式推荐的关键价值是可解释性:LLM 可以说出"推荐它的理由",而传统精排只能给出一个分数。同时它把"隐性偏好"变成"显性表达"——用户说得越多,模型理解越准。代价是:对话是有状态、回合式的,用户没有耐心,系统必须一次答好,这给延迟与质量都提出了更高要求。
3. Agent 化推荐:把推荐交给会"办事"的智能体
第三种方式把推荐从"一次性打分"升级为"自主探索":由 AI 智能体(Agent)代用户完成多步决策——对比商品、查参数、比价、看评论、下决策,甚至跨平台执行(见AI 智能体与Agent 应用案例)。
用户:"帮我选一台 7000 以内的办公笔记本,要轻、续航长,能写代码"
Agent:
① 意图理解 + 条件拆解(预算/用途/约束)
② 多路检索(商品库 + 评测内容 + 社区口碑)
③ 逐项对比、追问澄清("屏幕 14 寸可以吗?")
④ 生成推荐清单 + 理由 + 购买链接
⑤ 询问是否继续对比下一批与传统推荐的差异是本质性的:传统系统在"候选池里排序",Agent 在"目标空间里规划"——它可以主动搜索新信息、调用工具、在对话中修正假设。它的落地难点也最清晰:多步推理的可靠性、工具调用的正确性,以及"替用户做决定"的责任边界。目前工业界以"导购助手""比价助手"等窄场景为主,属于Agent 应用里"垂直职能型"的一类。
4. 生成式推荐:直接生成候选列表
第四种方式最为激进:把推荐建模为序列生成任务,由模型直接输出物品序列(generative retrieval,生成式检索)。这与"检索式推荐"(先召回再排序)形成范式对立:
检索式推荐(retrieval):用户/上下文 → 向量检索候选池 → 精排 → 输出列表
生成式推荐(generative):用户/上下文 → 模型直接生成物品 ID 序列 → 输出列表其思想来自可微检索(如 DSI——Differentiable Search Index,Tay et al., 2022):把"文档→ID"的映射直接学进 transformer 参数,检索时用生成替代搜索。应用到推荐后,模型不再需要维护海量向量索引,而是用生成概率表达候选——理论上可以打破双塔的信息瓶颈,让排序信号直接参与召回。现实约束也很直白:物品 ID 可达十亿级,token 化困难;生成的候选必须保证是库内真实物品;还要应对幻觉与重复。目前生成式推荐仍处于研究期,工业界把它视为"召回层的未来选项"而非替代品。它与推理优化里"生成速度决定可用性"的规律完全一致。
四、工业落地:LLM 推荐不是"接入就算"
四种方式各有取舍,但落到工业系统,都要过四道关:
1. 延迟与成本
推荐系统对延迟极其敏感:精排链路通常要求几十毫秒到百毫秒级响应,而一次 LLM 推理动辄几百毫秒到数秒,且 token 单价不菲。工业界的现实方案是分级混合:
- 传统双塔+精排承担绝大多数高频流量;
- LLM 只用于低流量、高价值场景(对话式推荐、推荐解释、冷启动特征生成);
- 对必须用 LLM 的地方做推理优化与量化:小模型蒸馏、KV 缓存、批量推理、结果缓存。
一句话判断:"先用便宜模型把绝大多数流量跑稳,再把贵模型用在能创造增量价值的地方"——这条经验在推荐场景比其他场景更严格。
2. 可解释性与幻觉
LLM 能给推荐理由,但理由可能编造(幻觉):说"因为您喜欢科幻片",而用户根本没看过。推荐理由造假比对话造假伤害更大——它直接破坏信任。落地方案包括:用检索到的事实片段约束生成(RAG 式),让理由与召回证据一一对应;对 LLM 输出做事实校验;或者让 LLM 只负责"组织语言",由规则系统保证内容正确。
3. 冷启动
LLM 语义理解能缓解冷启动:新物品靠文本描述就能进语义召回池;新用户靠一句话偏好描述就能得到初步推荐。但要注意"语义相似 ≠ 偏好相似"——用户喜欢"像 A 的东西",不等于喜欢"描述像 A 的东西"。冷启动的最终验证仍然要靠行为数据,评估方法见LLM 评估与基准。
4. 评估
传统推荐用 hit-rate、NDCG、AUC 等离线指标筛选模型,用在线 A/B 决策上线。LLM 化推荐带来两个评估难题:
- 指标错位:LLM 推荐的"流畅度/相关性"与业务目标(转化、时长)可能冲突——推荐语漂亮不代表用户会买;
- 生成式评估:对生成式推荐,"生成质量"本身难定义,需要人工评审、LLM 评委(LLM-as-a-judge)与业务指标的多层配合。
离线筛选、在线决策、长期监控三件套在 LLM 时代不但没有过时,反而因为生成内容的不确定性更加必要。
五、案例观察:LLM 推荐走到哪一步了
时效性说明
以下产品信息截至 dataAsOf,功能与名称可能随产品迭代而变化,引用时请以官方发布为准。
| 平台 | 已公开的 LLM 应用 | 形态判断 |
|---|---|---|
| YouTube | 用 LLM 做内容理解(标题/字幕/评论总结)、观看中的问答助手 | 先在外围功能落地,核心召回排序仍以传统链路为主 |
| Spotify | AI DJ(2023):个性化音乐推荐 + 主持人式语音叙述 | 生成式 AI 包装个性化推荐,未替代核心链路 |
| Amazon | Rufus(2024 年起逐步上线):对话式购物助手 | 典型的对话式 + Agent 化推荐 |
| 国内电商 | 淘宝问问、京东京言等导购助手 | 对话式导购,形态与 Rufus 类似 |
从这些案例能读出一个共性:LLM 目前在推荐系统的落地普遍从"外围"开始——内容理解、推荐解释、对话导购——而核心的召回与精排仍在传统链路里运行。原因不是模型不够强,而是推荐对延迟、成本、稳定性与可解释性的要求,恰好是生成式模型目前的短板。趋势是确定的,路径是渐进的。
判断框架
判断一个产品是否是"真·大模型推荐",问三个问题:① 用户的自然语言意图是否被理解并影响推荐结果?② LLM 是否参与候选生成(而非只负责包装话术)?③ 模型能否对推荐结果给出可验证的解释?三个都"是",才是范式级重构;否则只是"传统推荐 + LLM 皮肤"。
六、趋势:推荐、搜索与对话的融合
最后看方向。过去搜索、推荐、对话是三个产品形态,现在它们正在收敛:
- 搜索在对话化:Perplexity 把搜索变成"先理解、再检索、后生成回答",见AI 搜索案例;
- 推荐在语义化:LLM 让"懂内容"成为可能,推荐从行为匹配走向语义匹配;
- 两者在 Agent 化汇合:对话式导购、Agent 购物,本质上都是"理解意图 → 检索/生成 → 验证"的统一闭环。
这套融合背后的统一抽象是:意图理解(LLM)+ 检索/召回(向量/传统索引)+ 生成/组织(LLM)+ 反馈循环(行为与评价)。它同时是检索增强生成(RAG)、AI 智能体与对话式 AI的技术交会点。对从业者而言,这意味着"推荐工程师"的边界在拓宽:既要懂特征与排序,也要懂 prompt、检索与评估——这正是大语言模型时代对 ML 工程师的新要求。
推荐系统从 1994 年的 GroupLens 走到今天,经历了协同过滤、矩阵分解、深度双塔三代范式,每一代都建立在"更多数据、更强模型"之上。大模型时代的推荐,核心变化不是模型更大,而是系统第一次真正"理解"了它推荐的内容、和表达需求的用户。四种融入方式——特征理解、对话、Agent、生成式——不是互相替代的关系,而是沿着"从增强到重构"的光谱排列:前两种是增强,后两种是重构。落在哪一档,取决于产品形态、成本预算与对延迟的容忍度。工业界的经验法则仍然是那句话:先让便宜模型跑稳主干,把昂贵模型用在能创造增量价值的地方。
七、延伸阅读
- 全景与边界:概念边界:AI vs ML vs DL vs GenAI vs Agent、什么是 AI 热门概念
- 技术基础:大语言模型、Transformer 与注意力机制、多模态模型
- 检索与记忆:向量数据库与语义检索、检索增强生成(RAG)
- 交互形态:对话式 AI:ChatGPT、AI 搜索:Perplexity、Agent 应用
- 工程与评估:推理优化与量化、LLM 评估与基准
- 资源:模型与榜单速查、术语表
参考资料
- Covington, Adams, Sargin. Deep Neural Networks for YouTube Recommendations. RecSys 2016 —— 双塔召回与排序的经典工业论文
- Rendle. Factorization Machines. ICDM 2010 —— 因子分解机原始论文
- Guo et al. DeepFM: A Factorization-Machine based Neural Network for CTR Prediction. IJCAI 2017 —— DeepFM 论文
- Yi et al. Sampling-Bias-Corrected Neural Modeling for Large Corpus Item Recommendations. KDD 2019 —— Google 双塔召回的工业论文
- Lin et al. A Survey on Large Language Models for Recommendation. 2023 —— LLM 用于推荐系统的综述
- Gao et al. Chat-REC: Towards Interactive and Explainable LLMs-Augmented Recommender System. 2023 —— LLM 对话式推荐的代表工作
- Sun et al. Uncovering ChatGPT's Capabilities in Recommender Systems. RecSys 2023 —— 对 LLM 推荐能力边界的系统评测
- Tay et al. Transformer Memory as a Differentiable Search Index. NAACL 2022 —— 生成式检索(DSI)的开创性工作