Skip to content

Perplexity 与 AI 搜索

本页速览 Perplexity 把检索增强生成变成大众产品。本文拆解"搜索+引用"的对话式答案引擎机制、与传统搜索的范式差异,以及 AI 搜索对内容生态与流量分配的冲击。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

Perplexity 与 AI 搜索 ​

一、背景:把 RAG 变成大众产品的"答案引擎" ​

2022 年 12 月,由 Aravind Srinivas 等人创立的 Perplexity AI 正式上线。它的产品形态在当时显得与众不同:用户在输入框里问一个问题,得到的不是一屏蓝色链接,而是一段直接给出的答案——并且每个关键句后面都挂着可点击的来源引用,点击即可跳转原文核实。这种"搜索 + 引用"的对话式答案引擎,第一次把学术界早就提出的**检索增强生成(Retrieval-Augmented Generation, RAG)**变成了大众能直接上手的产品。RAG 的技术细节见检索增强生成(RAG),原理是:先检索再生成,让大模型"带着资料说话"。

此后短短两三年,AI 搜索从"新物种"变成了"标配"。2024 年 7 月 OpenAI 公布 SearchGPT 原型并于 2024 年 11 月并入 ChatGPT Search;2024 年 5 月 Google 在 I/O 大会发布 AI Overviews 并全面推向美国市场;中国这边,秘塔 AI 搜索在 2024 年 3 月一夜爆红,夸克、豆包等产品也纷纷内置 AI 搜索能力。到了 2025 年,"AI 搜索"已成为 ChatGPT 与对话式 AI 之后最拥挤的赛道之一。这股浪潮的本质,是把信息检索的入口从"关键词 + 链接列表"迁移到"自然语言 + 生成式答案"——一次范式级的变革。

二、产品核心机制拆解:一条"带引号的答案流水线" ​

Perplexity 的体验看似简单,背后是一条多环节流水线:

用户提问(自然语言)
      ↓
① 查询改写:把口语问题改写为多个可检索的子查询
      ↓
② 多源检索:同时查询网页索引、知识源、甚至实时信息
      ↓
③ 重排(Re-ranking):按相关性与可信度给结果排序,截取精华片段
      ↓
④ LLM 生成:把检索片段作为上下文,生成带引用的回答
      ↓
⑤ 引用溯源:每个答案片段绑定来源链接,可点击核验

逐个环节看:

  • 查询改写:用户的问题常常口语化、含糊("最近国内有什么大模型新闻"),系统要把它改写成若干适合搜索引擎的精确子查询,这也是提示词工程里"把模糊请求转化为可执行指令"思想的工程化落地。
  • 多源检索:底层依赖向量数据库与语义检索做语义匹配——用 embedding 把网页片段向量化,再与问题向量做相似度检索,解决"关键词不匹配但语义相关"的问题。
  • 重排:初召回(recall)要广、精度可以低;重排阶段再用更精细的模型(交叉编码器 cross-encoder)精排,把真正相关的片段顶到前面。这一步直接决定"喂给大模型的知识质量"。
  • 生成与引用:大模型负责把检索片段组织成连贯、直接的回答。引用溯源(citations)是 Perplexity 的杀手锏——每个论点都能追溯到来源,既缓解幻觉,也给了用户"自己核实"的路径,这是它与裸聊天机器人最大的不同。

一句话判断

AI 搜索的成败公式是"好检索 + 好生成 + 可溯源"。其中引用环节最容易被忽略,却恰恰是建立用户信任的关键——没有引用的 AI 搜索,本质上就是一个更贵的聊天机器人。

三、与传统搜索的对比:答案引擎 vs 搜索引擎 ​

把 Google 与 Perplexity 放在同一张表里,范式差异一目了然:

维度传统搜索引擎(Google 等)AI 答案引擎(Perplexity 等)
交互方式关键词 + 链接列表自然语言提问 + 直接回答
信息形态十条蓝色链接一段带引用的综合答案
用户心智"我自己找答案""AI 替我找并告诉我"
多步任务多次搜索、手动拼合一次提问、多源综合
时效信息索引更新,链接直给实时检索 + 生成
信任机制看域名、看排名看引用、可核验
主要风险广告与 SEO 污染幻觉与生成偏差

"答案引擎"对"搜索引擎"的冲击是范式级的:传统搜索把排序权交给算法,把判断权交给用户;AI 搜索把判断也包办了。这带来两个直接后果:一是用户的搜索行为从"多轮点链接"变成"单轮要答案";二是流量分配逻辑被重写——用户不再逐一点击十个结果,而是只看一段摘要,这彻底动摇了以点击为计费基础的网络生态。想理解这场变革在更大坐标系里的位置,可以对照什么是 AI 热门概念 与概念边界。

四、技术要点:检索质量决定答案质量 ​

AI 搜索在技术上的核心组合是"实时检索 + 大模型摘要":检索负责"知道最新的事实",大模型负责"组织成可信的表达"。但这条流水线的命门在于——

检索质量决定答案质量

LLM 生成再强,也无法凭空修正检索阶段引入的错误或噪音。"垃圾进,垃圾出"在 AI 搜索里被放大:检索到的片段互相矛盾、过时或被 SEO 污染,最终答案就会出错。因此 AI 搜索产品的核心工程竞争,本质上是检索质量与数据新鲜度的竞争。评估体系如何搭建,见LLM 评估与基准。

这条命门最著名的翻车案例发生在 2024 年 5 月:Google 在 I/O 大会后全面开放 AI Overviews,随后用户大量反馈"AI 建议在披萨上加胶水""建议每天吃石头补充矿物质"等离谱回答——AI Overviews 抓取到 Reddit 上的调侃帖与低质网页并当作事实生成。Google 被迫在数周内大幅回撤该功能,只保留一小部分查询。这个事件成了 AI 搜索"检索质量 + 幻觉"双重风险的经典教材,相关的安全与治理讨论见AI 安全与治理。

与裸聊天机器人相比,AI 搜索有两大结构性优势:知识新鲜(每次检索实时抓取,不受模型训练截止日期限制)与可溯源(引用允许用户核验)。这也解释了为什么"AI 搜索 + RAG"是企业落地大模型时的首选路径——从零搭建一套可用的 RAG 应用,见从零搭建 RAG 应用。当然,RAG 并非万能,常见的工程陷阱可以对照常见陷阱与反模式。

五、产品版图(dataAsOf: 2025-06) ​

截至 2025 年年中,AI 搜索赛道已形成"海外 + 国内 + 大厂 + 创业公司"的完整格局:

产品厂商特点
PerplexityPerplexity AI(美国创业公司)对话式答案 + 引用,首创大众化 AI 搜索
ChatGPT SearchOpenAI内置在 ChatGPT 中,与聊天生态打通
Gemini / Deep ResearchGoogle深度研究模式,多步检索生成报告
AI OverviewsGoogle在传统搜索结果顶部生成 AI 摘要
秘塔 AI 搜索秘塔科技(中国)2024 年 3 月爆红,中文场景表现突出
夸克 AI 搜索阿里巴巴(中国)移动端 AI 搜索,深度整合夸克浏览器
豆包 / 文心一言搜索字节 / 百度大模型产品内置搜索增强

如何读这张版图

大厂(Google、OpenAI、百度、字节)走"存量入口 + AI 增强"路线,把 AI 搜索嵌入已有产品;创业公司(Perplexity、秘塔)走"独立答案引擎"路线,赌一个新入口品类。前者的护城河是流量,后者的护城河是"答案体验"与引用质量。

从更宽的视角看,AI 搜索与 Agent 正在合流:Perplexity 已推出 Comet 浏览器、OpenAI 发布 Operator 与 Deep Research,搜索从"找答案"演进到"替你办事"——这与Manus 与 Agent 应用 描述的范式迁移是同一股潮流的两面。

六、对内容生态的影响:流量、分成与"零点击搜索" ​

AI 搜索越流行,对既有内容生态的冲击就越显著,三个议题绕不开:

  1. 流量分配:用户不再点击链接,网站流量普遍承压。早期数据显示,AI 摘要使部分查询的点击率明显下降,"零点击搜索"(zero-click search)成为内容方最焦虑的词汇。
  2. 出版商分成争议:2024 年起,Perplexity、OpenAI 等陆续与《时代》、Axel Springer、美联社等出版商签署内容授权与收入分成协议;也有《纽约时报》等走法律路线对簿公堂。核心争议是:"引用"与"摘要"的边界在哪里,谁来为被引用的内容付费。
  3. 内容生产被反向塑造:当"被 AI 引用"成为新的流量出口,内容生产开始转向"利于被检索、被引用"的写作,这与传统 SEO 时代的博弈如出一辙,只是玩法从"抢占排名"变成"抢占引用"。

一个值得警惕的循环

AI 搜索依赖高质量内容做语料,却在分发环节"截胡"内容方的流量。若内容方因收益枯竭而减产,AI 搜索的检索质量将同步恶化——引用生态的可持续性,是 AI 搜索真正的长期考题。这一点与数据合规、内容版权共同构成行业下半场的核心变量。

七、答案引擎的下一步 ​

AI 搜索的演进不会停在"文字答案",四个方向值得关注:

  • 多模态搜索:用一张截图、一段语音发起搜索,"以图搜文""以音搜物"开始进入产品形态(相关能力见多模态模型)。
  • Agent 化搜索:从"给出答案"到"替你执行"——查完资料直接帮你比价、订票、生成总结。这正是Manus 与 Agent 应用 所代表的范式:搜索与执行开始合流,答案引擎的终点是"把答案变成行动"。
  • 个人知识搜索:把本地文档、聊天记录、邮件纳入检索范围,答案引擎从"搜互联网"扩展到"搜我的世界",底层仍是向量检索与 RAG 的同一套技术。
  • 商业模式终极拷问:广告模式与"零点击"天然冲突,订阅制能否撑起增长,分成协议能否与内容方实现共赢——这些问题至今没有标准答案。

可以预见,AI 搜索的竞争将从"谁能给出更聪明的答案",转向"谁能同时守住准(检索质量)、真(引用可核验)、诚(与内容方利益共赢)"。技术层面的底座是检索增强生成(RAG),商业与治理的答案,则要交给时间来检验。

延伸阅读 ​

参考资料 ​