外观
Manus 与 Agent 应用
一、背景:一场由邀请码点燃的『通用 Agent』热潮
2025 年 3 月,一款名为 Manus 的产品在没有大规模投放的情况下引爆了国内外 AI 圈。它的演示视频里,AI 不再只是"聊天",而是真的打开网页、操作软件、下载文件,最后把一份十几页的报告交到你手上。"从思考到执行"——这是 Manus 给自己的定位,也把"通用 Agent"这个概念第一次以完整的产品形态推到大众面前。想要理解这个概念的全貌,可以先读什么是 AI 智能体(Agent)。
热潮最直观的表现是邀请码经济:Manus 采用邀请制,内测名额一码难求,二手平台上"Manus 邀请码"一度被炒到数千元,甚至出现了专门的代抢、代购生意。一码难求的背后是供给与需求的极端失衡,也是公众对"AI 真的能替人干活"这件事的强烈想象——人人都想拿到那张"数字员工的入场券"。
Manus 出自中国团队 Monica.im(武汉蝴蝶效应科技,创始人肖弘),该团队此前以浏览器插件 Monica 为人所知。它的走红让资本市场迅速重估 Agent 赛道:多家创业公司宣布"All in Agent",大厂同步布局,招聘市场里"Agent 工程师"岗位开始批量出现。这场热潮的深意在于:它标志着 Agent 从论文和 Demo 阶段,进入了产品化与商业化的阶段。从更宏观的视角看,这是演进简史中继对话式 AI 之后的又一个节点——AI 的交互范式正在从"我问你答"转向"我交代你办"。
二、什么是通用 Agent 产品
一句话定义:通用 Agent 产品是能接收自然语言任务、自主规划执行步骤、调用外部工具并交付完整成果的 AI 应用。它与聊天机器人的本质区别在于:聊天机器人"回答",Agent"交付"。前者输出文字,后者输出结果。
典型的任务流程可以画成一条流水线:
用户下达任务(自然语言)
↓
① 任务理解与规划:拆解目标,制定执行计划
↓
② 工具调用:浏览器访问网页 / 写代码并运行 / 读写文件 / 调用 API
↓
③ 中间反馈与自我修正:遇到错误重新尝试、调整方案
↓
④ 交付成果:报告、表格、演示文稿、可运行代码为了看清"通用 Agent"的位置,把它和另外两类常见形态放在一起对比:
| 维度 | 聊天机器人(Chatbot) | 工作流 Agent(Workflow) | 通用 Agent(如 Manus) |
|---|---|---|---|
| 任务类型 | 对话、问答 | 固定的自动化流程 | 开放式自主任务 |
| 决策方式 | 单轮生成 | 预设节点、硬编码 | 动态规划、自我修正 |
| 工具使用 | 极少或没有 | 流程中按序编排 | 自由调用浏览器/代码/文件 |
| 对环境的适应 | 无 | 流程外变化即失败 | 边执行边调整 |
| 交付物 | 文字回答 | 流程输出 | 完整成品(报告/文件/应用) |
| 典型代表 | ChatGPT | RPA、Zapier | Manus、OpenAI Operator |
一句话判断
通用 Agent 的本质是把"提示词"变成"执行计划",再把"执行计划"变成"真实世界的操作"。因此它的评测标准不是"说得对不对",而是"做没做成"。这一差别是它与 ChatGPT 与对话式 AI 最根本的分野。
从产品形态上看,Manus 还有一个显著特征:云端异步执行。用户在对话里下达任务后可以关掉页面,Agent 在云端跑几分钟甚至几十分钟,完成后通过通知把成果送回。这有点像"给 AI 派了份工",而不是"陪 AI 聊了会儿天"。
三、技术底座:四块积木拼出一个 Agent
通用 Agent 不是单个模型,而是一个系统。拆开来看,底座由四块积木组成,缺一块都跑不起来:
- LLM 大脑:负责理解任务、拆解步骤、判断中间结果。规划能力直接依赖模型的推理水平,这也是 DeepSeek-R1 与推理模型 掀起"慢思考"潮流后 Agent 突然"变聪明"的原因之一——推理强的模型做规划更可靠。基础机制见大语言模型(LLM)。
- 工具调用(Tool Use):模型通过结构化输出(function calling)触发外部工具。Manus 的能力目录涵盖浏览器操作、代码执行、文件读写等,原理与边界见AI 智能体(Agent)。
- 多模态感知:Agent 要"看"网页截图、"读"PDF 里的图表,就必须具备视觉理解能力。Manus 内置多模态模型处理截图类输入,相关能力见多模态模型。
- 沙箱执行环境:Agent 的代码运行在隔离的虚拟沙箱中,避免污染宿主系统,同时也是权限与安全控制的关键。任务涉及的隐私文件、账号凭证都只能在受控范围内被访问。
编排层负责把四块积木串起来。主流做法是"循环式执行"——思考 → 行动 → 观察 → 再思考,直到任务完成或达到终止条件:
while not task_completed:
plan = llm.plan(state) # 大脑:下一步做什么
result = tools.execute(plan) # 手:调用工具
state.update(plan, result) # 眼:观察结果,更新状态
if llm.should_stop(state): # 判断:任务完成或需要求助
break以"简历筛选"为例,一次真实任务在系统里的执行轨迹大致如下:
用户任务:"帮我筛 50 份简历,挑出 5 个符合前端岗位的候选人"
Step 1 规划 → 下载附件 → 解析 PDF → 提取技能字段 → 按 JD 打分
Step 2 工具调用 → 调用文件 API 下载简历压缩包(发现 3 个损坏文件)
Step 3 自我修正 → 对损坏文件重试下载,仍失败则记录原因并跳过
Step 4 代码执行 → 用 Python 统计关键词命中率,生成候选人排序表
Step 5 交付 → 输出 Markdown 报告 + 排序后的简历清单(附筛选依据)注意每一步都可能触发新的 LLM 调用:理解文件、决定重试、编写分析脚本、组织报告——一个"看起来简单"的任务,背后是几十次模型调用与十几次工具操作。这正是"成本失控"争议的根源,也是评测 Agent 时不能只看"最终结果"、还要看过程可靠性的原因(方法论见LLM 评估与基准)。
这一层的工程实践(LangGraph、AutoGPT、Claude computer-use SDK 等)极其重要:框架决定 Agent 的鲁棒性、成本与可观测性。想亲手实现一个最小可用的 Agent,推荐跟随从零开发一个 Agent 走一遍全流程。实践中常见的失败模式与反模式,可以对照常见陷阱与反模式。
一个容易忽略的成本点
Agent 一次任务往往要调用几十到上百次 LLM,多模态输入还会放大 token 消耗。同样的任务,Agent 路径的成本可能是直接对话的几十倍。成本建模与推理优化是 Agent 商业化的命门,相关方法见推理优化与量化。
四、同类产品版图(dataAsOf: 2025-06)
Manus 并非孤例。2024 至 2025 年,"能干活"的 AI 产品百花齐放,方向各有侧重:
| 产品 | 厂商 | 定位 | 特点 |
|---|---|---|---|
| Manus | Monica / 蝴蝶效应(中国) | 通用自主任务 Agent | 云端异步执行、交付完整成果、多模型路由 |
| OpenAI Operator | OpenAI | 浏览器操作 Agent | 基于 CUA 模型,操作网页完成订餐、购物等 |
| Claude Computer Use | Anthropic | 计算机操作 API | 直接操控屏幕光标与键盘,面向开发者开放 |
| Devin | Cognition AI | 编码 Agent | 端到端开发任务:建仓库、修 bug、部署 |
| Genspark Autopilot | Genspark | AI 搜索 + Agent | 从"搜索答案"升级到"替你办事" |
| OpenAI Deep Research | OpenAI | 研究型 Agent | 多步联网检索,输出带引用的研究报告 |
如何读这张版图
各产品的差异主要集中在权限边界与领域聚焦两条轴上:Operator 与 Computer Use 控制"浏览器/电脑",Devin 聚焦"代码库",Deep Research 专注"研究",而 Manus 追求"什么都干"。权限越广,能力天花板越高,风险与成本也越大——这条规律适用于所有 Agent 产品。
从技术谱系看,编码 Agent 与 GitHub Copilot 与代码智能一脉相承,但把场景从"补全代码"扩展到了"独立完成工程任务",是 Agent 化最成熟的垂直领域之一。
五、应用场景与生产力 Agent 的边界
从 Manus 官方演示和用户实测来看,高频场景集中在以下几类:
- 简历筛选:批量解析 PDF 简历,按 JD 关键词打分、排序,输出候选人对比表;
- 网页调研:给定主题,自动访问多个网站、抓取信息,汇总成带来源的调研报告;
- 数据分析:读取 CSV/Excel,编写 Python 代码完成清洗与统计,输出图表与结论;
- 报告生成:从资料收集到排版成文的一站式报告生产;
- 资料整理:下载、分类、重命名文件,维护本地资料库。
这些场景的共同特征是:目标明确、过程可拆解、成果可验收。反过来,边界也清晰:
生产力 Agent 的边界
开放、模糊、依赖人类判断的任务(如"帮我判断这家公司值不值得投资")不适合交给 Agent;涉及隐私与高价值数据的任务要极其谨慎;实时性要求极高的任务会受限于执行速度与工具生态。判断标准一句话:"能验收"才敢交出去。凡是验收标准说不清的任务,Agent 就会在错误的方向上越跑越远。
六、争议与风险
热潮之下,质疑同样尖锐,集中在四个维度:
- 任务成功率存疑:演示视频经过剪辑,"演示 vs 真实可用"的差距客观存在。社区实测中,复杂任务经常中途卡死、做错一半甚至完全跑偏,真实成功率远非 100%,复杂长任务尤其如此。
- 成本失控:每个任务消耗大量 token(规划 + 多轮工具调用 + 多模态输入),叠加云端异步执行,单任务成本可达传统对话的数十倍。定价与利润率是 Agent 产品化绕不开的难题——"免费炫技"容易,"盈利交付"很难。
- 权限与安全:Agent 拿着你的账号去操作浏览器、读写文件,一旦遭遇提示注入(恶意网页诱导 Agent 执行危险操作),轻则泄露信息,重则造成实际损失。安全治理的整体框架见AI 安全与治理。
- 评测基准缺失:Agent 任务的开放性让 MMLU 这类传统 LLM 基准失效;GAIA 等 Agent 基准覆盖面有限,"考试型选手"与"实际能干活的"之间仍有落差。如何系统评估一个 Agent,方法见LLM 评估与基准。
权限是 Agent 的第一安全边界
给 Agent 的权限应当遵循最小化原则:只授任务必需的工具有效范围与数据范围,重要操作必须设置人工确认环节。"能力越强,越要收着用"——权限设计的好坏,往往比模型选型更决定产品成败。
七、行业影响:从"对话"到"交付"
Agent 热潮正在重塑 AI 行业的三层叙事:
- Agent 即服务(Agent as a Service, AaaS):商业模式从"卖 API 调用"、"卖对话额度",演进到"按任务完成收费"。用户买的从"算力"变成"结果",价值锚点发生根本转移。
- 范式迁移:AI 的使用方式从"我问你答"转向"我交代你办"。这改变了产品交互、评测方式、计费规则与安全体系一整条产业链,也让"能力边界"成为每个产品必须写清楚的说明书。全景背景见什么是 AI 热门概念 与概念边界。
- 人才结构变化:Agent 开发者的核心技能从"调提示词"转向"设计工具、编排流程、控制成本与风险"。对求职者而言,掌握 Agent 工程已成为高价值加分项,相关岗位与技能拆解见JD 知识点拆解。
与ChatGPT 与对话式 AI 掀起的"对话革命"相比,Manus 代表的 Agent 浪潮是"执行革命":前者改变了人类获取信息的方式,后者试图改变人类完成任务的方式。这条路才刚起步,但方向已经明确——AI 的下半场,从"会说"走向"会做"。而"会做"意味着责任与边界,这恰是下一阶段所有从业者必须共同回答的问题。
延伸阅读
- AI 智能体(Agent)——Agent 的定义、类型与工具调用原理
- 从零开发一个 Agent——用框架从零搭一个最小可用 Agent
- 大语言模型(LLM)——Agent 的"大脑"底座
- 多模态模型——Agent 看网页、读图的能力来源
- LLM 评估与基准——Agent 任务如何评测与验收
- AI 安全与治理——提示注入、权限设计与 Agent 安全
- ChatGPT 与对话式 AI——从"对话革命"到"执行革命"
- 常见陷阱与反模式——Agent 落地的典型坑
- 推理优化与量化——控制 Agent 的推理成本
参考资料
- Manus 官方站点(manus.im)——官方演示与产品介绍
- Anthropic. Developing a computer use model——Claude Computer Use 技术公告
- OpenAI. Introducing Operator(2025-01)——浏览器操作 Agent 首发说明
- Cognition AI. Introducing Devin(2024-03)——编码 Agent Devin 的发布博客
- Meta. GAIA: A Benchmark for General AI Assistants(ICLR 2024)——通用 AI 助手基准论文
- LangGraph 官方文档——主流 Agent 编排框架
- Anthropic. Building Effective Agents(2024-12)——Agent 工程模式的系统性综述