Skip to content

Manus 与 Agent 应用

本页速览 2025 年 3 月 Manus 发布掀起通用 Agent 热潮。本文拆解自主任务 Agent 的产品形态、技术底座与同类产品版图,并审视其成功率、成本与安全争议。

本页含时效性内容,数据截止于 2025-06;JD、榜单、产品功能等信息可能已变化,引用前请核对原始出处。

Manus 与 Agent 应用 ​

一、背景:一场由邀请码点燃的『通用 Agent』热潮 ​

2025 年 3 月,一款名为 Manus 的产品在没有大规模投放的情况下引爆了国内外 AI 圈。它的演示视频里,AI 不再只是"聊天",而是真的打开网页、操作软件、下载文件,最后把一份十几页的报告交到你手上。"从思考到执行"——这是 Manus 给自己的定位,也把"通用 Agent"这个概念第一次以完整的产品形态推到大众面前。想要理解这个概念的全貌,可以先读什么是 AI 智能体(Agent)。

热潮最直观的表现是邀请码经济:Manus 采用邀请制,内测名额一码难求,二手平台上"Manus 邀请码"一度被炒到数千元,甚至出现了专门的代抢、代购生意。一码难求的背后是供给与需求的极端失衡,也是公众对"AI 真的能替人干活"这件事的强烈想象——人人都想拿到那张"数字员工的入场券"。

Manus 出自中国团队 Monica.im(武汉蝴蝶效应科技,创始人肖弘),该团队此前以浏览器插件 Monica 为人所知。它的走红让资本市场迅速重估 Agent 赛道:多家创业公司宣布"All in Agent",大厂同步布局,招聘市场里"Agent 工程师"岗位开始批量出现。这场热潮的深意在于:它标志着 Agent 从论文和 Demo 阶段,进入了产品化与商业化的阶段。从更宏观的视角看,这是演进简史中继对话式 AI 之后的又一个节点——AI 的交互范式正在从"我问你答"转向"我交代你办"。

二、什么是通用 Agent 产品 ​

一句话定义:通用 Agent 产品是能接收自然语言任务、自主规划执行步骤、调用外部工具并交付完整成果的 AI 应用。它与聊天机器人的本质区别在于:聊天机器人"回答",Agent"交付"。前者输出文字,后者输出结果。

典型的任务流程可以画成一条流水线:

用户下达任务(自然语言)
      ↓
① 任务理解与规划:拆解目标,制定执行计划
      ↓
② 工具调用:浏览器访问网页 / 写代码并运行 / 读写文件 / 调用 API
      ↓
③ 中间反馈与自我修正:遇到错误重新尝试、调整方案
      ↓
④ 交付成果:报告、表格、演示文稿、可运行代码

为了看清"通用 Agent"的位置,把它和另外两类常见形态放在一起对比:

维度聊天机器人(Chatbot)工作流 Agent(Workflow)通用 Agent(如 Manus)
任务类型对话、问答固定的自动化流程开放式自主任务
决策方式单轮生成预设节点、硬编码动态规划、自我修正
工具使用极少或没有流程中按序编排自由调用浏览器/代码/文件
对环境的适应无流程外变化即失败边执行边调整
交付物文字回答流程输出完整成品(报告/文件/应用)
典型代表ChatGPTRPA、ZapierManus、OpenAI Operator

一句话判断

通用 Agent 的本质是把"提示词"变成"执行计划",再把"执行计划"变成"真实世界的操作"。因此它的评测标准不是"说得对不对",而是"做没做成"。这一差别是它与 ChatGPT 与对话式 AI 最根本的分野。

从产品形态上看,Manus 还有一个显著特征:云端异步执行。用户在对话里下达任务后可以关掉页面,Agent 在云端跑几分钟甚至几十分钟,完成后通过通知把成果送回。这有点像"给 AI 派了份工",而不是"陪 AI 聊了会儿天"。

三、技术底座:四块积木拼出一个 Agent ​

通用 Agent 不是单个模型,而是一个系统。拆开来看,底座由四块积木组成,缺一块都跑不起来:

  1. LLM 大脑:负责理解任务、拆解步骤、判断中间结果。规划能力直接依赖模型的推理水平,这也是 DeepSeek-R1 与推理模型 掀起"慢思考"潮流后 Agent 突然"变聪明"的原因之一——推理强的模型做规划更可靠。基础机制见大语言模型(LLM)。
  2. 工具调用(Tool Use):模型通过结构化输出(function calling)触发外部工具。Manus 的能力目录涵盖浏览器操作、代码执行、文件读写等,原理与边界见AI 智能体(Agent)。
  3. 多模态感知:Agent 要"看"网页截图、"读"PDF 里的图表,就必须具备视觉理解能力。Manus 内置多模态模型处理截图类输入,相关能力见多模态模型。
  4. 沙箱执行环境:Agent 的代码运行在隔离的虚拟沙箱中,避免污染宿主系统,同时也是权限与安全控制的关键。任务涉及的隐私文件、账号凭证都只能在受控范围内被访问。

编排层负责把四块积木串起来。主流做法是"循环式执行"——思考 → 行动 → 观察 → 再思考,直到任务完成或达到终止条件:

while not task_completed:
    plan = llm.plan(state)          # 大脑:下一步做什么
    result = tools.execute(plan)    # 手:调用工具
    state.update(plan, result)      # 眼:观察结果,更新状态
    if llm.should_stop(state):      # 判断:任务完成或需要求助
        break

以"简历筛选"为例,一次真实任务在系统里的执行轨迹大致如下:

用户任务:"帮我筛 50 份简历,挑出 5 个符合前端岗位的候选人"
Step 1  规划     → 下载附件 → 解析 PDF → 提取技能字段 → 按 JD 打分
Step 2  工具调用 → 调用文件 API 下载简历压缩包(发现 3 个损坏文件)
Step 3  自我修正 → 对损坏文件重试下载,仍失败则记录原因并跳过
Step 4  代码执行 → 用 Python 统计关键词命中率,生成候选人排序表
Step 5  交付     → 输出 Markdown 报告 + 排序后的简历清单(附筛选依据)

注意每一步都可能触发新的 LLM 调用:理解文件、决定重试、编写分析脚本、组织报告——一个"看起来简单"的任务,背后是几十次模型调用与十几次工具操作。这正是"成本失控"争议的根源,也是评测 Agent 时不能只看"最终结果"、还要看过程可靠性的原因(方法论见LLM 评估与基准)。

这一层的工程实践(LangGraph、AutoGPT、Claude computer-use SDK 等)极其重要:框架决定 Agent 的鲁棒性、成本与可观测性。想亲手实现一个最小可用的 Agent,推荐跟随从零开发一个 Agent 走一遍全流程。实践中常见的失败模式与反模式,可以对照常见陷阱与反模式。

一个容易忽略的成本点

Agent 一次任务往往要调用几十到上百次 LLM,多模态输入还会放大 token 消耗。同样的任务,Agent 路径的成本可能是直接对话的几十倍。成本建模与推理优化是 Agent 商业化的命门,相关方法见推理优化与量化。

四、同类产品版图(dataAsOf: 2025-06) ​

Manus 并非孤例。2024 至 2025 年,"能干活"的 AI 产品百花齐放,方向各有侧重:

产品厂商定位特点
ManusMonica / 蝴蝶效应(中国)通用自主任务 Agent云端异步执行、交付完整成果、多模型路由
OpenAI OperatorOpenAI浏览器操作 Agent基于 CUA 模型,操作网页完成订餐、购物等
Claude Computer UseAnthropic计算机操作 API直接操控屏幕光标与键盘,面向开发者开放
DevinCognition AI编码 Agent端到端开发任务:建仓库、修 bug、部署
Genspark AutopilotGensparkAI 搜索 + Agent从"搜索答案"升级到"替你办事"
OpenAI Deep ResearchOpenAI研究型 Agent多步联网检索,输出带引用的研究报告

如何读这张版图

各产品的差异主要集中在权限边界与领域聚焦两条轴上:Operator 与 Computer Use 控制"浏览器/电脑",Devin 聚焦"代码库",Deep Research 专注"研究",而 Manus 追求"什么都干"。权限越广,能力天花板越高,风险与成本也越大——这条规律适用于所有 Agent 产品。

从技术谱系看,编码 Agent 与 GitHub Copilot 与代码智能一脉相承,但把场景从"补全代码"扩展到了"独立完成工程任务",是 Agent 化最成熟的垂直领域之一。

五、应用场景与生产力 Agent 的边界 ​

从 Manus 官方演示和用户实测来看,高频场景集中在以下几类:

  • 简历筛选:批量解析 PDF 简历,按 JD 关键词打分、排序,输出候选人对比表;
  • 网页调研:给定主题,自动访问多个网站、抓取信息,汇总成带来源的调研报告;
  • 数据分析:读取 CSV/Excel,编写 Python 代码完成清洗与统计,输出图表与结论;
  • 报告生成:从资料收集到排版成文的一站式报告生产;
  • 资料整理:下载、分类、重命名文件,维护本地资料库。

这些场景的共同特征是:目标明确、过程可拆解、成果可验收。反过来,边界也清晰:

生产力 Agent 的边界

开放、模糊、依赖人类判断的任务(如"帮我判断这家公司值不值得投资")不适合交给 Agent;涉及隐私与高价值数据的任务要极其谨慎;实时性要求极高的任务会受限于执行速度与工具生态。判断标准一句话:"能验收"才敢交出去。凡是验收标准说不清的任务,Agent 就会在错误的方向上越跑越远。

六、争议与风险 ​

热潮之下,质疑同样尖锐,集中在四个维度:

  • 任务成功率存疑:演示视频经过剪辑,"演示 vs 真实可用"的差距客观存在。社区实测中,复杂任务经常中途卡死、做错一半甚至完全跑偏,真实成功率远非 100%,复杂长任务尤其如此。
  • 成本失控:每个任务消耗大量 token(规划 + 多轮工具调用 + 多模态输入),叠加云端异步执行,单任务成本可达传统对话的数十倍。定价与利润率是 Agent 产品化绕不开的难题——"免费炫技"容易,"盈利交付"很难。
  • 权限与安全:Agent 拿着你的账号去操作浏览器、读写文件,一旦遭遇提示注入(恶意网页诱导 Agent 执行危险操作),轻则泄露信息,重则造成实际损失。安全治理的整体框架见AI 安全与治理。
  • 评测基准缺失:Agent 任务的开放性让 MMLU 这类传统 LLM 基准失效;GAIA 等 Agent 基准覆盖面有限,"考试型选手"与"实际能干活的"之间仍有落差。如何系统评估一个 Agent,方法见LLM 评估与基准。

权限是 Agent 的第一安全边界

给 Agent 的权限应当遵循最小化原则:只授任务必需的工具有效范围与数据范围,重要操作必须设置人工确认环节。"能力越强,越要收着用"——权限设计的好坏,往往比模型选型更决定产品成败。

七、行业影响:从"对话"到"交付" ​

Agent 热潮正在重塑 AI 行业的三层叙事:

  1. Agent 即服务(Agent as a Service, AaaS):商业模式从"卖 API 调用"、"卖对话额度",演进到"按任务完成收费"。用户买的从"算力"变成"结果",价值锚点发生根本转移。
  2. 范式迁移:AI 的使用方式从"我问你答"转向"我交代你办"。这改变了产品交互、评测方式、计费规则与安全体系一整条产业链,也让"能力边界"成为每个产品必须写清楚的说明书。全景背景见什么是 AI 热门概念 与概念边界。
  3. 人才结构变化:Agent 开发者的核心技能从"调提示词"转向"设计工具、编排流程、控制成本与风险"。对求职者而言,掌握 Agent 工程已成为高价值加分项,相关岗位与技能拆解见JD 知识点拆解。

与ChatGPT 与对话式 AI 掀起的"对话革命"相比,Manus 代表的 Agent 浪潮是"执行革命":前者改变了人类获取信息的方式,后者试图改变人类完成任务的方式。这条路才刚起步,但方向已经明确——AI 的下半场,从"会说"走向"会做"。而"会做"意味着责任与边界,这恰是下一阶段所有从业者必须共同回答的问题。

延伸阅读 ​

参考资料 ​