从“帮我写”到“替我做”:AI Agent 进化简史

引子:当 AI 开始“替你办事”

2025 年 3 月之前,大多数人对 AI 的认知还停留在对话框里——你问,它答。但过去一年半里,AI Agent 完成了一场从“工具”到“同事”的身份跨越。你不再需要告诉它每一步怎么做,只需要说“帮我把这件事办了”,它就能在云端虚拟机里打开浏览器、编写代码、预订机票、处理邮件,甚至替你接电话。

这场进化不是一步到位的,它经历了四个清晰的阶段。而在中国,大厂走了一条完全不同的路径——产品时间线比海外更早,但形态和逻辑截然不同。

第一代:网页型 Agent——AI 第一次“动手干活”

代表产品:Manus

2025 年 3 月,Manus 发布通用 AI Agent 测试版,成为第一个真正“出圈”的通用 Agent 产品。核心模式很简单:用户在网页输入任务,Manus 在云端虚拟机中拆解步骤、调用工具、生成交付物,完成后返回结果。用户无需保持设备在线,通过“一键甩单”将任务交付即可。

Manus 验证了一个关键命题:AI 不只是聊天,还能干活。到 2025 年 12 月,Manus 年度经常性收入突破 1 亿美元,从 0 到 1 亿美元仅用了 8 个月——而 SaaS 公司通常需要 5 至 7 年才能走完这条路。

但问题也很明显:用户用完即走,没有留存。任务完成,会话即结束,没有持续状态。

第二代:Working Agent——从云端走向本地

代表产品:Claude Code、Codex

这一代的关键转变是从云端走向本地,Agent 获得了对用户文件系统和终端的直接访问权。

Claude Code 运行在终端中,其 Agent SDK 提供了与 Claude Code 完全相同的工具、Agent 循环和上下文管理,可在 Python 和 TypeScript 中编程调用,内置工具、权限系统、会话管理和 Hooks 一应俱全。截至 2026 年 3 月,该 SDK 的 npm 周下载量已超过 185 万次。

能力跃升的关键来自长上下文窗口的扩大。模型在长任务中持续保存推理过程和工具调用记录的能力大幅提升,这是 Agent 从“频繁失控”到“基本可用”的临界点。

但 Working Agent 的边界也很清楚:它们解决的是工作场景中的深度任务(写代码、分析文档、跑构建),不覆盖生活场景,也不提供持续在线的个人助理体验。

第三代:广义 Personal Agent——自托管与自进化

代表产品:OpenClaw、Hermes

这一代的关键词是持续在线和自主进化。

OpenClaw 是 2026 年初爆红的开源 AI Agent,由奥地利开发者 Peter Steinberger 开发。2026 年 3 月 3 日,OpenClaw 正式超越 React,成为 GitHub 上最多星标的软件项目,突破 250,000 颗星。React 花了十多年才达到这个里程碑,OpenClaw 只用了大约 60 天。ClawHub 技能市场收录超过 40,000 个社区 Skill,月活用户超过 300 万。

Hermes Agent 由 Nous Research 于 2026 年 2 月发布,走的是“自我进化”路线。它是目前唯一一个内置自改进学习循环的 AI Agent——每完成一个复杂任务,Agent 会自动从经验中提取可复用的 Skill 文件,并在后续使用中持续优化。其自进化系统采用 DSPy + GEPA(遗传-帕累托提示进化)技术,分五个阶段推进:从 Skill 文档优化,到工具描述改进,逐步实现全维度自进化。

两者的架构哲学截然不同:OpenClaw 以多平台协同和 Skill 生态为核心价值,Hermes 以“经验提取 → 知识存储 → 智能检索 → 上下文注入 → 执行验证 → 自动改进”的闭环学习系统为竞争力。

部署成本方面,两者都可以在约 5 美元的 VPS 上运行,但 API 使用费通常在每月 15 至 80 美元之间。这意味着真正的成本不在服务器,而在模型调用。

第四代:狭义 Personal Agent——开箱即用

代表产品:Muse、Grok Bot、Dots、Cue

2026 年 9 月是一个密集的产品发布期。这一代的共同特征是:云端分配独立计算环境,开箱即用,无需部署。

Muse(Meta) 于 2026 年 9 月 8 日上线,发布后迅速登顶美国 App Store 免费榜。上线 22 天内下载量突破 500 万,周活用户达 300 万。对比日活数据,Muse 的美国移动端日活用户达 64.2 万,而 ChatGPT 上线初期的同一指标仅为 23.1 万,Muse 是后者的近三倍。Muse 的核心功能覆盖收发邮件、预订旅行、在线购物、账单谈判,已接入 Shopify、PayPal、Expedia 和 Instacart 等平台。

Cue(Manus) 是 Manus 于 2026 年 9 月 1 日恢复独立运营后推出的个人 Agent 应用。Cue 最核心的设计是给每个 Agent 配一套独立的身份:独立的邮箱、电话号码、钱包和电脑。Agent 可以直接对外发消息,在用户设定的预算内付款,在自己的机器上执行任务,还能替用户接电话。Manus 2.0 底层换上了自研 Cascade Agent 框架,Token 消耗减少 23.2%,任务完成时间缩短 28.2%,运行成本降低 32%。Cue 目前处于抢先体验阶段,凭邀请码免费使用。

国内大厂:比 Muse 更早,路径完全不同

“Personal Agent”这个产品概念的引爆点是 Meta Muse,但国内大厂在“AI 替人办事”这条路上的探索,比 Muse 早了至少半年。区别在于:海外产品的逻辑是“云端独立环境 + 通用生活场景”,国内大厂的逻辑是“嵌入已有生态 + 场景纵深”。

Kimi Claw:国内最早的云端个人 Agent 订阅制产品

2026 年 3 月,Kimi Claw 上线,定位是“多合一 OpenClaw 全能套件”——零配置免部署,一键解锁个人云端智能体,支持 7×24 小时定时任务与深度长期记忆。默认配置 Kimi K2.5 Thinking 模型和联网搜索能力,集成 5000 余项 ClawHub 社区技能,提供 40GB 云存储。目前仅向 199 元/月的 Kimi 月会员开放,提供免费体验版。

当 Muse 在 2026 年 9 月以“云端独立环境、开箱即用”的姿态引爆美国市场时,Kimi Claw 的同类产品已经运行了半年。定位不同,但底层逻辑高度相似——都是把持续在线的个人 Agent 从自托管变成云服务。

腾讯:三条线并行

腾讯在 Personal Agent 上的布局比外界看到的更复杂,实际上是三条线同时推进。

小微是微信原生的 AI 助手,2026 年 6 月启动灰度测试。它直接长在微信内部,可以通过文字或语音操作发送消息、拨打电话等微信原生功能,也可以调起小程序完成买咖啡等生活服务。主模型为腾讯自研 WeLM,部分场景调用 DeepSeek 配合。

Handy Bot 是腾讯正在秘密开发的独立 Personal Agent 产品,已在微信端上线服务号,简介写着“Your Personal AI Agent”,计划推出独立 App。

元宝+WorkBuddy 则定位为效率智能体工具,聚焦个人办公场景,按 DAU 计已是国内最受欢迎的效率智能体工具。

阿里:从“用千问”到“我的千问”

阿里在 2026 年云栖大会上正式宣布加速打造 Personal Agent。千问产品负责人郑嗣寿有一个判断值得注意:“今天 95% 以上的 AI 需求,还停留在高级搜索。” 他认为个人 Agent 的难度在过去被大大低估了,AI 要做的不是一次推荐,而是贯穿整个决策过程,本质上是关于人的理解。

千问的路径依托其 3 亿用户和电商、支付、健康、理财等交易生态。目前已接入健康、运动数据,并试点接入理财数据,开放平台申请入驻的伙伴超过 1000 家。

字节:终端渗透的第三条路

字节的策略与腾讯、阿里都不同,走的是“快速迭代 + 终端渗透”。豆包团队自 2026 年 4 月起就在内测个人助理方向的探索产品,内部代号“Spell”。2026 年 9 月,豆包手机助手消费者版本正式发布,落地机型为努比亚 NaviX Ultra。随后,Spell 项目正式定名为“小豆”,计划推出独立的 App 版本。

一张表看清全局

代际 代表产品 运行环境 核心任务 使用门槛 核心局限
网页型 Manus 云端虚拟机 一次性任务 零门槛 无留存
Working Claude Code、Codex 本地终端 深度工作 需技术背景 仅覆盖工作
广义 Personal OpenClaw、Hermes 本地自托管 持续运行 需部署能力 维护成本高
狭义 Personal Muse、Cue、Dots 云端独立环境 全场景 开箱即用 信任未解
国内厂商 核心产品 时间线 核心路径
月之暗面 Kimi Claw 2026.3 云端化 OpenClaw,订阅制
腾讯 小微 / Handy Bot 2026.6 起 微信生态内渗透 + 独立 App
阿里 千问 Personal Agent 2026.9 宣布 全栈 + 交易生态驱动
字节 小豆(Spell) 2026.4 起 终端渗透,手机助手 → 独立 App

如何选择

已有 Codex/Claude Code 的用户:你们已经有了最强的工作深度执行能力,缺少的是生活场景覆盖和持续在线能力。在意数据主权 → Hermes(自托管,自进化技能系统);想要开箱即用 → Muse(免费额度充足);需要多 Bot 团队协作 → Grok Bot(门槛较高)。

国内用户:Kimi Claw 是目前唯一一个“付费即可用”的国内 Personal Agent 产品(199 元/月)。如果你的数字生活中心是微信,小微和 Handy Bot 是天然选择。如果主要使用阿里生态(淘宝、支付宝、饿了么),千问的路径可能更顺滑。腾讯小微和 Handy Bot 仍在灰测/内测阶段,值得等,但等待的时间成本需要权衡。

四个容易被忽略的变量

1. 商业模式尚未跑通。 Muse 500 万下载、300 万周活证明了个人 Agent 存在真实的大众需求。但订阅费天花板极低——ChatGPT 在 10 亿周活下付费率仅 5%,Muse 免费档每周送约 1 亿 token,付费转化率注定更低。交易抽佣与“帮用户省钱”天然对立:Muse 的核心卖点是帮用户比价,但如果同时从商家抽取佣金,利益冲突无法回避。

2. 安全与信任是核心摩擦点。 当 Agent 开始代表用户执行资金流转时,事故责任归属没有清晰的法律框架。Muse 设了 Sentinel 监督系统审查所有对外操作,Cue 让 Agent 在用户设定的预算内付款——这不是功能缺陷,而是法律合规的现实考量。你愿意交出多少权限,比产品功能本身更能决定体验上限。

3. 时间成本被低估。 自托管 OpenClaw/Hermes 看起来省钱,但“5 美元 VPS”的前提是你能熟练使用 Linux、Docker 和模型部署工具链。配置模型、管理运行环境、调试工具调用错误的时间成本,可能远超订阅费。

4. 国内 Personal Agent 的“生态锁定”问题。 国内大厂的 Personal Agent 本质上是“生态内 Agent”——能力越强,意味着你对某个生态的依赖越深。微信的小微不需要你交出邮箱密码,因为它本身就住在微信里;千问不需要你单独授权健康数据,因为它背后就是阿里健康的生态。便利性的另一面是锁定。 如果你在意数据主权,自托管仍然是唯一的选择,代价是时间成本和技术门槛。

写在最后

Gartner 预测,到 2027 年,超过 40% 的 AI Agent 项目将被取消,主要原因包括商业价值不明确、成本持续上升以及风险控制措施不足。但与此同时,88% 的受访企业已开始融入代理式 AI。

这两个数字并不矛盾。它们共同勾勒出 Agent 进化的真实图景:方向确定,但路径曲折。从第一代网页型 Agent 到第四代个人 Agent,这场革命的基础设施已经在过去 18 个月里悄然铺就。

关键不在于“哪一代最好”,而在于你愿意让 AI 替你承担多少。你交出多少权限,决定了它能替你走多远。