引子:当 AI 开始“替你办事”
2025 年 3 月之前,大多数人对 AI 的认知还停留在对话框里——你问,它答。但过去一年半里,AI Agent 完成了一场从“工具”到“同事”的身份跨越。你不再需要告诉它每一步怎么做,只需要说“帮我把这件事办了”,它就能在云端虚拟机里打开浏览器、编写代码、预订机票、处理邮件,甚至替你接电话。
这场进化不是一步到位的,它经历了四个清晰的阶段。而在中国,大厂走了一条完全不同的路径——产品时间线比海外更早,但形态和逻辑截然不同。
第一代:网页型 Agent——AI 第一次“动手干活”
代表产品:Manus
2025 年 3 月,Manus 发布通用 AI Agent 测试版,成为第一个真正“出圈”的通用 Agent 产品。核心模式很简单:用户在网页输入任务,Manus 在云端虚拟机中拆解步骤、调用工具、生成交付物,完成后返回结果。用户无需保持设备在线,通过“一键甩单”将任务交付即可。
Manus 验证了一个关键命题:AI 不只是聊天,还能干活。到 2025 年 12 月,Manus 年度经常性收入突破 1 亿美元,从 0 到 1 亿美元仅用了 8 个月——而 SaaS 公司通常需要 5 至 7 年才能走完这条路。
但问题也很明显:用户用完即走,没有留存。任务完成,会话即结束,没有持续状态。
第二代:Working Agent——从云端走向本地
代表产品:Claude Code、Codex
这一代的关键转变是从云端走向本地,Agent 获得了对用户文件系统和终端的直接访问权。
Claude Code 运行在终端中,其 Agent SDK 提供了与 Claude Code 完全相同的工具、Agent 循环和上下文管理,可在 Python 和 TypeScript 中编程调用,内置工具、权限系统、会话管理和 Hooks 一应俱全。截至 2026 年 3 月,该 SDK 的 npm 周下载量已超过 185 万次。
能力跃升的关键来自长上下文窗口的扩大。模型在长任务中持续保存推理过程和工具调用记录的能力大幅提升,这是 Agent 从“频繁失控”到“基本可用”的临界点。
但 Working Agent 的边界也很清楚:它们解决的是工作场景中的深度任务(写代码、分析文档、跑构建),不覆盖生活场景,也不提供持续在线的个人助理体验。
第三代:广义 Personal Agent——自托管与自进化
代表产品:OpenClaw、Hermes
这一代的关键词是持续在线和自主进化。
OpenClaw 是 2026 年初爆红的开源 AI Agent,由奥地利开发者 Peter Steinberger 开发。2026 年 3 月 3 日,OpenClaw 正式超越 React,成为 GitHub 上最多星标的软件项目,突破 250,000 颗星。React 花了十多年才达到这个里程碑,OpenClaw 只用了大约 60 天。ClawHub 技能市场收录超过 40,000 个社区 Skill,月活用户超过 300 万。
Hermes Agent 由 Nous Research 于 2026 年 2 月发布,走的是“自我进化”路线。它是目前唯一一个内置自改进学习循环的 AI Agent——每完成一个复杂任务,Agent 会自动从经验中提取可复用的 Skill 文件,并在后续使用中持续优化。其自进化系统采用 DSPy + GEPA(遗传-帕累托提示进化)技术,分五个阶段推进:从 Skill 文档优化,到工具描述改进,逐步实现全维度自进化。
两者的架构哲学截然不同:OpenClaw 以多平台协同和 Skill 生态为核心价值,Hermes 以“经验提取 → 知识存储 → 智能检索 → 上下文注入 → 执行验证 → 自动改进”的闭环学习系统为竞争力。
部署成本方面,两者都可以在约 5 美元的 VPS 上运行,但 API 使用费通常在每月 15 至 80 美元之间。这意味着真正的成本不在服务器,而在模型调用。
第四代:狭义 Personal Agent——开箱即用
代表产品:Muse、Grok Bot、Dots、Cue
2026 年 9 月是一个密集的产品发布期。这一代的共同特征是:云端分配独立计算环境,开箱即用,无需部署。
Muse(Meta) 于 2026 年 9 月 8 日上线,发布后迅速登顶美国 App Store 免费榜。上线 22 天内下载量突破 500 万,周活用户达 300 万。对比日活数据,Muse 的美国移动端日活用户达 64.2 万,而 ChatGPT 上线初期的同一指标仅为 23.1 万,Muse 是后者的近三倍。Muse 的核心功能覆盖收发邮件、预订旅行、在线购物、账单谈判,已接入 Shopify、PayPal、Expedia 和 Instacart 等平台。
Cue(Manus) 是 Manus 于 2026 年 9 月 1 日恢复独立运营后推出的个人 Agent 应用。Cue 最核心的设计是给每个 Agent 配一套独立的身份:独立的邮箱、电话号码、钱包和电脑。Agent 可以直接对外发消息,在用户设定的预算内付款,在自己的机器上执行任务,还能替用户接电话。Manus 2.0 底层换上了自研 Cascade Agent 框架,Token 消耗减少 23.2%,任务完成时间缩短 28.2%,运行成本降低 32%。Cue 目前处于抢先体验阶段,凭邀请码免费使用。
国内大厂:比 Muse 更早,路径完全不同
“Personal Agent”这个产品概念的引爆点是 Meta Muse,但国内大厂在“AI 替人办事”这条路上的探索,比 Muse 早了至少半年。区别在于:海外产品的逻辑是“云端独立环境 + 通用生活场景”,国内大厂的逻辑是“嵌入已有生态 + 场景纵深”。
Kimi Claw:国内最早的云端个人 Agent 订阅制产品
2026 年 3 月,Kimi Claw 上线,定位是“多合一 OpenClaw 全能套件”——零配置免部署,一键解锁个人云端智能体,支持 7×24 小时定时任务与深度长期记忆。默认配置 Kimi K2.5 Thinking 模型和联网搜索能力,集成 5000 余项 ClawHub 社区技能,提供 40GB 云存储。目前仅向 199 元/月的 Kimi 月会员开放,提供免费体验版。
当 Muse 在 2026 年 9 月以“云端独立环境、开箱即用”的姿态引爆美国市场时,Kimi Claw 的同类产品已经运行了半年。定位不同,但底层逻辑高度相似——都是把持续在线的个人 Agent 从自托管变成云服务。
腾讯:三条线并行
腾讯在 Personal Agent 上的布局比外界看到的更复杂,实际上是三条线同时推进。
小微是微信原生的 AI 助手,2026 年 6 月启动灰度测试。它直接长在微信内部,可以通过文字或语音操作发送消息、拨打电话等微信原生功能,也可以调起小程序完成买咖啡等生活服务。主模型为腾讯自研 WeLM,部分场景调用 DeepSeek 配合。
Handy Bot 是腾讯正在秘密开发的独立 Personal Agent 产品,已在微信端上线服务号,简介写着“Your Personal AI Agent”,计划推出独立 App。
元宝+WorkBuddy 则定位为效率智能体工具,聚焦个人办公场景,按 DAU 计已是国内最受欢迎的效率智能体工具。
阿里:从“用千问”到“我的千问”
阿里在 2026 年云栖大会上正式宣布加速打造 Personal Agent。千问产品负责人郑嗣寿有一个判断值得注意:“今天 95% 以上的 AI 需求,还停留在高级搜索。” 他认为个人 Agent 的难度在过去被大大低估了,AI 要做的不是一次推荐,而是贯穿整个决策过程,本质上是关于人的理解。
千问的路径依托其 3 亿用户和电商、支付、健康、理财等交易生态。目前已接入健康、运动数据,并试点接入理财数据,开放平台申请入驻的伙伴超过 1000 家。
字节:终端渗透的第三条路
字节的策略与腾讯、阿里都不同,走的是“快速迭代 + 终端渗透”。豆包团队自 2026 年 4 月起就在内测个人助理方向的探索产品,内部代号“Spell”。2026 年 9 月,豆包手机助手消费者版本正式发布,落地机型为努比亚 NaviX Ultra。随后,Spell 项目正式定名为“小豆”,计划推出独立的 App 版本。
一张表看清全局
| 代际 | 代表产品 | 运行环境 | 核心任务 | 使用门槛 | 核心局限 |
|---|---|---|---|---|---|
| 网页型 | Manus | 云端虚拟机 | 一次性任务 | 零门槛 | 无留存 |
| Working | Claude Code、Codex | 本地终端 | 深度工作 | 需技术背景 | 仅覆盖工作 |
| 广义 Personal | OpenClaw、Hermes | 本地自托管 | 持续运行 | 需部署能力 | 维护成本高 |
| 狭义 Personal | Muse、Cue、Dots | 云端独立环境 | 全场景 | 开箱即用 | 信任未解 |
| 国内厂商 | 核心产品 | 时间线 | 核心路径 |
|---|---|---|---|
| 月之暗面 | Kimi Claw | 2026.3 | 云端化 OpenClaw,订阅制 |
| 腾讯 | 小微 / Handy Bot | 2026.6 起 | 微信生态内渗透 + 独立 App |
| 阿里 | 千问 Personal Agent | 2026.9 宣布 | 全栈 + 交易生态驱动 |
| 字节 | 小豆(Spell) | 2026.4 起 | 终端渗透,手机助手 → 独立 App |
如何选择
已有 Codex/Claude Code 的用户:你们已经有了最强的工作深度执行能力,缺少的是生活场景覆盖和持续在线能力。在意数据主权 → Hermes(自托管,自进化技能系统);想要开箱即用 → Muse(免费额度充足);需要多 Bot 团队协作 → Grok Bot(门槛较高)。
国内用户:Kimi Claw 是目前唯一一个“付费即可用”的国内 Personal Agent 产品(199 元/月)。如果你的数字生活中心是微信,小微和 Handy Bot 是天然选择。如果主要使用阿里生态(淘宝、支付宝、饿了么),千问的路径可能更顺滑。腾讯小微和 Handy Bot 仍在灰测/内测阶段,值得等,但等待的时间成本需要权衡。
四个容易被忽略的变量
1. 商业模式尚未跑通。 Muse 500 万下载、300 万周活证明了个人 Agent 存在真实的大众需求。但订阅费天花板极低——ChatGPT 在 10 亿周活下付费率仅 5%,Muse 免费档每周送约 1 亿 token,付费转化率注定更低。交易抽佣与“帮用户省钱”天然对立:Muse 的核心卖点是帮用户比价,但如果同时从商家抽取佣金,利益冲突无法回避。
2. 安全与信任是核心摩擦点。 当 Agent 开始代表用户执行资金流转时,事故责任归属没有清晰的法律框架。Muse 设了 Sentinel 监督系统审查所有对外操作,Cue 让 Agent 在用户设定的预算内付款——这不是功能缺陷,而是法律合规的现实考量。你愿意交出多少权限,比产品功能本身更能决定体验上限。
3. 时间成本被低估。 自托管 OpenClaw/Hermes 看起来省钱,但“5 美元 VPS”的前提是你能熟练使用 Linux、Docker 和模型部署工具链。配置模型、管理运行环境、调试工具调用错误的时间成本,可能远超订阅费。
4. 国内 Personal Agent 的“生态锁定”问题。 国内大厂的 Personal Agent 本质上是“生态内 Agent”——能力越强,意味着你对某个生态的依赖越深。微信的小微不需要你交出邮箱密码,因为它本身就住在微信里;千问不需要你单独授权健康数据,因为它背后就是阿里健康的生态。便利性的另一面是锁定。 如果你在意数据主权,自托管仍然是唯一的选择,代价是时间成本和技术门槛。
写在最后
Gartner 预测,到 2027 年,超过 40% 的 AI Agent 项目将被取消,主要原因包括商业价值不明确、成本持续上升以及风险控制措施不足。但与此同时,88% 的受访企业已开始融入代理式 AI。
这两个数字并不矛盾。它们共同勾勒出 Agent 进化的真实图景:方向确定,但路径曲折。从第一代网页型 Agent 到第四代个人 Agent,这场革命的基础设施已经在过去 18 个月里悄然铺就。
关键不在于“哪一代最好”,而在于你愿意让 AI 替你承担多少。你交出多少权限,决定了它能替你走多远。