如果你最近总听到“Agent”这个词,觉得它神秘又高级,不妨先记住一个公式:
Agent = 大模型 + Harness
Harness 是什么?你可以把它想成一套让“戒指里的老爷爷”重出江湖的系统。
网络小说里常有这种设定:一个绝世高手,灵魂困在戒指里,空有一身本事,却只能干等着。等不到有缘人,他就一直困着;等到了,还得有手脚能做事、有眼睛能看世界、有规矩不能乱来。大模型就像这位老爷爷——知识渊博、能力很强,但如果没有一套系统把它接出来、给它工具、告诉它现在世界什么样,它就只是个困在戒指里的灵魂。
这套系统,就是 Harness。
一、Harness 是怎么冒出来的?
早年的聊天机器人,你问一句它答一句,像老爷爷只能跟你聊天,不能帮你做事。它没法上网查资料,没法记住你昨天说过什么,更没法帮你把邮件发了、把表填了。
后来大模型能力上来了,人们开始让它“自己动手”。但问题立刻出现:它会乱用工具、会忘记目标、会把无关信息塞满上下文、会在该停的时候不停。于是,一套配套系统变得必不可少——这就是 Harness。
需要说清楚的是:Harness 并不是突然从石头里蹦出来的。早期 ReAct 模式的实现、AutoGPT 的工具编排层,都是它的雏形。只是到 2026 年初,Mitchell Hashimoto、OpenAI、LangChain 等人不约而同地用“Harness”来称呼这层系统工程,这个词才正式流行起来。
客观事实:Harness 的实践早已存在,术语化是最近的事。
主观观点:把它当成“新发明”来炒没必要;把它当成“早就该被重视的一层”来认真对待,很有必要。
二、Harness 里到底装了什么?
没有固定清单。但一个能用的 Harness,通常少不了这几样:
· 记忆系统:记住用户偏好、任务历史、关键事实。相当于让老爷爷记得有缘人说过什么、之前做过什么。
· 工具调度:知道有哪些工具可用,什么时候该调用哪个。这就是老爷爷的手和脚。
· 规则约束:什么能做、什么不能做、需要谁批准。老爷爷再强,也不能乱来。
· 主循环:思考 → 行动 → 检查 → 再思考,直到任务完成。这是老爷爷做事的节奏。
你可以把它想象成:大模型是戒指里的老爷爷,内力深厚;Harness 是给他接上的手脚、眼睛和规矩,让他能真正行走江湖。
但这里要提出一个质疑:“没有固定清单”不等于“什么都往里塞”。很多 Agent 项目失败,不是因为缺模块,而是因为塞了太多模块——记忆、反思、子 Agent、多轮辩论全上,结果调试难度爆炸,行为不可预测。Anthropic 的建议恰恰相反:从最简单的方法起步,只在任务确实需要时才增加部件。
主观观点:好的 Harness 设计,一半是“加了什么”,另一半是“忍住了没加什么”。
三、用两个维度,把 Agent 产品分清楚
市面上 Agent 产品很多,用“桌面端 vs 周期性任务”来分,粗略可以,但不够干净。更清楚的办法是看两个维度:
维度一:单次任务与人机耦合度
横轴从左到右:人盯着干的一次性任务 → 自动跑的周期性任务。
· 左边:你提需求,Agent 干活,你检查,它修改。人机耦合度高。
· 右边:定时触发、批量处理、无人值守。人机耦合度低。
维度二:技能复用与自我进化能力
纵轴从下到上:干完就忘 → 越干越会。
· 下面:每次任务都是白纸起步,上次经验不带入下次。
· 上面:能从任务中总结技能,下次直接调用,甚至自动生成新工具。
把这两个维度一叠,产品定位就清楚了:
| 产品 | 单次/耦合度 | 技能复用/进化 | 一句话 |
|---|---|---|---|
| Codex / Claude Code | 单次、高耦合 | 低 | 你盯着,它写代码,干完就完 |
| OpenClaw | 周期、低耦合 | 中 | 手机发指令,本地自动跑固定流程 |
| Hermes Agent | 周期、低耦合 | 高 | 干完活会反思,自动生成可复用技能 |
| DeepSeek Harness | 看你拼 | 看你拼 | 一套开源框架,自己组装 |
趋势预测:未来大多数 Agent 产品会往右上角走——更低的人机耦合,更高的技能复用。但右下角(自动跑但不会学习)在很长时间内仍是主流,因为够简单、够可控。
主观观点:Hermes Agent 的“从任务中学习并固化技能”是条有意思的路,但它也带来新问题:自动生成的技能质量谁来保证?错误技能被固化后,会不会越跑越偏?这些问题目前还没有好答案。
四、最后一句实在话
“大模型能力决定 Agent 能力上限,Harness 搭建质量决定能力能否稳定发挥”——这个判断方向没错,但别把它读成“Harness 万能”。
有厂商报告过,固定模型不变,只改 Harness 的提示和中间件,任务成绩能从 52.8% 提到 66.5%。这说明 Harness 确实能影响结果。但没有人做过严格对比:同样的投入,是改 Harness 收益大,还是升级模型收益大?
客观事实:Harness 设计会影响 Agent 表现。
趋势预测:Harness 会像“框架”一样变成模糊词,区分“意见性强的完整产品”和“低层编排原语”会比争论谁算 Harness 更有用。
主观观点:模型仍是瓶颈,Harness 是稳定器。两者都重要,但别把稳定器吹成发动机。
回到戒指老爷爷的比喻。老爷爷再强,也得有手脚、有眼睛、知道外面世界什么样,才能重出江湖。Harness 就是给他接上手脚、补上世界知识、立下规矩的那套系统。但老爷爷本身的内力有多深,终究决定了这件事的上限。Agent 没那么神秘,它就是大模型加一套 Harness。戒指里的老爷爷等到了有缘人,还得有手脚,才能真正做事。