🌐 外来客网

Harness决定AI Agent表现关键

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

华尔街投行杰富瑞的分析师,最近给市面上八个主流中美AI Agent做了一场实测,看谁真正能把活干好。

结果有点出乎意料:拿了第一名的,是阿里的千问办公,尽管它背后的模型智能分只排到第四;模型能力第一的Claude Opus 5,它的Agent产品Claude Cowork拿了第二;另一个反直觉的结果是,最近大火的Workbuddy,这轮测试中隐含的Harness分在中国Agent里反而垫底。

杰富瑞的核心结论,用一句话概括:决定一个AI Agent好不好用,往往不是背后那个模型,Harness做得好是可以弥补模型智能差距的。

Harness是什么:Agent里除了模型,剩下的都是它

一个AI Agent干活的流程,可以拆成两半:一半是模型,负责"想";另一半是harness,负责"管"。

杰富瑞把harness拆成了六层,每一层管的都是模型自己管不了的事:

指令:告诉Agent这个活是什么,红线在哪

上下文:Agent干活时能看到的背景信息

工具:Agent能用什么去完成这个任务

边界:Agent能行动的范围划在哪

反馈:告诉Agent哪里做错了,让它自己纠正、重新规划

0

评论 (0)