Ara Khan:评估体系虽存缺陷,仍应坚持使用
外来客 • 2026-08-30 03:24:53
声明:本文为对公开内容的摘要整理,
未经本站独立核实,可能与原内容存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:AI Dev 26 x SF | Ara Khan: Evals Are Broken Use Them Anyway)
🎯 核心观点
- 大众对 AI 评估存在两种极端误解:盲目相信实验室发布的客观基准分数,或完全否定数据仅凭主观体验。
- 评估并非万能,但也绝非无用,正确的方法论是将其作为工程与哲学结合的工具,用于迭代优化 Agent 流程。
- 评估的核心价值在于替代主观的哲学思辨,通过解决实际问题对智能体进行细微且客观的质量判断。
- 必须警惕“危险区”:一旦给出具体指标,团队容易陷入仅针对数字优化的陷阱,导致模型过拟合或针对特定任务修改提示词,而非真正解决业务问题。
- 建议采用“保持关注但不做最早采用者”的策略,等待新模型发布后尘埃落定再测试,避免消耗过多认知带宽。
📊 关键事实与论据
- Terminal Bench 案例:包含 89 个贴近真实软件工程的任务(如数据库问题、竞态条件、前端 Bug),通过隔离容器化环境运行,单次任务耗时可达 30-45 分钟。
- 评估维度:需追踪轮次、工具调用次数、Token 消耗及总耗时,以平衡性能与成本,例如使用低成本模型替代昂贵前沿模型。
- 三大测试对象:
- 模型本身:验证其基础能力。
- Harness(脚手架):Agent 的代码结构可能限制模型发挥,需优化工具链(如文件编辑、浏览器工具)。
- 问题集:确保评估任务与真实业务场景对齐。
- 失败分析:通过大规模运行评估,将失败归类为“读取文件失败”、“安装依赖失败”等宏观桶,从而定位具体工具或逻辑缺陷。
- 基础设施:使用 Modal 等基础设施实现并行容器化运行,避免任务间环境干扰,提升评估效率。
- 过拟合表现:修改提示词以通过特定任务、添加奇怪的技能以迎合指标,而非提升通用能力。
- 实践案例:Klein 团队花费数月专注于评估工作,每次新模型发布时都会运行评估以优化体验,并发现开源模型中许多被忽视的细微优势,这些模型不仅性能出色且成本更低。
💡 结论与建议
- 初级用户:学会解读第三方评估数据,不盲信实验室分数,结合业务场景判断适用性。
- 中级用户:利用评估数据改进自有 Agent,通过迭代优化 Harness 和工具链,提升模型在特定任务上的表现。
- 高级用户:构建专用评估体系,通过隔离环境、并行运行和细致的失败归因,实现比竞争对手更优的 Agent 性能。
- 核心原则:评估是发现 Agent 明显缺陷和进行精细化调优的关键手段,需诚实面对模型、脚手架与问题集三者的对齐关系。
- 行动指南:寻找适合自身业务的基准测试,尽可能构建评估体系,并诚实地进行持续改进。
- 综合判断:结合量化指标与定性判断,确保智能体既符合数据标准又具备合理的业务逻辑,即使获得高分,仍需通过“直觉检查”确认智能体逻辑合理且真正解决了问题。
👤 同一博主
AI Dev 2026旧金山大会:汇聚2599名开发者探索生成式AI与智能体趋势
二等奖作品:编码代理致电开发者推介发布策略
一等奖作品:编码代理致电开发者解决代码阻塞
吴恩达(Andrew Ng)30分钟应用开发完整课程
Andi Partovi:为何每个智能体都需要模拟沙箱
AI Dev 26 x SF | João Moura:构建可复用、受治理且嵌入式的企业工作流
AI Dev 26 x SF | Luke Kim:智能体数据栈——为何每个 AI 智能体都需要独立
VibeML:数小时内构建AI模型,告别数月开发周期
🧭 类似博主
-
《数智化生存》04 伟大的迁徙:探寻全球第一集装箱大港的数智密码 121台轨道吊仅需36人运维 工程
-
中国AI出海两条高速公路,全被美国公司拿下了:英伟达130亿美元收购抱抱脸|热点深度
-
Apple Watch Series 12与Ultra 4最终爆料及传闻
-
APEC嘉宾参访广州:“人生首次接受机器人服务有点不可思议”
-
AI胡编开始进入正式论文,安徽财大论文翻车始末|今日华尔街
-
AI与超级计算机重塑药物研发:周期从数十年缩短至秒级
-
點妹Vlog|實測陳茂波同款「無人」自主零售店 看「話癆」機器人店長高情商互動
-
它们就在这里”——哈佛科学家谈UFO | Jesse Weber Live
-
数据中心是美国的“梦想成真”:工业进步中心创始人
-
智神星一号成功首飞 七台发动机并联 为什么要用奇数?何时实现“重复使用”?| CCTV中文《新闻直播
0 条评论
发表评论
请先 登录 后参与讨论。