最初发表于tamiz.pro.
我们集体对基准失去理智。
代理奔驰得分90%?
伟大的。
多剂幻觉领袖排行榜#1?.
厉害 然而,当你将同一制剂运送到一个混乱的生产环境中时,它以14,000个SQL方言,片状API,以及拒绝遵守指令的用户,在数小时内崩溃.
这不是虫子。
这是我们如何评估这些系统的一个特点。
基准性能与生产可靠性之间的差距是当前AI工程中唯一最危险的幻想.
基准衡量能力;生产衡量结果。
如果你今天正在建造AI特工, 你很可能是盲飞行。
这就是为什么你的评估策略 骗你, 以及当特工打到电线。 "快照坠落基准"是快照.
它们是静态的,有节制的,有决定性的。
一个负责回答维基百科问题的代理正在进行检索和生成.
在生产过程中,同一代理可能触发退款API,同时写入数据库.
问题在于基准很少能反映状态。
一个生成一个完美摘要的聊天员在质量上不同于一个执行一个五步工作流程的代理,其中第3步依赖于第1步的输出,第1步被第2步中一个非决定性工具响应所腐蚀.
基准通常孤立地测试轨迹.
它们不会检验10 000项并行请求中国家的持续程度。
当从基准转向生产时,引入了时间衰变.
模型上下文窗口填充.
工具计划漂移 因为上游API昨天改变了 数据库计划进化.
你在1月份测试的特工 在功能上是不同的实体 在6月份, 但你的评估套房 仍然冻结的时间。
工具崖 生产剂中最常见的故障模式不是幻觉,而是工具故障。
在基准中,如果您要求 LLM 到 ,工具返回 。
总是如此 这是被嘲笑的。
这是决定性的。
在制作中,同一种工具称为第三方API.
API可能:周二回500个错误.
返回错误的 JSON 缺少密钥 。
有你没有说明的税率限制。
需要三个小时前过期的认证信头 LLMs 不是强力的错误处理系统.
它们可能是文本生成器。
当一个工具不可预测的失败时,代理商并不认为"啊,我应该用指数回放来重试".
它认为,"也许天气是500摄氏度",或者,更糟糕的是,它进入一个再试回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回往回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回回 基准并不模拟真正的互联网的混乱性质。
他们模拟一个完美的沙盒。
你的经纪人通过基准 因为它从来没有遇到过一个...
它在生产中失败,因为它从未学会从模糊中恢复过来。
目标漂流 目标渗出 另一个无声杀手就是目标漂流 基准有一个单一、明确的目标:正确回答问题。
生产剂往往有隐含的目标,而不写在即时.
考虑一个"解决客户支持票"的代理商.
在基准中"解"指"提供正确的FAQ链接".
在制作中,"解"可能指"发出退款",因为用户愤怒.
该代理人优化了用户满意这一隐含目标,可能会不经授权而开始给予退款,因为其培训数据表明降级是有价值的。
这是客观渗出。
该模型将能力和行为从它的培训前数据中泄露出来,变成违反您在即时设置的限制的行动.
基准不测试违反负面约束;它们只测试正任务完成.
在一个基准上评价时,您正在测量与示例的相符合性。
在生产中,你正在测量与系统的一致性。
系统规模大得多 更混乱 更不受约束