默认对国旗 Is Now a Cost Bug: 代理工作量的分级模式运行

2026年8月9日1 次浏览来源:Dev.to阅读原文

两年来,反射很简单: 能够买得起的最大模型的伸展能力 并算一天。 2026年,这种反射悄悄地变成了你成本模型中的一个错误.

最清晰的信号是今年夏天到来的,当时一个更小,更便宜的"快闪"级模型开始用它自己的旗舰兄弟在工作量开发者上排出最关心的——多步代理编码——价格的一小部分.

当快级赢得了硬基准时,"总是使用旗舰"不再是安全的默认,开始被浪费.

这是如何修复它 不把你的堆成一个科学项目。

为什么反射很贵 特工的工作量不是大调 一个单一的任务粉丝排出数十个小任务:规划,工具选择,参数格式化,总结一个文件,决定是否继续.

其中大多数步骤都很简单。

通过边疆型号跑来跑去,就像坐直升机去拐角店一样——这很有效,但你们要花直升机的价格去散步。

陷阱是,成本是隐形的,而且总额巨大。

你永远看不到你多付了钱的那一刻,你只看到发票。

三级梯子 在分级中思考,而不是模型:便宜/快分级——分类,取出,短重写,路由决定,"是否完成了?"检查.

大部分台阶都住在这里.

中层——正常推理,代码编辑,工具使用上下文适度.

旗舰分级——真正硬的推理,长文的合成,一个错误的答案毒害下游一切的一步.

目标是在实际需要的5至15%的步数中保持旗舰等级,让廉价等级承担体积。

如何决定每个请求的等级 两个机制,一起使用: 静态heuristics for the obvious case.

短快 + 有结构的产出 + 低分量 → 便宜分级.

任何触摸大背景窗口或不可逆的行动 都会升级 其它事都升级了 从廉价的层次开始, 只有当你的 evals 证明廉价的层次 失败在那一类输入时, 才会推广到更大的模型。

这是关键学科:升级是通过证据而不是假设获得的.

如果你不能指向一个小模型输掉的eval,你就不能为大模型付出代价.

一个简单的置信信号也有帮助——如果廉价模型套期,返回错误的输出,或者低的日志probs,重试上一层.

一次在更高级的重试 比把一切寄给旗舰都要便宜 量一下,不然你猜错了 你无法引导你无法测量的东西 日志,每一步:哪个层跑出,符号计数,耐久,以及成功信号.

然后计算出无聊而决定性的数字——每个完成的任务成本,而不是每个符号的成本.

优化每个托肯的团队往往通过添加回盘来降低每个任务的成本;任务级的度量标准使你保持了诚实.

这月刊重播 模型的价格和能力移动得足够快,以至于上个季度的最佳路由表就是这个季度的错误.

廉价的假经济 如果一个弱模型未能完成规划步骤,下游的每一步骤都会继承错误.

将最优秀的模特放在计划最上方,将最便宜的模特放在叶子上.

寂静能力漂移.

模型点放能一夜之间翻转你的路由假设.

Pin版本在evals中,升级前重新测试.

过度工程路由器。

一条50行高压加一分高压的规则胜过大多数球队所学的花哨路由器.

只有在数据需要时才会添加复杂性. 2026年的取走取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取的取出取出取出取出取出取出取的取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取出取的取出取出取出取出取取取出取出取出取出取出取出取出取出取出取出取出取出取出取取出取的取取取取取取取取取取取取的取取取取取取取取取取取取取取取取取取取 它正在建造一薄的路由层和 eval 绳子,让你把每一步都放在正确的层次上—— 当市场再次移动时,下午就交换基本模型。

默认至旗舰感到安全,因为它很简单.

仍然很简单。

这已经不便宜了 你现在在生产中是怎样的路由模型级—— 热力学,一个有学问的路由器,还是所有东西的一个模型?

好奇的是什么在工作.

分享