我们根据打开代码设定了我们的代理基准:相同任务,相同模式,40%的信用

2026年8月23日2 次浏览来源:Dev.to阅读原文

每个编码代理都说效率很高 几乎没有人公布该法案。

于是我们运行了无聊的实验: 相同的bugfix,相同的模型,相同的API,相同的价格,以及一个字节相同的快取,一次通过开码,一次通过本地未检查的编码代理.

头条:开口码在三跑中平均得分2157分.

我们的2.6.6探员完成了1298年的相同任务.

这比我们少40% 甚至最便宜的开口码 都比我们多出29% 有趣的部分不是头条。

差距之所以存在,并不是大多数人猜测的原因。

设置 成本比较只有在一切驱动成本被抑制的情况下才值得阅读.

持有什么常数 : 持有恒定值任务 修复一个在 npm repo 中失败的测试, 然后执行仓库 3个文件,一个行中的错误, 在启动时测试红色 Point 字节完全相同, sha256模型端点 相同的 OpenAI 兼容API 两个代理Prices Same 账户,同级,每令牌率相同 计算 API 前面的一通有线代理,每通开通码 1.18.21 从npm 读取的信用,作为 OpenAI 兼容提供商,否则默认成功在运行前被定义,而不是在运行后:通过完全一个承诺,要求的信息只在结束端更改了干净的工作树 全部4行清除了该栏.

没有失败,所以成本是唯一移动的变量.

数字 Run Credits Requests Success source accords opencode, 运行 1 1679 8 98 789 y opencode, 运行 2 2433 11 146 058 y opencode, 运行 3 2358 11 146 387 y 本地未审查 2.6.6 1298 16 74 629 y 本地未审查 2.6.5 4395 30 257 270 yes 先读上行.

我们自己早先从一个发行站运来的代理人 也是那张桌子上最贵的 这不是一个图 建造我们赢得建设。

它是一张图表,显示一个效率通过值多少钱, 而我们自己的软件的前版本是其中的失败者。

差距为何存在 诱人的解释是,一个代理人更聪明,需要更少的步骤.

事情不是这样的,方向是相反的。

Opencode 使用的转弯比我们少。

八到十一个请求 对我们的十六。

如果你在台阶上得分, Opencode 获胜.

因为每个请求都包含着什么 法案就变了 按要求开放码 本地未审查 2.6.6 按请求提供1,349至13,308的快速信使 4,664 工具目录大小 21,188字节 7,703字节 每个快取号0.0170/0.0166/0.016110.01739 最后一行是诚实的 计费率同.

每块迅速的地产的信贷 百分之几内 在所有四跑, 和我们的 略高的一套。

没人有秘密折扣 发票上的全部差额为象征性金额,不是象征性价格.

有两样东西能驱动这个音量, 并且对于任何建立代理循环的人来说都是熟悉的: 固定块。

一个21,188个字节对7,703个字节的工具目录,大约是站起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起起 上下文衰减.

随着特工工作的进行,笔录不断增长. 10步前停止重要的旧工具输出 一直充满怨恨 除非有东西积极修剪它 集合起来,一个固定的块,大小将每个开口码请求超过一万两千个令牌. 6个代理步骤的重量已经接近我们整个任务的消费总量。 2.6.5和2.6.6之间的变化 桌上的4395不是我们为这篇文章建造的稻草人,而是我们上次发行时运送的.

在2.6.5至2.6.6之间,我们恰好是针对上面的两个项目:固定块有多大,以及记录稿有多少会招来不满。

通过同一套工具驱动的运行测量, 信用消费减少了78.6%, 在运行时间最长的运行中, 下降了80.4%。

开口码的比较就是掉出来的

分享