你的推理模型不笨。 你的解剖师放弃了最好的答案.

2026年8月7日2 次浏览来源:Dev.to阅读原文

我将一个视觉语言模型设定为基准,得分为0.31分.

实际数字为0.70.

相同的模型,相同的重量,相同的硬件,相同的100个问题.

唯一能改变的是 我是如何读出它的输出的。

我已把0.31作为能力发现写了下来 认为这个模型不合适 这个结论是错误的,失败完全在我的控制之下。

这是错误,因为我怀疑 只有我做到了。

我当时的设定是在一个多选择的基准上评估一批开放量和边疆模型:多视角驱动场景,每个问题四个选项,一个正确的答案.

标准的东西。

迅速要求推理,然后是最后一行, 我的计分码做了显而易见的事情: 最后一个评论是错误。

到底发生了什么 我测试的模型是"思考"模型.

它在承诺做出答复之前就发出长期内部推理痕迹。

我一代的预算是1024个代币 在简单问题上,它简短地解释,释放,得分很好。

在困难的问题上,它长篇大论,在中思潮中击出标志性帽子,从未发出过答案。

因此,绳子的分数是错的。 100个问题中有64个没有解答。

其中零是图像装入错误或崩溃。

他们都是短跑。 (笑声) (掌声) 校对:Soup 模型未能回答的问题正是最需要推理的问题。

我的绳子系统化地丢弃了模型的性能 完全抛弃了我试图测量的硬子集, 并将结果报告为能力上限。

在36个回答中,86%正确 模型还不错 我的测量是垃圾。

修补停止解析自由文本 。

约束解码为一出"出谋划策".

与奥拉玛: 现在几乎到处都有类似的情况:OpenAI兼容端点上的JSON schema,vLLM中的结构化输出通过 ,大纲,或lama.cpp中plain语法受约束的采样.

要点是,该模型再也无法产生出无法分解的输出.

在取样时适用这一限制,之后不予检查。

重放同100个问题:0.70,回答率100%.

一直为零的类别又以0.82和0.75回落.

二等陷阱我在同一个家族中一个更大的模型上击中了与此相关的版本,而固定则不那么明显.

该模型还短短了100个问题中的36个。

我有一个倒背,从一个短痕的尾部找到一个回信, 所以这些行产生了一些东西。

得分为0.67分.

但找到的答案是垃圾 以一种特别,危险的方式。

预想的答案严重地偏向备选案文A(48个A对地面真理23的预测)。

当模型被切断 中度理性, 你从尾部刮出的信不是一个决定, 这是任何标志 发生在附近。

这是位置偏差, 它看起来像一个真正的答案 你的计分员。

推理实际完成的行得分为0.83分.

我重新排行,预算为8192分,而不是3072分,合并得分达到0.73分.

所以:尾部的恢复比不回答更糟糕.

一个不回答明显缺失。

一个有偏见的恢复答案悄悄地 污染了您的准确性 朝你没有选择的方向。

并请注意,这36个问题中有16个仍以8192个符号标出。 0.73仍为下限,不是测量.

我现在做的是 将评估师的生成预算 与培训或预期用途预算相匹配 预算不合时宜 一次打中我31%的分数 如果按512个令牌进行微调,不要按128个记号进行评分.

轨取为一等分量.

日志和旁边的准确性。

如果两个移动,则您的准确性数字与上次运行不相上下。

我现在完全失败了 如果失败计数是我所期望的 区分基础设施故障和不良业绩。

无法解析的输出是牵引事件,而不是模型事件.

他们

分享