#1712·evals

模型分级分类:无法解析的判定输出默认为最小分数

作者: AUTHENSOR创建于 2026年8月10日更新于 2026年8月29日

□ 总结

在模型分级分类路径中,无法解析到有效选择的评委反应被分配到标题中的最低分. 因此,法官的故障(运行、费率限制、非格式产出、拒绝)被转换成被评价模型最差的级别——默默无声地,没有出现出错,没有在所报告的衡量尺度中作无效的抽样核算。

□ 受影响的代码

2026-08-06年,对重播总部进行验证:

  • evals/elsuite/modeldated/classy utils.py:10'-INVALID STR = " 无效 '' '
  • evals/elsuite/modeldated/classify utils.py:99-101'——在无效的剖面上:返回分数(选择-分数.valers ())'
  • :33'(arts 或 endswith')进行选择提取是不便的:任何法官输出没有精确选择字符串的起始/结束都无效。

∮为什么这很重要∮

  • ** 与犯罪有关,不是随机的:** 判断失败与内容有关(长/复杂样本、拒绝、具体措辞),因此惩罚不平均——它有系统地对特定模型和样本类别征税。
  • ** 隐性:** 汇总指标中没有报告有多少样本被列为无效——最少。 基准消费者无法从实际能力差异中看出法官-功能税。
  • ** 计量规模:** 在3名制作法官的672次呼吁活动中,严格抽取失败率视法官而定,从**0%到53%不等。 在这个代码路径下,一位高端裁判手握被评价的模型在超过一半的样本上的最低分数,没有警告.

□ 建议修正

  1. 无法关闭到一个明确的"无效"状态,被排除在得分之外,并作为指标中的头等数报告。
  2. 在分配任何分数之前,在解析失败时重试后退。
  3. Schema-valied JSON判决,而不是以字符串匹配开头/结束。

-- -- . . .

*Context:意识到主机Evals平台2026-11-30. 追溯级固定或有文件记载的已知问题说明将使许多分叉和引文继承更正。 *