#1832·evals

建议: 在评估报告中确定硬件级故障归因(模型、硬件和评估定义)

作者: UniversePeak创建于 2026年9月13日更新于 2026年9月13日

当 eval 运行产生失败时,目前无法从结果中确定每个失败的来源。`evals/record.py`中的 `Recorder.record_error` 将异常类型和消息写入不透明事件,而最终报告仅聚合指标 - 因此,一个装载器出现故障(工具接线错误,评分器期望默默无声)的运行和一个模型确实无法完成任务的运行看起来完全相同。修复措施完全不同(修复装载器 vs 重新定义 eval 定义 vs 修复模型),并且在装载器故障被默默计入模型失败时,基准结论会被破坏。我想提出一个小的归因层: