#4159·lm-evaluation-harness当每个子任务完全在边界上时, 组行保持 0.0 stderr , 所以证据最多的行没有约束作者: Rodrigo-Palma创建于 2026年9月14日更新于 2026年9月14日发生了什么事 内容来源: EleutherAI/lm-evaluation-harness查看 GitHub 原文在 GitHub 查看讨论