lm-evaluation-harness · Issues· 994 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #4187
`mmlu_*_generative` `get_response` 将整个第一行与金字母进行比较 - 那些以前缀或准确解释其答案分数为 0.000 的模型
更新于 2026年9月18日 - #4185
Python API 指南传递了未受支持的 num_fewshot 给 evaluate()
更新于 2026年9月18日 - #4183
在收集的结果中忽略元数据 n-shot 覆盖
更新于 2026年9月18日 - #1473
`bigbench_gender_inclusive_sentences_german_multiple_choice` 存在问题
更新于 2026年9月18日 - #4178
CLI 值中的引号会默默地吞噬后面的每个 key=value 参数
更新于 2026年9月17日 - #1396
Acc vs acc_norm
asking questions更新于 2026年9月17日 - #4175
longbench2_multi 组不包含 longbench2_legal_multi, 因此与 longbench2 标签合并不一致
更新于 2026年9月16日 - #4171
在嵌套的组聚合中,共享任务会被计数两次
更新于 2026年9月16日 - #4169
在完成重试后,返回 None,而不是引发异常
更新于 2026年9月16日 - #1501
添加新兰巴达翻译
good first issue更新于 2026年9月15日 - #4159
当每个子任务完全在边界上时, 组行保持 0.0 stderr , 所以证据最多的行没有约束
更新于 2026年9月14日 - #4158
GGUF 后端的 echo=true 处理在当前 LLaMA 服务器上不起作用 - 每个 loglikelihood 请求都失败
更新于 2026年9月14日 - #4153
MELA 集团未列出冰岛,而阿拉伯语被列出两次
更新于 2026年9月14日 - #4070
在 0 (或 100%) 的精度下,在任何 N 处报告的 stderr 都完全为 0.0,因此空结果声称具有无限的精度;使用边界感知区间或标记可以解决此问题。
更新于 2026年9月13日 - #4147
CLI 关键字-值解析器保留参数名称中的空格
更新于 2026年9月12日