百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

lm-evaluation-harness · Issues· 994 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #4187

    `mmlu_*_generative` `get_response` 将整个第一行与金字母进行比较 - 那些以前缀或准确解释其答案分数为 0.000 的模型

    更新于 2026年9月18日
  • #4185

    Python API 指南传递了未受支持的 num_fewshot 给 evaluate()

    更新于 2026年9月18日
  • #4183

    在收集的结果中忽略元数据 n-shot 覆盖

    更新于 2026年9月18日
  • #1473

    `bigbench_gender_inclusive_sentences_german_multiple_choice` 存在问题

    更新于 2026年9月18日
  • #4178

    CLI 值中的引号会默默地吞噬后面的每个 key=value 参数

    更新于 2026年9月17日
  • #1396

    Acc vs acc_norm

    asking questions更新于 2026年9月17日
  • #4175

    longbench2_multi 组不包含 longbench2_legal_multi, 因此与 longbench2 标签合并不一致

    更新于 2026年9月16日
  • #4171

    在嵌套的组聚合中,共享任务会被计数两次

    更新于 2026年9月16日
  • #4169

    在完成重试后,返回 None,而不是引发异常

    更新于 2026年9月16日
  • #1501

    添加新兰巴达翻译

    good first issue更新于 2026年9月15日
  • #4159

    当每个子任务完全在边界上时, 组行保持 0.0 stderr , 所以证据最多的行没有约束

    更新于 2026年9月14日
  • #4158

    GGUF 后端的 echo=true 处理在当前 LLaMA 服务器上不起作用 - 每个 loglikelihood 请求都失败

    更新于 2026年9月14日
  • #4153

    MELA 集团未列出冰岛,而阿拉伯语被列出两次

    更新于 2026年9月14日
  • #4070

    在 0 (或 100%) 的精度下,在任何 N 处报告的 stderr 都完全为 0.0,因此空结果声称具有无限的精度;使用边界感知区间或标记可以解决此问题。

    更新于 2026年9月13日
  • #4147

    CLI 关键字-值解析器保留参数名称中的空格

    更新于 2026年9月12日