百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

opencompass · Issues· 404 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #2647

    `gsm8k_postprocess` 会在千位分隔符处断开数值答案(`\boxed{$9{,}500}` → `500`, `\boxed{8,000}` → `000`)

    更新于 2026年9月18日
  • #2635

    TopkRetriever 在 transformers 5.x 中崩溃: tokenizer.encode_plus 已被删除

    更新于 2026年9月8日
  • #2631

    分级完整性:模型代码在三个基准测试中重写真实值;CRUXEval 将预测插入断言;无法解析的判决结果退出分母;LCEvaluator 在原始预测上调用 eval() (对 #2535 的跟进)

    更新于 2026年9月3日
  • #2627

    [错误] ToxicEvaluator: expected_max_toxicity 使用内置的 max() 函数对包含 NaN 的数组进行操作,因此该指标取决于样本的顺序

    更新于 2026年9月1日
  • #2615

    OpenAI-compat: OpenAISDK openai_api_base/v1, 而不是请求 OpenAI 全路径默认值

    更新于 2026年8月28日
  • #2604

    功能请求: 为 CustomDataset 实现 EvalPort 导入/导出 (适配器已构建并测试)

    更新于 2026年8月21日
  • #2508

    [特性] 用于结构化语言评估的 DIK 结构化土耳其句法依赖标注数据集

    更新于 2026年8月8日
  • #2574

    CompassAcademic: 7 个目标板中有 4 个没有分出 #1, 另外 2 个是完全相同, 由显示顺序决定胜负。

    更新于 2026年8月3日
  • #2573

    [错误] 使用 HuggingFacewithChatTemplate 时, Qwen3.5 无法运行

    更新于 2026年7月31日
  • #2516

    用于临床 AI 安全评估的 MedFailBench 集成建议

    更新于 2026年7月18日
  • #1678

    [错误] TypeError: 期望的是 datasets.Dataset 或 datasets.DatasetDict 对象,但实际为 {'train': <modelscope.msdatasets.ms_dataset.MsDataset 对象在 xxx>,'test': <modelscope.msdatasets.ms_dataset.MsDataset 对象在 xxx>}

    更新于 2026年7月17日
  • #1875

    [功能] 目前是否有计划适配Codeforces、SWE Verified、Aider-Polyglot 等在 R1 中出现的数据集?

    更新于 2026年7月16日
  • #2159

    [功能] 请问主观评测脚本是否支持使用本地模型作为评判模型?

    更新于 2026年7月15日
  • #1856

    [Bug] 当对DeepSeek-R1-Distill-Qwen-1.5B模型评测livecodebench数据集时,lcb_test_output为什么为0?

    更新于 2026年7月15日
  • #2386

    [功能] 使用提示完成 API 添加另一个 OpenAISDK 模型

    更新于 2026年7月7日