HealthBench 调试模式会忽略明确的 --examples 覆盖
作者: sylvesterkaczmarek创建于 2026年8月16日更新于 2026年8月16日
□ 总结
eval CLI 文档-实例'为默认样本数的压倒性,但所有三个Health Bench 的硬码num examples=10,如果去bug mode else num examples'的话。
因此,`Python-m gpt oss.evals-debug-examples 2-eval healthbench.'仍然评价了10个实例。 GPQA 和 AIME 遵守同样的明确覆盖.
□ 影响
调试跑可以出乎意料地完成所请求的模型/分级工作5倍,这对Health Bench来说特别昂贵,因为每个样本被分级到多个路由项目.
□ 拟议决议
只要提供明确 " 实例 " 值。 只有在调试模式激活且用户未指定计数时,才会倒回Health Bench的调试默认为10. 添加清晰,调试-默认,以及全eval案件的焦点覆盖.
内容来源: openai/gpt-oss