#298·gpt-oss

Eval CLI - 实例崩溃非调试 AIME 和 GPQA 因为 n repeats stay 8

作者: sylvesterkaczmarek创建于 2026年8月16日更新于 2026年8月16日

□ 总结

如果 " -- -- 调试 " 有假,即使用户提供 " -- -- 实例 " ,电子CLI也会通过`n repeats=8 ' 到AIME和GPQA。

当请求一个正子集大小时,两个构造者都有意要求`n repeats == 1':

zz
声明 n  repeats = 1,"n repeats 只支持 num 例=无"

因此,诸如Python-m gpt oss.evars-examples 2-eval object25.'之类的有文件记录的命令以num examples=2,n repeats=8'到达构造器,并在评价开始前失效。 GPQA有相同的路径.

□ 拟议决议

当提供明确的样本数时,为AIME和GPQA设定"n repeats=1",而不论调试模式如何. 保温8只为全非调试评价重复. 添加轻量级回归覆盖,用于清晰,调试,并全程重复选择.