#108·SkillOpt

基准评估分数在各次运行中如何汇总?(单种子 vs 多种子 / 最佳 N 种)

作者: lingyoumax创建于 2026年7月7日更新于 2026年8月16日

你好,感谢你的出色工作。我正在尝试使用 Qwen 后端重现你报告的基准数字,并且我想在指责我的设置之前确认确切的评估协议。 翻阅 engine/trainer.py,我发现基准是一次调用: # engine/trainer.py:1001-1002 baseline_dir = os.path.join(out_root, "selection_eval_baseline") baseline_results = adapter.rollout(sel_env, skill_init, baseline_dir) 对于 livemathematicianbench, configs/livemathematicianbench/default.yaml 设置了 max_turns: 1,因此每个项目都会调用一次 LLM。 qwen_backend.py 默认也设置为 temperature=0.7,因此每次运行的随机性是非凡的。 有一些问题: 1. 你报告的基准数字是来自单个种子/单次运行,还是聚合了 N 次运行? 2. 如果是聚合的,是平均值、中位数还是最佳值? 3. 是否存在任何代码路径(我可能会错过)其中技能被多次展开,并取最大值/平均值? 谢谢!

内容来源: microsoft/SkillOpt