关于评估 AIME24 精度的问题
作者: ZJUCQR创建于 2025年8月15日更新于 2025年8月15日
顿
我谨确认以下命令是否是评估AIME24准确性的正确方法:
TASK = aime24 (韩语)
(原始内容存档于2013-10-12) (英语). lighteval vllm $MODEL ARGS "Lighteval $TASK+0"\?
... 使用聊天模式( T) ?
-- 输出目录 $UTPUT DIR
这个命令是否应该运行64次以评价AIME24的准确性来复制DeepSeek的评价结果? 谢谢你的帮助!
内容来源: huggingface/open-r1