#315·llama3

尝试重现 MATH 基准 + LLaMA 文档之间的不一致

作者: fzyzcjy创建于 2024年8月13日更新于 2025年5月29日

你好,感谢您提供的优秀的 开源 模型! 我正在尝试重现 MATH 基准测试,但目前我只获得了 50.9%(平均通过 10 次重试),而不是官方 LLaMA 所报告的 51.9%。因此,我想知道是否这种差异是正常的,或者我在这里做错了什么。特别是,如果我能够了解正确的提示和模板来评估 MATH,那就太好了。 我也似乎发现 LLaMA 文档之间存在一些不一致性。https://GitHub.com/meta-LLaMA/llama3/blob/main/eval_details.md 称"4-shot",而 https://ai.meta.com/blog/meta-LLaMA-3-1/ (表格) 则称"0-shot CoT"。因此,我想知道这些数字是 4-shot 还是 0-shot?

内容来源: meta-llama/llama3