关于基线 CoT 提示和设置( o3-mini-high、DeepSeek R1、Claude 3.7 8K)的问题
作者: tqandi创建于 2026年1月8日更新于 2026年1月8日
问题
你好,非常感谢你发布了 HRM 和代码;在 ARC-AGI、Sudoku-Extreme 和 Maze-Hard 上的结果非常令人印象深刻。我有一个问题要问你,关于论文中图 1 中的基准评估,特别是 CoT 模型: CoT 基准 (o3-mini-high、DeepSeek R1、Claude 3.7 8K) 显示了非常低的准确性,在 Sudoku-Extreme 和 Maze-Hard 上为 0%,而 HRM 在这些任务上表现出色。在论文中第 3.2 节中,你提到"对于 ARC-AGI,CoT 模型的分数来自官方排行榜,而对于 Sudoku 和 Maze,分数是通过相应的 API 进行评估获得的",并且这些基准使用了链式思维提示。
内容来源: sapientinc/HRM