BDH-CQ 削减ARC-AGI推断费用的经常性近期理由

BDH-CQ 削减ARC-AGI推断费用的经常性近期理由

2026年8月24日1 次浏览来源:Dev.to阅读原文

这是一份名为BDH-CQ uses reventional Lateent Reasoning to Cut ARC-AGI 推论费用的研究论文的英文平面论文摘要.

如果你喜欢这些分析,你可以找到更多关于AIModels.fyi的研究,或者在Twitter上跟踪我们.

视觉推理中的成本-准确性陷阱 大型语言模型对于视觉推理任务来说根本不匹配.

他们被迫大声地描述每一个想法, 生成一个又一个的符号来解释他们的逻辑。

这种动词税计算出预算,然而自相矛盾的是并没有提高绩效.

请一个语言模型解决一个ARC-AGI谜题(一个为测试抽象思维而设计的视觉推理基准),它要么不顾动词而挣扎,要么成功成本高昂.

根源问题比简单的推论成本更深:模型通过将演示解析为语言符号来从演示中学习,这是一种间接而低效的吸收视觉模式的方法.

效率前沿是无法原谅的。

如果你想要便宜的推断,就牺牲准确性.

如果你想要准确,你牺牲的代价。

领导板上的每个模型直到最近都被组合成两个阵营中的一个,没有人找到打破权衡的路径.

BDH-CQ通过提出激进的东西来挑战这一假设:推理不需要显眼才能工作.

该模型默默地将演示吸收到其内部内存状态中,再通过隐藏地层的私人迭代来解决问题,而不会产生一个单一的中间推理符号. 150个参数的变体在ARC-AGI-1基准上达到29.5%通过@2,计算成本仅为每起任务0.07美元,在之前的Pareto边界上穿行,并在成本效率方面建立了新的技术水平。

通过隐藏状态学习 核心洞察力是欺骗性的简单:一个模型的推理过程不需要与人类的交流相匹配.

当你从实例中学习出新的技能时,你不会说出每一个观察.

你直接把规律吸收到直觉中 BDH-CQ将此应用于神经网络,将模型的经常性隐藏状态作为持续吸收从演示中信息的工作记忆.

事情是这样的 该模型接收了演示集的一系列实例.

每个例子都更新其内部状态.

当模型到达了查询输入(即需要解决的问题)时,它的内存已经由它从这些例子中学到的一切来塑造.

然后它利用这个原始状态 通过潜入空间的迭代计算来解决新的问题。

这与文中学习如何在语言模型中发挥作用有着根本的不同.

在变压器中,实例作为符号出现在快取中,模型必须使用它用于语言理解的相同机械来分析.

这里的例子完全绕过语言瓶颈。

他们直接引导模型的潜在表现.

模型不需要"读"它应该学习什么;它可以直接吸收规律.

这种重排同时解决了两个问题.

首先,它更便宜,因为模型从来不产生推理符号.

第二,它可能实际上从少数例子中学习得更好,因为信息直接流入工作记忆,而不是通过语言解析来过滤。

这种方法并不与架构相抗衡;它与反复出现的网络自然而然的构建方式一致.

了解结构的经常性机制需要回到重复的实际作用。

反复出现的神经网络维持着一种随时间演变的隐藏状态.

在每个步骤上,状态根据当前输入进行更新,同时携带来自所有前步骤的信息.

这与变压器相反,变压器会平行地处理所有符号.

在BDH-CQ中,被隐藏的状态起到工作记忆的作用.

当模型处理第一次演示时,它的状态会转变.

当它处理第二次示威时,国家再次转移,继续前进

分享