为什么 LLMs 仍然用表格预测进行斗争

2026年8月4日1 次浏览来源:Dev.to阅读原文

大多数商业预测问题不是作为散文而来。

它们作为行来:账户属性,交易,传感器读取,测试结果,以及一个目标列.

就这类数据而言,梯度起伏的树木和其他传统方法仍然难以取代。

一篇新论文“为什么大语言模型在表征中失败”提出了比“LLM能对表格进行分类吗? ” 更有用的问题:具体来说,当任务变得更加像普通的表征机器学习时,又会怎样?

作者控制的实验的答案是输入维度。

其结果很重要,因为它从一些解释中分离出一种实际的限制,这些解释听起来是可信的,但在测试中并不成立。

实验内容是预测,而不是表聊天 论文在纯粹的推论设置中评价边疆 LLMs :一个模型接收被标注的例子,必须预测在一代传入中的新行的标签.

没有微调,回取管道,工具调用,或代理环来补偿基模型.

这是故意的狭窄。

它询问通用语言模式是否能够充当表格式的直接学习者.

在31个基准数据集中,作者比较了9个方法,252个配置了经典模型.

这一范围很重要:一个CSV的微弱结果很容易被解释为即时设计或奇特的数据集。

在许多任务中呈现出一贯的趋势是很难被否定的。

标题不仅仅是有限责任公司输给既定的表格基线。

正是随着输入维数的增加,其准确性会下降,而研究中的经典基线保持稳定或改善.

因此,本文将维度视为核心故障模式,而不是困难数据集的附带属性. 4个流行的解释没有幸存下来 开发者在表格中给出的LLM性能不佳有几个标准原因.

研究者把这些变成可伪造的假说. “类别重叠过多。” 如果数据很吵或者不能完全分开,也许模型不能推断一个决定边界.

实验表明这不足以解释差距:即使信号更容易分离,性能问题依然存在. “CSV摧毁了桌子结构。” 将列和行转换成符号序列,感觉明显不匹配.

但改变序列化格式并没有解决问题.

模型可以访问列信息,然而它仍然在应当简单的信号上失败. “数字的表示很差。” 数字字符串以尴尬的方式分割成符号,所以也许规模比较是罪魁祸首.

降低数字精确度和相关干预措施没有产生预期的恢复。 “一个即时试验行太多。” 使用许多预测的提示可能使模型的计算过于过薄。

同样,减轻这种负担也不是解释。

这些结论中没有一个说格式化、数字化或上下文长度在生产中从来不重要。

没错 较窄的一点是,它们没有说明在这种直接预测环境中观察到的倒塌。

这种区分应该改变我们调试这些系统的方式:从CSV切换到JSON不可能解决高维的学习问题.

维度是不同类型的障碍。

表格的特征常常是多种多样的,而且只有微弱的关联性:一个客户的区域、账户年龄、设备类型、交易数、收入范围,以及数十个衍生信号可能各自贡献一点。

随着特征的积累,有用的局部相似性变得难以识别.

这是人们熟悉的维度诅咒的一种形式.

在两个维度中,论文发现LLM行为类似于本地方法,如相距相近的低克相邻或短长相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相相 换句话说,模型的预测可以看起来像一个基于邻里的决策规则.

所报告的网格协议在某些此类比较中达到91.6%.

在更高的维度上

分享