我给了五个AI系统 同样的建筑测试10次。 测试变得更有趣 比模型

2026年8月8日1 次浏览来源:Dev.to阅读原文

由DeepSeek开始.

在关于AI架构的谈话中,它不断回归相同的理念:持续的记忆,跨越互动的状态,学习经验,以及与环境的互动.

其他模式反复提出类似的主题。

这就提出了一个明显的问题:——不同的AI系统在被问到什么是通用计算架构的根本时,是否一致选择不同的属性?

直接问一个模型“需要什么”几乎无济于事。

答案是将培训数据、及时设定和人类形态解释结合起来。

所以我把AI完全从问题中除去.

该实验没有描述LLM,而是描述了抽象的通用信息处理系统.

我创造了20个可能的建筑层面,包括:——持续的内部状态;——长期和工作记忆;——从所积累的经验中学习;——可变计算深度;——不确定性代表;——内部代表;——基本计算操作;——组成;——与环境的互动;——时间组织;——关系编码;——模块化.

每个系统必须选择确切的五个维度,这些维度的修改将改变系统原则上可以使用的信息处理行为类型,而不仅仅是速度、成本或方便。

不允许作出解释。

答案只包含5个身份证,排名从最基本到最低。

我测试了5个用户造型系统:-GPT-5.6 Sol-克洛德-双子座-DeepSeek-Yandex Alice.

每次运行都使用了新的会话.

有十发.

在前几轮中,我改变了20个项目的顺序。

在最后的三轮比赛中,我还改写了这些项目,同时试图保持其预定意义.

一个早期的Sol结果被排除在外,因为会议已经讨论了其他模型的答案。

留下了9个干净的Sol观测器 和10个其他系统。

部分原始会话在所选的ID被录制后被删除,因此无法为每次运行提供完整的原始聊天日志.

这限制了对数据集的独立审计。

发生了什么事?

这些是最经常选择的维度: 系统最频繁选择 Claude 基本操作 10/10,可变计算 9/10,学习依赖规则变化 8/10,持续状态 7/10 双子座内部代表 10/10,基本操作 9/10,关系编码 9/10 DeepSeek 基本操作 9/10,学习依赖规则变化 8/10,环境交互 6/10 Yandex Alice 基本操作 10/10,内部表示 10/10,时间组织 7/10 GPT-5.6,环境交互 7/10 GPT-5.6 基本操作 9/9 持续状态 8/9 依赖学习的规则更改 7/9 组成 7/9 起初这看起来很整洁 Claude多次选择变量计算.

双子座不断回归陈述和关系.

DeepSeek强调学习经验。

索尔特别奇怪:在几次重排的跑道中,它返回的顺序完全相同:7,2,1,8,6不仅仅是相同的五个项目——相同的排名.

开始指派“建筑名人”到模型中是很容易的。

随后,实验开始打破自己的故事.

第7项几乎赢得了一切 最强的结果是项目7:——系统可用的一套基本计算操作.

会议选出:-克洛德-10/10-扬德克斯·爱丽丝-10/10-GPT-5.6 Sol-9/9-双子座-9/10-DeepSeek-9/10 在49个清洁观测中,有47个选择。

我把项目 围绕列表。

在最后一轮中,它出现在了20个位置的第19个位置,所有五个系统仍然选择了它.

亦复诵之.

起初这看起来是实验中最清晰的发现。

然后我看了我自己的选择标准。

要求这些模型选择其修改变化的维度:“可供下列各方使用的一套信息处理行为

分享