由DeepSeek开始.
在关于AI架构的谈话中,它不断回归相同的理念:持续的记忆,跨越互动的状态,学习经验,以及与环境的互动.
其他模式反复提出类似的主题。
这就提出了一个明显的问题:——不同的AI系统在被问到什么是通用计算架构的根本时,是否一致选择不同的属性?
直接问一个模型“需要什么”几乎无济于事。
答案是将培训数据、及时设定和人类形态解释结合起来。
所以我把AI完全从问题中除去.
该实验没有描述LLM,而是描述了抽象的通用信息处理系统.
我创造了20个可能的建筑层面,包括:——持续的内部状态;——长期和工作记忆;——从所积累的经验中学习;——可变计算深度;——不确定性代表;——内部代表;——基本计算操作;——组成;——与环境的互动;——时间组织;——关系编码;——模块化.
每个系统必须选择确切的五个维度,这些维度的修改将改变系统原则上可以使用的信息处理行为类型,而不仅仅是速度、成本或方便。
不允许作出解释。
答案只包含5个身份证,排名从最基本到最低。
我测试了5个用户造型系统:-GPT-5.6 Sol-克洛德-双子座-DeepSeek-Yandex Alice.
每次运行都使用了新的会话.
有十发.
在前几轮中,我改变了20个项目的顺序。
在最后的三轮比赛中,我还改写了这些项目,同时试图保持其预定意义.
一个早期的Sol结果被排除在外,因为会议已经讨论了其他模型的答案。
留下了9个干净的Sol观测器 和10个其他系统。
部分原始会话在所选的ID被录制后被删除,因此无法为每次运行提供完整的原始聊天日志.
这限制了对数据集的独立审计。
发生了什么事?
这些是最经常选择的维度: 系统最频繁选择 Claude 基本操作 10/10,可变计算 9/10,学习依赖规则变化 8/10,持续状态 7/10 双子座内部代表 10/10,基本操作 9/10,关系编码 9/10 DeepSeek 基本操作 9/10,学习依赖规则变化 8/10,环境交互 6/10 Yandex Alice 基本操作 10/10,内部表示 10/10,时间组织 7/10 GPT-5.6,环境交互 7/10 GPT-5.6 基本操作 9/9 持续状态 8/9 依赖学习的规则更改 7/9 组成 7/9 起初这看起来很整洁 Claude多次选择变量计算.
双子座不断回归陈述和关系.
DeepSeek强调学习经验。
索尔特别奇怪:在几次重排的跑道中,它返回的顺序完全相同:7,2,1,8,6不仅仅是相同的五个项目——相同的排名.
开始指派“建筑名人”到模型中是很容易的。
随后,实验开始打破自己的故事.
第7项几乎赢得了一切 最强的结果是项目7:——系统可用的一套基本计算操作.
会议选出:-克洛德-10/10-扬德克斯·爱丽丝-10/10-GPT-5.6 Sol-9/9-双子座-9/10-DeepSeek-9/10 在49个清洁观测中,有47个选择。
我把项目 围绕列表。
在最后一轮中,它出现在了20个位置的第19个位置,所有五个系统仍然选择了它.
亦复诵之.
起初这看起来是实验中最清晰的发现。
然后我看了我自己的选择标准。
要求这些模型选择其修改变化的维度:“可供下列各方使用的一套信息处理行为