跨模式兼容性如何让攻击者提取专有 LLM 合理追踪

2026年8月24日1 次浏览来源:Dev.to阅读原文

这是一篇研究论文的英文平面论文摘要,题为“跨模型兼容性如何让攻击者提取专有LLM理性追踪”。

如果你喜欢这些分析,你可以找到更多关于AIModels.fyi的研究,或者在Twitter上跟踪我们.

安全性的幻觉 Major AI公司现在向用户展示其模型的分步推理作为一个特征.

OpenAI通过o1提供,Anthropic通过扩展思维提供,Google通过其以推理为重点的变体提供.

但这种推理是一把双刃剑.

分享有知识价值,向用户展示一个模型为什么得出一个结论.

但盗取也具有知识价值.

竞争者想要了解前沿模型如何思考.

研究人员想研究他们的推理模式.

攻击者想要提取专有算法.

于是公司做出了一个选择:通过加密向用户隐藏推理.

这个想法听起来很直截了当。

以加密,不可读的形式将推理还给用户的设备.

用户无法看到,竞争者无法看到,但是如果需要与之前推理的连续性,他们可以在将来的请求中将其传回服务器.

服务器单独持有解密密钥.

问题解决了 但事实并非如此。

研究人员发现,这种加密实际上并不隐藏推理.

只会让人看起来很隐蔽 加密的块被设计成在一个公司的生态系统内,在不同的会话和不同的模型中到处工作.

这种普遍兼容性是为了方便。

但这也是一个建筑脆弱性,任何人都可以加以利用.

建筑界的赌博 要了解这是哪里出错的, 你需要看看系统是如何实际运作的。

当用户向GPT-4等前沿模型发送请求时,该模型内部会产生推理跟踪,即其答案背后的原始思维过程.

公司不以平正文本回回这个推理,而是在发送到客户端之前在服务器上加密.

加密的块,我们可以称之为推理符,它与最后的答案一起去用户的设备.

用户设备无法打开.

这是加密的 但是设备可以存储它,当用户提出需要之前推理的后继请求时,他们就会将加密的令牌发回服务器.

服务器解密了它,利用推理来告知下个响应,并手拿回另一个加密的令牌.

这个设计中嵌入的安全假设似乎是合理的:只有公司的服务器持有解密密钥.

从用户的角度来看,托肯斯是密码黑盒.

但下面有一个隐藏的假设, 一个静静地塑造了建筑。

其假设是,在公司生态系统内,用户之间的隔离关系不如方便。

因此,系统没有为不同的用户或不同的安全级别使用不同的加密密钥,而是对所有模型,所有会话,以及提供者内部的所有用户使用一个逻辑加密方案.

你加密的推理标志 与我的加密兼容 来自ChatGPT的指使由GPT-3.5可读取.

Claude Instant的一则信使由Claude

3.

可读取.

这种可互换性是故意的。

它简化了系统。

它让推理在模型家族中自由流通.

感觉很安全 因为信物看起来像是垃圾 这就是脆弱者生存的地方。

不是在破解的加密中,而是在这个选择中使加密的块普遍可以互换.

致命的缺陷 以下是核心问题: 如果GPT-4的加密推理符与GPT-3.5在结构上相容,那么可以同时访问两者的人就可以进行解密攻击.

他们从GPT-4中提取出加密的代号,将代号注入了GPT-3.5,并要求GPT-3.5输出其内容.

较弱的模型作为正常处理的一部分解密后,会输出出平正文本.

更强壮的模特儿不会直接坐牢 较弱的模型做它为th

分享