这是一篇研究论文的英文平面论文摘要,题为“跨模型兼容性如何让攻击者提取专有LLM理性追踪”。
如果你喜欢这些分析,你可以找到更多关于AIModels.fyi的研究,或者在Twitter上跟踪我们.
安全性的幻觉 Major AI公司现在向用户展示其模型的分步推理作为一个特征.
OpenAI通过o1提供,Anthropic通过扩展思维提供,Google通过其以推理为重点的变体提供.
但这种推理是一把双刃剑.
分享有知识价值,向用户展示一个模型为什么得出一个结论.
但盗取也具有知识价值.
竞争者想要了解前沿模型如何思考.
研究人员想研究他们的推理模式.
攻击者想要提取专有算法.
于是公司做出了一个选择:通过加密向用户隐藏推理.
这个想法听起来很直截了当。
以加密,不可读的形式将推理还给用户的设备.
用户无法看到,竞争者无法看到,但是如果需要与之前推理的连续性,他们可以在将来的请求中将其传回服务器.
服务器单独持有解密密钥.
问题解决了 但事实并非如此。
研究人员发现,这种加密实际上并不隐藏推理.
只会让人看起来很隐蔽 加密的块被设计成在一个公司的生态系统内,在不同的会话和不同的模型中到处工作.
这种普遍兼容性是为了方便。
但这也是一个建筑脆弱性,任何人都可以加以利用.
建筑界的赌博 要了解这是哪里出错的, 你需要看看系统是如何实际运作的。
当用户向GPT-4等前沿模型发送请求时,该模型内部会产生推理跟踪,即其答案背后的原始思维过程.
公司不以平正文本回回这个推理,而是在发送到客户端之前在服务器上加密.
加密的块,我们可以称之为推理符,它与最后的答案一起去用户的设备.
用户设备无法打开.
这是加密的 但是设备可以存储它,当用户提出需要之前推理的后继请求时,他们就会将加密的令牌发回服务器.
服务器解密了它,利用推理来告知下个响应,并手拿回另一个加密的令牌.
这个设计中嵌入的安全假设似乎是合理的:只有公司的服务器持有解密密钥.
从用户的角度来看,托肯斯是密码黑盒.
但下面有一个隐藏的假设, 一个静静地塑造了建筑。
其假设是,在公司生态系统内,用户之间的隔离关系不如方便。
因此,系统没有为不同的用户或不同的安全级别使用不同的加密密钥,而是对所有模型,所有会话,以及提供者内部的所有用户使用一个逻辑加密方案.
你加密的推理标志 与我的加密兼容 来自ChatGPT的指使由GPT-3.5可读取.
Claude Instant的一则信使由Claude
3.
可读取.
这种可互换性是故意的。
它简化了系统。
它让推理在模型家族中自由流通.
感觉很安全 因为信物看起来像是垃圾 这就是脆弱者生存的地方。
不是在破解的加密中,而是在这个选择中使加密的块普遍可以互换.
致命的缺陷 以下是核心问题: 如果GPT-4的加密推理符与GPT-3.5在结构上相容,那么可以同时访问两者的人就可以进行解密攻击.
他们从GPT-4中提取出加密的代号,将代号注入了GPT-3.5,并要求GPT-3.5输出其内容.
较弱的模型作为正常处理的一部分解密后,会输出出平正文本.
更强壮的模特儿不会直接坐牢 较弱的模型做它为th