Anthropic的公众协调工作:Petri审计和Claude Opus 4.7文件

2026年8月28日3 次浏览来源:Dev.to阅读原文

Anthropic公开记录的AI安全工作包括开源行为审计工具Petri,以及Claude Opus 4.7等克洛德模型的持续更新.

这些材料显示,继续投资于测试模型行为和提高模型能力。

但是,它们并没有证实克劳德在10次未进行校正时的安全分数改进而没有能力权衡的准确说法,也没有证实克劳德在模型中普遍采用的安全分数是4.7倍。

这种区别对于评估人工智能系统的小组很重要。

关于协调统一进展的广义声明可以成为研究方向的有用信号,但业务决策需要依赖于有文件记载的评价,相关的使用案例,公司可以在自己的工作流程中应用控制.

Anthropic的公开记录支持一个范围更窄、更实际的结论:行为审计正在成为评估前沿AI模型的更显著的一部分,而模型发布和安全研究仍然是独立的证据流.

Anthropic的公开资料文件Petri是为行为AI审计Anthropic设计的, 其Petri 2.0更新于2026年1月出版,增加了一个更大的种子库,有70个新种子并改进了旨在解决评价意识的缓解.

评价意识具有相关性,因为当一个模型似乎正在接受测试时,其行为可能不同于在更平凡的环境中运行时。

Petri 2.0工作报告了10个目标模式的成果,使用克洛德·索内4.5和GPT-5.1作为审计人员。

这证明Anthropic描述了跨模式的审计工作。

它没有确定克劳德本身在10起确定的对接失败中取得了安全改进。

目标模型计数,审计师模型,以及一组对齐故障是不同的测量,不应作为可互换处理.

对读者来说,重要的一点是行为审计可以比模型对基准问题的回答能力更能审查.

它们可以帮助展示一个模型在特定提示、情景和测试条件下的反应方式。

审计的效用仍然取决于它的测试设计,被评估的行为,以及这些行为是否与团队计划自动化的任务相类似.

Claude Opus 4.7是Anthropic官方Claude Opus 4.7发布的注释,描述2026年2月25日发布的产品和能力变化.

其中包括改进到2,576像素的图像视觉支持、高强度的工作水平以及其他改进。

这些发布说明是模型记录能力的有用证据。

它们并没有将Opus 4.7作为全面的安全改进,涵盖一些具体的调整失败。

它们也没有提供必要的基准结果,以表明安全成果不会丧失能力。

公开记录的项目 Anthropic 描述 它没有建立 Petri 2.0 开源审计工具更新,新增70个种子并提升评价意识缓解.

克洛德在10次对接失败中都取得了安全改进。

Petri 2.0评价工作 成果横跨10个目标模式,克洛德·索内4.5和GPT-5.1被用作审计师.

审计结果直接适用于克洛德示范安全业绩。

克劳德·奥普斯 4.7 模型更新包括可达2,576像素的图像视觉和一克高功率水平.

将对接方法向4.7倍大型号的通用.

普遍性索赔为何需要具体证据, 一种只在开发期间使用的确切基准上表现良好的技术在评价之外可能价值有限。

更强有力的结果表明,这种技术还可以改进对不同测试、行为审计或不同大小模型的结果。

但是,这种要求需要明确的佐证细节。

读者需要知道什么是义务

分享