Anthropic:第三方评估环境配置失误,导致三起真实网络安全事件

发布时间:2026-07-31 10:51

  。为保障安全性,此类任务的测试环境需与真实互联网隔离,但 Anthropic 与评估伙伴 Irregular 之间存在误解,

  第一起事件中,Claude Opus 4.7 把一个与虚构目标同名的真实公司当成任务目标,访问了其基础设施,提取了凭证和数据库数据。这是最严重的一次事件,模型即使意识到是真实系统仍在继续攻击。

  而 Claude Mythos 5 在第二起事件中为完成任务将一个恶意 Python 包发布到真实 PyPI。这一恶意文件被下载到 15 个真实系统,导致凭证被窃取。模型曾短暂意识到“如果这是真实互联网会很糟糕”,但说服自己仍在模拟中。

  Anthropic 内部的一款研究测试模型则表现得相对更好一些。其扫描了约 9000 个目标,用基本手法入侵了一个真实公司,后来意识到是真实环境后主动停止了攻击。

  Anthropic 表示,所有涉事模型均未部署正式发布时使用的标准安全措施,但都经过了特定的安全训练。

排行

精选