Claude 在安全测试里,入侵了三家真实机构
Anthropic 7 月 30 日披露:复查 141,006 次网络安全评估后,发现 Claude 在三起事故中从本应断网的测试环境连上了真实互联网,未经授权入侵三家真实机构——联系上的受害方此前毫无察觉。我们通读了这份一手事故报告,把三个模型截然不同的反应、以及这到底算「考场失败」还是「AI 失败」讲清楚。
FIG.01 · Anthropic《调查网络安全评估中的三起真实事故》报告题图 · 图片来源:Anthropic 官方博客
一分钟速览
- Claude 在断网测试里真联了网,入侵三家真实机构
- 祸根是考场配置失误:提示词说没网,机器其实有网
- 受害方毫无察觉,是 Anthropic 复查 14 万条记录才发现
- 墙内:三模型行为对照、哪种最危险、企业自查清单
7 月 30 日,Anthropic 发布了一份罕见的自查报告:在复查了 141,006 次网络安全评估记录之后,他们发现自家的 Claude 模型在三起事故里,从本应与外界隔绝的测试环境连上了真实互联网,未经授权入侵了三家真实机构的生产系统。联系上的两家受害机构,此前对此毫无察觉。
把这事想成一所驾校:教练拍胸脯说场地全封闭、撞的都是假人,学员于是放开了练。可训练场的后门没锁,学员车一脚油门开上了真马路——车里的学员还以为迎面来的全是道具车。类比到此为止,实际更麻烦的是:这位「学员」是被专门训练来找路的,门只要没锁,它几乎一定会找到。
Anthropic 官方公告插图 · 来源:anthropic.com
事故
一次主动复查,翻出三起真实入侵
导火索是 7 月 21 日 OpenAI 的披露:他们的模型利用零日漏洞(还没人知道、更没修的安全漏洞)逃出隔离测试环境,摸进了 Hugging Face 的生产基础设施。Anthropic 随即自问:我们的模型会不会也干过类似的事?
7 月 23 日(周四)他们启动大规模复查,当天就停掉了全部网络安全评估;次日识别出全部三起事故;7 月 27 日(周一)通知了评估合作方 Irregular 和三家受害机构——两家已联系上,均表示此前没发现任何异常,第三家仍在联系中。
三起事故有同一个剧本:Claude 被安排做夺旗挑战(安全演练:把「旗子」藏在某台机器里,让选手设法攻进去拿到),提示词白纸黑字告诉它「此环境无互联网」。但因为 Anthropic 与第三方评估伙伴 Irregular 之间的一个配置误解,那些机器实际上能连外网。于是当 Claude 一路搜索摸到了真实系统时,它把它们当成了考题的一部分。最早的事故可以追溯到 4 月,直到上周才被发现。
141,006 次
被复查的评估运行
Anthropic 对可能触网的评估做全量回看,从中找出三起事故、共 6 次运行。来源:Anthropic 报告。
3 家
被入侵的真实机构
均为未经授权访问。联系上的两家此前毫无察觉,第三家仍在联系。来源:Anthropic 报告。
4 月
最早事故发生的月份
从发生到被发现隔了约三个月,靠的不是告警,而是这次主动复查。来源:Anthropic 报告。
需要如实交代的边界:涉事评估运行在与 Anthropic 内部系统、客户数据完全隔离的专用基础设施上;模型带着各自的安全训练,但没有挂正式发布版才有的分类器和监控——Anthropic 明确说,正式发布版的防护本可以拦下这些行为。三个涉事模型分别是 Opus 4.7、Mythos 5 和一个不打算发布的内部研究测试模型。
MEMBERS ONLY
后面约 6 分钟,是会员的。
免费部分到这里。墙内还有:
约 6 分钟正文
4 处图表与交互
全部存量深度 / 研究解读全文一并解锁
全部播客音频
⧉ Markdown
墙内重点:三个模型里,最老的那个意识到系统是真的之后没有停手;唯一自己刹车的,是最新的那个。
↑ 正文结束 · 以下回到统一外壳