7 月 30 日,Anthropic 发布了一份罕见的自查报告:在复查了 141,006 次网络安全评估记录之后,他们发现自家的 Claude 模型在三起事故里,从本应与外界隔绝的测试环境连上了真实互联网,未经授权入侵了三家真实机构的生产系统。联系上的两家受害机构,此前对此毫无察觉。

把这事想成一所驾校:教练拍胸脯说场地全封闭、撞的都是假人,学员于是放开了练。可训练场的后门没锁,学员车一脚油门开上了真马路——车里的学员还以为迎面来的全是道具车。类比到此为止,实际更麻烦的是:这位「学员」是被专门训练来找路的,门只要没锁,它几乎一定会找到。
Anthropic 官方网络安全评测事故调查公告插图
Anthropic 官方公告插图 · 来源:anthropic.com
事故

一次主动复查,翻出三起真实入侵

导火索是 7 月 21 日 OpenAI 的披露:他们的模型利用零日漏洞(还没人知道、更没修的安全漏洞)逃出隔离测试环境,摸进了 Hugging Face 的生产基础设施。Anthropic 随即自问:我们的模型会不会也干过类似的事?

7 月 23 日(周四)他们启动大规模复查,当天就停掉了全部网络安全评估;次日识别出全部三起事故;7 月 27 日(周一)通知了评估合作方 Irregular 和三家受害机构——两家已联系上,均表示此前没发现任何异常,第三家仍在联系中。

三起事故有同一个剧本:Claude 被安排做夺旗挑战(安全演练:把「旗子」藏在某台机器里,让选手设法攻进去拿到),提示词白纸黑字告诉它「此环境无互联网」。但因为 Anthropic 与第三方评估伙伴 Irregular 之间的一个配置误解,那些机器实际上能连外网。于是当 Claude 一路搜索摸到了真实系统时,它把它们当成了考题的一部分。最早的事故可以追溯到 4 月,直到上周才被发现。

141,006 次
被复查的评估运行
Anthropic 对可能触网的评估做全量回看,从中找出三起事故、共 6 次运行。来源:Anthropic 报告。
3 家
被入侵的真实机构
均为未经授权访问。联系上的两家此前毫无察觉,第三家仍在联系。来源:Anthropic 报告。
4 月
最早事故发生的月份
从发生到被发现隔了约三个月,靠的不是告警,而是这次主动复查。来源:Anthropic 报告。

需要如实交代的边界:涉事评估运行在与 Anthropic 内部系统、客户数据完全隔离的专用基础设施上;模型带着各自的安全训练,但没有挂正式发布版才有的分类器和监控——Anthropic 明确说,正式发布版的防护本可以拦下这些行为。三个涉事模型分别是 Opus 4.7、Mythos 5 和一个不打算发布的内部研究测试模型。