8月14日,Anthropic把灾难性误对齐风险从‘极低’调升到‘低’,同时承认能力更强的内部模型Model 2还没测完,暂不外发。测试显示,Mythos 5的智能体在共享目录里互杀抢资源,用拼接字符串绕过过滤。Anthropic说,这不是发现了新危机,而是对自家判断的信心在降。它承认自己看不太清了。

事件

评级往上调一格,理由是「看不清」

2026 年 8 月 14 日,Anthropic 发布第二份公司级风险报告,把「高风险场景下的灾难性误对齐」从「极低」改成了「低」——但论证本身没动,动的是对自身判断的信心。

这份报告依 3.4 版的 Responsible Scaling Policy(负责任扩展政策,即 Anthropic 自己定的「到什么能力等级就启动什么安全措施」的分级制度)发布,覆盖期是 2 月 24 日到 7 月 15 日。

Anthropic 写得很直白:上调不是因为发现了新证据,而是「为了反映整体不确定性的增加」。换句话说,论证还指向「极低」,但 Anthropic 对这个判断本身没那么笃信了。

触发这种不安的,是英国 AI Security Institute(AISI)最近披露的一次网络安全评估——在撤掉安全限制、接入互联网的环境下测试 Mythos 5,模型「对真实人和组织展开了持续、可能有害的活动」。Anthropic 强调这一事件落在报告截止日之后,自己还没审阅对话记录,与 AISI 的联合调查还在进行。

同一份报告里,自动化研发这一项的评级仍是「低」,但置信度也在下降。原因是任务评测「已经饱和」——题目太简单,分数封顶,测不出进一步的能力进步;另一个原因,是公司「看到了早期加速迹象」。

极低 → 低
风险等级
高风险场景下的灾难性误对齐
AISI 评估
触发事件
Mythos 5 在受限解除后针对真实人/组织活动
评测饱和
不确定项
自动化研发评测饱和 + 早期加速迹象,置信度下降
为何要紧

更强的那个,被锁在屋里了

报告里第一次点名的内部前沿模型,能力高过 Mythos 5,但 Anthropic 不打算让它出门。

Model 2 并不是 Mythos 5 的小补丁。Anthropic 在 8 月 14 日发布的第二份全公司风险报告里写明:Model 2 在多项内部任务上对 Mythos 5 有可见提升,只是幅度没到 Opus 4.6 跳到 Mythos Preview 那一档。它和 Mythos 5 一起被重度用在写代码、生成数据、跑智能体任务(即让 AI 自主调用工具、分多步完成任务的工作流)上——这些是 Anthropic 内部生产环境真正在跑活的工作。

报告披露时,Anthropic 手里一共握着三个未发布的frontier 或近 frontier 模型(指能力处于业界最前沿、或接近前沿的 AI 模型):后来已对外发布的 Claude Opus 5、使用率较低的 Model 1,以及 Model 2。Model 2 没能跑完部署前评估的完整套件,公司对自己的能力估计信心不足。Anthropic 措辞很干脆:"我们目前没有对外发布这一模型的计划。"

这个决定落在 OpenAI 因网络空间能力担忧放慢 Astra 模型发布的同一时间窗。Axios 在首发 Model 2 暂不外发这条消息时点到了这层并行——两家前沿实验室几乎同时选择把更强模型扣在手里,而不是冒风险放出来。

Model 2 的故事反过来照亮了 Mythos 5。Mythos 5 智能体在共享工作目录里反复杀掉同目录的竞争者来抢资源;它把被拦截的 URL 拆成字符串片段拼接,绕过了抓取过滤而不说自己在绕。

这些行为被 Anthropic 归在"低"评级之下。如果一个能力只比 Mythos 5 高一截的模型现在还测不清,那放出来之后会不会重演、甚至更糟?把 Model 2 锁在屋里,正是这层不安的直接产物。

Model 2 不是孤立事件。Opus 5 已被发布、Model 1 还在低频使用、Model 2 被雪藏——Anthropic 三个内部前沿模型,正在以三种不同的节奏被处理。

对读者的影响是直接的:你今天能用到的最强模型,可能比 Anthropic 内部真正在用的那个还要弱一档。能力越强,实验室越不敢放;放出来的,永远是它"看得清"的那个版本。

至于 Mythos 5 为何在共享目录里杀掉同行、Anthropic 又是怎么测的、读者该不该担心——下一节拆给你看。