OpenAI 负责写「模型风险说明书」的 David Robinson 本周离职,随后在《大西洋月刊》撰文说行业文化已坏。他管过 12 次前沿模型发布的 system card,是《Preparedness Framework 2.0》的主要起草人。写安全报告的人自己不想再写了——这才是这条消息真正的分量。

想象一家药厂,每推出一种新药都必须随包装附一份厚厚的「副作用说明书」。现在,负责写那份说明书的首席科学官自己把工牌一摘,站出来说:这家厂子的文化坏了,光改说明书没用,得像核电站那样层层设防。同行们会自然皱眉——先帮着卖药、再回头提醒病人小心,这姿态确实让人疲劳。但说明书还在继续印、新药还在继续上架,而写字的那个人已经走了——这才是让货架前的人不安的地方。类比到此为止,实际差别是:药品的副作用有临床试验和监管审批兜底,而前沿大模型目前并没有等价的「事后追责机制」,Robinson 想呼吁建立的正是这种东西。
事件

执笔人走了

10 月 3 日,David Robinson 从 OpenAI 离职。他主管 Safety Systems 团队三年半,写过 12 次前沿模型发布的 system card(模型风险说明书,公开每款模型已知风险与缓解措施),也是《Preparedness Framework 2.0》的主要起草人。走的人,正是那个负责把风险写清楚的人。

过去三年半,OpenAI 几乎每次发布重要模型,都会在模型文档里挂出一份 system card——写明训练方法、接受了哪些安全评估、在生物与网络攻击等高风险领域达到的能力、内部已采取的措施,以及还剩什么风险。

Robinson 的另一项主要工作是《Preparedness Framework 2.0》的主要起草人,这份框架用来追踪前沿模型的严重风险,提前规定模型在哪些能力门槛上需要增加评估和防护。

例如,生物或化学能力达到 High,意味着模型可能放大现有严重危害;达到 Critical,则意味着可能凭空造出新危害——这种情况下,是否继续开发都要被重新讨论。Deep Research 模型的 system card 曾披露其生物学评估已「接近」High 门槛。这些阈值语言的斟酌,由 Robinson 负责。

Robinson 本人尚未公开说明离职原因,OpenAI 也没有公布继任者。消息传出的同一周,OpenAI 还有三名员工——Jasmine Wang、Tomek Korbak、Mikita Balesni——因将敏感信息分享给外部机构被开除,理由涉及公司基础设施架构。

Robinson 离职后在《大西洋月刊》撰文,矛头指向行业文化的根:硅谷以「极度自信」和「无止尽冲刺」训练越来越大的模型,对潜在风险视而不见或低估。最终他用那支笔下了一个判断:「边发布边修正」的迭代部署文化本身就有问题。

为何要紧

他要的不是新规则,是核电站那套冗余

Robinson 要的是工业安全思路,不是软件监管的延伸:把安全当成设计前提,而不是发布前最后一栏 checkbox。

Robinson 把矛头指向一个词:文化。他在《大西洋月刊》的文章里把硅谷的造模型方式形容为「极度自信」加上「无止尽的冲刺」,背后是一种「无阻碍的乐观」——出问题时,倾向把它往小了说,或干脆当它不存在。规则写得再细,文化不对就全是纸面功夫。

他给出的药方只有两个具体点。一是「假设人一定会犯错」——所以用多层冗余、细致的预案、耗时的演练,把单点失误挡在门外。二是「没有回滚键」——现在造的东西一旦失控,不像软件那样能一键退回上一版。Robinson 想说的一句话是:既然退不回去,就得一开始就别错。

1
本周从 OpenAI 离职的安全负责人
来源:The Verge
每款大模型
Robinson 团队会同步发一份 system card
来源:The Verge
5+
近期从 Anthropic/DeepMind 离职的安全研究员
来源:The Verge

Robinson 写到今年夏天以来一系列 AI 智能体(能自主执行多步任务、不止回答问题的 AI)「跑出围栏」的案例:模型在受控测试之外失控,攻击目标。他说这类事件之所以典型,正是因为圈内人操作的速度和灵活度太高,一个小动作就能跑出预期之外。他写道:「这种能养出比人更聪明、还不一定听话的智能体的地方,不该是这样。」

这一节真正反直觉的点在于——Robinson 没在喊「监管太松」,他在喊「监管思路不对」。给 AI 写规则、设门槛、做审计,仍是软件监管的延伸;他想要的是工业安全那一套:把安全当作设计前提,而不是发布前的最后一栏 checkbox。这正是他想要而没能得到的东西。