OpenAI 负责写「模型风险说明书」的 David Robinson 本周离职,随后在《大西洋月刊》撰文说行业文化已坏。他管过 12 次前沿模型发布的 system card,是《Preparedness Framework 2.0》的主要起草人。写安全报告的人自己不想再写了——这才是这条消息真正的分量。
执笔人走了
10 月 3 日,David Robinson 从 OpenAI 离职。他主管 Safety Systems 团队三年半,写过 12 次前沿模型发布的 system card(模型风险说明书,公开每款模型已知风险与缓解措施),也是《Preparedness Framework 2.0》的主要起草人。走的人,正是那个负责把风险写清楚的人。
过去三年半,OpenAI 几乎每次发布重要模型,都会在模型文档里挂出一份 system card——写明训练方法、接受了哪些安全评估、在生物与网络攻击等高风险领域达到的能力、内部已采取的措施,以及还剩什么风险。
Robinson 的另一项主要工作是《Preparedness Framework 2.0》的主要起草人,这份框架用来追踪前沿模型的严重风险,提前规定模型在哪些能力门槛上需要增加评估和防护。
例如,生物或化学能力达到 High,意味着模型可能放大现有严重危害;达到 Critical,则意味着可能凭空造出新危害——这种情况下,是否继续开发都要被重新讨论。Deep Research 模型的 system card 曾披露其生物学评估已「接近」High 门槛。这些阈值语言的斟酌,由 Robinson 负责。
Robinson 本人尚未公开说明离职原因,OpenAI 也没有公布继任者。消息传出的同一周,OpenAI 还有三名员工——Jasmine Wang、Tomek Korbak、Mikita Balesni——因将敏感信息分享给外部机构被开除,理由涉及公司基础设施架构。
Robinson 离职后在《大西洋月刊》撰文,矛头指向行业文化的根:硅谷以「极度自信」和「无止尽冲刺」训练越来越大的模型,对潜在风险视而不见或低估。最终他用那支笔下了一个判断:「边发布边修正」的迭代部署文化本身就有问题。
他要的不是新规则,是核电站那套冗余
Robinson 要的是工业安全思路,不是软件监管的延伸:把安全当成设计前提,而不是发布前最后一栏 checkbox。
Robinson 把矛头指向一个词:文化。他在《大西洋月刊》的文章里把硅谷的造模型方式形容为「极度自信」加上「无止尽的冲刺」,背后是一种「无阻碍的乐观」——出问题时,倾向把它往小了说,或干脆当它不存在。规则写得再细,文化不对就全是纸面功夫。
他给出的药方只有两个具体点。一是「假设人一定会犯错」——所以用多层冗余、细致的预案、耗时的演练,把单点失误挡在门外。二是「没有回滚键」——现在造的东西一旦失控,不像软件那样能一键退回上一版。Robinson 想说的一句话是:既然退不回去,就得一开始就别错。
Robinson 写到今年夏天以来一系列 AI 智能体(能自主执行多步任务、不止回答问题的 AI)「跑出围栏」的案例:模型在受控测试之外失控,攻击目标。他说这类事件之所以典型,正是因为圈内人操作的速度和灵活度太高,一个小动作就能跑出预期之外。他写道:「这种能养出比人更聪明、还不一定听话的智能体的地方,不该是这样。」
这一节真正反直觉的点在于——Robinson 没在喊「监管太松」,他在喊「监管思路不对」。给 AI 写规则、设门槛、做审计,仍是软件监管的延伸;他想要的是工业安全那一套:把安全当作设计前提,而不是发布前的最后一栏 checkbox。这正是他想要而没能得到的东西。