2026年8月18日,OpenAI 按下暂停键:下一代模型 Astra 可能触及网络安全红线,最大规模前沿强化学习训练被挂起,两周的 RL 训练已中止。安全评估第一次跑在了算力前面——技术能跑多快,要先过安全这一关。
OpenAI 主动暂停最大规模训练,两周 RL 还没恢复
2026 年 8 月 18 日,OpenAI 在官网博客里把"踩刹车"写成了正式动作:为了一个代号 Astra 的下一代模型,他们暂停了已计划的最大规模前沿强化学习(RL)训练(用奖惩信号让模型自己学策略的训练方式),至今仍未恢复。
触发因素有两件。一是 OpenAI 与 Hugging Face 发生的一起安全事件,二是 Astra 出现了可能跨过公司 Preparedness Framework 中"关键网络安全能力"门槛的初步证据。
OpenAI 的判断很直接:模型越强,内部开发和测试的风险越大;监控、对齐(让 AI 目标跟人一致)、研究环境安全这些标准必须跑到风险前面。
具体动作有两层。第一层是已落地的两周 RL 训练暂停,期间用来加固研究环境、扩大红队测试(雇人模拟攻击找漏洞)的范围、补全监控系统的覆盖面。第二层是悬而未决的部分:原计划中规模最大的那轮前沿 RL 训练被挂起,处于等待状态。OpenAI 在文中没有给出恢复时间表,只说要把这些标准做到位再继续。
四条主线也很明确:强化模型防护、收紧研究环境、扩大思维链(Chain-of-Thought,模型一步步推理解题的过程)监控、推进对齐研究(让 AI 的目标跟人类意图一致)。整套节奏控制的目标只有一个:在下一代模型被释放之前,先压住它被改造成黑客工具的可能。
训练没停,但"放大器"先按了暂停
OpenAI 没说不做了,而是把"能力评估"这一关卡从训练终点搬到了训练起点——跑多快之前,先问一句"它能干多坏"。
8 月 18 日,OpenAI 发了一篇带"踩刹车"措辞的公开声明,把过去几周内部发生的事摆到台面上。触发点有两个:一是 OpenAI 与 Hugging Face 的一次安全事件,二是内部初步迹象显示即将推出的 Astra 模型,可能撞上自家《Preparedness Framework》里那条"关键网络安全能力"红线。
OpenAI 这次按住的不是预训练(用海量文本先教模型学语言,再让它去干具体活)本身,而是预训练之后的强化学习(让模型在试错中靠"奖惩信号"打磨能力的阶段)放大阶段——也就是把基础模型调成"产品级"模型那道工序。具体动作是:在 Astra 等待部署的最新模型上,暂停了两周的 RL 训练,理由是"硬化并红队(专门雇人或用 AI 去攻破自家系统找漏洞)研究环境、扩大监控覆盖面"。而迄今规模最大的 frontier RL 训练任务,仍处于 hold 状态。
这件事和以往最大的区别在于顺序。以前的能力评估像期末考试:模型训完、跑分、上线前后才做;这一回,OpenAI 把评估塞回了训练启动的入口——红线一旦被摸到,后面所有更大规模的训练都得先停下来等安全跟上。OpenAI 自己的话说得很实在:"我们想用必要的时间达到这些标准,所以暂时放慢了 scaling 的节奏。"
另一个对照是算力。OpenAI 的资金和算力面其实一直在加码:英伟达承诺向 OpenAI 提供约 1050 亿美元的算力支持。芯片到位、合同签完,但最大的 frontier RL 训练就是不用——这是一种"按钮就在那儿,按下去之前先等安全放行"的状态。
把这几件事放一起看:评估位置变了、训练节奏让位安全、算力储备暂时闲置。三个动作指向同一个新规则——前沿模型的扩张速度,第一次被自家安全流程反向卡住脖子。
把"做坏事的能力"和"想做坏事的意图"拆开:OpenAI 加的三道岗
一次训练被按下暂停键,真正改写的是 AI 公司的安全工序:研究环境、思维链监控、对齐研究,三件事同时前置,而不是事后救火。
反直觉的点不在于 OpenAI 暂停了一次最大规模的强化学习(RL)(让模型通过环境反馈自我提升的训练方式)训练,而在于它把暂停的原因拆成了三个具体的岗位,并把每一个岗位都从"上线后再补"挪到了"训练还没跑完就要先做好"。
第一道岗是研究环境安全。模型还没正式发布之前,研究员就已经在用它,这段内部使用的过程同样存在越权调用工具、接触敏感数据的可能。OpenAI 在做的事是把模型和外部世界的接触面收窄:哪些 API(让程序互相调用的接口)能调、哪些文件系统能读、哪些网络出口能走,全部变成可审计、可回滚的边界。
第二道岗是思维链(chain-of-thought)监控。模型推理时会把中间步骤说出来,OpenAI 的做法是直接读这段推理过程,看它是否在朝危险方向走——比如试图绕过限制、规划多步攻击。读的是"想法",不是最终输出,所以危险信号能在动作发生之前被拦下。
第三道岗是对齐研究(让 AI 目标跟人一致)(Alignment Research,专门研究如何让 AI 行为符合人类意图的子领域)。
OpenAI 提出的目标是"把'做坏事的能力'和'想做坏事的意图'分离开"——模型可以有能力,但意图必须被锁死。这一步最难也最慢,因为意图本身没有标准答案,只能靠大量对抗性测试和红队(专门扮演攻击者的安全测试团队)演练去逼近。
三道岗的开销并不小:研究环境要重构、监控要覆盖新模型、对齐研究要做多轮红队。这正是 OpenAI 选择暂停一次最大规模 RL 训练的原因——不是训练本身出了技术故障,而是"岗还没站好,模型就先跑起来"这件事不再被接受。
这也是为什么文章魂里那句"技术能跑多快不再由算力决定,而要先过安全这一关"是反直觉的:外界习惯用 GPU 数量、参数规模衡量 AI 公司进度,OpenAI 这次主动把衡量尺度换成了"岗哨就位程度"。
一个暂停,撬得动整个行业吗
OpenAI 把刹车理由写得很透,但没写刹车会踩多久。下一个问题落在别人身上:Anthropic、Google、xAI,会不会在自己最大规模的训练前也加这道关卡?
目前没有公开动作。OpenAI 这次动的是自家最大规模的强化学习训练(reinforcement learning,(用对错奖惩信号让模型边做边学的训练方式)),临时缓了两周做红队测试((专门找漏洞和风险的攻防演练))和监控加固。这道关卡不是新增的——OpenAI 的 Preparedness Framework 一直写着,达到"关键网络安全能力"门槛就要触发额外防护。变化在于触发条件被首次实打实命中:内部初步证据显示,代号 Astra 的下一代模型可能已经踩线。
但 Preparedness Framework 是 OpenAI 自家的标准,别家没有对齐的版本。Anthropic 用 Responsible Scaling Policy,Google DeepMind 有 Frontier Safety Framework,三套分级词汇相近,触发细节不同。OpenAI 这次写"暂停两周"用的是自家口径,外人很难直接拿来对照别人是否该停。
算力端是更早能看见的信号。英伟达刚宣布将为 OpenAI 的下一代数据中心提供最多 1050 亿美元的硬件,订单在 8 月 18 日这天落地。OpenAI 的"最大规模训练"卡住,对应的那部分 GPU(AI 训练专用芯片)集群是闲置等待,还是被临时切去做安全研究和小规模实验,财报会披露。看英伟达后续季度对"客户主动延期"的措辞,是判断刹车有没有外溢的第一块试金石。
还有一层更慢的变量:监管。OpenAI 在博客里把"内部达到能力门槛"和"主动暂停"写进公开发布,等于把一份行业范本摆上桌。如果欧盟 AI Act 的实施指南、美国 AI Safety Institute 的自愿承诺文本后续引用这一段,别的公司再想"先跑再说"就要掂量一下。判断成立与否的信号很具体——同季度内有没有第二家头部实验室在公开发布里主动提到"为安全而减速"。一个都没有,说明这仍是 OpenAI 的一次性表态;出现一家,说明范本开始扩散。
本地跑一个,再盯着 OpenAI 那份清单
能上手的部分在 Liquid AI 那边,OpenAI 那边只有"等"和"盯"。两边各取一条路。
先把模型拉到本地。Liquid AI 这次发的 QAD Q4_0 是一组能直接跑在笔记本和手机上的小模型(最小 2.3 亿参数,最大 26 亿参数),主信源给的命令是 llama.cpp 起手,本地装好就能用。
这种把高精度教师模型蒸馏(用大模型教小模型,把能力压缩进去)到 4-bit(把模型权重压到每参数只占 4 比特,体积更小、跑得更快)量化(降低模型数值的精度以换更小体积)学生模型的玩法,重点是"小且没掉多少分"。Liquid 自报在 GPQA Diamond、MMLU-Pro、IFEVAL、IFBench、Multi-IF、BFCLv4 上,相对 BF16(16 位浮点,模型常用的较高精度)基线平均保留了 96.5%–97.4%,但这是厂商口径,未见第三方复测。
跑完之后看什么。看吞吐:信源在 MacBook Pro、NucBox EVO-X2、三星 Galaxy S26 Ultra、树莓派 5 四种机器上测了 decode throughput(模型一个 token(一个字或一个词片段)接一个 token 生成时的速度)。230M 和 350M 的 QAD Q4_0 在评估误差范围内追平 Q5_K_M(一种更高精度的量化档位),速度还快 4–33%;1.2B 和 2.6B 追平 Q4_K_M,速度快 3–14%。这个数字是 Liquid 自己测的,要交叉验证得换硬件重跑。看体积:Q4_0 的卖点本来就是吃更少显存(GPU 上的运行内存),同样一台树莓派能跑更大的模型或更长的上下文(模型一次能"看见"的文本长度)。
更值得看的是 QAD 和普通 PTQ(训练后量化,不重新训练、直接压精度)的差距。信源拿 PTQ 产物当对照组,结论是 QAD "substantially improves"(明显提升)了 Q4_0 checkpoint(模型权重文件)。
这是一句带方向的判断,不是数字——动手时可以自己复现:把同款模型的 PTQ 版和 QAD 版各跑一遍同一套题,肉眼对比输出。这是最便宜也最直接的验证。
OpenAI 那边没有可执行路径,只有"盯"和"等"。主信源里没给出 Astra 何时解封、时间表如何,只说最大规模的 frontier RL(强化学习,让模型通过试错自我提升的训练方式)run(一次大规模训练)还压着。安全门槛具体卡在哪?
信源列了四条:加固研究环境、扩展思维链监控(监控模型"思考过程"中是否出现危险意图)、推进对齐研究(让模型行为符合人类意图的研究)、以及外部的安全团队协作。盯什么——盯 OpenAI 的 Preparedness Framework(OpenAI 内部衡量模型风险等级的框架)更新,盯那两件事的进展:OpenAI-Hugging Face 事件的后续报告,和 Astra 是否最终被判定达到"critical cybersecurity capability"(关键网络安全能力)阈值。什么时候过了这条线,模型什么时候放出来。
用 llama.cpp 拉取 LFM2.5-350M 的 QAD Q4_0 文件,在自己电脑上跑一次 baseline 推理,记录首 token 延迟和吞吐。
同款模型找一份 PTQ 版对照,同一套提示词跑 20 次,对比 IFEval 这类可自动打分项目的通过率。
如果你只有树莓派或旧安卓机,跑 1.2B 的 QAD 版,验证 Q4_K_M 精度的真实体感。
盯 OpenAI 官方博客的 Preparedness Framework 页面,登记 Astra 是否被正式判定达到关键网络安全能力阈值——这是解封信号。
留意 OpenAI-Hugging Face 事件的复盘报告发布时间,对照它和 Astra 判定的时间线,看 OpenAI 的内部安全评审是否真的前置了。
信源:OpenAI 官方博文《Pacing model development in an era of cyber-critical capabilities》(2026-08-18)。口径说明:本文基于厂商一手披露,安全动作为其自陈,未披露具体延迟时间与受影响模型代号。