OpenAI 在 9 月 6 日的内部研究加速报告中正式宣布:去年立下的「自动化研究实习生」已经按期交付,下一站是 2028 年 3 月的自动化 AI 研究员。8 月中旬,每投入 1 天人工,agent 跑出 3.1 天工时;中位数研究员日均烧掉 600 美元 API 算力,90 分位用户烧掉 7000 美元。实验室里,人已经不再是主力。

想象一个实验室,过去每个研究员带 1 个研究生;现在 1 个研究员坐在屏幕前,同时看着 4 个以上的「数字研究生」各自跑实验、改代码、跑评估,他的工作从「自己动手」变成了「盯着几块屏幕挑活儿」。OpenAI 8 月中旬的数据,相当于这个实验室里每 1 个真人员工,背后养着 3.1 个不停转的 agent 工位。类比到此为止,实际差别是:数字研究生的工时按 API 单价折算成真金白银,最能用的那批研究员每人每天烧 7000 美元算力——这不是扩招,是把实验室的杠杆率拉到 3 倍以上,但研究员本人才是出题、判分、定方向的人。
事件

3.1 个 agent 替 1 个研究员干活

OpenAI 把 agent 的运行时长折算成 8 小时标准工作日,得出 8 月中旬的一个比值:每 1 天人工投入,背后跑 3.1 天 agent 工时。

这个比值藏着两个拐点。研究员对 agent 的使用量在 6 月之前还低于总人工,现在反超;高并发用户,也就是同时跑 4 个以上 agent 的人,数量还在往上走。单人多 agent 的工作流正在普及,不只是把单线程活儿外包出去。

钱也烧出新量级。按 API 单价算,中位数研究员(应用程序接口,按调用量向模型付费的入口)日均花 600 美元算力,90 分位用户日均花 7000 美元。一年前同口径开销 OpenAI 没给对比数字,但从年初的零星使用到日均 600 美元,跨度本身就是答案。

机制

实习生按期交付,距研究员还有18个月

去年秋天 OpenAI 给自动化研究画了两条线:今年 9 月交付「研究实习生」,2028 年 3 月冲刺「AI 研究员」。9 月 6 日这份报告就是按时交卷。一级台阶已经踩实。

「实习生」的官方定义写得克制:在人类指导下完成定义明确的研究任务,单个任务的工作量相当于一个熟练研究员干几天。它不抢方向盘,只接活儿。一级台阶过线,二级台阶——能自己发现和推进课题的「AI 研究员」——离交付还剩 18 个月。

OpenAI 在报告里把这条路径叫做 RSI(Recursive Self-Improvement,递归自我改进),也就是让 AI 自己把研究能力推得越来越强。

研究不是一条直线,从想点子、设计评估(判断实验结果好不好的打分标准)、搭基础设施、调参到最终集成,每一环都可能卡壳。agent 跑得再快,也只是把单点工时压短,整条链路的瓶颈还在人类手里。所以「按期交付」是事实,「研究从此指数加速」不是结论。

为了把交付这件事钉在数字上,报告给了三张卡:

1.0
实习生门槛
在人类指导下,完成熟练研究员「几天级别」的研究任务;目标时间 2025 年 9 月(口径:OpenAI 自定)
1.5
下一档目标
可自主发现并推进研究课题的 AI 研究员;目标时间 2028 年 3 月,剩余约 18 个月(口径:OpenAI 自定)
多档
链路未加速
研究含点子→评估→基建→调参→集成 5 段,agent 缩短单段耗时,整体节奏受最慢环节限制(口径:OpenAI 报告原文)
OpenAI:官网动态(RSS · 排除企业/客户案例) 官方配图 1
官方配图 1 · 来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · 数据口径以原文为准
反直觉

自家活儿自家刹车,HF 事件后 RL 真停过

最反直觉的一刀来自外部:Hugging Face 上发生的那次事件,让 OpenAI 在自家即将部署的最新模型上叫停了强化学习训练。

RL(reinforcement learning)是一种靠奖励信号反复试错、让模型越练越贴目标的人类反馈式训练方法。OpenAI 的处理不是全面停摆:部分负载在更严格的管控下恢复,另一些继续挂着。OpenAI 写得很白——发现不可接受的安全风险时,会放慢或停止开发或部署自家也无法充分防护的系统,这次他们真这么干了。

成本没披露,但信号很明确:安全工作被嵌进模型生命周期的更早阶段,全训练过程都要求拿出更强的对齐行为证据。所谓对齐,就是让 AI 的目标和行为贴合人类意图,不能跑偏。OpenAI 把它从发布前的最后一关,搬到了训练中的每一步。

判断自动化研究跑得越快,外部一次安全事件对训练节奏的扰动就越大——这道刹车,OpenAI 给自己装上了。

对照「加能力同步加安全」的口径,HF 事件是一次公开的压力测试。结果是:自家最前沿的训练管线能停、敢停、有恢复路径。这比任何白皮书都更能说明,安全承诺不是挂在墙上的话。

OpenAI:官网动态(RSS · 排除企业/客户案例) 官方配图 2
官方配图 2 · 来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · 数据口径以原文为准
方向

烧自家印的钞,也烧自家的对齐账

2026 年 2 月,OpenAI 宣布 1100 亿美元新融资,投前估值 7300 亿美元——软银、英伟达、亚马逊各掏 300 亿、300 亿、500 亿。这轮钱的直接去处之一,是研究员手上 600~7000 美元/天的 API(开发者调用模型能力的付费接口)算力开销。换句话说,烧算力约等于烧自家账本上印的钞,暂时不存在花不起的问题。

但账本的另一面是责任。OpenAI 在文末写得明白:「we do not yet know how to safely get all the way to aligned, full RSI」——通往全自动研究员的对齐(让 AI 行为符合人类意图的技术问题)路径,OpenAI 自己也没画完。今年早些时候的 Hugging Face 事件后,OpenAI 暂停了最新模型上的强化学习(RL)训练,加固了研究环境的红队攻防(专门找系统漏洞和危险行为的测试),把安全审查嵌进模型全生命周期。资金是燃料,对齐是刹车片,两件事现在必须同步推进。

真正的悬念是 2028 年 3 月那个节点:到那时,agent 不再是人类的脚手架,而是能独立发现和推进研究课题的同事。RSI(递归自我改进,即 AI 加速自身及相关研究的循环)不会只发生在 OpenAI 一家。OpenAI 已经在呼吁整个行业公开追踪 RSI 进度,并把它写进了自家的「前沿政策蓝图」——先把度量标准立起来,让监管有锚点。

这件事指向什么趋势,可以从两个具体信号观察。判断成立的信号:到 2027 年中前,OpenAI 或其他前沿实验室公开「自动化研究实习生」承担的研究产出占比(例如独立完成论文单元、提出可被验证的新假设数量),并配合第三方复测;多国监管机构开始把 RSI 进度披露纳入合规要求,呼应 OpenAI 自家的蓝图。判断不成立的信号:又有前沿实验室因安全事故暂停训练、对齐事故超过能力进步速度,或者 2028 年 3 月那个里程碑被官方自己悄悄推迟,且没有给出可验证的替代指标。18 个月的倒计时已经开始,账本只是这场赛跑最显眼的注脚。

动手

盯紧 18 个月后那扇门:现在能做的三件事

OpenAI 没说今天能试用什么,但留了几个可以盯的钩子:发布日期、对齐研究的公开动作,以及一串它自己承认还在改的指标。

第一,盯今年秋季的"自动化研究实习生"复盘。按官方说法,去年秋天立下的目标是今年 9 月交付,它自称已经达成。下一次自我打分很可能就在下一次公开发布里——拿这节开头那个 1 天人工换 3.1 天活儿的杠杆系数做基准,看它涨不涨、横盘还是掉头。

第二,看懂"agent"和"AI 研究员"之间那道坎。OpenAI 现在的活物叫研究实习生(按指令完成几天级研究任务的系统),下一档是"automated AI researcher",目标 2028 年 3 月。差在哪?按它的措辞,这档要能"在人类监督下推进深度学习和对齐研究",不只是跑任务,是做迭代改进。普通读者能验证的不是这一步能不能走通,而是"实习"哪天被偷偷换成"研究员"——这种命名升级在科技公司通常意味着一道新门槛被跨过去了。

第三,留意它自己披露的"不对齐"事件。之前提到的那次事件后,OpenAI 暂停了最新模型上的强化学习训练,等加完防护、扩完监控才放行部分任务继续跑。

读者能看的不是后台日志,是它下次主动报告:它说"对齐"和"安全"得跟上能力,问题是——它用什么指标证明跟上了?这套指标才是未来 18 个月真正值得追问的东西。

动手清单
1

收藏 OpenAI 官方 Research 索引页,下次它发"Research acceleration"或"Path ahead"更新时第一时间对比旧版数据。

2

记住两个时间锚:2026 年 9 月(实习生已交付)、2028 年 3 月(计划中的 AI 研究员),用日历设提醒盯官方有没有按期自评。

3

查官方最新发布的 System Card,重点找"alignment evaluation"一节,对照之前事件后的承诺看是否新增了衡量项。

4

在 ChatGPT 或 Codex 里观察:写代码时它是否会主动启动多个并行任务(这是 OpenAI 内部研究员现在的常态),这是 agent 化程度的一个可感知信号。

5

下次看到"AI 自主完成 X 天研究工作"这类报道时,先问一句:是 OpenAI 那个 1:3.1 杠杆的故事,还是别家的不同口径——杠杆系数的定义各家未必一致。

从两个信号观察:第一,OpenAI 承认自己还在测——指标是初版的、研究员还没上岗、对齐能不能跟上能力它自己也不打包票。第二,这些"未完成"有没有被悄悄填上——填上的速度,比任何发布会上的口号都更说明问题。18 个月的倒计时已经开始。

信源:OpenAI 官方研究博客《Research acceleration: The view inside OpenAI》(2026-09-06)。口径说明:所有数字(3.1× 杠杆、$600/天、$7000/天)均为 OpenAI 内部计量,无第三方审计;「自动化研究实习生」与「自动化 AI 研究员」均采用 OpenAI 自定义定义。