OpenAIは9月6日の内部研究加速レポートで、自動化学術研究インターンの構築が予定通り完了したと正式に発表した。次の目標は2028年3月の完全自動AI研究員だ。8月中旬時点で、人間1日分の投入に対しエージェントが3.1日分の工数を稼働。研究者のAPI費用は中央値で600ドル、上位10%で7000ドルに達した。研究室の主力は人間からエージェントに移行しつつある。

従来の研究室を思い浮かべてほしい。これまでは1人の研究者が1人の大学院生を指導していたが、今では1人の研究者が画面の前で、4体以上の「デジタル大学院生」がそれぞれ実験を走らせ、コードを書き、評価を回しているのを見ている。研究者の仕事は「自ら手を動かす」ことから「複数の画面をにらんで仕事を仕分ける」ことに変わった。OpenAIの8月中旬のデータは、この研究室において1人の正規従業員の裏で3.1体のエージェントが稼働し続けていることを意味する。比喩はここまでだが、実際の決定的な違いはこうだ:デジタル大学院生の工時はAPIの単価で換算すれば本物の金であり、最も使い込んでいる研究者たちは1日あたり7000ドルのコンピュート費を燃やしている。これは人員増ではなく、研究室のレバレッジ倍率を3倍以上に引き上げるということだ。ただし、出題・採点・方向性の決定は依然として研究者本人に委ねられている。
事象

1人の研究者の代わりに3.1体のエージェントが稼働

OpenAIはエージェントの稼働時間を8時間の標準労働日に換算した。8月中旬の比率は、1日の人的投入に対し、背後で3.1日分のエージェント工数が動いているというものだ。

この比率からは2つの転換点が読み取れる。研究者のエージェント使用量は6月以前は総人的投入を下回っていたが、今ではそれを逆転した。同時並行ユーザー(4体以上のエージェントを同時に走らせる人々)の数は依然として増加している。1人で複数エージェントを動かすワークフローが普及しつつあり、単一スレッドの作業を外部委託するだけでなく、活用のあり方そのものが変わりつつある。

費用も新たな桁に達した。APIの単価で換算すると、中央値の研究者(アプリケーションプログラミングインタフェース。呼び出し量に応じてモデルへ支払う窓口)は1日平均600ドル、上位10%のユーザーは1日平均7000ドルをコンピュート費に投じている。OpenAIは1年前の同基準の支出について比較数字を示していないが、年初の散発的な使用から1日平均600ドルへ跳ね上がったこと自体が答えだ。

仕組み

インターンは予定通り納入、研究員までは残り18か月

昨年秋、OpenAIは自動化学術研究に対して2つの節目を設定した。今年9月に「研究インターン」を納入し、2028年3月に「AI研究員」を目指すというものだ。9月6日のこのレポートは、まさに期日通りの回答である。第1段階は確実に達成された。

「インターン」の公式定義は控えめに書かれている。人間の指導のもと、明確に定義された研究タスクを遂行し、単一タスクの作業量は熟練研究者が数日かける仕事に相当する。ハンドルを奪うことはなく、仕事を引き受けるだけだ。第1段階のハードルをクリアし、第2段階——自ら課題を発見し推進できる「AI研究員」——の納入までは残り18か月。

OpenAIはこのレポートでこの経路をRSI(Recursive Self-Improvement:再帰的自己改善)と呼んでいる。AI自身に研究能力をより強く推し進めさせるという考え方だ。

研究は一直線ではない。着想、評価設計(実験結果の良し悪しを判定する採点基準)、インフラ構築、ハイパーパラメータ調整、最終統合まで、どの段階でも行き詰まりうる。エージェントがいくら高速で稼働しても、各ポイントの作業時間を短縮できるだけに過ぎず、工程全体のボトルネックは依然として人間の側にある。したがって「予定通り納入」は事実だが、「研究は今後指数関数的に加速する」という結論にはならない。

納入の事実を数字で示すため、レポートには3枚のカードが添えられている:

1.0
インターン基準
人間の指導のもと、熟練研究者の「数日レベル」タスクを完遂。目標時期:2025年9月(基準:OpenAI独自定義)
1.5
次段階の目標
研究課題を自律的に発見・推進できるAI研究員。目標時期:2028年3月、残り約18か月(基準:OpenAI独自定義)
複数段
工程は未加速
研究は着想→評価→インフラ→調整→統合の5段階からなり、エージェントが各段階の所要時間を短縮しても全体の速度は最も遅い段階に律速される(基準:OpenAIレポート原文)
OpenAI:公式サイトの動向(RSS・導入事例/顧客事例を除く) 公式画像1
公式画像1 · 出典:OpenAI:公式サイトの動向(RSS・導入事例/顧客事例を除く) · データの基準は原文に従う
反直感

自社案件に自社ブレーキ、HF事件後にRLは本当に止まった

最も反直感的な動きは外部から来た。Hugging Faceで起きた一件を機に、OpenAIは自社の最新モデル上での強化学習の訓練を停止した。

RL(強化学習)は、報酬信号をもとに試行錯誤を繰り返し、モデルの出力を目標に近づける訓練手法だ。全面停止ではない。一部の負荷はより厳格な管理下で再開、他は保留中。OpenAIは明言する——許容できない安全リスクを発見した場合、自社で十分に防護できないシステムの開発・展開を減速・停止する。今回は実際に実行した。

コストは非公開だが、意図は明確だ。安全性を確保する取り組みをモデルライフサイクルの早期に組み込み、訓練全体を通じてより強いアライメントの証拠を求める。アライメントとは、AIの目標と行動を人間の意図に沿わせ、逸脱を防ぐこと。OpenAIはこれをリリース直前の最終関門から、訓練中の各ステップへと移した。

見解自動化された研究が加速すればするほど、外部の安全事故1件が訓練のリズムに与える影響は大きくなる。このブレーキは、OpenAIが自社に装着したものだ。

「能力向上と安全強化は同時進行」という方針と照らせば、HF事件は公開された形のストレステストだった。結果:自社最先端の訓練パイプラインを停止でき、停止する勇気があり、復旧経路も備えている。これは、どんなホワイトペーパーよりも、安全への約束が絵空事ではないことを示している。

OpenAI:公式サイトの動向(RSS・導入事例/顧客事例を除く) 公式画像2
公式画像2 · 出典:OpenAI:公式サイトの動向(RSS・導入事例/顧客事例を除く) · データの基準は原文に従う
方向性

自社で刷った紙幣を燃やし、自社のアライメント勘定も燃やす

2026年2月、OpenAIは1100億ドルの新規資金調達を発表した。プレマネー評価額は7300億ドルで、ソフトバンクが300億ドル、NVIDIAが300億ドル、Amazonが500億ドルをそれぞれ拠出した。この資金の使途の1つが、研究者の手元で1日あたり600~7000ドルに膨らむAPI(開発者がモデルの機能を呼び出すための有料インタフェース)コンピュート費だ。言い換えれば、コンピュート費を燃やすのは自社帳簿の上で刷った紙幣を燃やすのと同義であり、当面は出せないという問題はない。

しかし帳簿の裏には責任が伴う。OpenAIは文末でこう明言している:「we do not yet know how to safely get all the way to aligned, full RSI」——完全自律型研究員に至るまでのアラインメント(AIの行動を人間の意図に合致させるという技術課題)の経路を、OpenAI自身も描き切れていない。今年前半のHugging Face事件を受け、OpenAIは最新モデル上での強化学習(RL)訓練を停止し、研究環境のレッドチーム演習(システムの脆弱性や危険な挙動を意図的に探し出すテスト)を強化したうえで、安全監査をモデルのライフサイクル全体に組み込んだ。資金は燃料、アラインメントはブレーキパッドであり、この2つは今や同時進行が必須だ。

真の焦点は2028年3月という節目にある。2028年3月には、エージェントは人間の補助ではなく、独自に研究課題を発見し推進できる同僚となる。RSI(再帰的自己改善、すなわちAIが自身の研究および関連研究を加速させる循環)はOpenAI1社に閉じて起きるものではない。OpenAIは業界全体に対し、RSIの進捗を公に追跡するよう呼びかけ、自社の「フロンティア政策ブループリント」にもそれを盛り込んだ。まず指標を確立し、規制当局にアンカーを与えるということだ。

この事象が示すトレンドは、2つの具体的シグナルから観察できる。判断が成立するシグナル:2027年半ばまでに、OpenAIまたは他のフロンティアラボが「自動化学術研究インターン」による研究成果の割合(独立して完遂した論文ユニット、検証可能な新規仮説の提起数など)を公開し、第三者による再現検証を伴うこと。また複数国の規制当局がRSI進捗の開示をコンプライアンス要件に組み込み、OpenAI自身のブループリントに呼応すること。判断が成立しないシグナル:再びフロンティアラボが安全上の事故を理由に訓練を停止する、アラインメント事故が能力の進歩を上回る、あるいは2028年3月の節目が公式に静かに延期され、検証可能な代替指標が示されないこと。18か月のカウントダウンは既に始まっており、帳簿はこの競争のもっとも目につく注釈に過ぎない。

実践

18か月後の一画を注視:今できる3つのこと

OpenAIは本日試せるものについては語っていないが、注視できるいくつかのフックを残している。発表日、アラインメント研究の公開動向、そして同社が今も改定中と認める一連の指標だ。

第1に、今秋の「自動化学術研究インターン」振り返りを注視する。公式の説明によれば、昨年秋に掲げた目標は今年の9月納入であり、同社はそれを自称達成済みだ。次の自己評価はおそらく次回公開リリース内で行われるだろう。本節冒頭で触れた1日の人的工数で3.1日分の仕事を得るレバレッジ係数をベンチマークとして、それが上昇するのか、横這いなのか、反落するのかを見る。

第2に、「エージェント」と「AI研究員」の間の溝を理解する。OpenAIが今世に送り出している存在は研究インターン(指示のもと数日レベルの研究タスクを完遂するシステム)であり、次の段階は「automated AI researcher」、目標は2028年3月だ。差はどこにあるのか。同社の表現によれば、この段階では「人間の監督のもと、ディープラーニングとアラインメント研究を反復的に改善する」ことが求められ、単なるタスク実行ではなく、反復的改良を行う。一般読者が検証できるのはこのステップが実現可能かどうかではなく、「インターン」という名称がいつこっそり「研究員」に置き換わるかだ——こうした名称のアップグレードは、多くのテック企業において新たなハードルが越えられたことを意味する。

第3に、同社が開示する「アラインメント不備」事案に注目する。前述の件後、OpenAIは最新モデル上での強化学習訓練を停止し、防護策と監視体制を拡充したうえで、一部のタスクのみ走行を再開した。

読者が目にできるのはバックエンドのログではなく、同社による次回の能動的報告だ。同社は「アラインメント」と「安全性」は能力に追いつかなければならないと述べる。問題は——それをどんな指標で証明するのか、という点だ。この指標こそが、今後18か月間、本気で追及する価値がある対象だ。

実践チェックリスト
1

OpenAI公式のResearchインデックスページをブックマークし、次回「Research acceleration」または「Path ahead」が更新された際に旧版データと即座に比較する。

2

2つの節目を記憶する:2026年9月(インターン納入済)、2028年3月(計画上のAI研究員)。カレンダーにリマインダーを設定し、公式が期日通り自己評価しているかを監視する。

3

公式の最新版System Cardをチェック。特に「alignment evaluation」の節に焦点を当て、事案後のコミットメントと对照して新たな評価項目が追加されたか確認する。

4

ChatGPTまたはCodexでの挙動を観察する。コーディング中に自発的に複数の並列タスクを起動するか(これはOpenAI内部研究者の現在の常態)を見極める。これはエージェント化の程度を示す知覚可能なシグナルだ。

5

「AIが○日分の研究を自律的に完遂」といった報道を目にした際は、まず問いかける:OpenAIの1:3.1レバレッジの話なのか、それとも他社の別基準の数字なのか。レバレッジ係数の定義は各社で同一とは限らない。

2つのシグナルから観察できる。第1に、OpenAI自身がまだ検証中と認めている。指標は初版、研究者はまだ就任しておらず、アラインメントが能力に追いつけるかは同社も保証していない。第2に、これらの「未完」がこっそり埋められていないか。埋められるスピードは、どんな発表会のスローガンよりも雄弁に語る。18か月のカウントダウンは既に始まっている。

出典:OpenAI公式研究ブログ「Research acceleration: The view inside OpenAI」(2026-09-06)。基準説明:すべての数値(3.1倍レバレッジ、600ドル/日、7000ドル/日)はOpenAI内部の計測値であり、第三者監査は受けていない。「自動化学術研究インターン」および「自動化AI研究員」はいずれもOpenAI独自の定義による。