Epoch AIが3年間・5つのAIベンチマーク価格曲線を追跡:同等能力の1回あたりコストは四半期ごとに約47%低下、年率換算で約13倍。2025年1月、o3がPhDレベルの多肢選択問題を正解するのに30セントかかったが、GPT-5.6 Lunaではわずか0.04セント、18ヶ月で725倍となった。ただし、新規SOTA能力の四半期下落率は2年で66%から32%に半減。最激安期は過ぎた。
PhD物理問題を30セントで正解、18ヶ月後は4厘
2025年1月末、OpenAIはo3というモデルを公開した。博士レベルの物理・化学・生物の多肢選択問題で75%正答率を達成したが、1問あたりコストは30セント。ビッグマックセット2つ分を1問に燃やしていた計算だ。わずか18ヶ月後、GPT-5.6 Lunaが同スコアを1問0.04セントで出す。Epoch AIはこの落差を「思考の値段」と名づけた。
GPQA Diamondは448問の多肢選択問題からなる。門外漢には問題文すら読み解けないかもしれない。Epoch AIはOpenAIが公表したAPI価格と各モデルのベンチマーク得点を同一座標系に落とし込み、この「1回の正解思考」コスト曲線を算出した。同じ75%ライン上の1問コストは、18ヶ月も経たないうちに0.04セント——4厘まで叩き落とされた。
暮らしに換算するとより衝撃的だ。5万ドルの新車が18ヶ月後に69ドルで売られ、名義変更サービス付き。これがAI推論(モデルに段階的に「考えさせて」から答えを出させる方式で、一度に全文を生成させるのではなく)の実勢価格である。Epoch AIは2026年9月公開のレポートでこの曲線を正式に命名した——思考の値段(price of thought)。「計算資源」のような入力側コストと区別する意図がある。
では、この値下げはどのくらいの速さで進んでいるのか。Epoch AIが3年分のデータから算出したところによれば、同等能力のAI性能コストは四半期平均47%低下、つまり1年で13倍。蒸気エンジンも電力もインターネットも、このペースには追いつけない。
ただし725倍は起点と終点の距離であり、47%は平均速度だ。Epoch AIのデータによれば、値下げは減速している。能力がSOTA(state-of-the-art=現時点での最高水準)に達した直後は四半期コストが66%下落するが、2年後には32%まで縮小する。新規能力の値下げ红利が薄れつつある。
5ベンチ・3年データから四半期47%の下落をどう導くか
Epoch AIが見たのは絶対価格ではない。同じ問題で一定スコアを出すためのモデルコストが、時間とともにどう動くか——この曲線は3年間、四半期ごとに47%下落し続けている。
Epoch AIチームのLuke EmbersonとDavid Roodmanは、過去3年に取得可能なデータをすべて集約した。数学、硬科学(化学・物理・生物を包括)、ゲーム系——計5つのAI能力ベンチマーク。各ベンチマークで、モデル得点を達成時点の価格と同時記録している。
横軸は時間、縦軸は一定スコアラインに到達するための最低モデル価格。この切り方により、同等能力の限界コスト(同じスコアを出すために追加で必要な費用)の下落速度が、新モデル値上げ・新ベンチマーク難易度変化のノイズを排して抽出される。
5本の線を重ね合わせると、四半期コスト47%減=年率13倍減。蒸気エンジンも電力もインターネットも含め、汎用技術でこの値下げペースに追いついたものはない。
項目別ばらつきは小さくない。ゲーム系パズルが最も緩やかで四半期下落39~43%、年率7~10倍。数学問題が最も急で四半期下落50~52%、年率16~19倍。研究者の説明では、数学問題は正誤判定の信号が強く、学習時の改善がそのまま評価に直結する。一方、ゲーム系問題は戦略探索と計算資源の積み上げに依存し、アルゴリズム層の最適化余地が相対的に小さい。
これら5ベンチのデータはGPT-3の商用推論解放前まで遡ると不完全だが、研究者らは47%の四半期下落速度が2021年11月から既に始まっていた可能性が高いとみている。ただし初期にはモデル価格情報の連続記録がなく、論文上でその区間曲線を正確に再現できない。
研究者が用いたコストデータはモデルAPI(呼び出し回数ごとに課金されるクラウド経由の接続口)の公開価格表と公式技術報告に基づく。各ベンダー自身による自己申告値であり、独立第三者による再検証は施されていない。この数字を読む際は、ベンダー自身が走らせて出した成績表と捉える必要がある。
ただ、この数字には一つ引っかかる点がある。ベンチマークは実作業を反映しうるのか?研究者自身も論文中で最大の不確実性を認めている——ベンチマーク上のコスト曲線が、実運用環境で実タスクを処理するコスト曲線と等しいとは限らない。