Epoch AI 追踪 5 项 AI 基准近三年价格曲线:同等能力的单次成本每季度降约 47%,年化接近 13 倍。2025 年 1 月 o3 答对一道 PhD 级多选题要 30 美分,到 GPT-5.6 Luna 只值 0.04 美分,18 个月 725 倍。但新晋 SOTA 能力的季度跌幅两年内已从 66% 腰斩到 32%。最狠的跳水期过去了。

想象你去超市买鸡蛋,三年前十块一斤,之后每个季度自动降一半价格,十八个月后变成一毛三一颗——店员还会礼貌告诉你:接下来不会一直这么打折了,最狠的跳水期已经过去,剩下的是稳步降价。这跟 Epoch AI 看到的 AI 推理价格曲线几乎一模一样:刚解锁一个新能力时,厂商能定高价,竞争一进来就把价格砸穿,斜率最陡;等大家都学会做了,再降就只剩慢慢挤水分。类比到此为止,实际差别是——鸡蛋不会突然变得能解微分方程,而 AI 每便宜一分,能被它吃掉的任务就多一批,烧钱总账未必跟着变小。
事件

30 美分做对 PhD 物理题,18 个月后只花 4 厘钱

2025 年 1 月底,OpenAI 发了一个叫 o3 的模型,在博士级物理化学生物多选题上拿到 75% 准确率,单题成本 30 美分。不到 18 个月,GPT-5.6 Luna 同一分数,单题只要 0.04 美分。725 倍,Epoch AI 把它叫作"思考的标价"。

GPQA Diamond 是 448 道多选题,覆盖博士级物理、化学、生物,门外汉连题目都未必读得懂。o3 在 2025 年 1 月 31 日放出时,平均每道题要烧掉 30 美分——差不多够买两个麦当劳巨无霸套餐。

Epoch AI 把 OpenAI 公布的 API 价格和模型在基准上的得分拉到同一坐标系上,算出这条"单次正确思考"的开销曲线。18 个月不到,同一条 75% 分数线,单题成本砸到 0.04 美分,也就是四厘钱。

换算成生活里的东西更扎眼:一辆标价 5 万美元的新车,18 个月后标 69 美元,还包过户。这是 AI 推理(让模型一步步"想"再给答案,而非一次吐字)的真实价格。Epoch AI 在 2026 年 9 月发布的报告里把这条曲线正式命名——思考的标价(price of thought),用来和"算力"这类输入侧成本区分开。

725 倍只是起点和终点之间的距离。Epoch AI 用三年数据算出,同等能力的 AI 性能成本平均每个季度跌 47%,一年掉 13 倍,快过蒸汽机、电力和互联网。这条平均线怎么来的,后面会拆。

30¢
$0.04
725×

但 725 倍是终点,47% 是平均速度。Epoch AI 的数据显示,降价在减速:一项能力刚成为 SOTA(state-of-the-art,即当前最强水平)时,成本每个季度跌 66%,两年后只剩 32%。新能力的降价红利,正在变薄。

为何要紧

五项基准、三年数据,怎么拼出 47% 的季度跌幅

研究者盯的不是绝对价格,而是同一道题要做到某个分数,模型成本随时间怎么走——这条曲线三年来每个季度往下掉 47%。

Epoch AI 团队 Luke Emberson 和 David Roodman 把过去三年能拿到的数据全部拢起来:数学、硬科学(涵盖化学、物理、生物)、博弈类共五项 AI 能力基准,每一项都同时记录模型的得分和当时跑这个得分花了多少钱。

横轴是时间,纵轴是达到某条分数线所需的最低模型价格。这样切一刀,同等能力的边际成本(按季度计算)的下降速度就被剥离出来,不被新模型涨价、新基准难度的变化干扰。

五条线合在一起看,每季度成本下滑 47%,相当于每年 13 倍。从来没有哪项通用技术——蒸汽机、电力、互联网——的降价速度能跟上。分项之间的差距不小:游戏类谜题最慢,季度跌幅 39% 到 43%,折合每年 7 到 10 倍;数学题最快,季度跌幅 50% 到 52%,折合每年 16 到 19 倍。研究者给出的解释是,数学题的解法有强对错信号,训练时改进一寸就能在评测里兑现一寸;博弈类问题则更吃策略搜索与算力堆叠,算法层面的优化空间相对小。

这五条基准数据回溯到 GPT-3 商业推理开放前都不完整,但研究者认为 47% 的季度速度大概率从 2021 年 11 月就已启动——只是早期没有连续的模型价格信息,没法在论文里精确还原那段曲线。

研究者用的成本数据来自模型 API(按调用次数付费的云端接口)公开定价表与官方技术报告,属于厂商自报口径,未经独立第三方复测,读者读这条数字时需要把它当厂商自己跑出来的成绩单。

47%
每季度同等能力成本降幅
来源:Epoch AI
66%→32%
新晋 SOTA 能力从首现到两年后季度降幅
来源:Epoch AI
5 项
纳入分析的基准测试数量(数学/硬科学/博弈)
来源:Epoch AI

这个数字本身留了一个问号:基准能代表真实工作吗?研究者自己也在论文里承认了这条线最大的不确定性——基准上的成本曲线,等不等同于生产环境里做实际任务的成本曲线。