Epoch AI 追踪 5 项 AI 基准近三年价格曲线:同等能力的单次成本每季度降约 47%,年化接近 13 倍。2025 年 1 月 o3 答对一道 PhD 级多选题要 30 美分,到 GPT-5.6 Luna 只值 0.04 美分,18 个月 725 倍。但新晋 SOTA 能力的季度跌幅两年内已从 66% 腰斩到 32%。最狠的跳水期过去了。
30 美分做对 PhD 物理题,18 个月后只花 4 厘钱
2025 年 1 月底,OpenAI 发了一个叫 o3 的模型,在博士级物理化学生物多选题上拿到 75% 准确率,单题成本 30 美分。不到 18 个月,GPT-5.6 Luna 同一分数,单题只要 0.04 美分。725 倍,Epoch AI 把它叫作"思考的标价"。
GPQA Diamond 是 448 道多选题,覆盖博士级物理、化学、生物,门外汉连题目都未必读得懂。o3 在 2025 年 1 月 31 日放出时,平均每道题要烧掉 30 美分——差不多够买两个麦当劳巨无霸套餐。
Epoch AI 把 OpenAI 公布的 API 价格和模型在基准上的得分拉到同一坐标系上,算出这条"单次正确思考"的开销曲线。18 个月不到,同一条 75% 分数线,单题成本砸到 0.04 美分,也就是四厘钱。
换算成生活里的东西更扎眼:一辆标价 5 万美元的新车,18 个月后标 69 美元,还包过户。这是 AI 推理(让模型一步步"想"再给答案,而非一次吐字)的真实价格。Epoch AI 在 2026 年 9 月发布的报告里把这条曲线正式命名——思考的标价(price of thought),用来和"算力"这类输入侧成本区分开。
725 倍只是起点和终点之间的距离。Epoch AI 用三年数据算出,同等能力的 AI 性能成本平均每个季度跌 47%,一年掉 13 倍,快过蒸汽机、电力和互联网。这条平均线怎么来的,后面会拆。
但 725 倍是终点,47% 是平均速度。Epoch AI 的数据显示,降价在减速:一项能力刚成为 SOTA(state-of-the-art,即当前最强水平)时,成本每个季度跌 66%,两年后只剩 32%。新能力的降价红利,正在变薄。
五项基准、三年数据,怎么拼出 47% 的季度跌幅
研究者盯的不是绝对价格,而是同一道题要做到某个分数,模型成本随时间怎么走——这条曲线三年来每个季度往下掉 47%。
Epoch AI 团队 Luke Emberson 和 David Roodman 把过去三年能拿到的数据全部拢起来:数学、硬科学(涵盖化学、物理、生物)、博弈类共五项 AI 能力基准,每一项都同时记录模型的得分和当时跑这个得分花了多少钱。
横轴是时间,纵轴是达到某条分数线所需的最低模型价格。这样切一刀,同等能力的边际成本(按季度计算)的下降速度就被剥离出来,不被新模型涨价、新基准难度的变化干扰。
五条线合在一起看,每季度成本下滑 47%,相当于每年 13 倍。从来没有哪项通用技术——蒸汽机、电力、互联网——的降价速度能跟上。分项之间的差距不小:游戏类谜题最慢,季度跌幅 39% 到 43%,折合每年 7 到 10 倍;数学题最快,季度跌幅 50% 到 52%,折合每年 16 到 19 倍。研究者给出的解释是,数学题的解法有强对错信号,训练时改进一寸就能在评测里兑现一寸;博弈类问题则更吃策略搜索与算力堆叠,算法层面的优化空间相对小。
这五条基准数据回溯到 GPT-3 商业推理开放前都不完整,但研究者认为 47% 的季度速度大概率从 2021 年 11 月就已启动——只是早期没有连续的模型价格信息,没法在论文里精确还原那段曲线。
研究者用的成本数据来自模型 API(按调用次数付费的云端接口)公开定价表与官方技术报告,属于厂商自报口径,未经独立第三方复测,读者读这条数字时需要把它当厂商自己跑出来的成绩单。
这个数字本身留了一个问号:基准能代表真实工作吗?研究者自己也在论文里承认了这条线最大的不确定性——基准上的成本曲线,等不等同于生产环境里做实际任务的成本曲线。