研究The Decoder AI·原文 2026年9月25日

Epoch AI:固定AI基准成绩的成本每季度下降约47%,年降约13倍

Epoch AI测算,达到固定基准分数所需的价格自2023年以来年均下降约13倍;MIT团队剔除硬件降价和竞争因素后,认为纯算法效率提升约为每年3倍。双方都提醒,当前最强推理模型的单次成本反而可能更高。

Epoch AI测算,在选定AI基准上达到固定性能水平的成本正在快速下降:平均每季度约降47%,折合每年约13倍。该机构称,没有其他变革性技术的成本下降速度有这么快。

该数字反映的是固定基准分数对应的市场价格,而非纯算法或架构进步,也不是现实中的生产力成本。MIT研究人员在可比数据上看到成本每年下降5到10倍;剔除更便宜的硬件和竞争性定价压力后,他们把算法效率的实际提升定为约每年3倍。

单次运行的峰值性能实际上可能更贵,因为更新的推理模型每个任务会消耗多得多的算力。

Epoch用o3举例:同一分数从30美分降到0.04美分

Epoch AI以OpenAI的o3为例:2025年初,o3在GPQA Diamond(博士级科学测试)上得分75%,估算每道题成本30美分。18个月后,GPT-5.6家族的一个模型达到相同分数,成本为0.04美分。Epoch称这是原价的1/725。文章打比方说,如果汽车以这个速度降价,一辆5万欧元的车会卖不到70欧元。

OpenAI几天前刚发布了更便宜的GPT-6 Sol和Luna模型,因此这一差距可能进一步拉大。

Epoch的分析基于五个覆盖数学、科学和逻辑谜题的基准。由于样本较窄,该机构称其发现是“基于现有最佳数据的合理但粗略的测量”。

MIT:算法效率约每年3倍,其余来自硬件和竞争

MIT的Hans Gundlach及其同事使用比价平台Artificial Analysis的定价数据,覆盖2024年4月至2025年11月,并且每次测试评估的模型数量远多于此前研究。

他们的数字低于Epoch,部分原因是更新的推理模型可以在难题上投入额外的测试时算力,即使每token价格持续下降,每个正确答案的成本仍会被推高。Token是服务商计费的文本单位,单看它会漏掉全貌。

MIT拆解价格下降的推力:更便宜的硬件占一部分,竞争占更多。研究人员通过单独观察开放模型来控制竞争因素。剩下的纯算法效率提升约为每年3倍。Epoch的13倍更高,是因为它没有剔除硬件和竞争的影响。

基准进步不等于效率进步,还有“benchmaxxing”问题

MIT还发现,一些性能提升仅仅来自花更多算力。一个新模型在GPQA Diamond上击败前代,从外面看像是进步,但作者估计其中很大一部分改进来自每个问题使用更多处理能力。它得分更高,运行也更贵。编程和数学基准显示出同一模式的较小版本。

并非所有基准进步都是效率进步。新模型把更好的训练、更好的数据、更好的架构和更多测试时算力揉在一起,单一分数混合了所有这些因素。

还存在“benchmaxxing”问题:AI公司可能针对知名测试做优化,在缺乏实际回报的情况下抬高分数。Epoch试图用一个基于保密游戏的测试“Mystery Game Puzzles”来防范这一点。该测试上的成本下降最慢,这符合benchmaxxing理论,但也可能只是反映了任务形式或数据噪声。

选模型时,价格均值帮不上太多忙

宽泛的成本均值在为一个具体任务选模型时帮助不大。Artificial Analysis等平台按质量、价格、延迟、上下文窗口和输出速度对模型排名,最便宜的选项很少在每个维度都胜出。

一个延迟高的低成本模型对实时聊天机器人没用。一个强大的推理模型对自动化工作流可能太慢。一个更贵的前沿模型如果更常答对、减少重试,仍可能省钱。这些都不会体现在简单的每token价格对比里。

信息来源

The Decoder AI原始来源