研究The Decoder AI·原文 2026年9月25日

研究:AI专家与超级预测者集体低估AI进展速度

Forecasting Research Institute汇总多轮LEAP面板预测后发现,数学奥林匹克金牌、病毒学基准等里程碑比专家中位预测提前数年出现,但自动驾驶等现实场景的预测未必偏低。

AI解读:这项研究的价值在于把“专家预测靠不靠谱”变成一个可核对的问题。FRI从2022年中开始用LEAP面板收集AI进展预测,样本包括339名专家,其中76名计算机科学家、76名产业专家、68名经济学家和119名AI政策专家,另外还有过往预测记录良好的超级预测者。

从结果看,被记录到的高估偏差集中在少数里程碑上:AI在2025年7月达到国际数学奥林匹克金牌水平,比专家中位预测早五年,比超级预测者中位预测早十年。专家对实际发生基准给出的平均概率为24.6%,超级预测者为9.7%;数学奥赛金牌这一项分别只有8.6%和2.3%。

另一类低估出现在应用基准:病毒学能力测试上专家中位预期2030年追平顶尖团队,超级预测者预期2034年,FRI认为可能2025年4月就已发生;网络安全基准也出现类似偏差。但生物实验室任务对照试验中,语言模型表现与单独使用互联网没有可测量差异,说明基准追平不等于现实任务全部解决。

经济预测同样偏保守:专家对2026年底AI公司最高年化收入的中位预测是200亿美元,经济学家160亿,超级预测者250亿;FRI援引Anthropic约1000亿美元作为可能已达到的参考,并称2026年7月报告的650亿美元已远超所有组最高估计。

研究也提示自身局限:低估在现实超过预测时立刻可见,高估要等截止日期过去才能确认,因此中期报告天然偏向发现“太保守”的案例;部分评估还依赖原始预测者当时没有的LLM信息。FRI后续将单独标注预期2040年前AI极速进展的受访者,并发布持续更新的LLM预测。

Forecasting Research Institute(FRI)自2022年中起通过多轮LEAP(Longitudinal Expert AI Panel)调查收集AI进展预测,样本包含339名首轮专家,其中76名计算机科学家、76名产业专家、68名经济学家、119名AI政策专家,计算机科学家中包括30名顶尖高校教授和10名被引最高的AI作者,面板还纳入有准确预测记录的超级预测者。

研究结论是:在多项已被现实追上的里程碑上,专家和超级预测者的预测都偏低。最明显的是数学:AI在2025年7月达到国际数学奥林匹克金牌水平,比专家中位预测早五年,比超级预测者中位预测早十年。这些预测采集于2022年ChatGPT发布前,FRI称该模式之后仍然成立。

数学、病毒学与网络安全基准提前达标

按专家预测,实际发生的基准结果平均概率为24.6%,超级预测者为9.7%;数学奥赛金牌一项分别降至8.6%和2.3%。

AI可能还解决了一个千禧年大奖难题,但尚不清楚解答是否符合评估标准。在2025年8月和9月的调查中,专家对2027年底前出现此类解答的中位概率仅为10%,超级预测者为5.4%。

在病毒学能力研究中,专家预计AI模型到2030年才能在故障排查基准上追平顶尖病毒学家团队,超级预测者预计2034年。FRI称这可能在2025年4月就已发生。网络安全基准出现类似低估。受访者把这一里程碑与更高的生物风险预期联系起来,而非与任何已记录的实际危害上升挂钩。

收入预测偏保守,现实任务结果更复杂

经济预测也偏保守。专家对2026年底任何AI公司最高年化经常性收入的中位预测为200亿美元,经济学家为160亿美元,超级预测者为250亿美元。FRI援引Anthropic在2026年9月约1000亿美元作为可能已经达到的数字。Anthropic和OpenAI的年化收入远超所有受访组的中位预测,即使最高组估计250亿美元也远低于2026年7月报告的650亿美元。

并非所有预测都偏低。生物安全专家预计22.5%的使用语言模型的参与者能完成生物实验室任务,病毒学家预计40%,超级预测者预计16.2%。在一项对照试验中,使用语言模型和互联网的参与者只有5.2%成功,仅使用互联网的为6.6%。语言模型没有带来可测量的差异,不过该试验规模较小。

专家在自动驾驶上可能高估了。他们对2027年美国自动驾驶网约车行程占比的中位预测为7.3%,而一个LLM预测为2.5%。FRI表示经济增长、就业和重大AI危害方面的预测目前还无法可靠判断。

受访者上调预期,FRI调整预测方法

受访者正在上调预期。在完成两次调查的人中,九个月内AI成为“世纪技术”的平均概率从专家的31%升至36%,超级预测者从28%升至35%。专家和超级预测者现在都预期AI会产生比九个月前更大的社会影响,两组都把最高平均概率赋予“世纪技术”,与电力同级。

FRI接下来将单独标出一组预计到2040年AI极速进展的受访者,并同时发布持续更新的LLM预测与人类预测。据ForecastBench,一些模型在某些问题类型上已能匹配超级预测者。FRI还希望找出最准确的LEAP小组成员,在数据足够后展示他们的预测。

FRI也指出自身数据的一个问题:低估在现实超过预测时立刻可见,高估要等截止日期过去才能确认,因此中期报告天然偏向发现预测者过于保守的案例。FRI的部分评估还依赖使用了原始预测者当时没有的信息的LLM预测。

信息来源

The Decoder AI原始来源