Claude 算完九圈散射振幅,科学计算开始进入“长任务”
Anthropic 9 月 25 日公布,Claude Science 在平面 N=4 超杨-米尔斯理论中完成一个六粒子九圈散射振幅计算,耗时数天、成本约一两千美元。结果已交给物理学家 Lance Dixon 等人复核。现阶段更能说明 Agent 能把一项有明确验收标准的研究任务连续跑下去,还不能写成 AI 独立发现了新物理。
问题很窄,难度很高
Anthropic 9 月 25 日发布了一篇由理论物理学家、科普作者 Matt von Hippel 撰写的文章。文章说,Anthropic 的 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 使用 Claude Science,完成了平面 N=4 超杨-米尔斯理论中的六粒子九圈 MHV 散射振幅计算。
这是一套用来检验计算方法的理论模型,目标是研究公式本身,不等于直接测量现实粒子碰撞。“九圈”指量子修正计算里的第九层,和聊天轮数无关。每往上加一层,公式数量和约束都会增加。过去公开结果做到八圈,九圈长期没有完整答案。
Claude 连续跑了几天
Anthropic 的说法是,Claude Science 让 Fable 5.1 连续工作了几天,自己写代码、调用数学工具、检查中间结果,遇到错误再改。两名研究人员主要给方向和验收条件,计算预算约一两千美元。
这里最有价值的变化很朴素:模型能把一件事情放在手边几天,保留上下文,反复运行程序,记住哪些路径已经失败。短对话里答对一道题,和持续维护一套计算过程,完全是两种工作。
这段过程仍来自 Anthropic 自己的披露。公开文章没有给出完整运行记录、所有工具配置和可供外部直接复现的代码,费用也属于公司口径,不能把它当成独立实验报告。
结果已经交给物理学家核对
SLAC 和斯坦福大学的物理学家 Lance Dixon 在文章中写道,9 月 1 日收到了 Anthropic 团队的结果,并开始验证九圈振幅。核对要看公式是否满足已知约束,低圈结果能否对上,独立计算能否得到同样的表达式。模型输出一串漂亮公式,离被同行接受还有距离。
这也解释了为什么现在不宜把标题写成“AI 发现了新物理”。它完成的是一项有明确问题、边界和检查办法的高难度计算;研究者定义问题,提供工具和判断标准,最后仍要有人承担结果的学术责任。
普通人该怎么理解
以后会有更多研究任务适合交给这种长时间运行的 Agent:输入资料比较完整,约束条件写得清楚,结果可以用程序或公式验收。它更像一个能连续干活的研究助理,碰到卡点会自己换路,早上回来能看到一份留下过程的中间成果。
难点仍在开头和结尾:研究者要先把问题拆到模型能执行的程度,最后要判断它有没有偷走假设、误读数据,或者把一个看似合理的答案拼出来。九圈结果能否被独立重算,换一个理论问题还能不能稳定运行,这两件事比发布会上的一句“完成了”更能说明能力边界。
未来 3—6 个月 · 待核查问题
接下来怎么看
科学 Agent 会继续从代码和资料整理进入有明确验收条件的数学与实验任务。能否稳定复现这次九圈结果,能否换一个理论问题仍然工作,比单次展示更能说明它的能力边界。
持续检查:完整运行记录和工具配置是否公开;Lance Dixon 等外部专家能否独立重算;同一系统换题后是否仍能保持几天运行、控制成本并给出可核验的中间结果。