Nvidia的SoL-Pi通过优化“harness”将编程智能体token用量减少近一半
在EdgeBench的 51 个公开任务上,SoL-Pi与原始Pi harness表现相当;最省token的变体少用 49% 的token,得分达到Pi的 93.7%。
AI解读:Nvidia研究团队把降本目标从模型本身挪到了harness——也就是模型与环境之间那层控制逻辑,比如Codex、Claude Code或OpenClaw使用的调度框架。SoL-Pi让一个研究型AI去看另一个智能体的执行轨迹、提出harness改动,并且只保留那些既不掉性能又能省成本的方案。
对开发者来说,这直接关系到账单。研究给出的估算显示,在EdgeBench上最省token的配置比Codex节省 50%,比Claude Code节省 54.3%;按当前API价格折算,相比原生Codex和Claude Code harness每小时可省 8.75 至 13.50 美元。
但收益并不均匀。在Terminal-Bench 4的 63 个CPU任务上,SoL-Pi只解出 15 个,Codex和Pi各解出 18 个,尽管总成本仍比Pi低约四分之一。所以它更像是一种降低单位成本的工具,而不是提升解决能力的通用升级。
另一个限制是泛化。此前研究显示,自动优化过的harness容易过拟合训练任务。SoL-Pi的做法是把搜索反馈和评估严格隔开:EdgeBench的 40 个保留任务只在harness冻结后跑一次,结果不会回流到搜索过程中。
Nvidia研究人员公布了一个名为SoL-Pi的系统,它不修改模型,而是自动优化智能体与运行环境之间的harness层,从而降低编程智能体的token消耗。
根据The Decoder报道的论文内容,在EdgeBench的 51 个公开任务上,SoL-Pi的性能与原始Pi harness大致相当。最省token的配置同时启用四种机制,token用量比Pi少 49%,得分达到Pi的 93.7%。
研究团队在 535 个可执行环境中搜索了 152 个方向,包括 495 个由GitHub issue与pull request配对衍生的任务和 40 个合成测试用例,总共产生超过 3000 次运行和超过 6 万次智能体与环境交互。
四种消除重复工作的机制
搜索过程产出了四种机制。Action Fusion把两个连续步骤合并为一步,例如代码编辑后紧跟一次测试运行,从而消除一次完整的语言模型调用。
Online Context Compact在每个规划步骤之后运行,在不丢失重要信息的前提下裁剪累积的上下文。ObservationPack把较长的工具输出归档,后续步骤只插入一段简短摘要,而不是每次都重发全文。
Evidence-Preserving Reducer把大型错误日志和测试日志发给更便宜的模型进行浓缩,并配有一个自动验证步骤来捕捉可能被漏掉的关键线索。
- Action Fusion:合并连续步骤,消除一次模型调用
- Online Context Compact:每步规划后裁剪上下文
- ObservationPack:归档长输出,后续只发摘要
- Evidence-Preserving Reducer:用便宜模型压缩错误与测试日志,并自动复核
成本、配置与跨模型表现
具体节省幅度取决于配置。性能优先的变体只选用最强的单一机制,得分比Pi高 5.3%,同时仍然节省token。两种变体的token用量降幅在 44.7% 到 49% 之间。
效率变体的token用量是Pi的一半,成本从 1339 美元降到 894 美元,但得分略低。作者按当前API价格估算,相比原生Codex和Claude Code harness每小时可省 8.75 至 13.50 美元,相比Pi每小时可省 4.36 至 5.71 美元。
研究团队只用GPT-5.6 Sol构建了该系统,然后未经改动地应用到Opus 5上。在Opus 5上,系统保留了Pi 94.3% 的性能,节省幅度相近,但机制触发的频率和力度都更低。研究人员把这归因于harness仅基于GPT-5.6 Sol的执行轨迹进行了优化。
- EdgeBench 51个公开任务:性能与Pi大致持平
- 最省配置:token少 49%,得分达Pi的 93.7%
- 成本:从 1339 美元降至 894 美元
- Opus 5上保留 94.3% 性能,但机制触发更少、更弱
其他基准上的表现与取舍
在EdgeBench之外,结果更复杂。在Terminal-Bench 4的 63 个CPU任务上,SoL-Pi只解出 15 个,Codex和Pi各解出 18 个,但总成本仍比Pi低约四分之一。
在 2026 数学奥林匹克(IMO 2026)的形式化验证Lean 4任务上,该系统以最低的每题解决成本解出了 6 题中的 3 题。在一个内核优化实验中,由 20 个SoL-Pi工作单元组成的集群比同类Pi集群降低成本 26.8%。
效率提升伴随着取舍,更短的上下文可能降低提示缓存复用率。不过在一次测试运行中,总成本仍从 1339 美元降至 894 美元。作者展望称,可以像预训练模型那样跨多个任务预训练harness,并用已经精简的harness来降低搜索其继任者的成本;他们把这称为递归效率提升的愿景,而非本次研究的结论。
- Terminal-Bench 4:解出 15/63,Codex与Pi各 18/63,但总成本低约四分之一
- IMO 2026 Lean 4:6 题解出 3 题,每题解决成本最低
- 20 个SoL-Pi工作单元的内核优化集群:比Pi集群省 26.8%
- 短上下文可能降低提示缓存复用