模型The Decoder AI·原文 2026年9月23日

OpenAI发布GPT-6 Sol与Luna:token价格减半,智能水平基本持平

两款新模型对标Anthropic Claude系列,主打性价比;GPT-6 Sol输入每百万token 2美元、Luna仅 0.10 美元,但独立分析显示智能得分与GPT-5.6持平,部分知识工作评测出现回退。

AI解读:OpenAI这次发布GPT-6 Sol和Luna,真正的卖点是价格腰斩,不是模型变聪明。GPT-6 Sol输入每百万token从 4 美元降到 2 美元,输出从 20 美元降到 10 美元;Luna输入只要 0.10 美元,输出 0.50 美元。OpenAI把降价归因于缓存和推理改进,并说把节省直接让给了用户。

独立评测机构Artificial Analysis的结论很直接:每次任务成本大约减半,但智能得分还停在GPT-5.6的水平,有的评测涨一点,有的反而退步。比如在GDPval-AA v2.1这个覆盖 44 个职业领域的知识工作基准上,Sol掉了约 100 个Elo分,Luna掉了约 75 分,人工检查发现主要是呈现质量下降和结果不完整。

两款模型的分工很清楚:Sol用来做重复性的复杂任务,比如建新功能、审代码、调试、分析数据;Luna用来低成本处理大量定义明确的任务,比如摘要、信息提取、短问答。对天天跑批量任务的开发者来说,Luna的报价确实进入了便宜开源权重模型的价格区间,但前提是任务定义得足够清楚。

OpenAI这次几乎是把定价当成了主要竞争手段,对标Anthropic的Claude系列。在OSWorld 2.0计算机操作测试上,OpenAI称GPT-6能达到接近Claude Opus 5的效果,成本低约 80%;在AutomationBench上,最高推理档的GPT-6 Sol据称超过最高档的Opus 5,单任务成本只有对方的 9%。这些数字都来自OpenAI自己的说法,独立第三方还没有给出对应的复现结果。

问题也出在这里:连OpenAI自己的模型之间都开始打架。在DeepSWE v1.1上,Luna最高档跑出的分数和Sol的xhigh档一样,但成本低 78%;Sol拉到最高档只比Luna高 2.2 个百分点。

另外OpenAI这次没有给出GDPval和Terminal-Bench 4.0等常用基准的结果,而Anthropic的Opus 5.5据称比Opus 5便宜最多 40% 且性能更好。对开发者来说,真正要花的功夫不是选哪个模型强,而是算清楚哪个档位在自己的任务上性价比最高——这个复杂度,OpenAI自己贡献了很大一部分。

OpenAI推出GPT-6 Sol和Luna两款模型,性能与前代GPT-5.6 Sol和Luna大致持平,token价格减半。GPT-6 Sol为每百万输入token 2美元、每百万输出token 10美元;Luna为每百万输入token 0.10美元、每百万输出token 0.50美元。

OpenAI将降价归因于缓存和推理层面的改进,并表示把节省直接传递给用户。原先产品线中最便宜的Terra已不再提供。

除token降价外,OpenAI称GPT-6的提示缓存已改进,缓存输入token可享受 90% 折扣,并新增提示缓存仪表盘和诊断工具,帮助开发者优化缓存使用。开发者现在可以在不使缓存失效的情况下调整推理强度(reasoning effort)和工具可用性。

发布时,两款模型在ChatGPT Work和Codex中面向Plus、Pro、Business、Enterprise和Edu订阅用户提供;免费用户和Go用户可通过桌面应用访问Luna,但两款模型初期都不在常规聊天中提供。API中模型名为gpt-6-sol和gpt-6-luna,ChatGPT内的访问正逐步推送。

OpenAI在基准测试中主打与Claude的性价比对比

OpenAI主要围绕性价比来定位这两款新模型,对比对象是Anthropic的Claude系列。在测试计算机操作的OSWorld 2.0上,OpenAI称GPT-6取得与Claude Opus 5相近的结果,成本低约 80%,不过Astra在该类别仍领先。

在覆盖 47 个工具的业务流程测试AutomationBench上,OpenAI称GPT-6 Sol在最高推理强度下超过最高强度的Claude Opus 5,Sol的单任务成本仅为Opus的 9%。Luna相比前代提升 5.4 个百分点,成本低 58%。

编码基准:Sol接近Claude Fable 5.1,但价格低得多

在FrontierCode 1.1上,该基准衡量AI智能体产出的代码是否真能并入现有代码库,检查测试质量、代码风格和需求符合度,GPT-6 Sol在最高强度下得分 49.3%,单任务成本 2.14 美元,与Claude Fable 5.1在最高强度下的 50.3% 大致相当,但后者单任务成本为 12.83 美元,是前者的约六倍。Claude Opus 5在中等强度下达到 53.4%,成本 4.31 美元,这是它在该测试上表现最好的设置。

在面向真实代码库中长时间高难度软件工程任务的DeepSWE v1.1上,OpenAI报告GPT-6 Sol最高强度下得分 68.8%,与Claude Fable 5在xhigh档的最佳成绩 69.9% 相差 1.1 个百分点;Fable在max档为 69.7%,单任务成本 21.63 美元。OpenAI自己的GPT-5.6 Sol得分 72.7%,成本 6.46 美元;Claude Opus 5最高强度下得分 73.7%,成本 11.84 美元。

  • GPT-6 Sol在xhigh档得分 66.6%,单任务成本 1.00 美元;Luna在最高强度下达到相同分数,成本仅 0.22 美元。
  • OpenAI称Luna的结果与中等强度的Claude Opus 5和Claude Fable 5相当,成本比Opus低 93%、比Fable低 96%。
  • 在DeepSWE结果中,Luna最高强度与Sol的xhigh档分数相同,但成本低 78%;Sol拉到最高强度为 68.8%,仅比Luna高 2.2 个百分点。

独立分析:智能得分未提升,部分知识工作评测回退

Artificial Analysis的分析显示,GPT-6 Sol和Luna相比前代将单任务成本减半,但智能得分维持GPT-5.6水平,一些评测有提升,另一些则出现回退。在编码智能体指数上,Sol提升 2 分,Luna下降 2 分。在Artificial Analysis智能指数上,GPT-6 Sol从前代 47 分升至 48 分,Luna保持 37 分。

Artificial Analysis还发现两个关键知识工作基准出现回退:在覆盖 44 个专业领域的计算机知识工作测试GDPval-AA v2.1上,Sol下降约 100 个Elo分,Luna下降约 75 分。人工检查将回退主要归因于呈现质量下降和结果不完整。该机构此前也曾因使用过时基准给OpenAI的Astra评分偏低而受到批评,之后进行了两次基准更新,Astra重回榜首。

基准选择的争议

文章指出OpenAI的基准选择看起来有挑选痕迹,GDPval知识工作和Terminal-Bench 4.0智能体编码等常见项目未出现。OpenAI似乎也错过了Opus 5.5的发布,该模型可能比Opus 5便宜最多 40%,且性能显著更好。

信息来源

The Decoder AI原始来源