模型Artificial Analysis·原文 2026年9月22日本站收录 2026年9月23日

GPT-6 Sol与Luna发布:价格减半,编码与知识任务表现互有胜负

Artificial Analysis的评测显示,GPT-6 Sol每任务成本降至约 1.06 美元、Luna降至 0.07 美元,但两款模型在GDPval-AA v2.1等知识工作评测中出现退步,Sol在AI评测中因更频繁拒答而降低了幻觉率。

Artificial Analysis发布了对GPT-6 Sol和GPT-6 Luna的评测:两款模型价格约为GPT-5.6对应型号的一半,智能指数和编码代理指数与上一代基本持平,在部分评测中进步、在另一些评测中退步。

价格方面,GPT-6 Sol从GPT-5.6 Sol的每百万输入/输出token 4美元/20 美元降至 2 美元/10 美元;GPT-6 Luna从 0.20 美元/1.20 美元降至 0.10 美元/0.50 美元。缓存读取继续享受 90% 折扣,缓存写入继续加收 25% 溢价。

按Artificial Analysis的计算,每任务成本几乎减半:GPT-6 Sol(max档)运行智能指数每任务约 1.06 美元,比GPT-5.6 Sol(max)的 1.99 美元低约 50%;GPT-6 Luna(max)每任务约 0.07 美元,比GPT-5.6 Luna(max)的 0.18 美元低约 60%。评测指出,这一下降由降价驱动,因为两款模型每任务使用的输出token反而略多——Sol为 31k对 29k,Luna为 51k对 41k。

编码代理评测:Sol提升 2 分,Luna退步 2 分

在OpenAI的Codex环境中,GPT-6 Sol(max)在Artificial Analysis Coding Agent Index得 57 分,比GPT-5.6 Sol(max)高 2 分,Terminal-Bench 4.0从 37% 升至 43%,SWE-Atlas-QnA从 54% 升至 58%。其每任务成本约 2.99 美元,比上一代低约 50%,处于Coding Agent Index与每任务成本帕累托前沿上。

GPT-6 Luna(max)在该指数得 41 分,比GPT-5.6 Luna(max)低 2 分,SWE-Atlas-QnA从 49% 降至 44%,DeepSWE v1.1从 66% 降至 64%,但每任务成本低约 60%。

幻觉率下降,但Sol以更频繁拒答为代价

在知识与幻觉基准AA-Omniscience上,两款模型幻觉均减少。GPT-6 Sol(max)的幻觉率从 92% 降至 60%,GPT-6 Luna(max)从 93% 降至 77%。

Sol的下降主要来自更频繁地拒绝回答:它只尝试回答 83% 的问题,而GPT-5.6 Sol(max)为 99%,这使错误答案减少约四分之一,但准确率也从 59% 降至 54%。Luna准确率基本持平,为 44% 对 43%,同时回答更少问题。AA-Omniscience指数上,Sol从 22 升至 27,Luna从 -10 升至 1。

其他评测:自动化与终端任务改善,知识工作退步

除AA-Omniscience外,两款模型在AutomationBench-AA(Sol 62% 对 60%,Luna 53% 对 50%)和Terminal-Bench 4.0(Sol 44% 对 40%,Luna 13% 对 12%)上均有改善。

但Artificial Analysis在两个关键知识工作评测中观察到退步。在基于OpenAI数据集、覆盖 44 个职业经济价值任务的GDPval-AA v2.1中,Sol下降约 100 Elo,Luna下降约 75 Elo。Luna在AA-Briefcase v1.1中下降约 45 Elo,Sol持平。AA-Briefcase v1.1是覆盖多周知识工作项目、包含数千个输入文件的非公开评测。

评测方表示,其团队人工检查了数百个模型输出,退步主要源于展示质量下降,以及交付物遗漏了评分标准中的要素。在max档下,两款模型在GDPval-AA v2.1的退步均由交付物更短、更常省略必需元素驱动。

信息来源