Epoch AI测得GPT-5.6长上下文延迟呈二次增长,Claude 5接近线性
同一套Student-t、随机前沿和spike-plus-contention三种估计器下,GPT-5.6 Terra、Sol的首token时间随上下文变长出现明显上弯,Claude Sonnet 5、Opus 5的拟合线接近线性;Epoch AI称这指向两家在长上下文处理架构上的不同取舍。
AI解读:Epoch AI用同一套方法测了四个模型的首token时间(TTFT):GPT-5.6 Terra、GPT-5.6 Sol、Claude Sonnet 5、Claude Opus 5。结果是两组曲线形状明显不同——GPT两个模型随上下文变长出现上弯,符合二次项显著;Sonnet 5接近线性,Opus 5数据更嘈杂但也接近线性。
这条新闻有用的地方在于:如果你要跑长上下文任务,两家模型“能塞多少token”和“塞进去之后要多等多久”是两回事。GPT-5.6支持 105 万token,但超过 27.2 万token的请求输入和缓存输入按双倍计费、输出按 1.5 倍计费;Claude则不论输入多长价格不变。
Epoch AI的解释是架构选择差异:全注意力下注意力计算随上下文长度二次增长,Claude的近似线性说明二次部分占比远小于GPT,可能用了线性注意力或稀疏注意力类方案。这是依据曲线形状做的推断,不是两家公司公布的架构细节。
对普通读者来说不需要立刻做什么。真正相关的是把超长上下文当卖点的开发者:能否用满一百万token,取决于延迟和账单,而不是参数表上的上限。
Epoch AI测量了四个前沿模型在长上下文下的首token时间(TTFT)随上下文长度的变化,发现OpenAI的GPT-5.6 Terra和Sol呈现出明显的上弯曲线,而Anthropic的Claude Sonnet 5和Opus 5的拟合线接近线性。该结果发布在Epoch AI的出版物页面上。
测量时推理功能被禁用。Epoch AI对所有四个数据集使用同一个二次曲线设定,并为每个模型拟合曲线。其结论是:对GPT-5.6来说,上下文越长,每增加同样数量的token,TTFT的增量越大;而Claude的增量更接近恒定。
三种估计器下GPT上弯、Claude接近线性
Epoch AI称TTFT基准测试本身噪声较大,尤其是Opus。其工作假设是,噪声很大一部分来自排队和路由等更高层的服务延迟,而非模型执行本身。为检验结果对噪声处理的稳健性,Epoch AI用了三种估计器:Student-t回归、随机前沿回归,以及spike-plus-contention混合模型。
三种估计器对延迟噪声的假设不同,拟合出的曲线高度也不必然一致,Epoch AI称关键检验是它们是否在随上下文长度的关系形状上一致。结果是:Terra和Sol在三种估计器下都呈现相似的上弯;Sonnet在三者下都接近线性;Opus噪声更大、估计器分歧更大,但三者仍显示极小的曲率。
Epoch AI用 ΔAICc比较二次与线性模型(定义为AICc_linear − AICc_quadratic,正值支持二次模型):Terra为 75.50,Sol为 37.29;Sonnet为 −2.65,Opus为 −2.90。Huber 95% 的 γ 区间中,Terra为 [6.82, 9.12],Sol为 [8.97, 13.04];Sonnet为 [−1.22, 1.29],Opus为 [−6.30, 9.70]。Epoch AI称Terra和Sol的结果强烈支持正曲率,Sonnet在两个非对称点估计中都落在零曲率边界上,Opus仍不确定。
两家定价与Codex默认上下文的差异
Epoch AI指出,两家的长提示定价方式很不一样。GPT-5.6系列模型最大上下文为 105 万token,Claude模型最大为 100 万token。但对OpenAI模型超过 27.2 万输入token的请求,输入和缓存输入按正常价格的两倍计费、输出按 1.5 倍计费;Claude模型则不论输入长度价格固定。Epoch AI明确说明,定价不一定反映底层推理成本,这一差异只是促使他们去测试延迟扩展是否也不同。
文中还提到一个具体对照:Claude Code中所有Claude 5代模型默认支持 100 万token上下文窗口;而GPT-5.6系列虽然支持 105 万token,Codex会在 27.2 万token之前默认自动压缩。Epoch AI称OpenAI把避免上下文膨胀描述为Codex的关键设计目标,并有OpenAI高层员工公开表示,尽管官方支持最高 105 万token,他们不建议提高Codex默认的 27.2 万token上下文窗口。
Epoch AI用Opus 5定价做的算例
Epoch AI用Anthropic的Opus 5 API定价举了一个示例:10 万token上下文、其中 1000 个新输入token和 1000 个输出token。按缓存输入 100k × $0.50/百万token计 0.05 美元,输入(5 分钟缓存写入)1k × $6.25/百万token计 0.00625 美元,输出 1k × $25.00/百万token计 0.025 美元,合计 0.08125 美元。
Epoch AI称,若上下文改为 90 万token,仅缓存输入一项就要 0.45 美元。如果缓存输入价格翻倍(如GPT-5.6模型那样),从 10 万增加到 90 万token上下文时,缓存输入成本会上升 18 倍而非 9 倍。Epoch AI因此指出:Claude单价不变,但上下文增长仍带来显著成本增长;Codex则在 27.2 万token阈值前默认自动压缩,把上下文规模控制住、压低成本。Epoch AI称,可能的一种解释是OpenAI在赌 100 万token上下文常常没必要,或成本节省抵消了更短上下文带来的性能损失。
Epoch AI对架构差异的推断
Epoch AI称这一结果表明,两家模型在处理长上下文时做出了非常不同的架构选择。传统transformer全注意力层中,每个token关注全部前序token,因此处理提示的注意力总计算量随提示长度二次增长。Epoch AI提到已有多个开放模型家族转向更高效的长上下文扩展方式:Kimi K3、Qwen3.5等混合模型按 3:1 比例混合线性注意力层与少量全注意力层;Qwen3.8-Flash-Next和GLM-5.3-Flash进一步用稀疏注意力替换全注意力层;滑窗注意力则出现在OpenAI开源的gpt-oss模型中。
Epoch AI的推断是,至少在其评估的模型上,Anthropic也走了类似方向,Sonnet和Opus的二次曲率都远小于GPT模型。Epoch AI称这与Claude Code中Claude 5代模型默认支持 100 万token上下文窗口的事实一致。Epoch AI同时说明,其使用的估计器针对的底层延迟概念略有不同,拟合的水平高度不必一致,相关检验只是曲线形状。
Epoch AI在文中给出一处限制说明:测量本身没有做缓存与不缓存的深度对比,采用共享前缀是为了固定缓存身份;其假设噪声下降可能反映更窄的服务队列或更稳定的路由,例如缓存亲和性可能让所有请求路由到同一数据中心或工作引擎,但现有文档不足以就此做具体结论。
来源摘要还提到末尾出现“G. GPT-6 Astra”的测量标题,但正文内容在“Astra’s TTFT scalin”处截断,未给出可引用结果。