今日分析

AI 新闻里的变化、生意与判断。

013模型价格 / Agent 成本

GPT-6 Luna 每百万输入 0.1 美元,模型价格战开始算“每个任务”

OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格相较 GPT-5.6 促销价下降 50%,并把提示词缓存折扣和诊断工具一起推给开发者。模型更便宜,是否会让 Agent 工作流从“偶尔调用”变成“反复运行”,要看每个任务的总成本。

AI 生成示意图、非事件现场、非产品界面:根据 OpenAI 官方公布的 API 价格、缓存折扣和官方评测数据绘制;图中数字均来自来源,非独立复测。
点击图片放大
01

价格先砍半,Luna 直接进入低价位

OpenAI 9 月 22 日发布 GPT-6 Sol 和 GPT-6 Luna。按官方给出的对照价,GPT-6 Sol 的输入价格从每百万 token 4 美元降到 2 美元,输出从 20 美元降到 10 美元;GPT-6 Luna 的输入从 0.20 美元降到 0.10 美元,输出从 1.20 美元降到 0.50 美元。这里比较的是 GPT-5.6 的促销价,不能直接当成所有历史账单的普遍降幅。

Luna 的定位很明确:让更多请求可以持续跑起来。写摘要、整理资料、改代码这类任务,单次调用本来就不贵,成本常常出在反复试、调用工具和失败重跑。

02

OpenAI 想解决的是“长任务成本”

这次更新还配套改了提示词缓存。OpenAI 称,缓存输入读取最高可享 90% 折扣;即使调整推理强度或工具可用性,也能尽量保留已有缓存。对一个要反复读同一份资料、持续调用工具的 Agent 来说,省下的可能比单次 token 降价更多。

OpenAI 还引用 GitHub 的内部数据称,数十亿次请求中,新的处理量占比降了超过一半。这个数字来自合作方的内部披露,说明缓存有用,不能直接换算成所有团队都会少一半账单。缓存命中率、上下文大小和任务写法都会影响结果。

03

官方评测很亮眼,边界也写在页面上

OpenAI 在 AutomationBench 上给出的结果是:GPT-6 Sol 使用 xhigh 推理时得分 33.2%,平均每个任务成本 0.27 美元;GPT-6 Luna 在 DeepSWE 软件工程评测中得分 66.6%。官方还称,Sol 的单任务成本比 GPT-5.6 低约 80%,Luna 比 Claude Opus 5 低约 93%。

这些结果来自 OpenAI 的测试环境和公开报告,页面也注明生产环境的 API 和评测条件可能不同。AutomationBench 的竞品设置、失败重跑和人工复核方式,决定了 0.27 美元能不能在外部重现。看数字时,先看任务定义和账单口径。

04

以后算账,别只看每百万 token

低价模型会让“多试几次”变得便宜,Agent 也更可能在一个任务里反复查资料、改结果、跑工具。于是账单要同时记四项:缓存命中率、工具调用次数、失败重跑次数,还有最后需要多少人工检查。只看输入和输出单价,很容易低估长任务的总支出。

对普通团队,先拿一项已有工作做完整记录:同一任务跑几轮、每轮用了多少上下文、哪一步需要人接手。跑完再比较 GPT-6 Sol、Luna 和现有模型的总成本。价格降了,流程写得乱,账单照样会膨胀。

未来 3—6 个月 · 待核查问题

接下来怎么看

未来几个月,模型供应商会继续把“每百万 token 价格”往下压,公开比较会逐渐转向每个可交付任务的成本。OpenAI 目前给了少量 AutomationBench 账,但还没有给出不同缓存命中率、工具调用次数和失败重跑下的完整账本。

持续检查:同一任务的完整成本是否包含缓存、工具和重跑;外部团队能否复现 0.27 美元每任务;价格下降是否带来更长的 Agent 运行,而不只是让 API 账单变小。

往期分析

小米这次开源的,已经不只是模型权重

开源模型的竞争开始往后移:权重只是起点,任务环境、奖励评估和训练工具决定别人能不能继续把模型做强。小米这次把一部分训练机器放出来,价值比再报一个榜单名次更大。

Qwen 把生图、修图和透明图塞进一个 7B 模型

Qwen-Image-2.1 的变化在素材环节:生成一张图、改一张图、抠出透明主体,可以交给同一个模型处理。它离设计行业被改写还有距离,商用授权和本地运行成本先要算清楚。

审计还没开始,AI先把工具造出来了

AI 在安全审计里的先手,可能是先把缺的工具补齐。工具能复用,审计才会越做越快;只让 Agent 对着代码找漏洞,收益没那么稳定。

GitHub 用 Copilot 重写 83 万行 Rust,重点在于它没让 Agent 一次写完

这次迁移说明,Agent 可以承担大块代码搬运,交付靠的是分片、测试和持续审查。把任务丢给 Agent 等结果,撑不起 83 万行生产代码。

OpenAI 开始公开模型失准,最麻烦的是它会自作主张

OpenAI 这次公开的重点,不在于证明模型已经失控,而在于承认异常行为可能在修复前就该留下记录。对使用 Agent 的团队,任务摘要、工具权限和外部写入都不能只当作普通文本。

Siri AI 终于能替你办事,但中国用户暂时用不了

这次 Siri 更新的分量,在于它开始替用户跨应用办事:读消息、找邮件、看屏幕,再写信、建日程或整理清单。可惜中国首发不在名单里,短期能不能用,先看监管和本地化进度。

小红书开源 Iris,榜单分数要连 Harness 一起看

这次发布最有价值的地方,是把模型和 Harness 拆开报分。做搜索 Agent 时,工具、上下文丢弃、重试和评分器都会改结果;只截一行最高分,信息不完整。

长任务 Agent 会忘事,先别急着换模型

模型窗口再大,也装不下无限的工具结果。能否把旧信息放到可检索的位置,压缩后找回目标,并在出错时继续执行,决定了长任务能不能交付。

GitHub 把营销工作塞进 Issue,Copilot 负责起草,人仍要签字

这篇文章最有用的一点,是把 Copilot 放回流程里看:它起草名称和邮件,Issue、标签、Actions 负责执行,负责人继续签字。流程写不清,换模型也不会自动变好。

Claude 被用于导弹软件,Anthropic 没有说明何时发现

封禁账号可以停止后续调用,却无法收回已经写出的代码。判断平台是否及时干预,需要知道首次异常请求、人工调查和封号之间隔了多久。

DeepSeek V4.1 Flash:长任务 Agent 的成本账

缓存压缩降低了长任务的资源负担,能否转化成利润仍取决于复用比例和交付质量。值得优先试点的,是输入重复度高、结果可核验、出错后能恢复的流程。

AI 客服降本 65% 的案例里,真正值得重算的是哪笔账

AI 客服的价值要以问题解决后的总成本衡量。重复咨询减少后,人工会更集中地处理复杂工单;能否减少重复来单、控制错误操作并持续维护业务规则,比自动处理率更影响利润。