研究Artificial Analysis·原文 2026年9月30日本站收录 2026年10月1日

Upstage发布Solar Mini 4:智能指数 24 分,单任务成本约为GPT-6 Luna的 5 倍

韩国AI实验室Upstage推出专有推理模型Solar Mini 4,官方称 35B总参数、3B激活参数,每百万token价格降至 0.10/0.40 美元,但Artificial Analysis测得它完成一个智能指数任务平均耗时 7.1 分钟、成本约 0.36 美元。

AI解读:Upstage发布Solar Mini 4,官方称它用 35B总参数、3B激活参数拿到Artificial Analysis智能指数 24 分,比上一代旗舰Solar Pro 3的 8 分高 16 分,同时把每百万输入/输出token价格降到 0.10/0.40 美元,只有原来三分之一。对想用低激活参数换推理能力的团队来说,这个价位和参数规模是主要卖点。

但Artificial Analysis的测试显示,价格表便宜不等于账单便宜。Solar Mini 4完成一个智能指数任务平均约 0.36 美元,因为每个任务要吐 88k输出token,其中 72k是推理token;GPT-6 Luna (max) 同样任务只要约 0.07 美元。

原因是缓存命中率低:Solar Mini 4的重复上下文只有 48% 走缓存,GPT-6 Luna是 99%,而Terminal-Bench 4.0、AA-Briefcase这类agent任务每轮都会重发对话。

参数规模的优势也比较脆弱。Artificial Analysis指出,Solar Mini 4是专有模型、权重不公开,35B/3B的规模无法独立核实;同为 3B激活参数的Qwen3.6 35B A3B (Reasoning) 得 18 分,4B激活的K2 Horizon MoVA 36B A4B得 25 分。也就是说,这个“帕累托最优点”目前只在Upstage自报的数字上成立。

模型的特点很偏科:长上下文推理是相对强项,AA-LCR v1.1得 83%,与MiniMax-M3、GPT-6 Luna (max) 持平,高于Gemini 3.8 Flash (high) 和GPT-6 Astra (max) 的 81%;SciCode得 48%,略高于MiniMax-M3和Inkling (xhigh) 的 47%。

但agentic coding是弱项,Terminal-Bench 4.0得 1%,AutomationBench-AA得 22%。

知识类任务也不适合它。AA-Omniscience得 -11,正确率 18%,约一半问题选择不作答;好处是不幻觉率 64%,远高于Inkling (xhigh) 的 32% 和GPT-6 Luna (max) 的 23%。如果你的场景更怕胡编而不是怕不回答,这个取舍有意义;如果要求它直接给出正确答案,18% 的正确率很难支撑生产使用。

对选型的人来说,结论取决于任务形态:长上下文、需要模型“不确定就闭嘴”的场景可以关注;高频agent调用或需要精确知识问答的场景,按Artificial Analysis的实测成本与分数,它目前不是划算的选择。

韩国AI实验室Upstage发布专有推理模型Solar Mini 4。据Artificial Analysis报道,它在Artificial Analysis智能指数上得分 24,比Upstage上一代旗舰Solar Pro 3的 8 分高 16 分。

Upstage报告该模型为 35B总参数、3B激活参数,并将每百万输入/输出token价格降至 0.10/0.40 美元,比此前降低三分之一;缓存命中token价格为每百万 0.01 美元。模型上下文窗口 1M token,最大输出 262k token,知识截止日期 2026 年 2 月,仅支持文本输入输出,权重不公开。

Artificial Analysis的测试显示,Solar Mini 4完成一个智能指数任务平均花费约 0.36 美元,是GPT-6 Luna (max) 约 0.07 美元的约 5 倍,尽管两者的每token价格相近。其中未命中缓存的输入占 0.30 美元,推理与答案token仅约 0.04 美元。

成本差距主要来自缓存命中率:Artificial Analysis测得Solar Mini 4的重复上下文有 48% 由缓存提供,而GPT-6 Luna (max) 为 99%。Terminal-Bench 4.0和AA-Briefcase等agent任务每轮都会重发不断增长的对话,缓存命中率对成本影响很大。

按激活参数算分,但规模无法独立核实

Artificial Analysis称,Solar Mini 4在其报告的 3B激活参数规模上创下智能指数相对激活参数的新帕累托最优点。它比同样为 3B激活参数的Qwen3.6 35B A3B (Reasoning) 高 6 分,后者得 18 分;比 55B激活参数的Nemotron 3 Ultra高 1 分。

但Solar Mini 4是专有模型,权重不公开,因此其参数规模无法被独立核实。Artificial Analysis同时列出,4B激活参数的K2 Horizon MoVA 36B A4B得 25 分,Upstage上一代旗舰Solar Pro 3为 12B激活参数、得 8 分。

长上下文推理较强,agent编码是短板

在Artificial Analysis的测试中,长上下文推理是Solar Mini 4的相对强项:AA-LCR v1.1得 83%,与MiniMax-M3和GPT-6 Luna (max) 持平,高于Gemini 3.8 Flash (high) 和GPT-6 Astra (max) 的 81%。SciCode得 48%,高于MiniMax-M3和Inkling (xhigh) 的 47%。

agentic coding则是相对弱项:Terminal-Bench 4.0仅得 1%,AutomationBench-AA得 22%。在agentic知识工作上,GDPval-AA得 1072 Elo,AA-Briefcase得 872 Elo,接近Inkling (xhigh)。

输出快但任务慢,知识正确率低、不幻觉率较高

Solar Mini 4在发布日的生成速度为 208 token/s,快于GPT-6 Luna (max) 的 152 token/s。但它在每个智能指数任务上使用 88k输出token,其中 72k为推理token,因此平均每个任务解码耗时 7.1 分钟;GPT-6 Luna (max) 为 5.8 分钟,Inkling (xhigh) 为 2.8 分钟。Artificial Analysis指出,其输出token用量约为Inkling (xhigh) 的 2.5 倍、Gemini 3.5 Flash-Lite的 5 倍,而后两者智能指数分别为 25 和 22。

在AA-Omniscience上,Solar Mini 4得 -11,反映的是知识正确率低而非不幻觉率低:它正确回答 18% 的问题,约一半问题选择不作答。其不幻觉率为 64%,高于Inkling (xhigh) 的 32% 和GPT-6 Luna (max) 的 23%。

信息来源