开源量子位·原文 2026年9月21日

阶跃星辰发布Step 5 Preview:600B总参数、激活 27B,AA开源榜第二

阶跃星辰推出MoE旗舰基座模型Step 5 Preview,600B总参数、激活参数 27B、1M上下文,在Artificial Analysis评测中取得 44 分,位列全球开源模型第二;百万输入 1 美元、百万输出 2.7 美元。

AI解读:阶跃星辰这次把旗舰基座重新推回第一梯队:Step 5 Preview用 600B总参数的MoE架构,推理时只激活 27B,上下文开到 1M。Artificial Analysis评测 44 分,排在开源模型第二,而拿到相近分数的模型大多是万亿参数级别,这个激活量差距是它定价便宜的底气。

价格是最直接的变化:百万输入token 1美元、百万输出 2.7 美元,按量子位的说法,单个任务成本只有Opus 5的 12.5%,在AA的智能指数与单任务成本权衡图上位于帕累托前沿。对跑Agent长流程、token消耗大的团队来说,这类价格结构比榜单名次更能改变预算表。

技术路线不是单纯堆大。团队采用Narrow but Deep设计,92 层Transformer让信息经过更多层连续变换,配合Sparse MoE、Hybrid Sparse、Sparse GQA做稀疏化,并在底层算子和数据访问上优化,让理论稀疏尽量变成实际吞吐。围绕Agent的训练改成了Loop:规划、执行、调工具、看结果、继续修,靠Long-horizon RL和Context Compaction在几十轮调用后仍记得目标。

实测部分来自量子位作者:用Step 5 Preview操控Blender建模、做 3D游戏,任务耗时一个多小时,模型自己加了VHS质感和脚步声等后期;2D写作网站的审美和完成度被单独表扬。但首轮常有小细节不到位、模块溢出这类bug,要指出两三轮问题后自己修一轮才到可用状态。

这条新闻真正相关的是要接Agent和长上下文的生产团队:能力接近前沿、按token计费便宜、开源可选,代价是仍需人工review和迭代。至于它是否真能在复杂长任务里稳定替掉更贵的模型,来源没有给出公开的长期效果数据,目前的判断只到实测demo这一层。

阶跃星辰发布新一代旗舰基座模型Step 5 Preview:MoE架构,600B总参数、激活参数 27B、1M上下文。

据量子位报道,它在Artificial Analysis评测中取得 44 分,位列全球开源模型第二;报道称其他拿到这一分数的模型大多是万亿参数级别。

定价为百万输入 1 美元、百万输出 2.7 美元,报道称单个任务成本仅为Opus 5的 12.5%,在该榜单的智能指数与单任务成本权衡图上位于帕累托前沿。

27B激活打 44 分,靠的是“窄但深”

Step 5 Preview采用MoE架构,总参数 600B、激活参数 27B,上下文长度 1M。量子位称,它在Artificial Analysis的最新评测中拿到 44 分,直接冲到全球开源Top 2,而其他同分模型大多为万亿参数级别。

团队没有把“越大越好”当作唯一目标,而是采用名为Narrow but Deep的网络设计:92 层Transformer,在控制激活规模的同时让信息经过更多层连续变换。报道解释,这对Agent尤其重要,因为复杂任务常有大量multi-hop依赖,前面搜到的信息要经过很多步之后才真正派上用场,更深的网络给这些信息留下更长的传播和推理路径。

针对Agent的上下文问题,团队做的是稀疏化:Sparse MoE、Hybrid Sparse、Sparse GQA等。报道指出,几十轮工具调用之后上下文可轻松滚到上百万token,如果每一层都把前面所有内容重新扫一遍,计算量会迅速爆炸。

算法层写Sparse不代表GPU真的少干活。报道称,Step 5 Preview在硬件上也做了底层算子和数据访问优化,让理论上的稀疏尽量变成实际吞吐。

围绕Agent,团队把模型的基本单位从“回答”变成“Loop”:规划、执行、调用工具、看结果、发现不对、继续修,然后再Loop。通过Long-horizon RL、Context Compaction等方法,让模型在几十轮工具调用之后还记得自己到底要干嘛。

  • MoE架构,600B总参数,激活参数 27B,1M上下文
  • AA评测 44 分,全球开源Top 2
  • 92 层Transformer,Narrow but Deep设计
  • 稀疏化手段:Sparse MoE、Hybrid Sparse、Sparse GQA
  • 训练围绕Agent Loop:Long-horizon RL、Context Compaction

百万输入 1 美元,单任务成本标到Opus 5的 12.5%

价格是这次发布里另一个被强调的数字:百万输入 1 美元、百万输出 2.7 美元。量子位称这一定价“很有竞争力”,单个任务成本仅为Opus 5的 12.5%,并在AA榜单中位于Intelligence Index与单任务成本权衡的帕累托前沿。

报道还对比了阶跃的路线:从Step 3.5 Flash到Step 3.7 Flash,前两代都聚焦在Flash档位,这次则直接发布旗舰基座,向上杀回全球第一梯队,向下继续优化效率和成本。

  • 百万输入:1 美元;百万输出:2.7 美元
  • 报道称单个任务成本仅为Opus 5的 12.5%
  • 前两代为Step 3.5 Flash、Step 3.7 Flash,均聚焦Flash档位

实测:Blender建后室、搓乐高赛车,写网站不再“东坡肉里塞番茄炒蛋”

量子位作者称其烧了大量token并行跑了多个 3D资产和 3D游戏任务。第一个任务让Step 5 Preview操控Blender建一个后室,模型自己折腾了一个多小时后交付了渲染好的MP4,并自行添加了VHS录像质感、镜头噪点、昏黄灯光,人物走路时还有脚步声。

第二个任务是照着 1999 年的《LEGO Racers》搓一个乐高赛车游戏。报道称成品包含赛道、赛车、人机车手、实时排名,甚至配了发动机音效;问题是赛道修得太窄。

2D任务方面,作者用与阶跃上一代官网Demo类似的Prompt做霓虹跑酷小游戏,结果差距明显:道路两旁加了高楼,视觉层次更完整,Game Over后整个边框会变红,很多Prompt里没写的小细节它自己补上了。

写作网站任务被单独表扬,报道称“终于不往东坡肉里塞番茄炒蛋了”,审美可以、覆盖面全、基本能直接拿来用。

但报道也指出限制:有时会出现模块溢出这类小bug,依然得review、依然要改;第一轮经常有些小细节不到位,离Astra那种程度还有差距。通常需要指出两三轮问题,模型自己修一遍,才能到可用状态。

  • Blender后室任务耗时一个多小时,模型自行添加VHS质感、噪点、灯光和脚步声
  • 乐高赛车游戏包含赛道、赛车、人机车手、实时排名和发动机音效
  • 2D跑酷小游戏会自行补上Prompt未写的细节,如高楼和Game Over红色边框
  • 写作网站被认为基本可直接使用
  • 限制:首轮细节不到位、偶发模块溢出,需指出两三轮问题后自修才可用

信息来源

量子位原始来源