模型The Decoder AI·原文 2026年10月6日

Reflection发布首个开放权重模型Beam:激活 5010 亿参数中的 230 亿,主打低算力

Reflection称Beam在推理任务上与GLM 5.2持平,算力消耗为其三到四分之一;在编程与智能体基准上接近规模更大的Qwen3.8-Max。模型权重将在“本月晚些时候”以Apache 2.0许可发布,目前早期版本仅向部分用户开放。

AI解读:Reflection同时承认,Kimi K3等更强的开放模型在原始性能上仍优于Beam。

Beam的能力来自大规模预训练加一段高算力强化学习:Reflection称该阶段动用 10500 块Nvidia GB300 GPU、持续超过四周,并称这是开放实验室中规模最大的训练之一;性能在超过 8000 万次rollout后仍未出现平台期。

模型提供可调推理深度参数,用户可在快速作答与多花时间思考之间取舍;Reflection称按生成token数衡量,Beam在相近性能水平上比GLM-5.2和Qwen 3.8更高效。

安全与对齐由单独训练的第二个模型与Beam合并完成,准则涵盖不可违反的硬性规则与事实准确性、承认不确定性等质量标准。Reflection计划发布安全测试结果,并开源其评估方法。

Beam目前为纯文本模型,Reflection称只要其他媒体格式以文本表示即可处理;技术报告、开发者文档与Apache 2.0许可的模型权重预计本月晚些时候发布,模型仍在最终安全测试中,早期版本仅向部分用户开放。

Reflection发布首个开放权重模型Beam,称其在推理任务上与GLM 5.2持平,算力消耗仅为后者的三到四分之一。

Beam是什么:5010 亿总参数、每token激活 230 亿

Reflection将Beam定位为面向编程、逻辑推理与智能体任务的混合专家模型。该模型每token激活 5010 亿总参数中的 230 亿,公司称这一设计使算力成本相对较低。

Reflection表示Beam瞄准的是将AI用于编程和自动化工作流、但需要控制运营成本的企业。公司称已在训练后续模型,目标是缩小与顶级开放模型之间的剩余差距。

Beam目前是纯文本模型。Reflection称,只要其他媒体格式的内容以文本形式表示,Beam也能处理。

  • 总参数 5010 亿,每token激活 230 亿
  • 面向编程、逻辑推理、智能体任务
  • 纯文本模型,可处理以文本表示的其他媒体内容
  • Reflection称已在训练后续模型以追赶顶级开放模型

性能与算力:与GLM 5.2持平,算力用量为其三到四分之一

Reflection称,在要求较高的推理任务上Beam与GLM 5.2得分相当,但算力用量为其三到四分之一;在编程与智能体基准上,Beam接近规模大得多的Qwen3.8-Max。

公司同时承认,Kimi K3等更强的开放模型在原始性能上仍优于Beam。Reflection称,在三项基准上Beam与GLM-5.2、Qwen 3.8得分相当,但算力消耗远低于后两者。

按生成token数衡量,Reflection称Beam在相近性能水平上比GLM-5.2和Qwen 3.8更高效。上述对比均出自Reflection的说法,非第三方独立验证。

  • Reflection称推理任务与GLM 5.2持平,算力用量为其三到四分之一
  • 编程与智能体基准接近Qwen3.8-Max
  • 公司承认Kimi K3等更强开放模型在原始性能上仍胜出
  • 按生成token数衡量,Beam在相近性能下比GLM-5.2、Qwen 3.8更高效

训练:10500 块GB300跑四周强化学习,未见平台期

Reflection称,Beam的能力来自标准大规模预训练与一段算力密集的强化学习阶段。公司表示,该强化学习阶段动用 10500 块Nvidia GB300 GPU、持续超过四周,并称这是任何开放实验室做过的最大规模训练之一。

据Reflection,性能在整个训练过程持续提升,直到训练结束时仍未触及上限;基准分数在强化学习期间持续上升,即便超过 8000 万次rollout也没有平台期迹象。

公司在推理、软件工程和终端任务的强化学习组合中观察到其所称的“涌现能力”:Beam在未包含浏览任务的训练组合下,网页浏览能力有所提升。Reflection称,在具备网络访问时,模型自行学会查询其他语言模型并从外部服务拉取文档。

Reflection展示了数个演示,包括实时更新的纽约市地铁地图、一个小型 3D游戏,以及用于微调另一个AI模型的notebook。

  • 强化学习阶段使用 10500 块Nvidia GB300 GPU,持续超过四周
  • Reflection称性能到训练结束仍在提升,8000 万次rollout后未见平台期
  • 未训练浏览任务的情况下网页浏览能力提升,Reflection称之为“涌现能力”
  • 演示包括实时纽约地铁地图、小型 3D游戏和微调其他模型的notebook

使用方式与安全:可调推理深度,单独训练对齐模型

用户可以通过一个可调参数控制Beam的推理深度,在快速作答与对更难任务投入更多思考时间之间选择,从而在算力成本与输出质量之间取舍。

在安全与对齐方面,Reflection单独训练了一个模型并与Beam合并。准则范围从模型绝不可违反的硬性规则,到事实准确性、承认不确定性等质量标准,以及直接、详尽、主动的回应风格。

公司计划在技术报告中发布安全测试结果,并开源其开发的评估方法。技术报告、开发者文档和Apache 2.0许可的模型权重按计划于“本月晚些时候”发布。

  • 可调参数控制推理深度,在算力成本与输出质量之间取舍
  • 安全对齐由单独训练的第二个模型与Beam合并完成
  • 准则含硬性规则、事实准确性、承认不确定性等质量标准
  • 计划发布安全测试结果并开源评估方法
  • 技术报告、文档与权重按计划本月晚些时候发布

发布状态与公司背景

Beam仍在进行最终安全测试,早期版本目前仅向部分用户开放。Reflection称其将发布模型权重,但训练数据和流程保持专有。

Reflection由前Google Deepmind研究人员Misha Laskin和Ioannis Antonoglou于 2024 年创立。Laskin曾负责Gemini的奖励建模,Antonoglou曾参与构建AlphaGo。

该公司于 2025 年 3 月以 1.3 亿美元种子轮融资启动,目标是通过自主编程构建超级智能。2025 年夏天,公司发布用于分析大型代码库的智能体Asimov。2025 年 10 月,Reflection以 80 亿美元估值融资 20 亿美元,投资方包括Nvidia。

此前,Reflection还与SpaceX及云服务商Nebius签署了价值数十亿美元的算力协议。

  • Beam仍在最终安全测试,早期版本仅向部分用户开放
  • 发布权重,训练数据与流程保持专有
  • 2024 年由前Deepmind研究人员Misha Laskin和Ioannis Antonoglou创立
  • 2025 年 3 月种子轮 1.3 亿美元;2025 年 10 月以 80 亿美元估值融资 20 亿美元,Nvidia参投
  • 与SpaceX、Nebius签署数十亿美元算力协议

信息来源

The Decoder AI原始来源