Reflection发布首个开放权重模型Beam:激活 5010 亿参数中的 230 亿,主打低算力
Reflection称Beam在推理任务上与GLM 5.2持平,算力消耗为其三到四分之一;在编程与智能体基准上接近规模更大的Qwen3.8-Max。模型权重将在“本月晚些时候”以Apache 2.0许可发布,目前早期版本仅向部分用户开放。
AI解读:Reflection同时承认,Kimi K3等更强的开放模型在原始性能上仍优于Beam。
Beam的能力来自大规模预训练加一段高算力强化学习:Reflection称该阶段动用 10500 块Nvidia GB300 GPU、持续超过四周,并称这是开放实验室中规模最大的训练之一;性能在超过 8000 万次rollout后仍未出现平台期。
模型提供可调推理深度参数,用户可在快速作答与多花时间思考之间取舍;Reflection称按生成token数衡量,Beam在相近性能水平上比GLM-5.2和Qwen 3.8更高效。
安全与对齐由单独训练的第二个模型与Beam合并完成,准则涵盖不可违反的硬性规则与事实准确性、承认不确定性等质量标准。Reflection计划发布安全测试结果,并开源其评估方法。
Beam目前为纯文本模型,Reflection称只要其他媒体格式以文本表示即可处理;技术报告、开发者文档与Apache 2.0许可的模型权重预计本月晚些时候发布,模型仍在最终安全测试中,早期版本仅向部分用户开放。
Reflection发布首个开放权重模型Beam,称其在推理任务上与GLM 5.2持平,算力消耗仅为后者的三到四分之一。
Beam是什么:5010 亿总参数、每token激活 230 亿
Reflection将Beam定位为面向编程、逻辑推理与智能体任务的混合专家模型。该模型每token激活 5010 亿总参数中的 230 亿,公司称这一设计使算力成本相对较低。
Reflection表示Beam瞄准的是将AI用于编程和自动化工作流、但需要控制运营成本的企业。公司称已在训练后续模型,目标是缩小与顶级开放模型之间的剩余差距。
Beam目前是纯文本模型。Reflection称,只要其他媒体格式的内容以文本形式表示,Beam也能处理。
- 总参数 5010 亿,每token激活 230 亿
- 面向编程、逻辑推理、智能体任务
- 纯文本模型,可处理以文本表示的其他媒体内容
- Reflection称已在训练后续模型以追赶顶级开放模型
性能与算力:与GLM 5.2持平,算力用量为其三到四分之一
Reflection称,在要求较高的推理任务上Beam与GLM 5.2得分相当,但算力用量为其三到四分之一;在编程与智能体基准上,Beam接近规模大得多的Qwen3.8-Max。
公司同时承认,Kimi K3等更强的开放模型在原始性能上仍优于Beam。Reflection称,在三项基准上Beam与GLM-5.2、Qwen 3.8得分相当,但算力消耗远低于后两者。
按生成token数衡量,Reflection称Beam在相近性能水平上比GLM-5.2和Qwen 3.8更高效。上述对比均出自Reflection的说法,非第三方独立验证。
- Reflection称推理任务与GLM 5.2持平,算力用量为其三到四分之一
- 编程与智能体基准接近Qwen3.8-Max
- 公司承认Kimi K3等更强开放模型在原始性能上仍胜出
- 按生成token数衡量,Beam在相近性能下比GLM-5.2、Qwen 3.8更高效
训练:10500 块GB300跑四周强化学习,未见平台期
Reflection称,Beam的能力来自标准大规模预训练与一段算力密集的强化学习阶段。公司表示,该强化学习阶段动用 10500 块Nvidia GB300 GPU、持续超过四周,并称这是任何开放实验室做过的最大规模训练之一。
据Reflection,性能在整个训练过程持续提升,直到训练结束时仍未触及上限;基准分数在强化学习期间持续上升,即便超过 8000 万次rollout也没有平台期迹象。
公司在推理、软件工程和终端任务的强化学习组合中观察到其所称的“涌现能力”:Beam在未包含浏览任务的训练组合下,网页浏览能力有所提升。Reflection称,在具备网络访问时,模型自行学会查询其他语言模型并从外部服务拉取文档。
Reflection展示了数个演示,包括实时更新的纽约市地铁地图、一个小型 3D游戏,以及用于微调另一个AI模型的notebook。
- 强化学习阶段使用 10500 块Nvidia GB300 GPU,持续超过四周
- Reflection称性能到训练结束仍在提升,8000 万次rollout后未见平台期
- 未训练浏览任务的情况下网页浏览能力提升,Reflection称之为“涌现能力”
- 演示包括实时纽约地铁地图、小型 3D游戏和微调其他模型的notebook
使用方式与安全:可调推理深度,单独训练对齐模型
用户可以通过一个可调参数控制Beam的推理深度,在快速作答与对更难任务投入更多思考时间之间选择,从而在算力成本与输出质量之间取舍。
在安全与对齐方面,Reflection单独训练了一个模型并与Beam合并。准则范围从模型绝不可违反的硬性规则,到事实准确性、承认不确定性等质量标准,以及直接、详尽、主动的回应风格。
公司计划在技术报告中发布安全测试结果,并开源其开发的评估方法。技术报告、开发者文档和Apache 2.0许可的模型权重按计划于“本月晚些时候”发布。
- 可调参数控制推理深度,在算力成本与输出质量之间取舍
- 安全对齐由单独训练的第二个模型与Beam合并完成
- 准则含硬性规则、事实准确性、承认不确定性等质量标准
- 计划发布安全测试结果并开源评估方法
- 技术报告、文档与权重按计划本月晚些时候发布
发布状态与公司背景
Beam仍在进行最终安全测试,早期版本目前仅向部分用户开放。Reflection称其将发布模型权重,但训练数据和流程保持专有。
Reflection由前Google Deepmind研究人员Misha Laskin和Ioannis Antonoglou于 2024 年创立。Laskin曾负责Gemini的奖励建模,Antonoglou曾参与构建AlphaGo。
该公司于 2025 年 3 月以 1.3 亿美元种子轮融资启动,目标是通过自主编程构建超级智能。2025 年夏天,公司发布用于分析大型代码库的智能体Asimov。2025 年 10 月,Reflection以 80 亿美元估值融资 20 亿美元,投资方包括Nvidia。
此前,Reflection还与SpaceX及云服务商Nebius签署了价值数十亿美元的算力协议。
- Beam仍在最终安全测试,早期版本仅向部分用户开放
- 发布权重,训练数据与流程保持专有
- 2024 年由前Deepmind研究人员Misha Laskin和Ioannis Antonoglou创立
- 2025 年 3 月种子轮 1.3 亿美元;2025 年 10 月以 80 亿美元估值融资 20 亿美元,Nvidia参投
- 与SpaceX、Nebius签署数十亿美元算力协议