英伟达支持的 AI 初创公司 Reflection 公布首个开放权重模型 Beam。该模型采用 MoE 架构,总参数 5010 亿,每次激活 230 亿,主要面向代码、推理和 Agent 任务。
官方公布成绩接近 GLM-5.2
从 Reflection 自己公布的成绩看,Beam 整体表现接近 GLM-5.2,但还没有追上最新的中国头部开源模型。
在 DeepSWE 测试中,Beam 得分 44.4,GLM-5.2 为 44.0,Qwen 3.8-Max 为 51.0,GLM-5.3、Kimi K3 和 DeepSeek V4.1 Flash 分别达到 61.0、68.0 和 74.2。
预训练和强化学习规模较大
Beam 的训练规模也较大。预训练阶段使用 6144 块英伟达 GB300,不到 4 周处理 23.8 万亿 token。随后,Reflection 又用 1.05 万块 GB300 连续进行了 4 周强化学习,生成超过 1 亿条训练轨迹(rollout)。
Reflection 称,这是其所知公开记录中规模最大的强化学习训练之一。
完整权重计划本月晚些时候开放
Beam 目前仍处于最后的安全测试阶段,只有少量用户可以提前使用。Reflection 计划在本月晚些时候发布完整权重、技术报告和模型卡,并以 Apache 2.0 协议开放。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

