Reflection 发布开源权重模型 Beam:501B 总参数、23B 激活参数

Latent Space3 天前

Reflection 发布开源权重模型 Beam:501B 总参数、23B 激活参数

Reflection 宣布推出 Beam,一款面向代码、智能体和科学工作负载的文本模型。根据公开信息,Beam 是一个 MoE 模型,规模为 501B 总参数、23B 激活参数,从零开始训练,完整权重计划在本月以 Apache 2.0 许可发布。

主要信息

  • 模型形态:文本-only MoE 模型
  • 参数规模:501B 总参数,23B 激活参数
  • 重点方向:代码、智能体任务、科学场景
  • 训练方式:从零开始训练
  • 开源计划:完整权重预计本月发布,许可为 Apache 2.0

训练规模与数据处理

团队公开信息称,Beam 的预训练使用了 23.8T tokens。其中一部分训练数据来自针对数亿份 PDF 的 OCR 处理流程。

在强化学习与 OPD 训练方面,相关团队成员描述称,训练运行在约 10K GB300 上,覆盖约 100 万个任务,产生超过 1 亿次 rollout。

另有公开总结提到,Beam 的预训练和强化学习阶段分别约为四周,使用规模约为 10,500 张 GB300。

官方性能主张

Reflection 对 Beam 给出的部分性能主张包括:

  • SWE-bench Verified:80.9
  • 推理效率为 GLM 5.2 的 3–4 倍
  • 将发布技术报告,并推进开源生态集成

需要注意的是,这些数字来自团队或早期公开总结,仍需等待更完整的技术报告、权重发布以及第三方复现评测。

外部观察与定位

目前外部观察者对 Beam 的定位相对谨慎。一些早期评价认为,Beam 可能是同等智能水平下 token 效率较高的开放模型之一。

也有分析将其性能放在接近 GLM 5.2 的区间,并指出在部分基准上可能仍落后于更新一代模型,例如 GLM 5.3、Kimi K3、Qwen 3.8 Max 和 DeepSeek V4.1 Flash。

从生态角度看,Beam 的意义在于:它是一个由美国团队从零训练、计划开放完整权重的大规模模型。对于希望使用美国训练开放模型的开发者和企业,这提供了新的选择。

相关技术讨论

围绕 Beam 的早期技术讨论主要集中在以下几方面:

  1. 训练效率
    有研究者估计,Beam 预训练阶段的 BF16 MFU 约为 12%。这一估算并非官方最终结论,但反映了外界对其训练效率的关注。

  2. 架构特征
    有分析认为,Beam 可能采用了类似 3:1 交错的全局注意力与滑动窗口注意力结构,并在保留代码集困惑度上表现较好。

  3. 算力对比
    也有人将 Beam 视为对 DeepSeek V3 的近似等 FLOP 复现,并推测其强化学习阶段使用了大规模并行沙盒环境。

这些判断大多来自外部推断,仍应以正式技术报告为准。

同期开放模型动态

Beam 发布前后,开放权重和专用模型领域也出现了多项新进展:

  • Aleph Alpha Kolibri:78B 总参数、3.46B 激活参数,Apache 2.0 许可,面向德语和英语场景。团队自报成绩包括 AIME 2025 96.9%、GPQA Diamond 84.3%、SWE-Bench Verified 66.4%。但数据集尚未发布,部分智能体评测仍低于 Qwen。
  • Reka Rho-1:19B 全模态模型,可理解并生成文本、图像、视频和机器人动作。公开信息称其从零训练,使用 320 张 H100,耗时约三个月。
  • Command Code Agr / Agr-flash:分别为 31B 与 360M 的决策模型,不以文本生成为核心,而是返回带概率的类型化值,用于工具调用与路由。
  • Solar Mini 4:35B 总参数、3B 激活参数,支持 512K 上下文。
  • Eleven v4 Turbo:在语音 TTS 竞技榜中取得较高排名,并以更低价格提供服务。

小结

Beam 不是当前所有开放模型中的绝对领先者,但它的发布仍值得关注:大规模 MoE、从零训练、面向代码和智能体任务、计划开放完整权重,并采用宽松许可。

对于社区而言,接下来最关键的是三件事:

  1. 完整权重是否按计划发布;
  2. 技术报告是否披露足够训练与评测细节;
  3. 第三方能否复现其效率与基准表现。

在这些信息明确之前,Beam 更适合被看作一个重要的新开放模型候选,而不是已经被充分验证的行业标杆。

评论

请登录后发表观点

暂无数据