501B 参数却跑输国产模型?Beam 发布背后的"开放权重"尴尬
Reflection 发布 501B 参数开放权重模型 Beam,主打推理效率,却在 HN 上被质疑图表误导、不如中国开源模型——开放权重的下半场,拼的到底是什么?

这周 AI 圈最热闹的发布之一来自 Reflection:一家之前没怎么听过的实验室,一口气端出了 501B 总参数、23B 激活的稀疏 MoE 模型 Beam,主打代码、推理和 Agent 场景,号称"开放权重"。训练规模相当夸张——23.8 万亿 token 预训练,1 万多块 GB300 跑了整整 4 周强化学习,生成了超过 1 亿次 rollout。
Hacker News 上这条帖子拿了 484 分、156 条评论,但画风有点微妙:高赞评论几乎都在"找茬"。有人说性能图表把更强的开源模型藏在了折叠线后面,有人说这模型参数更大、跑分却不如 DeepSeek 和 GLM,还有人直接点破——号称开放权重,权重本身"本月晚些时候"才放出来。
今天请到的嘉宾是林深,一位大模型推理工程师,咱们来聊聊这场发布到底成色如何。
本文由每日自动管线生成:选题与素材来自 Hacker News 公开讨论,访谈内容由 AI 基于原文整理,嘉宾为角色设定,观点不代表任何真实人物。
小听: 先从硬参数说起。Beam 是 501B 总参数、23B 激活的 MoE,预训练 23.8T token,RL 阶段用了 10500 块 GB300、1 亿多次 rollout、13 亿个 sandbox。这规模在开放权重阵营里算什么水平?
林深: 训练投入是真金白银,1 亿次 rollout 这个量级,在公开的实验室里确实排得上号。但要看"有效"的部分——501B 只是总参数,真正干活的是每次只激活的 23B,这是 MoE 的老玩法了,数字大不等于能力强。反倒是他们解决的工程问题更值钱:异步 RL 里 policy staleness 导致的训练不稳定,他们能做到"用一天前的旧权重生成的数据还能稳定学",这才是这篇博客里最硬核的一章。
小听: HN 上点赞很高的一条评论说,官方的性能图表有误导性——把表现更好的开源模型放在了折叠线后面或者标成"未报告"。你怎么看这种"benchmark 修辞学"?
林深: 这已经是基操了,倒也不必上纲上线,但这次确实有点明显。他们自己贴的表里,DeepSWE v1.1 上 DeepSeek V4.1 Flash 拿了 74.2 分,Beam 只有 44.4,Terminal-Bench 上 90.6 对 80.1——差距就摆在那,藏是藏不住的。真正值得看的是他们换的叙事角度:不跟你拼绝对分数,拼"单位算力的智能",说推理只用 GLM-5.2 三分之一到四分之一的计算量就能拿到差不多的推理分数。这个 pivot 很聪明,因为绝对分数那条路他们确实走不通。
参数可以注水,FLOPS 不会说谎。
小听: 评论区里被反复提起的一句话是:"参数更大,却不如更小的中国开源模型"。好几个人拿 DeepSeek V4.1 Flash 和 GLM 5.3 出来对比,Beam 自己也承认 Kimi K3 在原始能力上领先。2026 年了,"西方追赶中国"在开放权重这条赛道上是不是已经反过来了?
林深: 反没反过来不好说,但"中国实验室是领跑者"这已经是共识了,你看 Beam 自己的对标表:GLM、DeepSeek、Kimi、Qwen,清一色中国模型,西方这边能拿出来对标的 Inkling、Nemotron 3 Ultra 反而成了陪跑。这在两年前是不可想象的。对国内开发者来说这是个好消息——最好的开放权重基本都在中文语境里长大,中文任务上的表现往往还更好。
小听: 那 Beam 的卖点到底是什么?如果绝对性能打不过,它的定位是什么?
林深: Workhorse(干活的马)。企业级 coding 和 agent 场景要的不是 leaderboard 冠军,是"便宜、够用、稳定"。23B 激活意味着推理成本可控,他们还专门做了个"推理力度"参数,让用户在 token 花费和效果之间自己权衡。HN 上也有人问到底能在什么硬件上跑——这才是真实用户关心的问题。可惜官方现在只给了 early access 申请,权重没放出来之前,这些都还是 PPT。
小听: 说到这个,评论区 zopper 的吐槽很精准:"号称开放的模型,既不开放,也没有 API。"你怎么看这种"先开发布会、后放权重"的操作?
林深: 都快成行业惯例了,发布节奏和工程节奏脱节。好在他们承诺了本月内放出权重、技术报告和 model card,比那些只放 API 的"开源"还是强一点。但在权重真正能下载之前,我建议把这当成一篇技术博客来读,而不是一个能用的模型。开放权重的"开放"二字,现在越来越像营销术语了,得看交付。
冠军负责领奖,workhorse 负责干活——只是别在领奖台上假装自己是冠军。
小听: 最后给开发者一句建议:如果关注 Beam,应该关注什么?
林深: 三件事。第一,等权重真放出来再动手,现在不用急;第二,关注"推理效率"这个指标——对做应用的人来说,每 token 的智能密度比绝对 benchmark 分数重要得多,Beam 在这上面的方法论(长度惩罚、异步 RL infra)值得学;第三,接受现实:2026 年选开放权重模型,优先看中国实验室的发布,这已经不是情怀,是跑分。