万亿参数、半价开卖:Mistral Large 4 的欧洲式反击
Mistral 发布 1.05T 参数的开源权重多模态模型 Large 4,49B 激活、1M 上下文,价格直接腰斩对标 DeepSeek——HN 评论区却在吵另一件事:欧洲到底需不需要自己的大模型。

欧洲大模型独苗 Mistral 今天扔出一颗重磅炸弹:Mistral Large 4,一个总参数 1.05T、每次只激活 49B 的稀疏 MoE,多模态、开放权重,上下文干到 1M。更狠的是价格——输入直接从 $1.36 砍到 $0.68,输出 $4.18 砍到 $2.09,摆明了冲着 DeepSeek Flash V4.1 来的。HN 上 447 分、224 条评论,但高赞区一半在聊跑分,另一半在吵架:欧洲花这么大代价训自己的模型,到底值不值?今天请到的嘉宾是陈默,一位大模型应用架构师,天天在模型选型里算账,咱们聊聊这场"欧洲式反击"到底几斤几两。
本文由每日自动管线生成:选题与素材来自 Hacker News 公开讨论,访谈内容由 AI 基于原文整理,嘉宾为角色设定,观点不代表任何真实人物。
小听: 先过硬参数。1.05T 总参数、49B 激活,外加一个 1.6B 的视觉编码器,1M 上下文,开放权重。这个"欧洲最大"在 2026 年的模型版图里,算什么段位?
陈默: 参数规模上确实是欧洲天花板了,1.05T 这个数字放在全球开放权重阵营里也没几个对手。但看门道要看"激活比"——49B 激活意味着推理时真正干活的只有不到 5%,这是 MoE 的标准打法:仓库很大,账单很小。真正让我多看两眼的是那个 1.6B 的视觉编码器,HN 上有人说它的视觉评测"如果属实就是世界第一",多模态这条线 Mistral 一直憋着没发力,这次像是补齐了最后一块拼图。
小听: 跑分这块,HN 评论区提到它在 DeepSWE 上和 GLM 5.3 打平,网络安全类的 benchmark 甚至超过了所有中国模型。但也有人阴阳"assuming the benchmarks are as good as claimed"。你信几分?
陈默: 跑分这事现在大家都懂,官方宣传页看看就好。但有意思的细节是评论区自己挖出来的:有人说它"50% off 就是为了跟 DS Flash V4.1 拼价格",这话点破了关键——Mistral 这次根本不想跟你争绝对第一,它争的是"够用+便宜+欧洲血统"这个生态位。网络安全 benchmark 强这点倒是实在,defender 模型这个定位很聪明:企业安全场景对"非中非美"有天然偏好,这是它真正的差异化。
小听: 价格战这部分值得展开。输入 $0.68/M、输出 $2.09/M,直接腰斩。评论区有人算账说这是冲着 DeepSeek 来的,欧洲公司跟中国公司拼价格,拼得过吗?
陈默: 拼不过,但它也不用拼过。DeepSeek 的价格是靠极致工程和规模摊薄打下来的,Mistral 学不来也不用学——它的客户画像不一样。欧洲本土企业、政府项目、以及"对中美模型有顾虑"的第三方,愿意为合规和主权付溢价。腰斩更像是一种姿态:告诉市场"我认真了"。真正的问题在另一头:1.05T 的 MoE,推理成本再怎么稀疏也便宜不到哪去,这个价格能撑多久,季度财报会说话。

参数是肌肉,价格是姿态,账单才是真相。
小听: 评论区吵得最凶的其实是这条:"欧洲人为什么想要一个不属于美国巨头、也不是中国造的高质量开源模型?"下面直接开战,有人说这是法国主权问题,有人说不如像 Cursor 那样拿现成模型做后训练,别重复造轮子。你站哪边?
陈默: 两边都有道理,但"主权"这张牌比很多人想的实在。评论区里那句"their reason to exist is to ensure the sovereignty of France"看着像调侃,其实是 Mistral 的商业基本盘——法国政府和欧盟的采购清单上,需要一个"自己人"。至于"别重复造轮子",从纯工程角度是对的:在别人预训练好的底座上做 RL 和后训练,性价比高得多。但 Mistral 赌的是另一件事:底座这层一旦彻底让出去,往后所有的对齐、优化、定制都受制于人。对大国来说,这不是性价比问题,是供应链问题。
小听: 还有个绕不开的质疑:有人直接问"有什么理由相信他们没有蒸馏中国开源模型?",底下还有人接"大家都在互相'借鉴'"。开放权重时代,蒸馏这事是不是已经没法聊了?
陈默: 已经是公开的秘密了,评论区那句"everyone is dis-stealing from everyone else"虽然是玩笑,但基本是实话。蒸馏在法律和社区规范里都还是灰色地带,可现实是:所有实验室都在用合成数据,所有合成数据都来自别家模型。Mistral 这次强调"probably got there without distillation",与其说是澄清,不如说是姿态。真正值得问的不是"蒸没蒸馏",而是"蒸馏之后有没有做出自己的东西"——视觉编码器和网络安全这两块如果真是原创,那就有增量价值。

铁塔还是那座铁塔,云已经不一样了。
小听: 最后问个实在的。如果你现在要给公司选主力模型,Large 4 会进你的候选名单吗?什么场景下你会用它?
陈默: 会进,但有条件。三个场景:第一,欧洲客户有数据主权要求的项目,它是唯一解;第二,安全攻防、代码审计这类它 benchmark 强的垂直场景,值得做 PoC;第三,需要 1M 上下文的多模态文档任务,可以跟 Gemini 和 GPT 比比价格。但我不会把它当默认主力——生态、工具链、社区案例都还太薄。HN 上那句"good enough to use as a daily driver"更多是情绪,真到生产环境,迁移成本和稳定性才是 CTO 们半夜睡不着的东西。一句话:它是欧洲 AI 最好的名片,但名片不等于订单。
这次发布最有意思的不是模型本身,是它照出来的格局:中美在拼绝对能力和极限价格,欧洲在拼"第三选项"的存在感。Large 4 能不能打,跑分说了不算,订单说了算。本文观点仅代表访谈角色设定,原始讨论见参考链接。