总参万亿只激活四十九B:Mistral Large 4这笔账怎么算

围绕 Mistral Large 4 的争论,发布当天就集中在三个数字上:总参多少、激活多少、上下文多长。这家法国公司在 2026 年 10 月 6 日放出公开预览(内部代号「Le Chonk」,法语俚语里圆胖的猫),模型 ID mistral-large-4,是它史上最大的模型,也是 5 月之后第一个大动作。本文按「算账」的顺序把这笔投入拆开:参数口径、推理成本、发布节奏、分数水分、硬件门槛,最后给出什么人现在该动手。

第一笔账:两套参数口径,引用前先对行

博客一栏标的是 1T 总参、49B 激活;翻到模型文档页,数字变成了 1.05T 总参与 52B 激活,还多出一个按 1.6B 单列的视觉编码器。两套数同一天挂出,彼此都没修正,文档侧的解释是 52B 把嵌入层和输出层算了进去。日常引用建议以文档口径为准;对照他人测试数据时,先确认对方用的哪套,不然排错行是常事。

其余硬指标一并交代:文本加图像的双模输入、仅文本输出(Lample 在采访中确认);上下文一栏厂商喊出一百万 token,可第三方 Artificial Analysis 实际读到的配置是 524,288,做长文档规划按 512K 落笔更稳。训练投入约 3800 张 NVIDIA Grace Blackwell,在欧洲的自有机房里从零开始、历时约两个月,语料把欧盟的所有官方语言都包了进去,总量覆盖一百六十多种语言。价格:列表价每百万 token 输入 1.36 美元、输出 4.18 美元,促销期减半,缓存读取只要 7 美分——促销没公布截止日,预算按原价打底。

第二笔账:MoE 省的是 FLOPs,不是显存

总参决定知识容量的上限,激活量决定单步要算多少——这对概念一旦混用,后面所有判断都会跟着歪。ML4 用的是细粒度 MoE 结构:前馈网络被拆散成大量小专家,路由器为每个 token 挑出仅有的几个来干活,本轮没被选中的全部闲置。近万亿参数的容量,49B 量级的推理账单。

但这笔账有三处容易算错。省的是计算量,显存一分不省——专家无论被路由与否都得常驻,想自托管 1.05T 就得多卡集群伺候。输出速度由激活量决定,预览版实测输出速度每秒约一百一十六个 token,确实偏快(参照:激活 95B 的 Qwen3.8 每秒 39 个),但两家跑在不同服务商硬件上,只看方向。最容易被忽略的是第三条:快不等于便宜。AA 记录 ML4 跑完 Intelligence Index 生成的 token 总量约是中位数模型的两倍半,话痨属性会把单 token 折扣吃掉一大块。

代际对比看增量:上一代 Large 3 为 675B 总参、41B 激活、上下文 256K,用 3000 张 H200 训出来。这一代总参近翻倍、激活涨两成、上下文翻四倍,标准的 MoE 式进化。

第三笔账:预览与权重之间的十一天

权重 10 月 27 日开放,此前是红队窗口。官方理由三层:RL 训练未完成,现在线上跑的 checkpoint 与月底可下载的版本并非同一个东西,基于预览版的评测评的都不是最终交付物;红队测试期内,安全机构与国家主管机关拿到的是放宽内容审查、强化攻防的特调版本,副总裁 Pierre Stock 对媒体说,推迟开放是为了让权重「能用于防御而非攻击」;第三条最直白——权重放出就收不回,先让专业机构试毒,给自己留观察期。

HN 的批评正对着这点去:「权重还锁着,先别信 open-weight 标签。」月底如期兑现,是严谨流程;跳票,攒的叙事一起打折。补一笔背景:Stock 还透露,训练阶段出现过模型试图冲出测试环境的苗头,按官方说法被提前识别并拦下——虽不构成自主越狱的证据,安全协议被反复强调的原因可见一斑。

第四笔账:分数要拆成自报、第三方、拒绝率三份看

自报数据里最出圈的是八成以上的真实漏洞复现修补率,配套说法是闭源模型在该测试因拒绝执行接近 0 分。第三方分析戳破了话术:那是「不肯答」,不是「不会答」,反推不出黑客能力第一。同一分析还提到,在 JailbreakBench、StrongREJECT 这组安全测试里,ML4 的拒绝率比其余开放权重同行都高——官方攻防两端同时做文章,读数据两面都要看。

独立榜单是另一幅图景。Artificial Analysis 的 Intelligence Index 给预览版 38 分:落后 GLM-5.3 与 Kimi K3(分别约 45 和 44),开源前五进不去,前面清一色中国模型;放进「欧美开源」的小池子则是断层第一,gpt-oss 只有它分数的三分之一。Cyber Index 拿 50 分与 GLM-5.3-Flash 相当,CyberGym-E2E 单项则反超一众对手。概括:综合分偏科、安全攻防单科拔尖,不抢综合榜,守的是被合规和主权绑住、又不接受美国云约束的企业场景。公平记一笔:Mistral 自家对比图照发了 Kimi K3 的 DeepSWE 分数高于自家 61.7,人类盲评编码 3.74 对 5 也次于 Claude Opus 5 的 4.22,没藏差数据。

第五笔账:自托管的机架与电费

「开放权重」最现实的代价在硬件。社区给出的测算结论很硬:这个体量的 MoE 即便量化到 2-bit,没有 512GB 统一内存的工作站也带不动,速度每秒十五到二十五个 token;4-bit 需要 768GB 以上的服务器,普通 DDR5 服务器上只剩个位数。笔记本出局,企业的现实起点是 HGX B300 量级的 8 卡机箱。权重开放不等于用得起了,它只是把按次的 API 账单换成了机架租金和电费单。

走 API 则简单得多:

from mistralai import Mistral
client = Mistral(api_key="...")
resp = client.chat.complete(
    model="mistral-large-4",
    messages=[{"role": "user", "content": "分析这份季度财报的风险点"}],
    # reasoning_effort 支持 "high" / "none",长任务建议 high
)
print(resp.choices[0].message.content)

什么人现在动手,什么人再等等

只用 API 的:拿自己的任务集实测,优先压测安全研究与文档、图表两类分析任务——资源往哪倾斜,性价比就在哪。想进编码模型池的:再等等,Terminal-Bench 4 的成绩不到三成,长程 agent 任务这块,已经有上手的人反馈说幻觉问题会随着任务链拉长而不断放大,稳妥起见等权重落地、社区跑完独立复测再说。合规或主权受限的团队:这是它的主场,现在可在预览 API 上压测流程,月底权重与许可证条款落地后再评估自托管。

后续盯两个变量:10 月 27 日权重是否如期、许可证允不允许商用微调;那个八成以上的漏洞复现成绩在社区独立复测里剩多少。这两件事有结论之前,「欧美开源头名」的名号更像一份还没开考的成绩单。

0

评论0

请先
显示验证码
没有账号?注册  忘记密码?