Mistral Large 4
TL;DR · AI 摘要
Mistral Large 4是Mistral AI推出的1万亿参数多模态模型,性能超越现有开源模型,在网络安全、金融等领域达到SOTA。
核心要点
- Mistral Large 4拥有1万亿参数,490亿活跃参数,是目前最大的开源模型。
- 在网络安全、金融、法律等关键领域,其性能达到或超越现有开源模型。
- 模型在欧洲自主训练,支持160+语言,提供自部署能力增强AI主权。
结构提纲
按章节快速跳转。
- §模型发布
宣布Mistral Large 4公开预览版上线,参数规模达1万亿。
- ·核心参数
模型包含1万亿参数,其中490亿为活跃参数,为当前最大开源模型。
- ·性能表现
在网络安全、金融、法律等关键领域达到SOTA,部分领域超越封闭模型。
- ›训练细节
使用欧洲数据中心3800块NVIDIA Grace Blackwell GPU训练,支持160+语言。
- ·部署策略
模型提供自部署能力,欧洲部署独立于其他数字服务商。
- ›应用场景
已与金融、制造、物流等行业的领先企业合作训练模型。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Mistral Large 4
- 模型特性
- 1万亿参数/490亿活跃参数
- 多模态能力
- 性能表现
- 网络安全SOTA
- 超越封闭模型
- 训练部署
- 欧洲数据中心
- 160+语言支持
金句 / Highlights
值得收藏与分享的关键句。
ML4是1万亿参数的多模态模型,490亿活跃参数,是目前最大的开源模型。
在网络安全、金融、法律等关键领域,ML4达到SOTA,甚至超越部分封闭模型。
模型在欧洲自主训练,使用3800块NVIDIA Grace Blackwell GPU,支持160+语言。
自部署能力使组织能在自身政策下运行高级安全工作,避免供应商限制。
Le Chonk
今天,我们正式推出 Mistral Large 4 的公开预览版。非正式名称为 ML4,正式名称是:_le Chonk_。ML4 推动了开源模型性能的前沿边界。您现在就可以在 Mistral Studio 上体验预览版 API。模型权重将在本月底正式发布。
前沿性能
ML4 是一个原生多模态模型,拥有 1 万亿参数,其中 490 亿个参数处于活跃状态。这是迄今为止我们推出的规模最大、能力最强的模型,并且随着持续优化,其性能正在快速提升。
该模型在编程、智能代理工作流程和多模态理解等任务中展现出卓越表现。目前其性能已达到全球顶尖开源模型的水平,同时显著超越美国或欧洲开发的任何开源权重模型。在网络安全、金融和法律等关键企业工作负载上,我们发现其在开源模型中处于领先地位。在视觉定位等某些领域,其表现甚至超越了部分封闭模型。
我们将在本月底前发布模型权重。在此期间,我们将与网络安全领导者、经过验证的合作伙伴和国家机构在真实场景中进行红队测试,这些机构将通过降低内容审核和增强网络能力的方式使用相同模型。
欧洲打造,为 AI 主权而生
ML4 在欧洲 Mistral 自有数据中心的 3,800 台 NVIDIA Grace Blackwell GPU 上从零开始训练。公开预览版同样运行在该基础设施上。这是我们在基础设施、研究和产品开发长期投资中的重要里程碑:通过开源权重实现关键垂直领域最先进的性能,赋予客户对人工智能的控制权。
这在网络安全领域尤为重要,因为供应商级别的拒绝可能阻碍合法漏洞研究和事件响应,而事件进行中失去某项能力的访问权限本身可能成为关键安全风险。ML4 将顶级网络安全性能与开源权重和自主部署相结合,使组织能够在自身政策下自主运行高级安全工作。
该模型将在全球多个地区提供,包括 Mistral 独立运营的欧洲部署(不受其他数字服务提供商影响,并遵循欧洲法律)。有趣的是:ML4 的大量训练数据是多语言的,涵盖 160 多种语言,包括欧盟所有官方语言。
我们已与全球金融、工程、制造、物流、制药、科学、航运、公共部门及其他关键行业领先企业密切合作,共同训练 ML4。事实上,该模型使用了与我们通过 Mistral Forge 为客户提供的训练、定制和强化学习环境完全相同的系统。
立即体验
后续还有更多内容即将发布。在模型权重正式发布前,我们将进一步分享模型架构细节、额外基准测试结果以及我们的后训练方法。
该模型也将作为新一代专用且优化的Mistral模型的基础。同时,我们邀请您体验预览版API,并在社交媒体上与我们分享您的反馈。
能力深度解析
网络安全
ML4是全球最强的网络安全AI模型之一。在Artificial Analysis Cyber Index(一个独立评估AI模型在实际软件中发现和修复安全漏洞能力的指标)中,它位列全球前五,大幅领先中国以外地区开发的开源模型。在该指标的一项测试中,模型需要复现开源软件中的真实漏洞并进行修复,ML4得分82%,为所有模型中的最高分。在Cybench(一套从安全竞赛中提取的40项练习)中,它解决了93%的挑战,这是开源模型报告的最高成绩之一。
这一顶尖成绩反映了实际应用优势。包括Claude Opus 5.5和GPT-6 Astra在内的多个领先闭源模型在相同测试中得分接近零,因为它们拒绝执行任务。然而,防御软件通常需要先证明漏洞的真实性,这正是闭源模型中的安全过滤器会阻止的工作类型。随着威胁行为者越来越多地破解这些模型以支持进攻性网络活动,防御者需要能够匹配这些能力且不受相同限制的系统。ML4可以完成这项工作,其能力甚至超出明确训练范围:在内部测试中,它被证明对分析恶意软件、优先处理漏洞和编写检测规则都有帮助。对于需要主权可控且可审计AI进行安全运营的组织,ML4可在私有云或本地部署运行。
##### ML4面对挑战:高效处理多样化复杂问题
##### 恶意软件逆向工程:解决分布外调查任务
智能编程
ML4在软件工程、代码库理解和复杂终端工作流程方面表现优异,在DeepSWE v1.1测试中得分为61.7%,在SWE-Atlas-QnA测试中得分为59.4%,在Terminal-Bench 4测试中得分为28.3%。其综合编码代理指数得分49.8%,领先于DeepSeek V4 Pro 0813和Qwen3.8 Max。
我们还与Surge AI合作进行了盲测编码质量评估:专业标注人员在1-5分的评分标准下对模型输出进行评分,且隐藏模型身份。ML4 Preview在五款模型中排名第二(3.74分),领先于Kimi K3(3.59分)、GLM-5.3(3.60分)和GLM-5.2(3.40分),仅落后于Claude Opus 5(4.22分)。
%201_20jgWu.webp?dpl=6ac516f190c69e0008d46233) #### 智能工作流
ML4运行通用智能代理,能够跨复杂工作流收集信息、使用工具并生成最终成果。在AutomationBench(包含Gmail、Google Sheets、Slack和Salesforce等应用的657个业务工作流)测试中,其得分59.9%,领先于Kimi K3、MiMo-V2.6-Pro和DeepSeek V4 Pro。
它在知识工作实际产出的专业成果(如电子表格、幻灯片和PDF)方面同样表现出色:在评估长期知识工作的AA-Briefcase测试中,其达到1,393 Elo分,领先于DeepSeek V4 Pro。

#### 多模态
ML4标志着我们的模型在理解图像方面能力的飞跃。它能够跨复杂文档、图表和自然图像进行强大推理,并将视觉感知能力带入到对感知至关重要的行业,如工程、制造和地球观测领域。
该模型可以进一步结合视觉定位能力与自主能力:从检查十亿像素的卫星图像(帮助救灾团队在关键时刻采取行动),到分析工程图纸(放大、检查并验证直至得出精确答案)。在我们上面的演示中,ML4实现了密集自然场景的定位、技术图纸中机械部件的验证、从PDF中检索证据,以及在大规模地理空间图像中扫描最难发现的物体。
在视觉定位方面,我们发现ML4是我们测试过的最强大的模型之一,例如在Dense 200基准测试中,其表现超越了GPT-6-Astra(42% vs 41%)。
#### 科学与数学
ML4带来了强大的科学能力,这是通过将AI驱动的方法与我们在数学、物理和化学领域的专家知识相结合实现的。
它在科学任务的自主编码方面表现出色,如数据分析、建模和模拟物理现实,这让研究人员能够专注于问题本身而非技术细节。在基准测试中,ML4在SciCode-Verified指标上是开源模型中的最先进水平。在实践中,它能够一次性生成完整的Hartree-Fock模拟——这是一个由一系列高级例程构建的复杂多步骤化学任务。
ML4的数学能力同样强大,既包括形式推理也包括应用数学。在我们的人类评估中,它比GLM-5.3更精确且结构更清晰,并且能够持续执行长期的、特定领域的应用数学任务,包括与前沿理论物理相关的工作。
这些能力的结合使ML4成为贯穿整个技术工作流程的强大研究助手——从最初的问题到最终结果。
-alt_ZYLgs8.webp?dpl=6ac516f190c69e0008d46233) _SciCode-Verified测试模型在代码中实现复杂科学工作流程的能力,涉及物理、数学、材料科学和生物学等领域。_

_ML4与GLM5.3在STEM任务(数学和物理)上的内部评估_
知识工作
ML4是我们目前在处理专业人士日常真实世界任务方面最强大的模型。它能够创建、编辑和修复复杂的电子表格和文档,在法律和财务基准测试中表现出色。
值得注意的是,我们通过第三方评估机构(vals.ai)对ML4在法律和财务任务的代表性任务进行了评估,发现该模型在两种情况下都超过了GPT-6-Astra。在HarveyAI的法律代理基准测试中,ML4的表现优于所有开源模型。
_FinWorkBench测试模型在真实生活中的财务和会计场景中创建/编辑电子表格的能力。_
金融分析需要精确性以及从多个来源综合信息的能力,这一过程在许多金融机构中仍然耗时费力。在本演示中,ML4与其他领先的开源模型(OSS)共同面对相同的多步骤企业财务挑战,搜索公开的公司文件和财务报告(如EDGAR及欧洲同类数据库中的内容)。动态语义地图追踪每个模型通向解决方案的路径,突出显示沿途检索到的每一份文件。每条路径的位置反映了收集到的证据、计算结果以及尚未解决的问题。观众可以观察调查过程的展开,并比较每个模型在得出最终答案前采取的不同路径。
模型安全性
ML4在抵御间接提示注入的鲁棒性基准测试中表现优异,处于开源模型的前沿(与GLM-5.2、GLM-5.3、Kimi-K2.6、Kimi-K3、DS-V4-Pro-0813相比)。在Lakera公开的B3 AI安全基准中,ML4成功抵御了93.3%的攻击——我们未在竞争对手中看到更高的得分。
ML4与用户互动时也比以往任何模型都更加负责任。我们在KORA基准上的测试结果表明,ML4再次在开源模型中达到我们测得的最高分(1.691,满分2分标记为“_Exemplary_”)。
特别值得关注的是,该模型拒绝恶意网络安全请求的倾向。尽管在网络安全基准测试中表现强劲,但ML4在来自JailbreakBench、StrongREJECT和AgentHarm的网络安全提示上的平均拒绝率高于所有开源模型。
人类评估
我们进行了内部评估,来自编程、计算机辅助设计(CAD)、金融、数学和物理领域的专家标注员将Mistral Large 4与GLM-5.3进行了比较。ML4在CAD和STEM领域更受青睐,而在金融和编程领域表现与GLM-5.3相当或接近。

大规模强化学习
基础模型的改进速度很快,我们的微调训练必须跟上节奏。为昨日模型设计的优化方案在今日前沿模型上会留下能力空白,因为曾经推动模型达到极限的真实样本已不再具有挑战性。我们采用强化学习(RL),因为它能随着模型进步而动态适应:我们基于模型自身尝试的成果进行训练,并随着模型能力提升逐步增加任务难度和广度。
我们的RL库设计旨在简化新环境的添加和大规模训练。共享的可组合接口使单次训练运行能够整合从单轮对话、复杂科学问题解决到安全对齐、事实性验证和长期工具使用的任务。这些环境共享支撑结构和资源,如代码沙箱、网络搜索和外部API。这种可组合性同样延伸至验证环节,根据任务需求灵活组合奖励模型、单元测试、LLM评委和静态检查。
在运行时,自动扩展的演员舰队会并行生成数万个rollouts,同时模型训练以异步方式进行。生成和训练流程针对长轨迹进行了优化,支持在多个压缩操作中跨数百万个token的rollout预算,同时保持数据陈旧度较低。两个阶段的新方法和优化措施最小化了离线策略漂移,实现了长期目标的稳定强化学习。
在我们当前的规模(3000个GPU)下,单次训练运行每天大约生成330亿个token,其中经过过滤和掩码处理后,约有160亿个可训练完成token。我们可以在训练rollouts中直接看到运行进度:随着策略学习解决日益复杂任务,多个代表性环境中的训练奖励持续上升。以下是几个示例。

这些改进不仅限于我们训练的环境;它们可以迁移到下游评估中,最终模型的性能归功于两个后训练阶段(监督微调和强化学习),如图表所示。

接下来的发展
这只是开始。ML4是我们路线图上的第一个里程碑,由我们30亿欧元D轮融资支持——这是欧洲科技公司有史以来最大的股权融资轮次。这笔资金已经开始发挥作用:我们正在大幅扩展位于欧洲自有数据中心的计算能力,未来几个月将有更多资源上线。
更多计算能力意味着更多训练。此次预览背后的强化学习训练仍在进行中,模型尚未表现出饱和迹象——前方仍有大量提升空间。随着我们在扩展后的基础设施上扩大训练规模,我们预计未来几周和几个月将出现显著且快速的性能提升。
我们将在本月底前发布模型权重,并提供更多关于架构、额外基准测试以及后训练方法的详细信息。ML4只是基础:它将成为新一代专用且优化的Mistral模型的基础,这些模型将针对客户最关注的行业和工作负载进行构建。
从这里开始,进步的速度将非常快。敬请期待。