Hacker News Best

Mistral Large 4: "Le Chonk"

8.5内容质量

TL;DR · AI 摘要

Mistral Large 4发布,1万亿参数多模态模型在欧洲自主训练,性能超越同类开源模型并挑战闭源模型。

核心要点

  • Mistral Large 4拥有1万亿参数,490亿活跃参数,是目前参数量最大的开源模型。
  • 在网络安全、法律、金融等关键领域表现达到开源模型SOTA水平,部分任务超越闭源模型。
  • 模型在欧洲数据中心训练,支持多语言(160+语言),强调数据主权与AI自主权。

结构提纲

按章节快速跳转。

  1. 宣布Mistral Large 4公开预览版发布,参数量达1万亿。

  2. ML4是首个1万亿参数的原生多模态模型,490亿活跃参数。

  3. 在编码、网络安全、法律等领域超越开源模型,部分任务超越闭源模型。

  4. 使用欧洲3800台NVIDIA Grace Blackwell GPU训练,支持多语言(160+)。

  5. 已与金融、制造、物流等关键行业企业合作验证模型能力。

  6. 模型在欧洲独立部署,强调数据主权与AI自主控制。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Mistral Large 4
    • 模型规格
      • 1万亿参数/490亿活跃参数
      • 多模态能力
    • 性能表现
      • 超越开源模型
      • 部分任务超越闭源模型
    • 部署与自主权
      • 欧洲独立部署
      • 160+语言支持

金句 / Highlights

值得收藏与分享的关键句。

#Mistral Large 4#AI模型#欧洲部署#多模态#开源
打开原文

Mistral Large 4 重磅发布 | Mistral

Le chonk

Mistral Large 4 正式发布

返回博客

14 分钟阅读

2026年10月6日

由 Mistral 发布

if full button is clickable

分享本文

复制链接到剪贴板

已复制

Le Chonk

今天,我们正式推出 Mistral Large 4 的公开预览版。非正式名称为 ML4,正式名称:le Chonk。ML4 将开源模型性能推向新高度。您现在就可以在 Mistral Studio 上体验预览版 API。模型权重将在本月底正式发布。

颠覆性性能表现

ML4 是一个拥有 1 万亿参数的原生多模态模型,其中 490 亿参数为活跃参数。这是迄今为止我们推出的规模最大、能力最强的模型,随着持续优化,其性能仍在快速提升。

该模型在编程、智能代理工作流和多模态理解等任务中展现出卓越表现。目前其性能已达到全球顶尖开源模型的水平,同时显著超越美国和欧洲开发的任何开源模型。在网络安全、金融和法律等关键企业工作负载领域,我们发现其性能在开源模型中处于领先地位。在视觉定位等特定领域,其表现甚至超越了部分封闭模型。

我们将在本月底前发布模型权重。在此期间,我们将与网络安全领导者、经过验证的合作伙伴和政府机构共同进行红队测试,这些机构将获得经过适度降低内容审核、增强网络安全能力的相同模型。

欧洲锻造,为 AI 主权而生

ML4 在欧洲 Mistral 自有数据中心的 3,800 台 NVIDIA Grace Blackwell GPU 上从零开始训练。公开预览版同样运行在该基础设施上。这是我们在基础设施、研究和产品开发长期投资中的重要里程碑:通过开源权重实现关键领域的前沿性能,赋予客户对 AI 的完全控制权。

这在网络安全领域尤为重要。目前某些供应商的拒绝策略可能阻碍合法漏洞研究和事件响应,而事件处理过程中失去某项能力本身可能成为关键安全风险。ML4 将顶级网络安全性能与开源权重和自主部署能力相结合,使组织能够在自有政策下自主运行高级安全工作。

该模型将在全球多个地区部署,包括 Mistral 独立运营的欧洲部署版本,该部署完全不受其他数字服务提供商影响,并遵循欧洲法律。有趣的是,ML4 的训练数据中包含大量多语言内容,涵盖 160 多种语言,包括欧盟所有官方语言。

我们已与全球金融、工程、制造、物流、制药、科学、航运、公共部门及其他关键行业领先企业密切合作训练 ML4。事实上,该模型使用与 Mistral Forge 为客户提供的一样训练、定制和强化学习环境。

该模型也将作为新一代专业化和优化版Mistral模型的基础。在此期间,我们邀请您试用预览版API,并在社交媒体上与我们分享您的反馈。

能力深度解析

网络安全

ML4是全球最强的网络安全AI模型之一。在Artificial Analysis Cyber Index(人工分析网络指数)上,该模型在评估AI模型发现和修复实际软件安全漏洞能力的独立测试中,位列全球前五,远超中国以外开发的开源模型。在该指数的一项测试中,要求模型复现开源软件中的真实漏洞并进行修复,ML4得分82%,为所有模型中最高。它还在包含40个来自安全竞赛题目的Cybench测试集中解决了93%的挑战,这是开源模型报告的最高成绩之一。

这一顶尖成绩体现了实际应用优势。包括Claude Opus 5.5和GPT-6 Astra在内的多个领先闭源模型在相同测试中得分接近零,因为它们拒绝执行任务。然而,防御软件通常需要先证明漏洞的真实性,这正是闭源模型中的安全过滤器可能阻止的工作类型。随着威胁行为者越来越多地破解这些模型以支持进攻性网络活动,防御方需要能够匹配这些能力但不受相同限制的系统。ML4可以完成这项工作,其能力甚至超出明确训练范围:在内部测试中,它被证明对分析恶意软件、优先处理漏洞和编写检测规则都有帮助。对于需要主权可控且可审计AI进行安全运营的组织,ML4可在私有云或本地部署运行。

##### ML4对抗领域:高效推理多样复杂挑战

##### 恶意软件逆向工程:解决分布外调查任务

  • AA Cyber Index
  • CyberGym-E2E
  • Cybench

代理编程

ML4在软件工程、仓库理解和复杂终端工作流程方面表现优异,在DeepSWE v1.1测试中得分61.7%,在SWE-Atlas-QnA测试中得分59.4%,在Terminal-Bench 4测试中得分28.3%。其综合编码代理指数得分49.8%,领先于DeepSeek V4 Pro 0813和Qwen3.8 Max。

  • DeepSWE 1.1
  • Terminal Bench 4.0
  • SWE Atlas QnA

我们还与Surge AI合作进行了盲测人类评估,评估编程质量:专业标注人员在1-5分的评分标准下对模型输出进行评分,且隐藏模型身份。ML4预览版在五款模型中排名第二(3.74分),领先于Kimi K3(3.59分)、GLM-5.3(3.60分)和GLM-5.2(3.40分),仅落后于Claude Opus 5(4.22分)。

#### 代理工作流程

ML4运行通用代理,能够跨复杂工作流程收集信息、使用工具并生成最终交付成果。在AutomationBench测试中(包含Gmail、Google Sheets、Slack和Salesforce等应用的657个业务流程),其得分59.9%,领先于Kimi K3、MiMo-V2.6-Pro和DeepSeek V4 Pro。

它在知识工作实际产出的专业交付成果方面同样表现出色:电子表格、幻灯片和PDF文档。在评估长周期知识工作的AA-Briefcase测试中,其达到1,393 Elo分,领先于DeepSeek V4 Pro。

#### 多模态

ML4 是我们模型在理解图像能力方面的一次重大飞跃。它能够对复杂文档、图表和自然图像进行强有力的推理,将视觉感知能力引入到对感知至关重要的行业,如工程、制造和地球观测领域。

该模型可以进一步结合视觉定位能力与智能代理功能:从检查十亿像素的卫星图像——帮助救灾团队在关键时刻迅速行动——到分析工程图纸——放大查看、细致检查、反复验证直至得出精确答案。在我们上面的演示中,ML4 能够定位密集的自然场景、在技术图纸中验证机械部件、从 PDF 中检索证据,并在海量地理空间图像中扫描最难发现的物体。

在视觉定位方面,我们发现 ML4 是我们测试过的最强大的模型之一,例如在 Dense 200 测试中,其表现优于 GPT-6-Astra(42% vs 41%)。

  • Dense 200
  • ChartQA Pro
  • GDP.pdf

#### 科学与数学

ML4 拥有强大的科学能力,通过将人工智能方法与我们在数学、物理和化学领域的专家知识相结合而实现。

它在科学任务的智能代理编程方面表现出色,例如数据分析、建模和模拟物理现实,这让研究人员能够专注于核心问题而非技术细节。在基准测试中,ML4 在 SciCode-Verified 测试中是开源模型中的最先进水平。在实际应用中,它能够一次性生成完整的 Hartree-Fock 模拟——这是一个由一系列高级算法构建的复杂多步骤化学任务。

ML4 的数学能力同样出色,既包括形式推理也包括应用数学。在我们的人类评估中,它在精确性和结构化推理方面优于 GLM-5.3,并且能够持续处理长期、领域特定的应用数学任务,包括与前沿理论物理相关的研究。

这些能力的结合使 ML4 成为贯穿整个技术工作流程的强大研究助手——从最初的问题到最终的结果。

SciCode-Verified 测试模型在代码中实现复杂科学工作流程的能力,涵盖物理、数学、材料科学和生物学等领域。

ML4 与 GLM5.3 在 STEM 任务(数学和物理)上的内部评估

知识工作

ML4 是我们处理专业人士日常真实世界任务的最强大模型。它能够创建、编辑和修复复杂电子表格和文档,在法律和金融基准测试中表现出色。

值得注意的是,我们通过第三方评估机构(vals.ai)对 ML4 在法律和金融任务的代表性任务进行了评估,发现该模型在两种情况下均优于 GPT-6-Astra。在 HarveyAI 的法律代理基准测试中,ML4 超越了所有开源模型。

FinWorkBench 测试模型在真实生活中的财务和会计场景中创建/编辑电子表格的能力。

金融分析要求精确性以及综合多来源信息的能力,这一过程在许多金融机构中仍然耗时费力。在本演示中,ML4与其他领先的开源模型共同面对相同的多步骤企业财务挑战,搜索公开的公司文件和财务报告(如EDGAR及欧洲同类数据库中的内容)。动态语义地图追踪每个模型通向解决方案的路径,突出显示沿途检索到的每一份文件。每条路径的位置反映了收集到的证据、计算结果以及尚未解决的问题。观众可以观察调查过程的展开,并比较每个模型在得出最终答案前采取的不同路径。

模型安全性

  • B3攻击防御能力
  • 网络安全拒绝率
  • KORABench

ML4在抵御间接提示注入的鲁棒性基准测试中表现优异,已达到开源模型的前沿水平(与GLM-5.2、GLM-5.3、Kimi-K2.6、Kimi-K3、DS-V4-Pro-0813相比)。在Lakera公开的B3人工智能安全基准测试中,ML4成功抵御了93.3%的攻击——我们未在竞争对手中看到更高的得分。

ML4在与用户交互时也比以往任何模型都更加负责任。在KORA基准测试中,我们的结果显示ML4在开源模型中再次达到最高得分(1.691,满分2分标记为“卓越”)。

特别值得注意的是,该模型在拒绝恶意网络安全请求方面的倾向性。尽管在网络安全基准测试中表现强劲,但该模型在JailbreakBench、StrongREJECT和AgentHarm的网络安全提示上的平均拒绝率高于所有开源模型。

人工评估

我们进行了内部评估,来自编程、计算机辅助设计(CAD)、金融、数学和物理领域的专家标注员将Mistral Large 4与GLM-5.3进行了比较。ML4在CAD和STEM领域更受青睐,而在金融和编程领域表现与GLM-5.3相当或接近。

大规模强化学习

基础模型的改进速度很快,我们的后训练必须跟上节奏。为昨日模型设计的调优方案在今日前沿模型上会留下能力空白,因为曾经推动模型达到极限的真实样本如今已不再具有挑战性。我们采用强化学习(RL),因为它能随着模型的演进而适应:我们基于模型自身尝试的成果进行训练,并且随着模型能力增强,可以逐步提升任务难度和广度。

我们的RL库设计旨在简化新环境的添加和大规模训练。共享的可组合接口允许单次训练运行结合多种任务,从单轮对话到复杂科学问题解决,再到安全对齐、事实性验证和长周期工具使用。这些环境共享代码沙盒、网络搜索和外部API等基础设施资源。这种可组合性同样延伸至验证环节,根据任务需求灵活组合奖励模型、单元测试、LLM裁判和静态检查。

运行时,自动扩展的执行者舰队可并行生成数万个模拟轨迹,同时模型训练以异步方式推进。生成和训练流程针对长轨迹进行了优化,支持跨多轮压缩的数百万级token预算,同时保持较低的滞后性。两个阶段中创新的方法和优化手段共同作用,有效减少离线策略漂移,实现长期稳定的强化学习。

在我们目前的规模(3000个GPU)下,单次训练运行每天可生成约330亿个标记,其中经过过滤和掩码处理后,约有160亿个可训练完成标记。我们可以在训练过程中直接看到进展:随着策略学习解决越来越复杂的任务,多个代表性环境中的训练奖励值持续上升。以下是一些示例。

这些改进不仅限于我们训练的环境;它们可以迁移到下游评估中,最终模型的性能得益于两个后训练阶段(监督微调和强化学习),如图表所示。

接下来的发展

这只是开始。ML4是我们路线图上的第一个里程碑,由我们30亿欧元的D轮融资支持——这是欧洲科技公司有史以来最大的股权融资轮次。这笔资金已经开始发挥作用:我们正在大幅扩大位于欧洲自有数据中心的计算能力,未来几个月将有更多资源上线。

更多的计算能力意味着更多的训练。此次预览背后的强化学习训练仍在进行中,模型尚未出现饱和迹象——前方仍有大量提升空间。随着我们在扩展后的基础设施上扩大训练规模,我们预计在接下来的几周和几个月内将实现显著且快速的性能提升。

我们将在本月底前发布模型权重,并提供更多关于架构、额外基准测试以及后训练方法的细节。而ML4只是基础:它将成为新一代专用且优化的Mistral模型的基础,这些模型将针对客户最关心的行业和工作负载进行构建。

从现在起,进步的速度将非常快。敬请期待。

Mistral Large 4

全新发布

开放权重的混合指令与推理专家模型,支持多模态输入;在单一模型中融合指令、推理和智能体能力,在开放权重模型中处于网络安全、金融和制造领域的领先地位,原生支持160多种语言。

多模态

推理

编程

智能体

网络安全

输入(每百万个标记)

$1.36

输出(每百万个标记)

$4.18

了解更多

0% /