Latent Space

[AINews] NVIDIA buys HuggingFace for $13B, as OpenAI publishes their HF incident retro

8.5内容质量
[AINews] NVIDIA buys HuggingFace for $13B, as OpenAI publishes their HF incident retro

TL;DR · AI 摘要

NVIDIA以130亿美元收购HuggingFace,同时Z.ai发布GLM-5.3-Flash模型,参数达320B,支持1M上下文窗口。

核心要点

  • NVIDIA收购HuggingFace交易金额达130亿美元,为后者估值80倍。
  • Z.ai发布的GLM-5.3-Flash模型拥有320B总参数和1M上下文窗口。
  • 社区认为该模型可能是当前性价比最高的AI模型之一。

结构提纲

按章节快速跳转。

  1. 披露130亿美元收购交易及估值逻辑。

  2. ·GLM-5.3-Flash模型发布

    介绍参数规模、许可证及性能对比数据。

  3. 分析第三方支持及性能争议点。

  4. 明确1M上下文窗口与MIT许可证覆盖范围。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI行业重大事件
    • NVIDIA收购HuggingFace
      • 130亿美元估值
      • 80倍ARR溢价
    • GLM-5.3-Flash发布
      • 320B总参数
      • 1M上下文窗口
      • MIT许可证

金句 / Highlights

值得收藏与分享的关键句。

#NVIDIA#HuggingFace#AI模型#OpenAI#GLM
打开原文

[AINews] NVIDIA以130亿美元收购HuggingFace,OpenAI发布HF事件回顾

AINews:工作日精选

开源胜利!

2026年8月27日

TheInformation率先披露了消息,现在他们获得了确认——NVIDIA将以130亿美元收购HuggingFace,这一价格约为其1.5亿美元年度经常性收入(ARR)的80倍,且其客户群在2026年实现了翻倍。这一价格几乎是NVIDIA在2026年1月最初70亿美元报价的两倍。

我们能说什么呢?当正义的一方获胜时,我们总是感到欣喜。但就在GLM-5.3-Flash(又名Ox Alpha)令所有人(除了GDM模糊发帖者)印象深刻,以及Qwen也在中国芯片上推出了令人印象深刻的Flash模型的背景下,或许关于西方开源AI的Hot Chips会议后讨论,为这一事件提供了绝佳的背景。

2026年8月25日至8月26日的AI新闻。我们检查了12个Reddit子版块、544个Twitter账号,未发现更多Discord信息。AINews网站允许您搜索所有过往内容。提醒一下,AINews现在是Latent Space的一个版块。您可以选择是否接收电子邮件通知!

AI Twitter回顾

头条新闻:GLM 5.3 Flash发布及反响

发生了什么

Z.ai正式推出了GLM-5.3-Flash,并透露此前预览的“Ox Alpha”模型是其公开身份。

  • Z.ai宣布GLM-5.3-Flash是一个原生多模态模型,具有100万token上下文窗口,总参数3200亿 / 激活参数180亿,采用MIT许可证,可通过权重、API、聊天、编程计划和AutoClaw获取。
  • Z.ai同时将其定位为GLM-5.2的高性价比继任者,声称在内部基准测试中,该模型在每个努力级别上都优于GLM-5.2,并在编程方面与Claude Opus 4.8相当。
  • 发布还解决了长期存在的Ox Alpha谜团:多位发帖者明确将Ox Alpha与GLM-5.3-Flash联系起来,包括SemiAnalysis、rasbt、theo和Cline。
  • 发布后不久,第三方模型基础设施支持几乎立即出现:CoreWeave、Baseten以及Cline在VS Code / JetBrains / CLI中的免费集成。
  • 发布后不久,Z.ai工程师李子轩表示聊天模板已更新,早期下载者应重新下载模型,暗示进行了0天打包或提示格式修正。
  • Artificial Analysis首次发布了一篇概述,但错误地提到了40万token上下文窗口,随后更正为100万token上下文,与Z.ai的原始公告一致。
  • 社区对这一开源权重发布的反响异常强烈,从简短的震惊反应如“HOLY”到更实质性的观点,如认为该模型现在可能是每美元智能的最佳选择,例如Artificial Analysis和zainhas。
  • 发布被纳入了关于中国前沿开源模型的更广泛叙事中,有帖子认为中国开源实验室在选择线性注意力、稀疏注意力、残差路径设计和Muon架构方面趋于一致。
  • 至少有一个模态声明出现了独立反驳:skalskip92认为该模型在多个视觉/目标检测任务上表现较弱,尽管被描述为“原生视觉”。

官方声明和发布细节

Z.ai的主要发布推文是事实锚点:GLM-5.3-Flash被描述为:

  • 总参数3200亿 / 激活参数180亿
  • 100万token上下文
  • 原生多模态
  • MIT许可证
  • 之前预览为Ox Alpha
  • “完全基于中国AI芯片运行”

发布时的分发/可用性:

  • Hugging Face上的权重
  • Z.ai API
  • 聊天
  • ZCode
  • 编程计划
  • AutoClaw

最有力的自述供应商性能声明来自 Z.ai 的编码线程:在 Z.ai Code Bench 上,GLM-5.3-Flash “在每个努力级别上都明显优于 GLM-5.2,并且与 Claude Opus 4.8 的表现相当”。由于这是第一方基准测试,因此虽然有用,但应比独立评估更谨慎地解读。

AutoClaw 的后续发布支持文章将该模型描述为适用于视觉语言理解、代码生成和长期代理任务,并将可用性与积分/回扣相结合,但这主要是发布信息而非新技术证据:AutoClaw 发布文章。

独立基准测试与成本/性能定位

推文集中最具实质性的独立评估来自 Artificial Analysis。他们的总结:GLM-5.3-Flash 在 Artificial Analysis 智能指数中得分为 57。

Artificial Analysis 引用的指标

  • AA 智能指数得分:57
  • 与 GLM-5.3 的差距:比 GLM-5.3(60 分)低 3 分
  • 每任务成本:0.09 美元
  • API 价格:输入 100 万 0.15 美元,输出 100 万 0.50 美元
  • 缓存输入:约 0.026–0.03 美元/100 万,描述为 80% 折扣
  • 模型规模:总 320B / 激活 18B
  • 许可证:MIT
  • 上下文:最初列为 400k,后更正为 1M

Artificial Analysis 引用的对比

  • 与 GPT-5.6 Terra 和 Muse Spark 1.2 并列 57 分,但每任务成本低得多
  • 0.09 美元/任务 vs GLM-5.3 最大值 0.68 美元/任务
  • 声称每任务成本比 GLM-5.3 最大值低约 7.5 倍
  • 声称每任务成本比 GPT-5.6 Terra 低约 5.7 倍,比 Muse Spark 1.2 低约 4.4 倍

令牌效率与推理组合

Artificial Analysis 指出一个有趣的权衡:

  • GLM-5.3-Flash 运行智能指数使用了 149M 输出令牌
  • 相比之下,GLM-5.3 使用了 168M
  • 但比 Kimi K3(133M)和 Qwen3.8 2.4T A95B(136M)在相似智能指数得分下消耗更多令牌
  • 149M 令牌中 134M(约 90%)为推理令牌

这是一个重要细节:模型的经济性看起来非常出色,主要是因为令牌定价极低,而不是因为特别节省令牌。

Artificial Analysis 的代理/工作评估

Artificial Analysis 还报告称,GLM-5.3-Flash 在代理任务上的表现可能比其原始知识指标所暗示的更强:

  • GDPval-AA v2 Elo:1770 分在误差范围内与 GLM-5.3 平齐,Grok 4.6 仅落后于 Claude Opus 5 xhigh/max
  • Terminal-Bench v2.1:84.3% vs GLM-5.3 的 83.9%
  • τ³-Banking:47.2%,落后于 GLM-5.3 3.1 个百分点

知识/幻觉统计数据

  • AA-Omniscience 分数:+7
  • 准确率:28%
  • 幻觉率:28%
  • 与 GLM-5.3 对比:GLM-5.3 准确率 34%,幻觉率 30%
  • 与 GPT-5.6 Terra 对比:Terra 准确率 47%

这表明反应中反复出现的主题:GLM-5.3-Flash 在实际代码/代理工作流程上的表现可能远强于在广泛现实世界事实知识上的表现。

架构与系统细节

一些技术背景的反应尝试反向工程或总结 GLM-5.2 / GLM-5.x 的变化。

推文集中最详细的公开架构分解来自 rasbt,他表示 GLM-5.3-Flash 从 GLM-5.2 的 744B-A40B 主干转向 320B-A18B,并使用:

  • Kimi Linear 风格 3:1 混合注意力
  • 34 KDA 层(Kimi Delta Attention)
  • 11 MLA/DSA 层(MLA = 多头潜在注意力,DSA = DeepSeek 稀疏注意力)
  • DeepSeek V4 风格 mHC 残差路径
  • 四个并行流
  • 加上原生视觉编码器

中国芯片角度与服务影响

硬件/服务方面是此次发布最受讨论的部分之一。

Z.ai 自身表示该模型“完全运行在中国AI芯片上”。最强的放大解读来自 SemiAnalysis,其聚焦于“每天在国产芯片上处理100万亿token”的声明。该推文并未提供所有推导过程,但将其描述为此次发布的最令人震惊的基础设施成就。

反应强调了其重要性:

  • theo:“Ox 作为‘flash’模型已经非常疯狂。所有流量都运行在国产芯片上更是疯狂。”
  • 同日开源情绪帖子将 GLM 整合进更广泛的开源庆祝叙事中。

teortaxesTex 还给出了明确的估算推导:

  • 如果推理经济性与 V4-Flash 相当,
  • 每秒 10,000 token/NPU 是“现实的”
  • 每芯片每天 8.64 亿 token
  • 每天 100 万亿 token 将意味着约 11.6 万芯片
  • 表明需要 10 万+ 芯片规模,“可行”但会消耗总计算资源的庞大比例

该估算属于推测而非确认,但它展示了工程师如何解读服务声明:不仅作为营销噱头,更作为基础设施声明,暗示着非常庞大的国产加速器集群和成熟的推理优化能力。

采用与分发反应

反应周期中值得注意的部分是使用帖子出现的速度之快。

Cline 表示 GLM-5.3 Flash 已经成为其历史上增长最快的模型,不到一周就驱动了所有流量的 11%,同时在 Cline 上宣传其为免费模型。这在一定程度上是促销行为,但也是一种具体的市场需求信号。

基础设施提供商迅速行动:

  • CoreWeave:“即将上线 CoreWeave 无服务器推理”
  • Baseten:零日可用性,强调通用智能 + 代理编码、原生视觉和 100 万上下文
  • Dell 通过 Jeff Boudier:将 GLM 5.3 Flash 和 Qwen 3.8 Flash 框架为适用于本地部署的开源模型

这很重要,因为它强化了 GLM-5.3-Flash 并未被视为奇观,而是立即被纳入实际推理/开发者堆栈中。

事实 / 可归因于外部的声明

  • Z.ai 推出了 GLM-5.3-Flash 模型,总参数量为 320B,活跃参数量为 18B,支持 100 万上下文长度,采用 MIT 许可证,具备多模态能力,此前曾以 Ox Alpha 名称进行过预览。
  • Z.ai 声称该模型运行在国产 AI 芯片上。
  • Artificial Analysis 报告显示该模型的 AA 智能指数为 57,每任务成本为 0.09 美元,并提供了各种基准测试细节和定价信息。
  • Artificial Analysis 后续将上下文长度列表从 400k 更正为 1M。
  • 李子轩表示聊天模板已更新,模型用户应重新下载。
  • Cline 表示该模型在一周内驱动了全部流量的 11%。
  • Baseten、CoreWeave、AutoClaw 等公司宣布了对该模型的支持/分发。

观点 / 解读

  • theo、zephyr_z9 和 nicdunz 表达了强烈的积极惊喜。
  • thealexker 将此次发布解读为效率工程的典范。
  • eliebakouch 将其视为中国前沿开源架构令人兴奋的融合证据。
  • zainhas 认为这现在是性价比最高的智能选择。
  • skalskip92 认为该模型在视觉任务上表现不佳,对发布时强调的多模态特性提出质疑。
  • scaling01 声称 Ox Alpha 作为 GLM 模型是“显而易见”的,并进一步指控 ZAI 使用了营销账号;该说法在推文集中尚未得到验证。

不同视角

使用 7 天免费试用继续阅读

订阅 Latent.Space 以继续阅读本文并获得 7 天免费访问完整文章档案的权限。

开始试用

已是付费订阅者?

上一篇

下一篇文章