[AINews] GLM > GPT? GLM-5.2 passes vibe check; Z.ai forecasts Open Fable by December
![[AINews] GLM > GPT? GLM-5.2 passes vibe check; Z.ai forecasts Open Fable by December](/api/img-proxy?url=https%3A%2F%2Fsubstackcdn.com%2Fimage%2Ffetch%2F%24s_!MgR2!%2Cw_1456%2Cc_limit%2Cf_auto%2Cq_auto%3Agood%2Cfl_progressive%3Asteep%2Fhttps%253A%252F%252Fsubstack-post-media.s3.amazonaws.com%252Fpublic%252Fimages%252F3af66988-dd32-43bd-b9bf-84636ea1ccf8_816x514.png)
TL;DR · AI 摘要
GLM-5.2在多个基准测试中表现优异,被认为是首个接近前沿水平的开源模型,Z.ai预计将在年底前推出Open Fable模型。
核心要点
- GLM-5.2通过多项基准测试,被认为是首个接近前沿水平的开源模型。
- Z.ai预计将在2026年底推出Open Fable模型,具备抗蒸馏攻击能力。
- GLM-5.2引入了IndexShare技术,降低100万token推理成本。
结构提纲
按章节快速跳转。
- §引言
GLM-5.2在多个基准测试中表现优异,被认为是首个接近前沿水平的开源模型。
Z.ai预计将在2026年底推出Open Fable模型,具备抗蒸馏攻击能力。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- GLM-5.2与Open Fable模型
- GLM-5.2性能表现
- 通过多项基准测试
- 引入IndexShare技术
- 降低100万token推理成本
- Z.ai未来计划
- 预计2026年底推出Open Fable模型
- 具备抗蒸馏攻击能力
金句 / Highlights
值得收藏与分享的关键句。
GLM-5.2通过多项基准测试,被认为是首个接近前沿水平的开源模型。
Z.ai预计将在2026年底推出Open Fable模型,具备抗蒸馏攻击能力。
GLM-5.2引入了IndexShare技术,降低100万token推理成本。
[AINews] GLM-5.2 是真正的突破;Z.ai 预测年底前将推出 Open Fable
AINews:工作日精选
[AINews] GLM > GPT?GLM-5.2 通过氛围测试;Z.ai 预测年底前推出 Open Fable
随着 GLM-5.2 通过了所有人的氛围测试,开源模型的故事终于成为了一个真正的前沿故事。
2026 年 6 月 19 日
不要错过我们今天 Anj Midha 的节目以及 AIE World’s Fair 的常规门票!
在 AI 新闻领域,谈到开源模型时,总会有些忐忑:它们一开始火力全开,在重要基准测试中表现亮眼,但一个月后却逐渐被遗忘,仿佛从未存在过。换句话说:它们被“基准测试了”。而我们在这里 LS 不喜欢报道你很快就会忘记的新闻。
读者告诉我们,他们喜欢 AINews 的一个政策,就是如果今天没有发生什么大事,我们会直接说出来(一份告诉你可以跳过它的通讯非常罕见,部分原因是我们不是以眼球驱动的商业模式运营的。1)。越来越多地,我们也尝试做相反的事情——反复指出一个显著趋势的重要性,与过滤低信号同样重要。
GLM 5 通过了这个门槛,而 GLM 5.1 却没有。我们两天前报道的 GLM 5.2 看起来有些不同,而今天的多个样本数据点证实了这一点,它们通过了“这是一个前沿模型,恰好是开源的”氛围测试:
Jeremy Howard,这个节目的朋友,不轻易吹捧,真诚地称赞它:
而 Artificial Analysis 的新知识工作基准测试也给它比 GPT 5.5 更高的评分:
它还通过了 /r/LocalLlama 的氛围测试:
Z.ai 被验证为一个真正的前沿实验室,这一趋势现在变得越来越明显;(中国)开源模型最终取得胜利的里程碑,就是我们何时能够获得一个开源的 Fable 级模型,而不会受到蒸馏攻击的可能性(Z.ai 明显不在 Anthropic 2 月份“工业规模蒸馏”报告中被指控的中国实验室名单中):
没人能回答的棘手问题是——在接下来的 6 个月内,顶尖的 4 家实验室中是否有任何一家能够再次发布另一个 Fable 级模型,还是持续的 Mythos 禁令让一切陷入停滞?
2026 年 6 月 17 日至 6 月 18 日的 AI 新闻。我们检查了 12 个 Reddit 论坛、544 个 Twitter 帐号,没有进一步的 Discord。AINews 的网站可以搜索所有过往的期数。提醒一下,AINews 现在是 Latent Space 的一部分。您可以选择加入或退出电子邮件频率!
- GLM-5.2 成为了当天的共识性开源模型话题:多位实践者独立指出,智谱的 GLM-5.2 是首个在日常使用中感觉接近前沿水平的开源权重模型。@rasbt 强调了架构上的变化:除了继承自先前 GLM/DeepSeek 风格设计的 MLA 和 DSA 之外,GLM-5.2 还新增了 IndexShare,通过在多个层组之间复用稀疏注意力的 top-k 索引,从而降低 100 万 token 推理的成本。社区的反响异常强烈:@jeremyphoward 表示对于他的使用场景,GLM-5.2 至少和 Opus 4.8 以及 GPT 5.5 同样好,但同时也指出其主要的不足是缺乏视觉支持;@matvelloso 表示这是首个通过他“日常驾驶”标准的开源模型;@ArtificialAnlys 在一个新的代理知识工作评估中,将其定位在 GPT-5.5 和 Opus 4.8 之间。智谱还积极地推动了 GLM-5.2 的可用性:在有限的时间窗口内通过 Hugging Face 推理服务免费提供;通过 llama.cpp/Unsloth 提供本地 GGUF 支持;并且根据 @ZixuanLi_ 的数据,其在 21/70 到 48/70 内部任务上的应用开发增量显著优于 GLM-5.1。
- 其他开源模型的发布也引起了关注:@poolsideai 在 Apache 2.0 许可下发布了 Laguna M.1 的权重,支持 256K 上下文;@vllm_project 将其描述为一个 70 层的稀疏 MoE 模型,总参数量为 225B,激活参数量为 23B,拥有 256 个专家,top-k=16,优化用于长周期代理编码,支持交错推理/工具使用。随后,Poolside 展示了在 Apple Silicon 上运行的 3 位 MLX 构建,其在 M3 Max 128 GB 机器上的吞吐量约为 26 tok/s,峰值内存约为 100 GB @poolsideai 。在较小的模型方面,@cohere 推出了 North Mini Code,支持 4 位量化、Ollama 支持以及免费的 OpenRouter 访问;@ollama 增强了对开源本地部署的支持。
代理工具、工作流自动化和编码工具
- 重心正从“模型”逐步转向“模型 + 工具 + 内存 + SCM”:@_xjdr 发布了一篇详细的论述,指出传统的 git/GitHub 工作流在数十到数百个并发运行的代码代理下会失效,原因包括陈旧的工作树、分歧的评审状态、环境设置的开销以及状态同步的不足。他提出的替代方案结合了虚拟浅层检出、jj、类似 Sapling 的提交堆栈、云同步、文件级 ACL 以及从模型到 SCM 到远程运行时的垂直整合,现在通过 Noumena Code / ncode 产品化,并且之后其推理引擎和模型将免费提供访问 @_xjdr 。同样地,@gneubig 认为基准测试应评估工具 + LLM 的组合,而不是单独评估其中任何一个;他的 OpenHands 对比发现,根据模型家族和成本配置的不同,结果也不同。
- 自动化原语正变得更容易教学和复用:@OpenAIDevs 推出了 Codex Record & Replay,允许用户演示一次工作流,然后将其转化为可检查的技能;@cursor_ai 启用了 /automate,Cursor 通过自然语言任务配置触发器/指令/工具,增加了 Slack 表情触发器、GitHub 触发器以及云代理的计算机使用功能。@ClaudeDevs 在 Claude Code 中推出了 Artifacts,使代理能够将正在进行的工作转化为可共享的实时页面;@_catwu 表示,这已经改变了内部的工作流程,包括架构变更和原型共享。
- 安全性和审查正成为代理任务的一等重要事项:@cognition 将自动安全审查功能添加到 Devin Review 中,而 @shayanshafii 将 Devin 用于安全领域,通过代理推理和利用链式反应,将低严重性发现整合为确认的严重性漏洞,从而解决了 AppSec 领域长期存在的“发现与修复”之间的割裂问题。
- 在工具领域,互动性最高的推文是:@OpenAIDevs 的 Codex Record & Replay 是该组中互动性最强、信号质量最高的开发者工具相关帖子,反映了开发者对通过演示教学代理工作流程的强烈需求。
基准测试、评估和长期代理测量
- Artificial Analysis 推出了一项更现实的代理知识工作基准测试:@ArtificialAnlys 推出了 AA-Briefcase,围绕多周项目、数千个碎片化输入、Slack/电子邮件/文档语料库以及财务模型和董事会演示文稿等交付成果构建。在该基准测试中,Claude Fable 5 以 1587 Elo 分领先,其次是 Opus 4.8 以 1356 Elo 分,GLM-5.2 以 1266 Elo 分成为最强的非 Anthropic 开源模型。重要的是,该基准测试揭示了质量和经济性:Fable 5 平均每任务 31 美元,Opus 4.8 每任务 10.40 美元,GPT-5.5 xhigh 每任务 3.68 美元,GLM-5.2 每任务 2.40 美元,而一些较弱的选项则便宜了几个数量级。更广泛的经验教训不仅仅是排行榜的变动,而是现实世界中的长期知识工作仍然具有挑战性:顶级模型仅在 3% 的任务中满足所有评分标准。
- 其他基准测试工作也朝着相同方向推进:@terminalbench 发布了 Terminal-Bench Challenges,用于长期、高令牌密集型的单任务;@omarsar0 提出了 SkillWeaver,将代理路由视为组合技能检索 + DAG 规划,而不是单一工具选择;@arena 描述了 Agent Arena 的因果追踪方法,通过可操控性、bash 恢复和工具幻觉等信号来量化人类与 AI 协作的价值。此外,@isidoremiller 继续对代理评估质量进行元批评,认为当前的分析代理基准测试经常测量了错误的内容。
推理、检索和系统效率
- 推理和检索优化仍然是一个强有力的主题:@liquidai 发布了 LFM2.5-Embedding-350M 和 LFM2.5-ColBERT-350M,这是支持 11 种语言的多语言检索模型,声称在企业级堆栈上实现了 1.5 毫秒的端到端检索延迟。@CoreWeave 声称 Kimi K2.7 Code 的服务速度达到每秒 289 个 token,强调了提供方的价格/性能作为差异化因素。@vllm_project 报告称,通过直接流式传输、Ray V2 执行器后端和基于 HAProxy 的入口路由,Ray Serve LLM + vLLM 在预填充密集型工作负载上实现了高达 4.4 倍的吞吐量提升,在解码密集型工作负载上实现了 24 倍的提升。
- 向量数据库/解析经济性有了实质性改善:@turbopuffer 将其基础计划从每月 64 美元降低到 16 美元,然后增加了 i8 向量,与量化感知嵌入结合使用时,每维度字节数降低了 4 倍,存储/查询成本降低了高达 75%。在文档方面,@llama_index 和 @jerryjliu0 发布了 LiteParse v2.1,声称这是最快的开源、无模型 PDF/文档 → markdown 管道,三个基准测试中优于多个开源解析器基线。
- OpenAI 的一天格外关注健康领域:@OpenAI 与波士顿儿童医院/哈佛大学合作,分享了一项发表于《新英格兰医学杂志》(NEJM)的 AI 研究,表明 o3 Deep Research 帮助临床医生重新审视之前未解决的儿科罕见病病例;@gdb 总结称,这项研究在 376 个之前未解决的病例中发现了 18 个新诊断。另外,@OpenAI 表示,GPT-5.5 Instant 现在在健康相关问题上的表现已与前沿的“思考”模型相当,这一结论得到了来自 60 个国家、49 种语言、26 个专业领域的数百名医生的反馈支持。
- OpenAI 还发布了更广泛的对齐工作:@OpenAI 引入了关于训练模型以实现广泛且持续有益的研究,声称在健康领域对话中使用强化学习(RL)来加强诸如诚实、谦逊和对人类福祉的关注等特质,使 44/53 项内部和外部对齐及效益评估得到提升,甚至仅针对健康领域有益特质的训练也使 17/19 项非健康对齐评估(包括欺骗和编码奖励黑客)得到改善,如 @thekaransinghal 所述。这还处于早期阶段,但这是目前为数不多的尝试将“广义有益行为”进行操作化,而非仅仅依赖狭窄的拒绝式安全措施。
热门推文(按互动量排序)
- @narendramodi 与 Mistral 的 Arthur Mensch 会面:主要是地缘政治而非技术内容,但值得注意,这是另一个国家级 AI 外交和印度合作定位的信号。
- @OpenAIDevs 关于 Codex Record & Replay:当天最重要的开发者工具帖子;强有力地验证了基于演示的自动化作为产品界面的有效性。
- @ClaudeDevs 关于 MCP 的企业级管理认证:受到高度关注的企业基础设施公告;通过 IdP 为 MCP 连接器提供中央认证,是企业代理部署的重要基础设施。
- @OpenAI 关于 GPT-5.5 Instant 健康改进:这是主流产品模型围绕特定领域实用价值进行调整的最强信号之一,且由医生主导的评估循环支持。
- @jeremyphoward 关于 GLM-5.2 和 @ollama 扩展 GLM-5.2 云容量:两者共同体现了当天开源模型的氛围——GLM-5.2 不仅发布,还立即接受了压力测试、获得赞誉并投入实际应用。
AI Reddit 总结
/r/LocalLlama + /r/localLLM 总结
1. GLM-5.2 本地访问与量化
- GLM-5.2 对本地 AI 来说是个好消息(活动:1623):这篇文章认为,尽管 GLM-5.2 的总参数 MoE 规模达到 753B(约 40B 活动/令牌),但其 MIT 许可证、28.5T 令牌的预训练规模、声称的 1M 上下文 / 131k 输出支持以及前沿级别的代码代理行为,使其能够将高质量的合成数据蒸馏到 8B / 70B 的本地模型中。作者估计,FP8 的推理内存需求约为 744–890GB,而动态 1 位量化则可降至约 176–180GB,FP16/BF16、8 位或 4 位缓存的 KV 缓存开销分别为每 100k 令牌约 15–20GB、7.5–10GB 或 3.5–5GB,同时指出该表格是 AI 生成的,数据仅供参考。评论者报告了基于 API 的良好印象,其中一人声称 GLM-5.2 和 MiniMax/Mimi 模型在很大程度上缩小了与专有前沿模型之间的差距,并表示他们更信任 GLM-5.2 而不是 Opus 4.8。其他人则对“本地”实用性提出质疑:一些拥有 512GB Mac、GB10 集群或多个 128GB AMD AI Max 系统的用户可能可以运行它,但硬件需求正变得越来越“难以获得”,这激发了人们对蒸馏或密集的 70B 版本的兴趣。几位评论者将 GLM-5.2 视为缩小大型开放权重/API 可访问模型与前沿封闭模型之间差距的举措,其中一位用户表示,结合 MiniMax M3 / Mimi-V2.5-Pro,前沿与大型开放模型之间的“距离已经基本消失”。他们特别将信任和交互质量与 Claude Opus 4.8 和 GPT-5.5 进行了比较,同时承认这些模型仍然无法解决一些“前沿问题”。硬件可行性也引发了讨论:虽然 512GB Mac、GB10 集群或多个 AMD AI MAX 128GB 系统在技术上可以运行这种规模的模型,但一位评论者认为,当上下文长度较大时,Mac Studio 级别的设置变得不切实际。提到的瓶颈是 50K+ 上下文窗口下的 PP/TG 性能较差——“你可以运行它,但它并不实用”,突显了模型在内存中适配与实现可接受的生成吞吐量之间的区别。一位评论者强调了 GLM-5.2 的参数效率,指出其在不到 800B 参数的情况下即可达到 Claude Opus 4.6 的能力水平,并推测像 GLM-5.2 Air(200B–300B)或 GLM-5.2 Flash(约 40B)这样的较小衍生版本可能特别有吸引力。他们还将这一点与预期的下一代开放模型(如 Gemma 5 和 Qwen 4)联系起来,假设 Gemma 4 和 Qwen 3.5/3.6 的能力提升将继续下去。
使用 7 天免费试用继续阅读
订阅 Latent.Space 以继续阅读这篇文章,并获得 7 天的免费访问完整文章档案的权限。
开始试用
已经是付费订阅者?
上一篇