Kimi K3 Redraws the Open Frontier, Muse Spark 1.1 Undercuts Competitors, Cloudflare Moves to Cut Off Crawlers

TL;DR · AI 摘要
开放模型在防御安全事件中展现优势,封闭模型的防护机制反而导致防御失效,推动行业重新评估模型开放性价值。
核心要点
- GLM 5.2帮助Hugging Face分析攻击日志而无需数据外泄
- 封闭模型的防护规则导致防御失败
- 开放模型权重释放使技术透明度提升
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 开放模型防御优势
- 事件案例
- OpenAI测试事故
- Hugging Face防御过程
- 技术优势
- 本地化分析能力
- 避免数据外泄
- 行业影响
- 模型开放趋势
- 监管博弈加剧
金句 / Highlights
值得收藏与分享的关键句。
GLM 5.2允许在本地基础设施分析敏感日志,避免数据外泄
封闭模型的防护规则导致防御系统无法响应攻击
开放模型权重释放使技术透明度提升,促进安全改进
Kimi K3 重新定义开放边界,Muse Spark 1.1 挑战竞品,Cloudflare 限制爬虫
kg-card-begin: html
加载
Elevenlabs 文本转语音
AudioNative 播放器...
kg-card-end: html
亲爱的朋友们,
一些前沿实验室曾试图讲述一个关于开放模型危险的故事,声称它们可能被用于发起网络攻击,而他们"安全"的专有模型则通过严格的防护机制来保护我们。本周却出现了相反的情况:封闭模型的用户无意中发起了一次重大网络攻击;其他封闭模型由于防护机制反而未能有效防御这次攻击。最终,一个未受过度防护机制限制的开放模型反而协助了防御工作。
事件细节仍在浮出水面,但看起来OpenAI的研究人员在测试其系统时,意外允许自主代理攻击Hugging Face的基础设施。攻击成功并获得了某些数据集和凭证的未授权访问权限。这次攻击的特殊之处在于攻击代理协调了数以万计的自动化操作。
Hugging Face 从攻击中提取了日志,并试图使用商业托管的LLM进行分析以加强防御,但该LLM以安全为由拒绝了请求。因此,Hugging Face最终使用了开放的GLM 5.2模型来分析日志,帮助他们理解并应对攻击。Hugging Face还指出GLM 5.2的另一个优势:它允许他们在自己的基础设施上完成分析,敏感日志、攻击者数据或凭证都不需要发送给第三方供应商。
LLM的防护机制确实有其存在的意义。对于某些请求,例如涉及自残或伤害他人的详细指导,或明显犯罪行为的请求,我们更希望模型能够拒绝。但与其试图让LLM变得"安全",我更希望我们强调确保其使用方式负责任的重要性。就像锤子这样的工具,我们能做的安全防护是有限的,其帮助或危害更多取决于使用方式是否得当,而非制造方式。
但目前AI安全领域相当一部分工作已不再关注安全本身,而是旨在煽动恐惧以推动监管捕获。正如David Sachs指出的:"没有理由在中文模型能正常处理的任务上限制美国模型,我们只会让自己变得不那么有竞争力。"
我认为开放权重模型,以及更广泛的开放性——尽管有些公司错误地声称其危险——实际上能让技术更加透明,最终实现更安全。随着GLM 5.2的发布和Kimi K3权重的即将发布,开放权重模型已几乎追平专有前沿模型。因此,专有模型提供商正在大幅加速游说行动,试图压制开放权重竞争对手。正如Bill Gurley指出的,开源是一种成熟的企业战略,而非需要被管控的危险。
尽管Hugging Face被意外攻击令人遗憾,但很高兴在反开放模型游说最为激烈之际,我们有了一个明确案例证明开放模型实际上让网络防御变得更简单,从而提升安全性。
让我们继续为开源和开放权重模型发声并进行辩护!
继续构建!
Andrew
新闻
Kimi K3 揭示巨型前沿AI模型的工作原理
Moonshot 最新模型在多项基准测试中超越了仅发布一个月的 GLM-5.2 以及众多专有竞品,仅在 GPT-5.6 Sol 和 Claude Fable 5 之后排名。
最新进展:Moonshot AI 推出了 Kimi K3,这是一款拥有 2.8 万亿参数的视觉-语言模型。公司已通过 API 立即开放该模型,并承诺于 7 月 27 日前发布模型权重,这将使 Kimi K3 成为迄今为止参数规模最大的已知开源模型。
- 输入/输出:支持文本、图像和视频(最多 100 万个 token),输出文本(最多 100 万个 token,每秒 62.0 个 token)
- 架构:专家混合变压器架构,包含 Kimi Delta Attention 层;总参数量 2.8 万亿,每个 token 激活 896 个专家中的 16 个(估计约 500 亿参数)
- 特性:可调节推理级别(当前仅支持最高和最低档位,承诺未来提供中档位)、工具使用、结构化输出、自动上下文缓存
- 性能:在 Artificial Analysis 的 Intelligence Index 排名第三(57 分),在开源模型中排名第一;在 Arena.ai 的 Code Arena WebDev 领域榜单中排名第一
- 可用性:通过 Kimi.com、Kimi 移动应用、Kimi Work 应用和 Kimi Code CLI 使用;每百万输入/缓存/输出 token 分别收费 $3.00/$0.30/$15.00;权重即将发布;Kimi 应用会员计划从免费层级到每月 $199 不等
- 未公开信息:当前激活参数数量、训练数据集和方法、承诺权重的授权协议
工作原理:Kimi K3 集成了 Moonshot 最近发布的两项架构改进:Kimi Delta Attention(KDA),该技术通过减少长输入中注意力机制的内存和计算消耗来优化性能;以及 Attention Residuals,该技术允许每一层选择性地参考早期层的输出,而非简单地平均所有层的输出。Moonshot 表示,这些改进结合更稀疏的专家混合设计和优化的训练数据方案,使训练效率达到前代模型的 2.5 倍(以单位计算量下的模型提升为衡量标准)。公司承诺将在即将发布的技术报告中提供更详细信息。
- 该模型在四分之三的注意力层中使用 Kimi Delta Attention(KDA)。KDA 是一种线性注意力机制:无需将每个新 token 与所有历史 token 进行比较,而是维护一个固定大小的内存,在读取输入时动态更新,并决定何时覆盖旧信息。在 2025 年发布的实验性模型 Kimi Linear 中,KDA 在 100 万个 token 输入长度下将内存使用量减少高达 75%,同时将输出速度提升至原来的 6 倍。
- Kimi K3 使用 Attention Residuals 替代标准残差连接来传递信息。标准连接以相等权重将每一层的输出累加,导致层数增加时单层贡献被稀释。Attention Residuals 则通过深度维度应用注意力机制,使每一层能选择性地参考早期层的输出,类似于标准注意力机制对早期 token 的选择性参考。Moonshot 在今年早些时候发布的实验中开发了该技术的两种形式:一种是关注所有早期层输出的版本,另一种是 Kimi K3 使用的版本,该版本将层分组并关注各组的输出。使用块级 Attention Residuals 的模型在性能上与标准残差连接模型相当,但训练计算量减少了 20%。
性能:Kimi K3在独立测试中超越了所有开源权重模型,在智能性、代理任务和编码方面表现突出。在大多数基准测试中,它仅落后于少数几家顶级专有模型。
- 在Artificial Analysis的智能指数(由9项经济实用任务评估组成)中,Kimi K3在最大推理模式下得分57,仅落后于Claude Fable 5在最大推理模式下启用回退机制的60分,以及GPT-5.6 Sol在最大推理模式下的59分。最接近的开源权重模型是GLM-5.2在最大推理模式下的51分。
- 在AutomationBench-AA(测试跨商业软件的自动化工作流程)中,Kimi K3在最大推理模式下以53%的得分领先所有模型。在GDPval-AA v2(对金融、医疗、法律等经济核心领域常见任务进行模型性能的直接排名)中,Kimi K3在最大推理模式下以1,668 Elo分排名,仅落后于Claude Fable 5在最大推理模式下启用回退机制的1,760 Elo分,以及GPT-5.6 Sol在最大推理模式下的1,743 Elo分。
- Kimi K3首次登顶Arena.ai的Code Arena WebDev排行榜,该榜单由开发者对同一前端网页开发任务下两个模型的输出进行选择。发布时,其初步排名达到1,679 Elo分,在7个前端领域中有6个排名第一。
- Kimi K3在最大推理模式下完成Artificial Analysis智能指数任务的成本为每任务0.95美元,接近GPT-5.6 Sol在最大推理模式下的1.04美元/任务,低于Claude Fable 5在最大推理模式下启用回退机制的2.75美元/任务,高于GLM-5.2在最大推理模式下的0.47美元/任务。
新闻背景:过去一年,开源模型持续相互超越,但这是自2024年Llama 3以来它们距离最先进水平最近的一次。Kimi K2推出了Moonshot的1万亿参数系列,随后Kimi K2.5和Kimi K2.6依次成为Artificial Analysis智能指数的领先开源权重模型。竞争同样激烈:上个月,Z.ai的GLM-5.2以仅为同类专有模型四分之一的成本取得领先。Kimi K3发布仅三天后,Moonshot的财务支持方阿里巴巴推出了Qwen3.8-Max-Preview,这是该公司声称仅落后于Claude Fable 5的2.4万亿参数模型的早期版本,并承诺以开源权重形式发布。
重要性:Kimi K3消解了开发者选择模型时默认倾向顶级专有模型的每一个理由。它在每任务成本远低于Claude Fable 5的情况下,性能差距不超过3分,且发布后开放权重允许微调、蒸馏和更深入研究。权重拥有者可制定使用策略:Claude Fable 5拒绝的许多请求对Kimi K3用户不会造成阻碍。最后,如此接近的竞争——在价格、控制权和性能方面——迫使专有模型开发者推出更优质、更廉价的产品。
我们的思考:Kimi K3的效率提升源于线性注意力(KDA)、重新设计的残差连接和更高稀疏性等创新。其中两项创新由Moonshot以带代码的论文形式发布。当面临计算限制的实验室通过架构创新作出回应并公开成果时,所有开发者都将受益。
Meta点燃价格战
凭借Llama,Meta确立了自己作为OpenAI开源替代方案的地位。通过其新的闭源模型,Meta现在将自己定位为低成本、高价值的竞争对手。
更新内容:Meta 推出了 Muse Spark 1.1,这是专为智能体任务训练的视觉-语言模型,并开放了 Meta Model API,这是该公司首次向外界提供模型的付费访问服务。
- 输入/输出:文本、图像、视频(最多 1,048,576 个标记),文本输出(最多 131,072 个标记,每秒 119 个标记)
- 特性:工具使用、提示缓存、可调节推理(无、最小、低、中、高、极高)
- 性能:在工具使用基准测试 MCP Atlas(Scale AI)和 JobBench 中表现最佳,在 Artificial Analysis 的 Intelligence Index 指数中与 GPT-5.6 Luna 和 GLM-5.2 并列,每项任务成本较低
- 可用性/价格:通过 Meta AI 应用和 meta.ai 免费使用,通过 Meta Model API 访问(公开预览版,仅限美国,需加入候补名单,初始信用额度价值 20 美元)每百万输入/缓存/输出标记价格分别为 1.25/0.15/4.25 美元,网络搜索每 1,000 次查询 2.50 美元
- 未公开信息:参数数量、架构、训练数据和方法
工作原理:Meta 仅透露了关于 Muse Spark 1.1 构建方式的有限信息,该模型更新了自 4 月以来一直用于 Meta AI 的初始 Muse Spark 模型。公司的训练技术强调上下文管理、计算机操作和与其他智能体的协调。
- Meta 训练该模型在多个智能体编码框架中运行,这些框架将模型连接到文件、工具和测试,支持规划和子智能体编排等功能。
- 公司训练模型支持双向委托。在主导任务时,它会划分工作并将任务分发给同时运行的子智能体,从而缩短总完成时间。在其他智能体下工作时,它会严格遵守分配的角色,并在决策超出权限范围时将控制权交还给编排模型。
- Meta 表示,模型本身而非外围软件会在长期任务中调整输入上下文,从任务早期检索细节并压缩对话内容,同时保留后续步骤所需的信息。
- 在计算机使用方面,Meta 训练模型在自动化(编写脚本)和直接操作(点击或在虚拟键盘上输入文本)之间进行选择,优化速度和简易性。它还会同时发出多个操作而非每次仅一个操作,从而提升速度和性能。
性能表现:Muse Spark 1.1 在衡量智能体工具使用的基准测试中表现突出,但总体智能水平略低于顶级模型。在盲测人类比较中排名紧随领先者之后,在智能体编码中处于中游。它特别擅长降低每项任务的成本。
- 在 Artificial Analysis 的 Intelligence Index 指数上(由九项经济相关任务评估综合而成),Muse Spark 1.1 在设置为极高推理模式时获得 51 分,与 Z.ai 的 GLM-5.2 和 GPT-5.6 Luna(两者均设置为最大推理模式)并列,落后于设置为最大推理模式的 Claude Sonnet 5(53 分)。Muse Spark 1.1 每项 Intelligence Index 任务成本为 0.26 美元,低于除 GPT-5.6 Luna(每项任务 0.21 美元)外所有得分相同或更高的其他模型。
- 在 Arena.ai 的 Text Arena 平台上(通过盲测人类一对一比较对模型进行排名),Muse Spark 1.1 排名第六(1,490 Elo),落后于 Claude Fable 5(1,505 Elo)和四个 Claude Opus 版本,但领先于设置为极高推理模式的 GPT-5.6 Sol(1,486 Elo)。
- 在人工分析的编码代理指数(Artificial Analysis' Coding Agent Index)中,Muse Spark 1.1在xhigh推理模式下获得71.3分,低于GPT-5.6 Luna的max推理模式(71.4分),但高于Gemini 3.5 Flash的medium推理模式(70.1分)。每项任务成本约1.40美元,是所比较的编码代理中最低的,尽管每项任务耗时比其他模型更长。
- 在MCP Atlas(Scale AI的多步骤软件工具使用基准,通过模型上下文协议服务器进行评估)中,Muse Spark 1.1(88.1%通过率)排名高于Gemini-3.5-Flash的high推理模式(83.6%)和Claude Fable 5(83.3%)。在JobBench(一项测试白领职业专业任务的基准)中,Muse Spark 1.1(54.7%)排名第二,仅次于Claude Fable 5(57.4%),领先于Claude Opus 4.8(48.4%)。
新闻背景:Muse Spark 1.1发布时正值模型上线的密集期。同一天,OpenAI向公众开放了GPT-5.6系列;前一天,Grok 4.5以类似强调每任务低成本的方式发布。(两周后,Google推出了Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。)同周,Meta还推出了图像生成器Muse Image,并宣布了视频生成器Muse Video。Muse Spark 1.1也是Meta新Model API首次发布的模型。
重要性:令牌价格决定了哪些应用在规模化时具有经济性;通过Muse Spark 1.1,Meta改变了这一门槛。该模型的输出令牌成本仅为近似竞争对手的几分之一(Claude Opus 4.8、GPT-5.6 Sol和Claude Fable 5的每百万令牌成本分别为25美元、30美元和50美元),每任务的测量结果证实了这一折扣的真实性:根据人工分析的数据,唯一智能程度相当且运行成本更低的模型是GPT-5.6 Luna。扎克伯格将定价策略描述为对竞争对手经济模式的攻击,称其他实验室的定价“非常极端且利润率极高”。与Google一样,Meta可以通过广告收入补贴模型开发、训练和推理成本,这为其在依赖API利润率和订阅收入的实验室中提供了结构性优势。如果竞争对手被迫捍卫市场份额,整个行业运行代理的成本都将下降。
我们的思考:能力正从框架结构向权重迁移。指令遵循最初是提示工程,工具使用最初是围绕模型的代码包装;两者都成为训练目标。Muse Spark 1.1延续了这一趋势,吸收了开发者之前构建到框架中的行为,例如将任务委托给代理、在任务中途管理上下文等。开发者需要手动构建的外部工具越少,代理应用的普及速度就越快。
Cloudflare的网络爬虫升级
使用Cloudflare的网页发布者将很快能够根据AI bot的行为单独控制其访问权限,从而允许搜索索引同时阻止AI训练或代理活动。
最新动态:Cloudflare(为近20%的互联网提供内容分发网络服务)推出了新的AI流量控制功能,该功能默认阻止训练和代理bot,同时允许搜索索引爬虫。它还宣布了一项 monetization 工具,允许客户向指定访客(无论是人类还是bot)收取访问网页、数据集、API或模型上下文协议的费用。
如何运作:Cloudflare 客户可以根据爬虫的使用场景切换其访问权限,从而为搜索、AI 训练或 AI 代理启用或禁用爬虫访问权限。具有多种用途的爬虫将适用最严格的设置。例如,如果出版商选择阻止训练爬虫,像 Googlebot、Applebot 和 Bingbot 这类既为搜索引擎索引内容又收集 AI 训练数据的爬虫将被阻止。这些控制措施将从 9 月 15 日起开始实施。
- Cloudflare 将搜索引擎爬虫定义为为搜索引擎索引内容的爬虫;出版商历来欢迎这些爬虫,因为它们增加了网站内容出现在搜索结果中的可能性,从而带来流量。代理爬虫是代表用户执行网站任务的爬虫(例如获取数据或进行购买),而训练爬虫则是收集数据用于训练 AI 模型的爬虫。
- 对于每个类别,客户有三种选择:阻止所有页面、仅在包含广告的页面上阻止,或允许爬虫访问。默认情况下,显示广告的页面将阻止训练和代理爬虫(或像 Google、Apple 和 Bing 这样的多用途爬虫),但继续允许仅用于搜索的爬虫。
- Cloudflare 还推出了 BotBase,这是一个公开的已知爬虫和代理数据库,根据其行为对爬虫进行分类,并跟踪它们如何使用网站内容。Cloudflare 的“已验证”标签表示爬虫操作员已通过身份验证,其声明的身份与实际一致,遵守 robots.txt 指令,并不会试图绕过出版商的限制。出版商仍然控制是否允许该爬虫类别(如搜索或训练),但这也允许更精细的限制,例如阻止特定公司的搜索、训练或代理爬虫,同时允许其他公司。
- Cloudflare 的 monetization 系统使出版商可以按请求次数向 AI 代理收取访问在线数据的费用。当 AI 代理请求受保护的网页或 API 时,Cloudflare 会在将请求转发给出版商之前要求支付费用,并在网络层处理支付验证。该工具尚未发布,但客户可以加入等待名单以使用它。
新闻背景:AI 爬虫在网页流量中所占比例正在增长;Cloudflare 表示,目前超过一半(57.5%)的 HTTP 请求来自自动化系统而非人类。搜索流量的价值已经下降到一定程度,以至于一些出版商甚至选择退出 Google 搜索,部分原因在于他们不希望 Google 的代理爬虫绕过其展示广告或在他们的内容上进行训练。Cloudflare 的新框架试图在保留搜索优势的同时,给予出版商对其他形式 AI 爬虫更多的控制权。它也奖励像 OpenAI 这样将搜索和训练爬虫分开的公司,而惩罚像 Google、Apple 和 Microsoft 这样没有这样做的公司。
为什么重要:高质量网络数据的访问对于开发和改进 AI 模型仍然至关重要,但像 Cloudflare 这样的出版商和合作伙伴越来越限制数据的收集方式。这种摩擦带来了技术和经济成本。这些成本可能会对较小和较新的 AI 开发者产生不成比例的影响,因为这些开发者缺乏与出版商签订协议的资源,并且在获取大型公司已经纳入其数据集的在线知识时面临更大的障碍。
我们正在思考:Cloudflare认为AI公司与在线出版商之间可以达成某种协议,而公司本身将扮演收费关卡的角色。但这一做法触及了大多数AI公司坚持的基本原则,即在公共网络数据上进行训练应属于合理使用范畴。目前尚不清楚Cloudflare是否拥有足够的影响力来实施这种收费机制,以及其对“公平性”的定义是否会胜过大多数AI公司的定义。
网络检索扰乱大型语言模型
大型语言模型经常需要收集新闻信息。研究人员发现,在这项任务中,它们找到相关报道的能力是最薄弱的环节。
最新进展:斯坦福大学和云平台Together AI的Mirac Suzgun及其团队测试了六种配备网络搜索工具的流行大型语言模型(LLMs)回答每日新闻问题的能力。这些LLMs通常能准确作答,尤其是当问题本身包含准确信息且用英语提出时。当它们回答错误时,通常是因为检索到了无帮助的文章。
关键发现:LLM回答训练数据中未涵盖的事实性问题的能力至少依赖三个步骤:(i) 接收结构良好的问题,(ii) 检索相关文档,(iii) 从文档中提取事实。任何步骤的妥协都会导致输出质量下降。例如,包含错误事实的问题(如错误的人名)会使LLM难以正确回答。同样,检索到不包含必要事实的文档更可能导致错误答案。如果LLM未在文档语言上接受充分训练,它也无法从检索到的文档中提取事实。构建高性能的新闻报道系统需要掌握这三个步骤。
工作原理:作者于2026年2月9日至2月22日期间每天进行测试。他们基于BBC新闻的六种语言(阿拉伯语、英语、法语、印地语、俄语和土耳其语)报道提出问题。测试对象包括配备网络搜索工具的Google Gemini 3 Flash和Pro、xAI Grok 4、Anthropic Claude 4.5 Sonnet,以及OpenAI的GPT-5和GPT-4o mini。
- 每天,Gemini 3 Flash根据当前新闻为每种语言生成25道多项选择题(总计150题)。每个问题都以时间背景开头,如“今天是2026年2月10日……”,并提供五个潜在答案。正确答案是可验证的细节,如数字、地点或引语。
- 作者对LLMs进行了三类测试:(a) 五选一的多项选择题,(b) 引入单个错误前提(如错误的演员、时间线或细节)并添加“信息不足无法回答”选项的变体问题,(c) 原始问题(无选项)。
- 他们使用Claude Opus 4.7、GPT-5.4和Gemini 3 Pro的多数投票结果,将错误输出原因归类为八种类型,包括检索失败、检索到与问题所用信息不同的相关来源、理解不足和时间线错误等。
结果:这些模型在结构良好的英语问题上通常表现出高准确性。然而,(i) 它们在其他语言(尤其是印地语)上的表现较差,(ii) 大多数错误源于检索问题而非智能缺陷,(iii) 当问题包含错误前提时,它们的表现也明显下降。
- 在回答原始未修改的多项选择题时,排名前四的模型准确率均超过90%:Gemini 3 Flash(95.6%)、Grok 4(95.0%)、Gemini 3 Pro(93.7%)和Claude 4.5 Sonnet(90.4%)。GPT-5达到85%,GPT-4o mini为69%。(在自由回答问题场景下,模型保持相对排名,但准确率下降了11至22个百分点。)
- 在回答未修改的多项选择题时,所有模型在印地语问题上表现最差(平均79.3%)。即使问题使用其他语言(尤其是印地语)提出,模型仍频繁引用英文来源(如英文维基百科)。
- 错误的主要原因是检索失败(38.8%)。第二大原因是检索到主题相关但包含“聪明但错误”细节的来源(32.7%),这些内容虽与主题相关,却未能正确回答具体问题。
- 在包含虚假前提的修改后问题场景中,Grok 4(70%准确率)比其他模型至少高出15个百分点。GPT-5(19%准确率)在六种潜在答案选项中仅略高于随机猜测。
为什么重要:配备网络搜索功能的大型语言模型(LLMs)在查找事实信息方面具有优势,但其表现取决于能否接收事实输入、找到相关文档并正确提取事实。由于大多数错误源于检索环节,改进检索效果可能比扩大模型参数规模带来更显著的性能提升(至少在涉及时效性信息的查询场景中如此)。作者提出三种改进检索的方法:(i)更全面的索引覆盖范围(确定哪些文档或网页应纳入搜索),(ii)更精准的来源排序(确定检索到的文档向模型展示的顺序),(iii)更高效处理非英语语言查询。
我们的思考:专为智能体而非人类设计的网络搜索引擎正成为一个令人兴奋且快速发展的领域。看来,为智能体构建更优质的网络搜索仍有巨大提升空间!