Latent Space

[AINews] SpaceXAI Grok 4.6 and Grok @Bot

8.5内容质量

TL;DR · AI 摘要

SpaceXAI发布Grok 4.6模型,性能超越竞品且效率更高,Grok Bot作为AI队友已进入早期测试。

核心要点

  • Grok 4.6是1.5T参数模型,在AA-Briefcase基准测试中成本比其他领先模型低30%。
  • Grok Bot能登录用户工具执行任务,目前处于早期测试阶段且用户反馈积极。
  • 模型通过补充训练优化了长期代理任务处理能力,包含STEM和软件工程领域数据。

结构提纲

按章节快速跳转。

  1. 介绍AI队友领域新突破,Grok Bot作为重要进展。

  2. ·Grok 4.6模型详解

    1.5T参数模型通过补充训练提升长期代理任务处理能力。

  3. AA-Briefcase基准测试

    在知识工作基准测试中表现优异且成本效益显著。

  4. AI队友可执行工具登录和任务完成,处于早期测试阶段。

  5. 使用高质量工程数据和改进优化器进行补充训练。

  6. 可能重塑AI队友市场格局,与 Claude Tag 等产品竞争。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Grok 4.6与Grok Bot
    • 模型参数
      • 1.5T参数规模
    • 训练方法
      • 补充训练优化器
      • 领域数据覆盖
    • 应用案例
      • Grok Bot工具集成
      • AA-Briefcase基准测试

金句 / Highlights

值得收藏与分享的关键句。

#Grok 4.6#AI队友#SpaceXAI#模型训练
打开原文

[AINews] SpaceXAI Grok 4.6 和 Grok @Bot - Latent.Space

AINews:工作日精选

[AINews] SpaceXAI Grok 4.6 和 Grok @Bot

AI 同伴类别迎来了迄今为止最重要的新成员

2026年8月13日

今年我们反复强调的一个主题是编码代理突破知识工作的边界,显然 AI 同伴/多玩家/多代理领域将成为下一个重要的 AI 战场。随着 Claude Tag 发布后评价两极分化,Block 的 Buzz 需要更专业的用户群体,这个领域仍有机会诞生新的领导者,现在 Cursor→SpaceX 团队已成功推出 Grok Bot 并获得积极反馈:

Grok Bot

@bot

我们很高兴推出 Grok Bot,目前处于早期测试阶段。这些 Bot 是能实际为您工作的 AI 同伴。它们可以登录您的工具,像您一样使用它们,并返回完成的工作。

2026年8月11日 下午5:09

·

2290万次浏览

2330条评论

3220次转发

28900个赞

这得益于他们最新发布的模型 Grok 4.6,今天发布后被普遍认为是全球第二大知识工作模型(竞争对手 Cognition 和 Elon 都认可这一说法)……不过在效率方面它无疑是首屈一指:

人工分析

@ArtificialAnlys

Grok 4.6 在我们的代理知识工作基准 AA-Briefcase 上取得了显著进展,成本却远低于其他主流模型。AA-Briefcase 测试模型在长期代理知识工作任务上的表现,测试集为私有数据以防止数据污染。Grok 4.6 的表现与

2026年8月12日 下午5:55

29600次浏览

28条评论

35次转发

479个赞

Grok 4.6 是确认的1.5万亿参数模型,"在 Grok 4.5 的基础上,特别关注长期运行的代理和更复杂的交互及视觉工作"。唯一公开的训练信息如下(重点部分由我们强调):

Grok 4.6 的补充训练时长比 Grok 4.5 更长,使用了精心筛选的模型生成数据用于推理和高级技术概念,高质量的工程数据,以及改进的优化器和训练方案。这为后续的 SFT 和 RL 阶段打下了更坚实的基础。随后我们使用 Grok 4.5 重新生成了所有推理任务、代理框架和包括 STEM、软件工程和知识工作等领域的 SFT 轨迹,并通过模型检查过滤掉有问题的轨迹。最终的 SFT 检查点表现出色且行为更优。Grok 4.6 在广泛的代理 RL 任务上进行了训练,包括知识工作、通用编程以及针对内核优化、网页开发、计算机辅助设计等领域的专用环境。

目前尚不清楚在训练 Grok 4.6 时未发生沙盒逃逸事件,是证明了他们的基础设施工程师能力,还是对研究人员的批评。

(这是一个关于当前事件的玩笑,别生气)

2026年8月11日-8月12日 AI 新闻。我们检查了12个Reddit版块、544个Twitter账号,未发现更多Discord信息。AINews官网可搜索所有过往内容。提醒您,AINews现已成为Latent Space的一个版块。您可以选择是否接收电子邮件通知!

  • Grok 4.6 在性价比方面达到前沿水平:xAI 发布了 Grok 4.6,其性能在相同价格下较 4.5 有显著提升。Artificial Analysis 的独立评估显示其在智能指数中排名 61,与 GPT-5.6 Sol Max 基本持平,落后于 Claude Opus/Fable,但在代理任务中表现突出,例如 Terminal-Bench v2.1 达到 88.4%、GDPval-AA v2 Elo 达到 1753,且在 AA-Briefcase 任务中以远低于竞品的成本实现竞争力(AA-Briefcase 备注)。Code Arena 的早期数据也显示其在 Web 开发任务中接近 GPT-5.6 Sol 和 Claude Fable。定价是核心亮点:AA 强调每百万输入/输出 token 仅需 $2/$6,显著低于行业标杆,从业者立即将其视为编程和缺陷检测任务的新默认选择(Pawel Huryn,Devin 的 Cognition 可用性)。xAI 表示性能提升源于更长的补充训练、重新生成的 SFT 追踪数据,以及在编程、网页开发、CAD 和内核优化领域的代理强化学习;他们还报告在长任务中表现出更强的自我测试行为(@kimmonismus 总结)。Elon 同时表示 Grok 4.7 已经进入测试阶段,初始训练已完成,计划使用 SpaceX 内部数据进行补充训练。
  • Qwen3.8-Max 开源权重版本发布:阿里巴巴的 Qwen3.8-Max 以 2.4T 总参数量/95B 激活 MoE 的开源模型形式发布。社区关注其规模、即开即用的部署能力以及长上下文/代理任务的定位:Yuchen Jin 称其为迄今为止最大的开源模型之一;vLLM 提供了即开即用支持,并为 NVIDIA B300 和 AMD MI355X 提供了特定厂商的 4 位检查点;Together AI 和 Baseten 也宣布了即时支持。用户特别提醒:此次发布的开源版本似乎仅限文本输入,初始版本未包含视觉输入(skalskip92)。
  • DeepSeek V4 Pro GA 以经济性冲击市场:DeepSeek 的 V4 Pro GA 发布立即引发关注,焦点并非“每项指标均为最佳”,而是其经济性。多位观察者强调其定价为 $0.435/M 输入和 $0.87/M 输出(kimmonismus),Cline 称其成本约为 Fable 5 的 57 分之一,同时报告相比预览版有显著提升,包括 Terminal Bench 提升 15.8%。能力评估反应不一:部分早期用户认为其表现稳健但未在所有任务上明显超越 Kimi/Flash(Yuchen Jin 的综述,scaling01,teortaxesTex),这表明 DeepSeek 的下一步提升可能更依赖于强化学习环境和代理工作,而非单纯规模扩大。
  • 微软推出自有推理模型:Mustafa Suleyman 宣布了 MAI-Thinking-1,微软首款“从零构建”的推理模型,现已在 Foundry 上线。团队的初始需求格外务实——Finbarr Timbers 特别请求对工具使用进行反馈——这表明微软将其定位为应用推理模型,而非单纯的基准测试参与者。
  • Solar Pro 4 也实现跃升:Artificial Analysis 报告显示,Upstage 的 Solar Pro 4 在智能指数中从 14 跃升至 42,尤其在代理任务和长上下文任务中提升显著,但仍在原始得分和价格两个维度上落后于当前顶尖前沿模型和开源领导者。

开源多模态与边缘模型:视频、视觉、语音及本地推理

  • LTX-2.5 与开源视频栈持续改进:@RisingSayak 指出 Lightricks 的 LTX-2.5 已集成到 Diffusers 中,新增了对本地工作流至关重要的实用功能:联合视频 + 48 kHz 音频生成、提示控制的片段长度、双通道质量模式、降低内存占用的分块渲染,以及预处理阶段对输入图像的重新压缩以更好地匹配训练数据。同日 Ostris AI Toolkit 也新增了对 LTX-2.5 的支持。更广泛地看,多个账号将本周描述为开源多媒体发布的异常强劲时期,涉及 MiniMax H3、LTX-2.5、LFM2.5-VL-3B 和 North Micro Vision(victormustar、multimodalart)等项目。
  • 小型 VLM 与本地多模态技术正加速发展:Cohere 推出 North Micro Vision,这是一个基于 Apache-2.0 开源协议的小型视觉语言模型(VLM),专注于文档理解,声称在广泛视觉基准测试中表现优于 Gemma 4 E2B 和 Ministral 3 3B(结果讨论)。Liquid AI 的 LFM2.5-VL-3B 也被多次提及为强大的紧凑型视觉模型,用户展示了混合本地/远程代理架构的实例,例如 Hermes Agent 使用 DeepSeek V4 Flash 进行规划,同时使用 LFM2.5-VL-3B 进行本地视觉处理。
  • 语音与手语模型发布内容异常丰富:Google DeepMind 宣布推出 SL2T,这是一个用于 Android/Pixel 11 的手语转文本系统。后续技术细节颇具价值:身体姿态追踪在设备端完成,翻译在服务器端执行,系统针对单手手语等现实约束进行了优化(详情)。另外,Deepgram 推出 Flux TTS,这是一个低延迟对话式 TTS 模型,声称响应时间约 80 毫秒,并支持通话中的语音代理动态适配。

推理、压缩与系统:vLLM、量化、CUDA 调度与排序基础设施

  • vLLM 为巨型模型和长提示新增关键基础设施:vLLM 现在支持 Azure Blob 路径用于模型加载和 KV 连接器。微软/NVIDIA 的技术方案具有实际意义:通过 Dynamo ModelExpress 实现更快速的权重加载(在 H100/A100 上快至 7.3 倍),以及通过 LMCache + NIXL 使用 Blob 后端的 KV 缓存,在长提示工作负载中以获取操作替代重新计算(后续更新)。
  • 压缩技术正在延长超大规模模型的使用寿命:LLM Compressor v0.13.0 新增了针对 MoE 模型的 REAP 专家剪枝功能——在量化前根据校准显著性移除整个专家——以及任意 3/5/6/7 位量化支持。在极端情况下,Unsloth 声称通过动态 1 位量化将 Qwen3.8-2.4T-A95B 从 4.9 TB 压缩至 397 GB,使 410 GB+ 内存/显存系统实现本地执行成为可能。他们还展示了 2 位 Nemotron 3.5 Lightning 配置,在 22 GB 显存中支持长时间工具使用会话。
  • GPU 内核开发正变得更安全且更具声明性:maharshii 突出了 CuTeDSL 4.7.0 任务调度内核,允许开发者显式声明线程块角色、资源、依赖关系和调度方案,从而在生成 GPU 代码前实现对死锁、竞态和屏障初始化的静态检查。同作者还发布了关于 TMA 异步复制前提条件的简洁说明——获取/释放语义、mbarriers 和 CuTe 算术元组——帮助人们理解现代 NVIDIA 内存移动原语(线程)。
  • 传统推荐/排序系统仍在默默带来成果:François Chollet 提到 Expedia 迁移到现代 Keras 3 架构,报告称排序模型的训练速度提高了 30%,推理延迟降低了 70%(tweet)。他的后续强调了一个更具战略性的观点:Keras 的与后端无关的 API 减少了团队后续需要 PyTorch 或 JAX 内核时的锁定风险(note)。

代理、Harness 工程与开发者工具:可靠性、内存、插件与安全性

  • 模型之上的堆栈正成为主要的产品界面:多条推文都聚焦于同一主题:许多实际收益来自于 Harness 工程、内存、审批、评估和工具,而非定制化模型训练。Scott Stevenson 重申了 RAG 和 Harness 工程通常优于训练的论点,因为它们能按客户个性化、避免隐私风险、实时改进并继承基础模型的进展(thread, follow-up)。Random Walker 补充了委托代理与协作代理之间有用的产品区分,两者在可验证性、延迟和人工控制方面的优化目标差异显著(tweet)。
  • 工具发布反映了这一转变:GitHub 的 @code 推出了 Agent Plugins 1.0,将技能、MCP 服务器和 AI 扩展打包在一起,并单独推出了 UX 改进功能,如粘性滚动和更好的会话处理(release thread)。OpenAI/Codex 方面的动向也有所体现,包括 Codex for Linux。LangChain 重建了 LangSmith 仪表板,以实现更有用的追踪分析和报告。
  • 内存和可移植的代理状态正成为基线期望:Hermes Agent 获得了多个生态系统更新,从树莓派部署到简单的配置文件导出/导入,以及新技能如从观察到的网络流量生成可重复使用的 API(Teknium)。LangChain 提供的托管深度代理示例明确聚焦于持久内存和重复工作流程,例如社交媒体代理(hwchase17)。
  • 代理的安全性和治理正变得具体:W&B 展示了一个并排的代理电子邮件示例,其中一个代理泄露了 SSN/信用卡信息,而另一个代理在模型看到这些信息之前阻止了提示注入并删除了秘密信息(thread start)。《Turing Post》提出了一个更架构层面的问题,围绕委托身份:如果代理直接使用你的 SaaS 凭据,撤销和审计将变得模糊(tweet)。

基准测试、研究方向与用于科学的 AI

  • AI 辅助的数学和科学声明正变得越来越难以忽视:最引人注目的技术推文是 Steven Strogatz 分享的一个故事,据报道,一位神经外科住院医师使用 ChatGPT 5.6 解决了数值线性代数中的一个重要开放性问题(tweet)。相关地,多个账号提到另一个 EpochAI 开放性问题似乎已解决(scaling01)。
  • 新的基准测试针对更不易被游戏化的技能:普林斯顿/麻省理工学院的合作者发布了 DiG-bench,这是一个基于文本的发现基准,而非标准问答或代码任务;tri Dao 特别称赞其具有 ARC 的一些特点,而没有视觉问题的干扰(tweet)。Redwood + Anthropic 推出了概念推理指数,针对 AI 风险相关的论证和概念推理,其中反馈稀疏且难以自动化。Vals 宣布了 SRE-Bench,专注于二进制逆向工程,而非源级网络任务。
  • 微调后的效率和长上下文研究表现突出:Lewis Tunstall 总结了 Direct On-Policy Distillation 方法,该方法在小型模型上执行强化学习,通过密集隐式奖励将产生的策略变化转移到大型模型,据文中实验设置显示可将流水线成本降低约50%。另外,dair.ai 对新 OLMo/Llama/Qwen 长上下文工作的总结指出,四个架构选择——归一化、GQA、预训练上下文长度和滑动窗口注意力——即使在短上下文验证表现良好的情况下,仍可能共同导致长上下文性能损失高达47%。
  • 临床和领域特定强化学习逐渐成熟:总结 Google ResidencyRL 工作的推文显示,通过49,870次模拟远程医疗场景训练 Gemini 3.5 Flash 模型,在对抗性条件下将诊断准确率从81%提升至88%,并减少31%的红旗误判(kimmonismus)。Snowflake 也提供了“更大未必更好”的有力反例:新推出的4B参数SQL自动补全模型超越了之前30B-A3B MoE模型,同时将中位延迟降低71%,并提升了用户接受度。

Top tweets(按互动量排序)

  • Grok 4.6 版本发布:@SpaceXAI 宣布了该模型;@elonmusk 进行了推广;Artificial Analysis 提供了最有用的独立分析。
  • Qwen3.8-Max 开源权重:@ClementDelangue、@Yuchenj_UW 和 @UnslothAI 涵盖了发布、部署和激进量化角度的分析。
  • DeepSeek V4 Pro 正式发布:@synthwavedd 跟进了发布进展;@cline 和 @kimmonismus 分析了其异常强劲的性价比表现。
  • 数学领域AI突破:@stevenstrogatz 分享了涉及 ChatGPT 5.6 的数值线性代数案例。
  • 可访问性里程碑:@GoogleDeepMind 宣布在安卓系统上推出 SL2T 手语转英语输入功能。

AI Reddit 总结

/r/LocalLlama + /r/localLLM 总结

1. Claude 文本水印功能上线

  • Claude 现在在所有文本输出中嵌入不可见水印,并在文件上添加签名元数据(活动:2077):Anthropic 表示 Claude 通过元数据/出处信号标记部分人工智能生成或编辑的内容,而非使用可见文本水印;该机制和持久性取决于文件类型和工作流程,在编辑、导出或平台处理后可能会丢失(支持文章)。对于纯文本,评论者质疑这是否意味着统计语言学水印而非附加元数据;根据 Anthropic 的描述,明确的声明是元数据/出处标记,而非嵌入任意复制文本中无法删除的水印。评论者对文本水印的实用性持怀疑态度,因为通过其他模型或本地 LLM 进行改写可能会消除可检测信号,部分人认为任何与 Claude 相关联的标记都可能成为隐私控制的理由,从而更倾向于使用开源模型。Anthropic/Claude 的部署细节:评论者引用提交声明指出,2026 年 8 月 2 日或之后发布的 Claude 模型将嵌入一种不可察觉的模型级文本水印,该水印旨在在复制粘贴和部分编辑后仍能保留,且不会影响可读性和语义。支持的文件输出格式如 .png、.jpg 和 .svg 也将携带数字签名的 C2PA 出处元数据,第三方检测工具仍在开发中,旧版本模型预计将在过渡期内更新。一个技术性担忧是鲁棒性:对于文本,用户认为通过其他模型(尤其是本地/开源模型)进行改写可能破坏水印,因为重述会破坏基于标记的统计模式。另一位评论者指出这并非 Anthropic 独有,并提到 OpenAI 的出处/水印工作:理解我们在网络上看到和听到的内容的来源。
  • AI生成文本中的“不可见水印”究竟如何实现?(活动:878):该讨论询问如何在Claude风格的LLM输出中嵌入不依赖隐藏Unicode的文本水印,技术方案是采用基于密钥的生成时机制,在采样过程中根据上下文和密钥对特定“优选”token进行微小偏置,通过z分数等统计指标检测其过代表现。评论者指出该方法对复制粘贴和小幅修改具有鲁棒性,但在大幅改写、句式重构或经其他LLM再生后效果会下降;Google在《自然》期刊描述的SynthID-Text方案采用了类似的锦标赛采样水印方法。主要质疑集中在认知层面:“如何确定文本是否被水印?”即检测依赖对密钥规则的访问或可信检测器,一旦文本被大幅重写,其鲁棒性主张将受到限制。有评论者将LLM文本水印描述为“基于密钥的采样偏置”:在生成下一个token时,模型会略微提升一组依赖上下文的隐秘token的概率,从而在保持流畅性的同时产生隐藏的统计模式。检测过程则通过重新应用相同的密钥规则,检查优选token是否出现概率显著高于随机水平,通常采用类似z分数的统计量进行判断;复制粘贴和轻微编辑可能保留该信号,但重度改写可能破坏水印。一个相关技术参考是《自然》期刊论文“用于识别大语言模型输出的可扩展水印方案”,该论文与Gemini风格的锦标赛采样等生产级方案密切相关。讨论还指出不同供应商的实现方式存在差异,有说法称水印可添加在采样/模型输出层而非需要可见文本标记。一个关键未解决的技术问题是误报风险:若检测纯粹依赖统计学,自然撰写的文本可能偶然过度使用“白名单”或优选token。这意味着实际检测器需要校准阈值、足够长的样本长度,并权衡误报与漏报的取舍,而非将水印检测视为确定性的二元信号。

2. 前沿模型安全与治理争议点

使用7天免费试用继续阅读

订阅Latent.Space以继续阅读本文并获得7天完整文章库免费访问权限。

开始试用

已是付费订阅者?

上一篇

下一篇