Together AI Blog

From 732 bytes to nowhere: shutting down Copy Fail in production

3.0内容质量
From 732 bytes to nowhere: shutting down Copy Fail in production

TL;DR · AI 摘要

本文主要介绍了Together AI平台的多项服务更新,但缺乏深度和实用性的技术细节。

核心要点

  • Together AI平台更新了多项服务
  • 包括服务器无感推理、批量推理等
  • 但未提供具体技术实现细节

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Together AI平台服务更新
#Together AI#服务更新#AI平台
打开原文

从 732 字节到无处可寻:关闭生产中的 Copy Fail

图像 1⚡️ FlashAttention-4:在 NVIDIA Blackwell 上比 cuDNN 快达 1.3 倍 →

图像 2介绍 Together AI 的新外观 →

图像 3🔎 ATLAS:运行时学习加速器,最多可使 LLM 推理快 4 倍 →

图像 4⚡ Together GPU 集群:自助式 NVIDIA GPU,现已普遍可用 →

图像 5📦 批量推理 API:大多数模型的成本降低 50%,处理数十亿个标记 →

图像 6🪛 微调平台升级:更大的模型,更长的上下文 →

[](https://www.together.ai/)

  • ![图像 7 无服务器推理 高性能推理作为 API](https://www.together.ai/serverless-inference)
  • ![图像 8 批量推理 用于批量工作负载的推理](https://www.together.ai/batch-inference)
  • ![图像 9 专用模型推理 自定义硬件上的推理](https://www.together.ai/dedicated-model-inference)
  • ![图像 10 专用容器推理 自定义模型的推理](https://www.together.ai/dedicated-container-inference)

![图像 11 MiniMax M2.5 图像 12 Nano Banana Pro 图像 13 Qwen3.5-397B 图像 14 GLM-5 图像 15 kimi k2.5 图像 16 gpt-oss-120B 模型库 探索顶级开源模型](https://www.together.ai/models)

加速计算

  • ![图像 17 GPU 集群 大规模可靠的 GPU 集群](https://www.together.ai/gpu-clusters)
  • ![图像 18 AI 工厂 边缘前沿定制基础设施](https://www.together.ai/ai-factory)

开发环境

  • ![图像 19 沙盒 为 AI 构建开发环境](https://www.together.ai/sandbox)

存储

  • ![图像 20 管理存储 安全存储模型权重与数据](https://www.together.ai/managed-storage)
  • ![图像 21 微调 使用您的数据塑造模型](https://www.together.ai/fine-tuning)
  • ![图像 22 评估 测量模型质量](https://www.together.ai/evaluations)

![Image 23 DeepSeek V3.1 Image 24 GLM 5 FP4 Image 25 Qwen3-VL 32B Image 26 gpt-oss-120b Image 27 kimi k2.5 Image 28 Llama 4 Maverick Model library Fine-tune top open-source models](https://www.together.ai/models)

  • ![Image 29 研究系统 用于生产的人工智能研究](https://www.together.ai/research)
  • ![Image 30 研究博客 我们的所有研究出版物](https://www.together.ai/research-blog)

特色出版物

显示全部

  • ![Image 31 文档 Together AI 的技术文档](https://docs.together.ai/)
  • ![Image 32 示例 我们的开源示例应用](https://www.together.ai/demos)
  • ![Image 33 烹饪书 实用的实现指南](https://www.together.ai/cookbooks)
  • ![Image 34 语音代理 构建生产环境中的语音代理](https://www.together.ai/solutions/voice)

MiniMax M2.5 MiniMax M2.5

Nano Banana Pro Nano Banana Pro

Qwen3.5-397B Qwen3.5-397B

GLM-5 GLM-5

kimi k2.5 kimi k2.5

gpt-oss-120B gpt-oss-120B 模型库 探索顶级开源模型 探索

* 加速计算

  • ![GPU 集群 GPU 集群 可靠的大规模 GPU 集群](https://www.together.ai/gpu-clusters)
  • ![AI 工厂 AI 工厂 前沿规模的自定义基础设施](https://www.together.ai/ai-factory)

开发环境

  • ![沙盒 沙盒 为 AI 构建开发环境](https://www.together.ai/sandbox)

存储

  • ![托管存储 托管存储 安全地存储模型权重和数据](https://www.together.ai/managed-storage)

*

  • ![微调 微调 使用您的数据塑造模型](https://www.together.ai/fine-tuning)
  • ![评估 评估 测量模型质量](https://www.together.ai/evaluations)

DeepSeek V3.1 DeepSeek V3.1

GLM 5 FP4 GLM 5 FP4

Qwen3-VL 32B Qwen3-VL 32B

gpt-oss-120b gpt-oss-120b

kimi k2.5 kimi k2.5

Llama 4 Maverick Llama 4 Maverick 模型库 微调顶级开源模型 微调

*

  • ![研究 研究 生产级 AI 的系统研究](https://www.together.ai/research)
  • ![研究博客 研究博客 我们的所有研究出版物](https://www.together.ai/research-blog)

精选出版物

显示全部

*

  • ![文档 文档 Together AI 的技术文档](https://docs.together.ai/)
  • ![演示 演示 我们的开源演示应用](https://www.together.ai/demos)
  • ![食谱 食谱 实用的实现指南](https://www.together.ai/cookbooks)
  • ![语音代理 语音代理 构建生产级语音代理](https://www.together.ai/solutions/voice)

资源

  • ![Image 70 客户故事 来自AI原生的用户评价](https://www.together.ai/customers)
  • ![Image 71 创业加速器 构建并扩展您的创业公司](https://www.together.ai/startup-accelerator)
  • ![Image 72 客户支持 寻找您问题的答案](https://www.together.ai/support)
  • ![Image 73 博客 我们的最新消息与博客文章](https://www.together.ai/blog)
  • ![Image 74 活动 探索我们的活动日历](https://www.together.ai/events)

公司

  • ![Image 75 关于 了解我们](https://www.together.ai/about-us)
  • ![Image 76 职位 加入我们的使命](https://www.together.ai/careers)

联系销售

联系销售

登录

所有博客文章

公司

发布日期:2026年4月30日

从732字节到无处可去:关闭生产中的Copy Fail

摘要

我们将Copy Fail(CVE-2026-31431)视为一次舰队级紧急事件,并在数小时内关闭了基础设施中易受攻击的加密套接字接口,一旦内核补丁在我们的AI工作负载中稳定后就进行了部署。在上游修复措施广泛可用之前,我们依赖于一个有针对性的内核加固步骤:卸载易受攻击的模块并将其从模块路径中移除,以防止其被无声地重新启用。

Copy Fail一句话总结

Copy Fail(CVE-2026-31431)是Linux内核加密子系统中用于AEAD操作的algif_aead AF_ALG接口中的逻辑错误。它允许任何未授权的本地用户对系统上任何可读文件的页缓存进行精确的4字节写入。实际上,公开的漏洞利用会在内存中的共享、设置了SUID的二进制文件中翻转几个字节,并借此获得主流Linux发行版的root权限。磁盘上的文件从未改变,页面也从未被标记为脏,这意味着即使修改后的二进制文件运行,传统的文件完整性检查也不会发现攻击。

这对AI基础设施的重要性

在开发人员笔记本电脑上,Copy Fail只是一个本地权限提升。在现代AI平台中,“本地”通常意味着CI作业、多租户GPU节点、临时研究环境或第三方工作负载带来的自己的依赖项。

从云和AI的角度来看,风险如下:

  • 在具有访问AF_ALG套接字权限的容器内部的妥协可以转化为宿主机的root权限。
  • 因为页缓存是共享的,一个工作负载的写入可能会微妙地破坏同一节点上其他租户使用的二进制文件或库。
  • 一旦宿主机被攻破,访问附加存储、控制平面和相邻工作负载变得容易得多。

我们已经假设容器不是安全边界。如果暴露了易受攻击的接口,Copy Fail正是那种安静且确定性的原始工具,可以在共享内核的多租户环境中迅速缩小剩余的安全边际。

我们的即时响应:禁用所有地方的`algif_aead`

一旦有效的漏洞细节公布,我们立即关注最直接的杠杆:停止暴露易受攻击的AF_ALG接口。

对于Together AI的生产工作负载,我们在推理或训练主机上不依赖用户空间的algif_aead套接字。这使我们能够在整个舰队中采取一种简单但安全的行动:

Image 77
Image 77

卸载algif_aead模块会立即关闭运行内核中的易受攻击代码路径。将模块文件移出标准模块目录可以防止系统服务或自动化在正常操作期间重新加载它。

这种方法有几个重要特性:

  • 快速:不需要重启,这对于运行长时间的GPU作业来说很重要。
  • 低风险:典型的服务器和AI工作负载并不直接依赖AF_ALG AEAD套接字,因此操作影响很小。
  • 持久:即使主机重启到相同的易受攻击内核,algif_aead仍然会被禁用。

我们将此编码为配置管理中的幂等合规检查:主机在模块未加载且.ko文件被隔离之前被视为不健康。

安全地推出内核补丁

禁用algif_aead只是缓解措施,而不是最终状态。一旦供应商发布了CVE-2026-31431的补丁,我们将进入更传统的生命周期管理阶段:

  • 在非生产集群中逐步引入修补的内核,这些集群模拟我们最繁重的 AI 工作负载,包括密集的多租户 GPU 节点。
  • 运行加速的浸泡测试以评估性能、GPU 驱动程序兼容性和在实际推理和训练负载下的稳定性。
  • 通过区域和环境逐步推出修补的内核,从使用较少共享的集群开始,逐渐过渡到高度多租户的集群,前提是遥测数据保持干净。

即使在打补丁之后,我们仍然会在没有明确需求的环境中禁用 algif_aead。一旦某个地方出现问题,狭窄且专门的内核接口可能会产生生态系统范围的影响;如果我们能够安全地在没有它们的情况下运行,我们会选择这样做。

同时,我们的检测团队向遥测系统中添加了 Copy Fail 意识信号:

  • 对于节点上不应发生意外 AF_ALG 使用或加密模块加载的情况发出警报。
  • 监控特权二进制文件的行为,即使磁盘上的镜像未发生变化,也要寻找异常行为。

构建安全 AI 平台的经验教训

Copy Fail 很好地说明了小型内核错误如何在 AI 基础设施中产生不成比例的影响:

  • 共享内核和密集的多租户会将局部错误放大为跨租户风险。
  • 页面缓存技巧可以绕过传统的基于文件完整性的防御措施。
  • 曾经“无人使用”的狭窄接口可能突然成为主要攻击面。

在 Together AI,我们的经验是不断收紧内核暴露模型:对于特定接口默认关闭,出现问题时快速全局切换,并且有一个验证管道来证明这些决策与高性能 AI 工作负载兼容。

在 Together AI 开始构建

从优化训练和模型塑造到大规模生产推理

立即开始

Image 78
Image 78

* 产品

  • 模型

查看所有模型DeepSeek Meta Qwen Google OpenAI Mistral AI 自定义模型 * 开发者

定价

* 资源

© 2026 Together AI. All Rights Reserved.

  • [](https://discord.gg/9Rk6sSeWEG)
  • [](https://x.com/togethercompute)
  • [](https://www.linkedin.com/company/togethercomputer/)