Get Started with Kimi K3 on CoreWeave Dedicated Inference

TL;DR · AI 摘要
CoreWeave支持部署2.8万亿参数的Kimi K3模型,提供租户隔离网关和GPU优化服务,适合需要大规模推理的用户。
核心要点
- Kimi K3是2.8万亿参数的开源模型,支持百万级上下文窗口和视觉理解。
- CoreWeave部署流程包含7步,需自备许可证且不收取流量费用。
- 模型采用KDA和AttnRes技术,在推理任务中达到行业领先水平。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Kimi K3部署方案
- 部署流程
- 7步操作指南
- 租户隔离网关
- 模型特性
- 2.8万亿参数
- KDA+AttnRes架构
- 性能表现
- AI Index 60分
- LMArena #2排名
金句 / Highlights
值得收藏与分享的关键句。
Kimi K3在Artificial Analysis的 Intelligence Index 获得60分,接近顶级专有系统。
CoreWeave提供按GPU小时计费模式,无额外流量费用。
KDA混合线性注意力机制和AttnRes残差连接替代方案提升模型扩展性。
在CoreWeave上部署Kimi K3专用推理
发布于
2026年8月26日
4
分钟阅读
在CoreWeave专用推理上开始使用Kimi K3
按照以下逐步指南,在NVIDIA GB300 NVL72上部署Kimi K3到CoreWeave专用推理。
by
Sitanshu Gupta
已复制
CoreWeave客户可以将Moonshot AI最新旗舰版本Kimi K3部署到专用推理服务,将自有模型权重上传至CoreWeave。CoreWeave负责在NVIDIA GB300 NVL72系统上进行部署,并提供针对Kimi K3架构的优化支持。
在专用推理上开始使用Kimi K3
在专用推理上运行Kimi K3的方式与其他自定义部署相同:将权重上传到CoreWeave AI对象存储,然后创建网关和指向它们的部署,选择GPU类型和运行时。CoreWeave会分配一个租户隔离的网关,处理身份验证、负载均衡和路由,并在您选择的GPU上调度部署。从那里,您的端点即刻可用,具备最小/最大副本自动扩展功能,以及上述描述的路由工作在后台运行。计费按GPU小时计算,针对您选择的GPU类型,无需额外的出站或入站费用。我们的技术文档中的逐步指南将带您完成以下步骤:
- 将Kimi K3权重和DSpark草稿模型上传到CoreWeave AI对象存储桶。
- 授予专用推理对存储桶的访问权限。
- 创建网关以暴露模型。
- 使用验证后的Kimi K3引擎配置创建部署。
- 等待部署加载权重并启动引擎。
- 发送推理请求以验证端点。
- 完成后清理网关和部署。
在专用推理上开始使用Kimi K3
CoreWeave不提供Kimi K3权重或许可证。您必须使用自己的有效许可证。在部署Kimi K3之前,请查看Moonshot AI的许可证条款。
为前沿性能构建的2.8万亿参数开源模型
Kimi K3是目前最大的开源模型。它采用2.8万亿参数的专家混合架构,其基准测试结果接近其他前沿实验室的顶级专有系统。截至8月,Kimi K3在Artificial Analysis的智能指数(涵盖推理、编码和知识任务的独立基准测试)中得分60。它还在LMArena的前端代码竞技场中排名第二,在盲测开发者比较中仅落后于Claude Opus 5 Max。
该模型配备100万token上下文窗口、原生视觉理解能力,以及一种名为"思考模式"的始终开启推理模式,该模式基于Moonshot内部开发的两种架构技术:Kimi Delta Attention(KDA),一种混合线性注意力机制,以及Attention Residuals(AttnRes),一种替代标准残差连接的方案,可提供一致的扩展增益。
CoreWeave如何在生产规模服务Kimi K3
服务Kimi K3不仅仅是将权重适配到GPU上。在生产规模上,挑战在于在保持首字时间及用户解码吞吐量的同时,增加并发请求数量,特别是对于需要重复使用长上下文的智能代理和多轮对话工作负载。
CoreWeave 在 NVIDIA GB200 和 GB300 NVL72 上对 Kimi K3 进行了基准测试,测试并发用户数从 1 到 32,每种平台均使用 16 块 GPU。这些基准测试反映了智能体工作负载——多轮对话和工具调用交互,以持续压力测试吞吐量和延迟,这是单轮基准测试无法捕捉的特性,测试过程中始终保持 95% 的缓存命中率。我们在三个维度评估性能:每 GPU 输出令牌吞吐量、平均请求延迟和每用户第 50 百分位解码吞吐量。得出的帕累托前沿展示了不同并发级别下基础设施效率与用户交互性的关系。
在 GB300 上,Kimi K3 在并发用户数达到 32 时仍能持续扩展,每 GPU 达到 198,000 TPM。从 4 到 32 个并发用户,GB300 的第 50 百分位首令牌延迟(TTFT)均低于 GB200,分别降低 23%(4 个并发用户)、32%(8 个并发用户)、18%(16 个并发用户)和 97%(32 个并发用户)。在 32 个并发用户时,GB300 每 GPU 达到 198,000 TPM,而 GB200 仅为 64,000 TPM,前者高出 209%。其第 50 百分位解码吞吐量也高出 133%。GB200 在 16 个并发用户时达到每 GPU 149,000 TPM,此后性能急剧下降,使得 GB200 在 32 个并发用户时无法满足延迟敏感型交互工作负载的需求。
对于此类工作负载,GB300 更大的 HBM 容量和额外的 AI 计算能力提供了足够的余量,可支持 GB200 两倍的实际并发量。GB300 的第 50 百分位首令牌延迟降低了 18% 至 32%,同时在不出现 GB200 观察到的吞吐量急剧下降的情况下支持更多同时的长上下文请求。
技术栈解析:NVIDIA Dynamo 与 vLLM 对 Kimi K3 的支持
硬件本身并不足以发挥 Kimi K3 的全部性能。要充分释放 Kimi K3 的性能,需要从集群级调度到模型特定运行时内核的整个服务栈进行协调优化。在基础设施层,CoreWeave 通过 NVIDIA Dynamo 部署 Kimi K3。在运行时层,CoreWeave 通过 vLLM 服务 Kimi K3,整合了 vLLM 团队、Moonshot AI 和 NVIDIA 开发的优化方案。
当用户通过 CoreWeave 推理 API 提交 Kimi K3 部署时,基于 NVIDIA Dynamo 构建的推理栈会在 CoreWeave 管理的基础设施上渲染 Dynamo 前端和工作节点组件。每个 Kimi K3 部署至少需要 2 个 GB300 NVL72 节点(8 块 GPU),因此单个 NVL72 机架最多可容纳 9 个副本。生产级部署会跨多个机架扩展,每个副本固定到单个 NVLink 域,使张量和专家并行流量保持在 NVLink 交换机上,而不是回退到跨机架的 IB 网络。
同一技术栈还支持 KV 缓存感知路由,确保重复查询发送到具有热前缀的副本。这对于减少令牌成本和优化多轮智能体、编码和长上下文工作负载的高吞吐量至关重要。它还支持推测解码(MTP 或自定义推测器如 Inferact/Kimi-K3-DSpark 或 RadixArk/Kimi-K3-DSpark),提升每用户解码 TPS,同时通过预填充/解码分离使每个组件独立扩展,实现更高吞吐量和更低的 TTFT。
专用推理服务专为这类模型打造——需要实际基础设施优化才能良好运行,而不仅仅是容纳权重的空间。请携带自己的 Kimi K3 许可证和权重,CoreWeave 将处理其余工作,为您提供即用型生产端点,无需自行管理服务栈。
快速入门:在 CoreWeave 专用推理上使用 Kimi K3
分享本文: /think