Why Agentic Inference Needs Prefix-Aware Routing Infrastructure
代理推理需前缀感知路由基础设施以减少重复计算,提升性能。前缀缓存可降低TTFT但依赖基础设施支持。
入选理由:前缀缓存可减少70%的重复计算开销
公司
提供AI基础设施服务的科技公司
已跟踪 22 条高相关材料
最近变化
2026-08-28 · 使用Ray和CoreWeave Kubernetes服务可将GPU集群部署时间从数月缩短至1小时
为什么值得关注
CoreWeave 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Video Captioning at scale: 600 TB in 95 minutes with Anyscale on CoreWeave
CoreWeave · 8.5 分
Anyscale与CoreWeave通过优化GPU基础设施,实现600TB视频数据95分钟处理完成,展示大规模视频字幕生成的工程实践。
Get Started with Kimi K3 on CoreWeave Dedicated Inference
CoreWeave · 8.5 分
CoreWeave支持部署2.8万亿参数的Kimi K3模型,提供租户隔离网关和GPU优化服务,适合需要大规模推理的用户。
5 Lessons from Building a Multi-plane Network Fabric for Agentic AI
CoreWeave · 8.5 分
构建多平面网络架构需解决Agentic AI的高并发低延迟需求,通过非阻塞设计、1:1上行链路比例和多平面分离等方案实现。
已收录 22 条与 CoreWeave 相关的内容,按评分排序。
代理推理需前缀感知路由基础设施以减少重复计算,提升性能。前缀缓存可降低TTFT但依赖基础设施支持。
入选理由:前缀缓存可减少70%的重复计算开销
CoreWeave为物理AI提供定制化基础设施,支持Wayve、Decart等公司实现高效训练和实时推理。
入选理由:物理AI需要生成模拟训练数据,真实场景数据不足时需依赖仿真
构建多平面网络架构需解决Agentic AI的高并发低延迟需求,通过非阻塞设计、1:1上行链路比例和多平面分离等方案实现。
入选理由:非阻塞网络设计可避免训练峰值导致的代理链阻塞
CoreWeave支持部署2.8万亿参数的Kimi K3模型,提供租户隔离网关和GPU优化服务,适合需要大规模推理的用户。
入选理由:Kimi K3是2.8万亿参数的开源模型,支持百万级上下文窗口和视觉理解。
Anyscale与CoreWeave通过优化GPU基础设施,实现600TB视频数据95分钟处理完成,展示大规模视频字幕生成的工程实践。
入选理由:使用Ray和CoreWeave Kubernetes服务可将GPU集群部署时间从数月缩短至1小时
AI Loop框架通过持续循环优化模型,提升效率和准确性,适合工程师关注。
入选理由:AI Loop包含运行、观察、整理、评估、改进五个步骤,形成闭环优化
AI工厂运营的核心是优化goodput指标,CoreWeave在NVIDIA Hopper GPU上实现96%的goodput,揭示吞吐量与弹性对AI系统效率的决定性影响。
入选理由:CoreWeave在NVIDIA Hopper GPU上实现最高96%的goodput,显著提升AI训练效率
Weights & Biases达成10亿次模型训练运行里程碑,推出CoreWeave ARIA工具加速AI研究自动化。
入选理由:10亿次运行里程碑显示AI实验规模呈指数级增长
CoreWeave在MLPerf 0.7 Endpoints基准测试中,使用68块NVIDIA Blackwell GPU实现每秒44万输出token,验证了DeepSeek-R1模型的高效推理能力。
入选理由:CoreWeave在MLPerf 0.7测试中使用68块NVIDIA Blackwell GPU实现了441,740 token/s的吞吐量
AI代理系统性能取决于基础设施质量,长流程工作流对延迟和可靠性影响显著。
入选理由:代理工作流的基础设施需求是传统聊天机器人的3-5倍
AI工厂需在生产前验证基础设施可靠性,NVIDIA与CoreWeave合作提升AI计算效率。
入选理由:AI工厂需验证全栈系统连续运行能力,避免GPU资源浪费和项目延误
MLPerf Endpoints v0.7发布,提供动态、全面的AI推理基准,支持企业采购决策。
入选理由:MLPerf Endpoints v0.7支持自动化提交和实时结果可视化
数据中心应与社区合作,通过负责任的开发带来经济和基础设施利益,同时避免将成本转嫁给用户。
入选理由:CoreWeave签署美国用户保护承诺,确保社区不承担能源成本
nTop与CoreWeave通过GPU加速技术,在32小时内完成10,000次LES模拟,提前达成NASA CFD 2030目标。
入选理由:GPU加速使CFD模拟效率提升至传统方法的100倍以上
CoreWeave与Aston Martin Aramco合作,利用AI代理实时处理F1无线电通信,提取关键信息辅助比赛策略,解决海量音频数据处理难题。
入选理由:F1无线电处理需应对38万单词/50小时音频的实时分析挑战
液冷交换机使AI网络每机架带宽翻倍,CoreWeave部署NVIDIA Spectrum-X SN6600-LD实现1.64 Pb/s交换能力。
入选理由:液冷技术使交换机带宽达102.4 Tb/s,每机架交换容量提升至1.64 Pb/s
NVIDIA Vera Rubin NVL72在能耗效率上比Blackwell提升10倍,适合大规模AI推理。
入选理由:Vera Rubin NVL72在相同功耗下生成的token数量是Blackwell的10倍
SpaceX 与多家公司达成 GPU 租赁协议,年收入达 280 亿美元,成为 AI 领域的重要云服务提供商。
入选理由:SpaceX 与 Reflection 签订 63 亿美元 GPU 租赁协议,月租金 1.5 亿美元。
AI数据中心可能成为下一个泡沫破裂的导火索,因巨额支出与低回报并存,且依赖持续增长的开支。
入选理由:OpenAI年支出约600亿美元,但收入仅130亿美元,存在严重收支不平衡。
AI热潮推动资本市场狂热,Anthropic估值达9000亿,SaaS旧王面临转型压力,AI基础设施与IPO成为焦点。
入选理由:Anthropic获9000亿估值融资,体现AI模型公司资产负债表战争加剧
CoreWeave播客第三季聚焦AI云服务创新,揭示88%企业已应用AI并强调AI原生云基础设施的重要性。
入选理由:麦肯锡2025年报告显示88%企业使用AI,较2020年增长38%。
一条社交平台短帖,报道AI与金融界代表在纽交所峰会会面,称AI资本部署仍处早期,但未提供具体技术、数据或机制分析。
入选理由:峰会聚集高盛、摩根士丹利等机构代表,聚焦AI融资议题。