Latent Space
[AINews] Hot Chips: OpenAI’s Jalapeño, Cerebras CS-5, Groq 3 LPX, Apple M6
8.5内容质量
![[AINews] Hot Chips: OpenAI’s Jalapeño, Cerebras CS-5, Groq 3 LPX, Apple M6](/api/img-proxy?url=https%3A%2F%2Fsubstackcdn.com%2Fimage%2Ffetch%2F%24s_!Cg9M!%2Cw_1456%2Cc_limit%2Cf_auto%2Cq_auto%3Agood%2Cfl_progressive%3Asteep%2Fhttps%253A%252F%252Fsubstack-post-media.s3.amazonaws.com%252Fpublic%252Fimages%252F509d42ef-7b44-4187-9f7a-12347c2579c9_1430x1188.png)
TL;DR · AI 摘要
OpenAI的Jalapeño芯片在能效和延迟方面显著优于现有系统,预计年底部署。
核心要点
- Jalapeño芯片实现1.5-1.9倍能效提升,端到端延迟降低1.7-3.6倍
- OpenAI计划2026年底部署Jalapeño,Gen2/Gen3研发已启动
- GPT-Astra与Codex模型优化使Jalapeño核心模块运行速度提升1.5-1.8倍
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Jalapeño芯片技术突破
- 性能指标
- 能效比提升1.5-1.9倍
- 延迟降低1.7-3.6倍
- 部署计划
- 2026年底部署
- Gen2/Gen3研发中
- 模型优化
- GPT-Astra/Codex加速开发
- 核心模块性能提升1.5-1.8倍
金句 / Highlights
值得收藏与分享的关键句。
Jalapeño芯片在700W功耗下实测功耗稳定在550W以下
OpenAI声称Jalapeño在交互型工作负载中性能提升2.1-4.1倍
GPT-Astra与Codex模型优化使Jalapeño核心模块运行速度提升1.5-1.8倍
#OpenAI#芯片#推理#能效#Hot Chips
打开原文[AINews] Hot Chips: OpenAI的Jalapeño、Cerebras CS-5、Groq 3 LPX、Apple M6
AINews:工作日速报
聚焦前沿芯片与顶尖企业的盛会
2026年8月27日
第37届Hot Chips大会最大的消息无疑是OpenAI在自研芯片领域取得的突破性进展——距离Broadcom相关公告不到一年时间,其推出的Jalapeño芯片不仅性能超越Blackwell,更打破了传统ASIC的局限。
OpenAI
@OpenAI
自发布首款自研推理芯片Jalapeño以来,我们一直在对其进行系统性测试。测试结果表明,该芯片实现了重大突破:在单位功耗下提供更强的智能表现,同时实现响应速度的提升,通过单一架构同时实现更高吞吐量和更低延迟
2026年8月25日 下午5:19
·
226万次观看
584条评论
1080次转发
1.36万次点赞
当前关键指标已转向每瓦性能,Jalapeño的表现如下:
完整版Hot Chips演示文稿尚未公开,但以下已有多方解读。如需深入了解,可关注OpenAI的完整分析:
2026年8月24日至25日AI新闻速报。我们核查了12个子版块、544个Twitter账号,未发现其他Discord讨论。AINews官网支持检索所有历史内容。提醒您,AINews现已整合至Latent Space板块,您可自主选择接收邮件频率!
AI Twitter动态回顾
OpenAI的Jalapeño推理芯片与推理堆栈的变革
- Jalapeño公布的性能数据是当日最大的技术新闻:OpenAI首次披露了自研推理芯片Jalapeño的基准测试详情,声称在真实模型工作负载中,其能效和延迟表现显著优于NVIDIA GB200/GB300系统。在OpenAI的测试中,Jalapeño在峰值吞吐量下实现了每瓦1.5-1.9倍的性能提升,端到端延迟降低了1.7-3.6倍,对于高交互性工作负载性能提升了2.1-4.1倍;该芯片标称功耗700W,但实际测试中功耗保持在550W以下。OpenAI表示将在年底前部署至自有基础设施,第二代产品已深入开发阶段,第三代产品也已启动(OpenAI公告,部署路线图,Sam Altman)。
- 工程师关注的焦点:这一突破不仅体现在原始性能,更在于其平衡的推理架构设计,有效缓解了传统吞吐量/延迟的权衡困境。多个技术分析指出,某些对比数据尤其值得关注,因为Jalapeño即使在未采用激进预填充/解码分离或推测解码等技术的情况下仍表现出色,同时超越了采用这些技术的系统(gdb,kimmonismus总结,eliebakouch分析,You Jiacheng)。SemiAnalysis将其描述为罕见的初代ASIC强性能表现,并直接与Blackwell和Rubin级系统进行了对比(SemiAnalysis,dylan522p)。
- 第二层次的进展是模型辅助的系统优化:OpenAI的报告还提到,GPT-Astra与Codex共同参与了低级内核的编写与优化,使三个原本未计划的开放权重模型在约两个月内实现了在Jalapeño上的高性能运行;对于选定的注意力机制和MoE模块,这些实现据称比现有专家编写的代码快了1.5-1.8倍(kimmonismus,eliebakouch)。这一信号表明,编译器/内核开发工作正越来越多地融入模型优化流程,而不仅仅是应用层编码。
- 更广泛的基础设施影响:多篇文章将Jalapeño与一个更大的行业转型联系起来,其中前沿实验室可能不再严格依赖NVIDIA进行推理经济,即使封装和代工产能仍是一个硬性瓶颈(Liam Fedus,teortaxesTex反应,LearnOpenCV关于TSMC/CoWoS产能的注意事项)。
工具链、内存系统与评估工程成为核心要素
- 工具链质量的重要性日益提升:多篇论文和产品发布都聚焦于同一主题:代理性能高度依赖于周围系统。微软主导的一篇关于AutoSaddler的论文将工具链视为代码,通过失败日志离线修补提示、工具配置和控制逻辑,报告在GAIA2上提升+9.0,在SWE-Bench Pro上提升+9.6,在Terminal-Bench 2.0上提升+10.0(论文摘要)。同时,另一篇论文直接量化了工具链的方差,发现更换工具链对评分的影响远大于更换模型,模型对之间的排名在不同框架下会发生翻转;提出的解决方案是结构化的工具链卡片披露标准(分析,“不存在中立的工具链”)。
- 长期软件工程问题仍未解决:SWE Refactor Bench衡量了跨真实项目(包括SQLite、zlib和libsodium)的全仓库迁移任务,如C→Rust、Maven→Gradle和POSIX→WebAssembly。在520次运行中,仅有28次通过所有三个阶段,生存率为5.4%,20项任务中有13项无人解决(EinsiaAI)。这为本地编码基准上较强的错误修复数据提供了有益的修正。
- 内存系统正被重新设计为可编程状态而非压缩的聊天历史:由DAIR总结的一篇阿里巴巴论文为代理会话提供了仅追加事件日志和持久化Python内核,将工具输出和派生状态绑定到类型变量而非持续序列化到提示中。报告结果包括LongMemEval_S的94.8%、BEAM_10M的73.1%(较之前最佳内存系统提升5.1%)、LOCA_256K的86.7%(使用Qwen3.8-Max)(摘要)。相关工作Knowledge Triage显示,原始上下文压缩会破坏精确规则保留;经过五轮压缩后,一个设置仅保留了10%的安全规则,而类型感知保留策略保留了2-4倍的规则(摘要)。
- 实用评估工程正从临时方案转向产品化工作流:LangChain/合作伙伴分享了一个具体循环,将追踪和人工反馈转化为任务规范、合成环境和评估,可用于长期衡量和后训练代理(Vtrivedy10,hwchase17)。LangSmith Engine在关键内部基准测试中也实现了超过2倍的性能提升,具备更好的问题检测/聚类、SaaS和自托管支持、Slack/Linear集成以及分层分析模式(LangChain)。
本地优先代理、设备端推理与新的个人计算栈
- Perplexity 的便携式计算机是当天最清晰的本地代理产品发布:Perplexity 在 NVIDIA DGX Spark 上推出了便携式计算机,将其定位为 Perplexity 计算机的完全本地版本,其中协调器 LLM、子代理 LLM 和代理引擎均在本地硬件上运行,无需依赖云端(Perplexity 发布,模型详情,NVIDIA,Arav Srinivas)。初始本地堆栈使用了经过微调的 PPLX 27B,Qwen 3.8 27B 也已提供;Nemotron 3.5 Lightning 支持即将推出。
- 更深层的趋势是持续运行的本地代理:Srinivas 明确勾勒出一个未来,即后台进程持续从连接器中获取上下文,在永续循环中执行多跳推理,并在用户自己的硬件上运行(Arav Srinivas)。社区反应呈现两极分化,一部分人对隐私/控制权感到兴奋,另一部分人则质疑“本地优先”是否应意味着需要 5000 美元的 DGX Spark 而非消费级设备(theo 批评,theo 后续)。
- Apple/macOS 本地 AI 工具链也在逐步成熟:exo 表示 Apple 在新的 M5 Ultra Mac Studio 和 M6/M5 Pro Mac Mini 页面上重点展示了其能力,强调通过 Thunderbolt 5 实现低延迟 RDMA,以集群 Mac 并以类似 API 的速度运行 Kimi K3 和 GLM-5.3 等模型,4 个 M5 Ultra 可扩展至约 4.8 TB/s 的聚合内存带宽(exo)。相关帖子指出 Apple 更快的 PCIe 存储和基于 ANE 的视觉流水线使小型本地集群和混合 CPU/ANE/GPU 推理更加实用(anemll,onirenaud)。
- 工具链继续围绕本地运行时完善:Ollama v0.33 新增一键集成功能,使 Claude Desktop 能通过 Ollama 作为第三方网关使用云端和本地模型(Ollama);OpenCode v2 被展示在 Cloudflare Durable Object 内运行,说明小型代理运行时正逐渐成为边缘环境的可嵌入组件(fayazara)。
模型、检索与搜索基础设施
- Qwen 3.8 正在堆栈各层全面出现:围绕 Qwen3.8 发布的热情在部署和评估帖子中均有体现,Together 增加了对 Qwen3.8-27B 的微调和专用推理支持(Together),而 Unsloth 声称通过优化内核在免费的 2× Tesla T4 Kaggle 实例上实现了对 27B 模型的完整 QLoRA 微调(danielhanchen)。在应用层面,Qwen3.8-27B 在 Image-to-WebDev Arena 中位列开放模型第一,在整体排名中位列第七,定价为每百万输入/输出 token 0.40 美元/3 美元(arena)。
- 搜索与检索基础设施获得多项实质性更新:Hugging Face 发布了关于 Papers with Code 搜索引擎的详细架构说明:PostgreSQL + pgvector、Qwen 3 Embedding 0.6B、混合检索、通过 Hugging Face Jobs 在 NVIDIA L4 上生成嵌入、存储桶中的工件以及通过推理端点进行实时服务;相同的架构也用于论文页面的“相关论文”功能(Niels Rogge)。Keenable 从隐身状态中现身,推出了由前 Yandex 搜索负责人打造、获得 2600 万美元种子轮融资的 Web 搜索 API 和 Web 查询语言,明确针对代理级网络检索(styskin)。
- 检索模型设计仍是活跃领域:围绕晚期交互/多向量检索的讨论重新兴起,有观点称检索工作负载的扩展行为终于开始显现,且模型+数据库的协同设计至少与存储格式一样重要(mixedbread 观点,Silvio Martinico)。
- Figure公司推出的“Index”是机器人数据领域的重要公告:Figure推出了Index,被描述为世界上最大且最多样化的机器人数据集,据报道每秒上传30分钟视频,累计上传1600万段视频,已支付1500万美元数据费用,下载量达26.4万次。该公司还表示,未来12个月内将在数据和计算方面投入10亿美元(Brett Adcock,后续跟进)。这种规模具有重要意义,因为许多机器人实验室在演示和感知数据方面的瓶颈仍比架构创新更突出。
- 大规模物理/世界建模持续突破上下文限制:Anima Anandkumar介绍了Accelerated Understanding,这是一家构建跨模态和四维时空物理模拟大模型的初创公司,声称预训练阶段达到1万亿参数,训练时上下文长度达1万亿,推理阶段无需子采样或分块即可实现超过5万亿上下文(Anima Anandkumar)。尽管细节有限,但该帖子值得注意,因为它表明部分前沿非语言建模工作正朝着大规模上下文多模态模拟方向发展,而不仅是文本/视频生成。
- 具身策略泛化仍是活跃的基准目标:另一篇机器人技术文章介绍了S1,这是一种操作模型,能够从单次演示中完成超出训练分布的任务(anag004)。Google Research还推出了AgentHands,这是一个XR系统,通过同步手势增强对话代理,在物理任务中提供空间引导(Google Research)。
热门推文(按互动量排序)
- OpenAI芯片发布:@sama关于Jalapeño芯片的推文,以及@OpenAI的基准测试公告引发了迄今为止最大的技术讨论。
- 本地代理发布:@perplexity_ai推出的便携式计算机是芯片故事之外最大的产品发布。
- 开发者平台/代理原生网页:@OpenAIDevs宣布WebMCP挑战赛并在ChatGPT桌面版中支持WebMCP,表明OpenAI正推动网站转向明确的代理接口。
- 开源本地任务代理:@AndrewYNg关于OpenWorker的推文引人注目,因为它结合了开源框架、本地模型和以安全为重点的工作流程。
- 编码代理的基准真实性:@EinsiaAI关于SWE Refactor Bench的推文是该系列中最有用的基准发布之一,因为它针对整个仓库迁移而非本地编辑。
AI Reddit动态回顾
/r/LocalLlama + /r/localLLM 回顾
1. Qwen3.8 Flash/27B基准测试与本地适配
使用7天免费试用继续阅读
订阅Latent.Space以继续阅读本文并获得7天免费访问完整文章档案的权限。
开始试用
已经是付费订阅者?
上一篇
下一篇文章