Apple Launches Core AI for Apple-Silicon Optimized On-Device Generative AI

TL;DR · AI 摘要
Apple 推出 Core AI 框架,支持在 Apple Silicon 上运行大型语言模型和生成式 AI,提升设备端 AI 性能。
核心要点
- Core AI 支持从 3B 参数视觉模型到 70B 参数大语言模型的部署。
- Core AI 提供统一的硬件访问接口,支持 CPU、GPU 和 Neural Engine。
- 模型压缩技术可减少内存占用、延迟和功耗。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Core AI 框架
- 功能
- 支持多种模型部署
- 统一硬件访问接口
- 内存安全 Swift API
- AOT 编译
- 模型转换
- PyTorch 模型转换
- 自定义操作支持
- 优化技术
- 模型压缩
- 量化与调色板化
金句 / Highlights
值得收藏与分享的关键句。
Core AI 提供统一的硬件访问接口,允许工作负载在 CPU、GPU 和 Neural Engine 下通过一个 API 无缝运行。
模型压缩技术可减少内存占用、延迟和功耗,或同时优化所有指标。
Core AI 可以仅在 Apple Silicon 上运行,确保用户数据隐私和零服务器依赖。
苹果推出 Core AI,为 Apple Silicon 优化的本地生成式 AI - InfoQ
InfoQ 首页 新闻 苹果推出 Core AI,为 Apple Silicon 优化的本地生成式 AI
移动
面向代理时代工程:如何规范、构建、测试和运营 AI 驱动的系统(网络研讨会 7 月 16 日)
苹果推出 Core AI,为 Apple Silicon 优化的本地生成式 AI
6 月 20 日,2026 年 2 分钟阅读
作者:
- Sergio De Simone
#### 为 InfoQ 撰写
激发你的好奇心。
帮助 55 万+ 全球
高级开发人员
每月保持领先。
联系我们
收听这篇文章 -
0:00
音频准备播放
你的浏览器不支持音频元素。
正常
1.25x
1.5x
喜欢
新下拉阅读列表
- 阅读列表
在 WWDC 26 上,苹果宣布了 Core AI 框架,这是 Core ML 的官方继任者。它旨在允许开发人员在设备上完全运行大型语言模型和生成式 AI,支持自定义转换的 PyTorch 模型和预优化的开源模型。
苹果表示,新的 Core AI 框架为部署从紧凑的 3B 参数视觉模型到大规模 LLM(包括最多 70B 参数的推理模型)的模型提供统一的架构,覆盖 iPhone、iPad、Mac 和 Apple Vision Pro。
Core AI 是 Apple Intelligence 的核心技术,随着其操作系统和工具链的下一次发布,苹果将其提供给开发人员,以构建其所谓的“自定义智能”。Core AI 仅能在 Apple Silicon 上运行,确保用户数据隐私、零服务器依赖性和零每令牌云成本。
Core AI 的关键功能包括统一的硬件访问,允许工作负载通过一个 API 在 CPU、GPU 和神经引擎之间无缝运行;一个内存安全的 Swift API,实现零复制数据路径和对推理内存的细粒度控制;以及提前(AOT)编译,将工作从用户的设备转移出去,实现接近即时的加载时间。
如前所述,你可以使用 Core AI PyTorch 将 PyTorch 模型转换为 Core AI 模型。最简单的方法是将 PyTorch 导出为 torch.export.ExportedProgram,然后使用 TorchConverter().add_exported_program(ep).to_coreai() 将其转换为 CoreAI AIProgram。
或者,你可以使用库提供的内置组合操作(如注意力、RoPE 嵌入、RMSNorm 和 gather-matmul),从 PyTorch 模型创建新的 Core AI 模型,注册自定义降低函数以将新的 PyTorch 操作映射到 Core AI IR,甚至创建自定义 Metal 内核以进行更底层的优化。
在转换 PyTorch 模型时,一个关键步骤是将其压缩以部署在 Apple 硬件上。此过程应用优化技术,如量化和调色板化,这些技术默认与 Core AI 运行时的执行模式对齐,确保设备上的高效性能。
模型压缩可以帮助减少模型的内存占用(磁盘大小和运行时),减少推理延迟,减少功耗,或同时优化所有这些方面。
运行 AIModel 的一个重要方面是其能够自动适配当前的硬件和操作系统版本,这一过程在模型首次加载到模型缓存时完成。因此,首次使用模型可能比后续运行花费更长的时间,因为一旦模型被缓存,后续运行会更快。开发人员可以通过自定义 SpecializationOptions 来控制这一过程的发生时间和方式,还可以通过访问 AICacheModel 来检查模型是否已经可用或删除已缓存的模型,甚至可以在应用组之间共享模型缓存。
随着 Core AI 的引入,Apple 现在为其操作系统提供了三种不同的方法来运行 ML/AI:Core ML、Core AI 和 MLX Swift。根据 Hacker News 上的开发者讨论,Apple 看起来建议使用 Core ML 来处理“经典、非神经网络的 ML”,例如决策树或表格特征工程,使用 Core AI 来处理神经网络和转换器,使用 MLX 来处理自定义模型权重——尽管性能可能较低。社区反馈还指出,虽然 Core AI “使高性能大语言模型的集成更加容易”,但其长期价值将取决于“官方 Core AI/社区的未来发展”。
作者部分的主包装器
关于作者
部分标题
每个作者的主包装器
#### Sergio De Simone
显示更多
显示更少
#### 此内容属于移动主题
##### 相关主题:
- 开发
- AI、ML 与数据工程
- iOS
- 移动
- 人工智能
- visionOS
- Python
- Apple
- MacOS
- 大型语言模型
- 相关编辑
- 相关赞助商
- 相关赞助商 2026 年 7 月 16 日,东部时间上午 1 点 工程的智能时代:如何规范、构建、测试和运营 AI 驱动的系统 由:Juveria Kanodia - Harness 工程高级总监
InfoQ 新闻简报
每周五发送 InfoQ 上一周内容的汇总。加入超过 25 万名高级开发者的社区。查看示例
我们保护您的隐私。