Bonsai 27B: A 27B-Class model that runs on a phone
TL;DR · AI 摘要
Bonsai 27B 是首个可在手机端运行的 27B 参数模型,通过三元和 1-bit 权重压缩技术实现 5.9GB/3.9GB 超小体积,保留 95%/90% 原始性能。
核心要点
- 三元 Bonsai 27B 在 5.9GB 体积下保留 95% 原始模型性能,支持完整推理与工具调用
- 1-bit 版本仅 3.9GB,首次实现 27B 级模型在 iPhone 17 Pro 的部署
- 支持 262K 上下文长度与无损加速的 speculative-decoding 技术
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Bonsai 27B 技术突破
- 模型架构
- 三元/1-bit 权重压缩
- FP16 分组缩放
- 性能表现
- 95% 原始性能保留
- 90% 原始性能保留
- 应用场景
- iPhone 17 Pro 部署
- 多模态处理
金句 / Highlights
值得收藏与分享的关键句。
三元 Bonsai 27B 在 5.9GB 体积下保留 95% 原始模型性能,支持完整推理与工具调用
1-bit 版本仅 3.9GB,首次实现 27B 级模型在 iPhone 17 Pro 的部署
支持 262K 上下文长度与无损加速的 speculative-decoding 技术
PrismML — 发布 Bonsai 27B:首个可在手机上运行的 27B 级模型
START LAUNCH BANNER DECODE
END LAUNCH BANNER DECODE
START BANNER BG ANIMATION
END BANNER BG ANIMATION
LAUNCH
1001011100 11010 001
返回所有文章
发布 Bonsai 27B:首个可在手机上运行的 27B 级模型
2026 年 7 月 14 日
•
今天,我们宣布推出 Bonsai 27B,该模型基于 Qwen3.6 27B,是 Bonsai 家族的新一代多模态旗舰产品,也是首个具备该能力级别的手机可运行模型。
我们之前的发布证明了使用 1-bit 和三值权重的模型可以产生具有商业价值的语言模型。Bonsai 27B 将这一边界扩展到新的能力层级:多步骤推理、结构化工具调用、视觉任务以及跨多个步骤保持连贯性的人机协作流程。直到今天,由于一个具体原因,将这一层级模型本地化部署一直不切实际:27B 模型在 16 位精度下占用约 54GB 存储空间,即使是优化后的 4 位版本(18GB)也超过了手机和大多数笔记本电脑的存储容量。
Bonsai 27B 改变了这一现状。它提供两种版本:
三值 Bonsai 27B 使用三值 {-1, 0, +1} 权重配合 FP16 分组缩放,实现每权重 1.71 有效位的真正精度。5.9GB 的体积使其成为质量导向版本:可在普通笔记本电脑上完整运行推理、工具调用和人机协作能力。
1-bit Bonsai 27B 使用二值 {-1, +1} 权重配合相同分组缩放,实现每权重 1.125 有效位。3.9GB 的体积使其成为存储导向版本,可适配 iPhone 17 Pro 的内存预算,首次实现 27B 级模型在手机端运行。
与所有 Bonsai 发布版本一致,低比特表示在语言网络、嵌入层、注意力机制、MLP 和 LM 头之间端到端运行,没有更高精度的逃生舱门。两个版本均为多模态,视觉模块以紧凑的 4-bit 形式发布,使设备端工作流能够处理截图、文档和摄像头输入,而不仅是文本。Bonsai 27B 支持完整的 262K-token 上下文窗口,并支持推测解码,通过无损草稿-验证加速提升速度。所有内容今天起均在 Apache 2.0 许可证下开放。
保持智能水平
在涵盖知识、推理、数学、编程、指令遵循、工具调用和视觉(在思考模式下评估,即模型完整推理能力被激活)的 15 个基准测试中,三值 Bonsai 27B 保留了全精度基线的 95%,1-bit Bonsai 27B 保留了 90%。
类别(基准测试)
Qwen 3.6
27B
三值 Bonsai
1-bit Bonsai
数学(GSM8K、MATH-500、AIME25、AIME26)
95.3
93.4
91.7
编程(HumanEval+、MBPP+、LiveCodeBench)
88.7
86.0
81.9
人机协作与工具调用(BFCL v3、TauBench)
80.0
74.0
66.0
指令遵循(IFEval、IFBench)
78.4
71.8
65.8
知识/STEM(MMLU-Redux、MuSR)
83.1
77.0
73.4
视觉(MMMU Pro、OCRBench)
72.6
65.2
59.6
总体(15 个基准测试)
85.0
80.5
76.1
图 I:Bonsai 27B(思考模式)在全精度基线上的基准测试得分。每个基准测试的完整结果请参见白皮书。
通过按能力读取表格,故事比平均水平更加清晰:数学和编程能力几乎未被触及,工具调用保持在接近完整精度的几个点范围内——这正是智能代理工作负载所依赖的核心能力。相比之下,相同基础模型的最激进传统低比特构建版本得分显著低于1比特Bonsai 27B,同时占用2.5倍的内存。
这与我们早期语言和图像模型展示的帕累托转变如出一辙,现在在27B规模上实现:27B级别的能力却拥有比完整精度2B模型更小的内存占用。按照我们通过1比特Bonsai 8B引入的“智能密度”指标衡量,1比特Bonsai 27B达到0.53/GB:超过完整精度基准值的10倍,且约为当前最佳低比特替代方案的2.7倍。
图II:Bonsai 27B与其他同参数级别的模型在智能密度(每GB)上的对比。
为什么这是重要的范式转变
最有价值的AI工作负载正在从单次响应转向持续性工作:能够操作真实工具的助手、无需人工干预即可完成并返回结果的工作流,以及需要综合数十份文档的研究。这种转变改变了工作负载的形态——一个代理不会只进行一次模型调用,而是会进行数百次调用,每次调用都携带上下文、生成结构化输出,并传递给下一次调用。
云API对于许多产品来说仍然是正确的选择。但对于智能代理工作负载而言,仅依赖云端执行会带来结构性限制:每一步都需要远程请求,每次迭代都会累积每token的成本,所有计划、工具调用和中间结果都需要跨网络传输,包括用户的私有文件、屏幕和数据。
VIDEO CAROUSEL — 粘贴至Webflow嵌入。横向14:9幻灯片。
视频1
轮播图I:通过我们的三进制Bonsai 27B模型在NVIDIA GeForce RTX 5090上运行的Hermes实现端到端智能代理工作流。
视频2
轮播图II:通过M5 Max上三进制Bonsai 27B实现的智能代理工具调用与MCP集成。
本地执行改变了整个计算公式。当能够执行持续性智能代理工作的模型可以装入设备时,代理可以内嵌在产品中:百步循环的边际成本为零,用户数据永远不会离开设备。全新的可能性由此开启——持久化的设备端代理、离线运行的助手、通过本地私有数据构建的推理助手。此前缺失的是一个足够小巧以便以这种方式部署、同时又足够强大值得信赖执行任务的模型。Bonsai 27B正是这样的模型。
它还解锁了一种新的系统架构:混合部署方案将非前沿且涉及隐私的任务路由到本地强大模型,而将最困难的步骤保留给云端前沿模型——从而大幅降低智能代理系统的每任务成本。
Bonsai 27B在NVIDIA GeForce RTX 5090上可达到1比特模式163 tok/s、三进制模式134 tok/s。在M5 Max上可达到1比特模式87 tok/s、三进制模式58 tok/s。
手机端适配比存储数字显示的门槛更严格。手机从不会将完整内存暴露给应用程序——12GB的iPhone仅提供约6GB用于设备端模型使用,且该模型需要与键值缓存和激活内存共享这一预算。任何传统构建的27B模型都无法接近这一门槛。约4GB的1比特Bonsai 27B是首个能够通过并留有工作空间的模型。
That constraint is why the family ships two deliberate operating points, specifically keeping that in mind: ternary for laptop-class quality, 1-bit for phone-class footprint.
VIDEO — single portrait (1:2) Vimeo embed. Paste into Webflow.
Demo II: Multimodal agentic use-cases powered by 1-Bit Bonsai 27B on an iPhone 17 Pro Max (Demo Mode: Cached & Prefilled Image Context)
The frontier keeps moving
Every Bonsai release has moved the intelligence-per-gigabyte frontier left, and Bonsai 27B moves it past a practical threshold: the full capability set of a modern model with thinking, multimodal understanding, vision, reliable tool use, now fits on the devices people already own.
We believe intelligence density will be one of the defining axes of the next stage of AI progress. Raw capability determines what a model can do; density determines where it can do it. Every leftward shift of the frontier expands the set of devices, products, and environments where advanced AI can operate and changes the economics of every deployment surface it touches, from phones to single-GPU serving. The methodology behind Bonsai is architecture-agnostic, and the frontier will keep moving: larger models and new architectures are already in progress.
Early computers filled rooms; today they live in our pockets. Intelligence is making the same journey, and Bonsai 27B is its largest step yet. Platform Coverage
Bonsai 27B runs natively on Apple devices (Mac, iPhone, iPad) via MLX and on NVIDIA GPUs via CUDA, through custom low-bit kernels built for its hybrid-attention architecture. Model weights are available today under the Apache 2.0 License. With this release, we’re offering a free, limited-time developer preview API so developers can easily try our model.
Full technical details of our compression, evaluation, and benchmarking processes are available in our whitepaper .
Join Us
PrismML emerged from a team of Caltech researchers and was founded with support from Khosla Ventures, Cerberus, and Google, with continuing support from Samsung. We've spent years tackling one of the field's hardest problems: compressing neural networks without sacrificing their reasoning ability.
If you want to help build the next generation of state-of-the-art AI, we'd love to hear from you. Check out our careers page .
Introducing 1-bit and Ternary Bonsai Image 4B: Image Generation for Local Devices
May 26, 2026
PrismML Releases Bonsai Image 4B
Thanks, we’ll keep you posted!
Something went wrong.
Resources
Demo
Whitepaper
Docs
Models
Hugging Face
GitHub
Locally AI (iOS)
API
Follow
X
Discord