PrismML 发布了 Bonsai 27B,并称这是首个跨过消费级智能手机内存门槛的 27B 级 AI 模型。按行业常见标准,27 billion parameters 的中等规模模型若以 half precision 运行,通常需要约 54 GB 内存,多数笔记本无法承载,部分台式机也不行。PrismML 这次给出的版本压缩到 3.9 GB,已经可以装进 iPhone。

参数是模型可调节权重的数量。参数越多,模型通常越稠密,能力也越强。PrismML 表示,Bonsai 27B 在 iPhone 17 Pro Max 上可达到 11 tokens per second。其三值版本大小为 5.9 GB,在一台 M5 Pro 笔记本上的速度约为 26 tokens per second。两种版本都以 Apache 2.0 协议免费提供。
压缩方式把模型权重降到 1 bit 或 3 值表示
这套压缩方法建立在 Caltech 的知识产权之上。PrismML 将每个模型权重从 16-bit 浮点精度压缩为单一符号:二值版本只有 +1 或 -1,三值版本则是三种取值之一。每 128 个权重共享一个 16-bit 缩放因子,因此二值版本最终做到每个权重 1.125 bits,相比全精度原始模型缩小 14 倍;三值版本加入了 0 状态,以换取略强的表达能力,最终为 1.71 bits。
换成更直白的说法,三值 AI 模型对每个内部数值只使用三种设置:负、零、正;而标准 AI 模型大约可以从 65,000 种设置中选择。PrismML 称,在这种压缩下,输出质量损失并不大。

PrismML 还强调,Bonsai 与常见的“低比特”模型不同。它没有给任何组件保留更高精度的“逃生通道”:embeddings、attention,以及完整的 language model head 都是端到端压缩。多数 quantized build 会把部分敏感层保留在全精度,以较大体积换取更好的质量;Bonsai 没有采用这种做法。
从 Bonsai 8B 走到 27B
这是 Bonsai 系列的第二次重要发布。PrismML 在今年 3 月推出过 Bonsai 8B,当时模型大小为 1.15 GB,用来证明 1-bit 架构在 8 billion parameters 规模下不会让推理能力崩掉。PrismML 认为,这次从 8B 跳到 27B,意义已经不同:在这一规模上,持续链式推理、可靠工具调用,以及多步 agentic behavior 才会稳定出现,而更小的模型在这些任务上仍经常失手。
15 项基准测试结果
在 NVIDIA H100 GPU 上、以 thinking mode 评估的 15 项基准测试中,测试范围覆盖知识、数学、编程和工具使用。Ternary Bonsai 27B 的平均得分为 80.49,相当于全精度模型的 94.6%;1-bit 版本得分为 76.11。
报道写道,就体积对应的潜力来看,这些模型在 benchmark 上的表现明显优于 Gemma 4 或 Qwen 3.6。文中还列出了几项对比数据:AIME25 和 AIME26 这两项以 American Invitational Mathematics Examination 为模板的测试中,Ternary Bonsai 27B 得分为 93.7%,而体量大得多的 Qwen 3.6B 为 95.3%;编程方面,Bonsai 得分 86,Qwen 3.6 为 88;通用知识方面,Bonsai 为 77%,Qwen 3.6 为 83。

PrismML 还采用了 hybrid attention backbone,其中大约 75% 的层是 linear attention,而不是完整的 quadratic attention。报道称,正是这一架构,让 262K-token 上下文窗口能够在端侧设备上变得可行;如果使用标准 attention stack,在手机硬件上的成本会高到难以接受。
Decrypt 的上手测试
Decrypt 表示,其团队也实际运行了 Bonsai 27B。就编程任务而言,模型需要多轮迭代,单次提示词的效果无法与云端前沿模型竞争,但由于它是本地运行且免费,这一点的重要性有所下降。Decrypt 用它制作了一款名为 Zombie Type 的浏览器第一人称打字恐怖游戏,经过两轮 vibe coding 后,模型生成了较为干净的碰撞检测、正常的计分逻辑,以及能保持统一的图形效果。报道认为,这个模型很早就能抓住结构,第二轮更像是在细化,而不是推倒重来。
报道还提到,在这次任务中,部分模型生成内容——比如 skeletons——看起来甚至比 GPT 5.6 Sol 做得更复杂。不过文中同时强调,这并不意味着 Bonsai 更强,只能说明在这个具体任务里,它做出了一个更可爱的 skeleton,而“AI king”则做了一个较差的风格选择。该游戏已提供测试链接。
在创意写作方面,Decrypt 的评价更为保留,也指出判断标准本身更主观。报道称,如果采用 zero-shot prompt,Bonsai 的结果不算特别有想象力。不过,它写出的故事在内部逻辑、节奏和叙事弧线上保持一致,效果优于或接近 Claude Haiku,甚至在相似提示下、较低 effort 设置中可与 Sonnet 相比。对于一个完全运行在用户自有硬件上、且没有 API 成本的模型来说,报道认为这已经相当值得一提。相关故事文件也已上传至其 Github repository。

DSpark 解码层与苹果接触
PrismML 还随模型一同提供了 DSpark speculative decoding layer。这是一个轻量级 drafter,会先提出一批候选 token 块,再由主模型在单次 forward pass 中统一验证,而不是逐 token 生成。报道称,在 H100 上,这项设计可把吞吐量提升 1.37 倍,同时不改变输出质量,因为验证过程会保留完全一致的输出分布。在 Apple Silicon 上,这一功能目前还未默认启用,但对于 GPU 服务场景,文中认为它带来了实际收益。
苹果的兴趣则给这项技术增加了商业层面的想象空间。PrismML CEO Babak Hassibi 向 CNBC 确认,公司正与苹果进行早期接触,苹果正在评估这项压缩技术是否可用于潜在的端侧部署。
Hassibi 还表示,下一步产品管线中会有压缩版 Gemma 模型,之后是更大的 frontier models;1-bit Bonsai 27B 目前已经按照 Apache 2.0 协议开放免费下载。

