PrismML发布 Bonsai 27B,可在 iPhone 上本地运行

PrismML发布 Bonsai 27B,可在 iPhone 上本地运行

N
News Editor
2026-07-15 19:55:41
PrismML推出 Bonsai 27B,称其是首个突破消费级智能手机内存门槛的 27B 级 AI 模型。该模型压缩后最低仅 3.9 GB,可在 iPhone 17 Pro Max 上以 11 tokens/s 运行,三值版本为 5.9 GB,在 M5 Pro 笔记本上约 26 tokens/s。PrismML表示,Bonsai 27B 采用基于 Caltech 知识产权的压缩方法,并以 Apache 2.0 免费提供下载。公司 CEO Babak Hassibi 还向 CNBC 确认,PrismML 正与苹果进行早期接触,苹果在评估这项压缩技术是否适合端侧部署。
PrismMLBonsai 27B端侧AI苹果模型压缩Apache 2.0人工智能

PrismML 发布了 Bonsai 27B,并称这是首个跨过消费级智能手机内存门槛的 27B 级 AI 模型。按行业常见标准,27 billion parameters 的中等规模模型若以 half precision 运行,通常需要约 54 GB 内存,多数笔记本无法承载,部分台式机也不行。PrismML 这次给出的版本压缩到 3.9 GB,已经可以装进 iPhone。

PrismML发布 Bonsai 27B,可在 iPhone 上本地运行 2

参数是模型可调节权重的数量。参数越多,模型通常越稠密,能力也越强。PrismML 表示,Bonsai 27B 在 iPhone 17 Pro Max 上可达到 11 tokens per second。其三值版本大小为 5.9 GB,在一台 M5 Pro 笔记本上的速度约为 26 tokens per second。两种版本都以 Apache 2.0 协议免费提供。

压缩方式把模型权重降到 1 bit 或 3 值表示

这套压缩方法建立在 Caltech 的知识产权之上。PrismML 将每个模型权重从 16-bit 浮点精度压缩为单一符号:二值版本只有 +1 或 -1,三值版本则是三种取值之一。每 128 个权重共享一个 16-bit 缩放因子,因此二值版本最终做到每个权重 1.125 bits,相比全精度原始模型缩小 14 倍;三值版本加入了 0 状态,以换取略强的表达能力,最终为 1.71 bits。

换成更直白的说法,三值 AI 模型对每个内部数值只使用三种设置:负、零、正;而标准 AI 模型大约可以从 65,000 种设置中选择。PrismML 称,在这种压缩下,输出质量损失并不大。

PrismML发布 Bonsai 27B,可在 iPhone 上本地运行 3

PrismML 还强调,Bonsai 与常见的“低比特”模型不同。它没有给任何组件保留更高精度的“逃生通道”:embeddings、attention,以及完整的 language model head 都是端到端压缩。多数 quantized build 会把部分敏感层保留在全精度,以较大体积换取更好的质量;Bonsai 没有采用这种做法。

从 Bonsai 8B 走到 27B

这是 Bonsai 系列的第二次重要发布。PrismML 在今年 3 月推出过 Bonsai 8B,当时模型大小为 1.15 GB,用来证明 1-bit 架构在 8 billion parameters 规模下不会让推理能力崩掉。PrismML 认为,这次从 8B 跳到 27B,意义已经不同:在这一规模上,持续链式推理、可靠工具调用,以及多步 agentic behavior 才会稳定出现,而更小的模型在这些任务上仍经常失手。

15 项基准测试结果

在 NVIDIA H100 GPU 上、以 thinking mode 评估的 15 项基准测试中,测试范围覆盖知识、数学、编程和工具使用。Ternary Bonsai 27B 的平均得分为 80.49,相当于全精度模型的 94.6%;1-bit 版本得分为 76.11。

报道写道,就体积对应的潜力来看,这些模型在 benchmark 上的表现明显优于 Gemma 4 或 Qwen 3.6。文中还列出了几项对比数据:AIME25 和 AIME26 这两项以 American Invitational Mathematics Examination 为模板的测试中,Ternary Bonsai 27B 得分为 93.7%,而体量大得多的 Qwen 3.6B 为 95.3%;编程方面,Bonsai 得分 86,Qwen 3.6 为 88;通用知识方面,Bonsai 为 77%,Qwen 3.6 为 83。

PrismML发布 Bonsai 27B,可在 iPhone 上本地运行 4

PrismML 还采用了 hybrid attention backbone,其中大约 75% 的层是 linear attention,而不是完整的 quadratic attention。报道称,正是这一架构,让 262K-token 上下文窗口能够在端侧设备上变得可行;如果使用标准 attention stack,在手机硬件上的成本会高到难以接受。

Decrypt 的上手测试

Decrypt 表示,其团队也实际运行了 Bonsai 27B。就编程任务而言,模型需要多轮迭代,单次提示词的效果无法与云端前沿模型竞争,但由于它是本地运行且免费,这一点的重要性有所下降。Decrypt 用它制作了一款名为 Zombie Type 的浏览器第一人称打字恐怖游戏,经过两轮 vibe coding 后,模型生成了较为干净的碰撞检测、正常的计分逻辑,以及能保持统一的图形效果。报道认为,这个模型很早就能抓住结构,第二轮更像是在细化,而不是推倒重来。

报道还提到,在这次任务中,部分模型生成内容——比如 skeletons——看起来甚至比 GPT 5.6 Sol 做得更复杂。不过文中同时强调,这并不意味着 Bonsai 更强,只能说明在这个具体任务里,它做出了一个更可爱的 skeleton,而“AI king”则做了一个较差的风格选择。该游戏已提供测试链接。

在创意写作方面,Decrypt 的评价更为保留,也指出判断标准本身更主观。报道称,如果采用 zero-shot prompt,Bonsai 的结果不算特别有想象力。不过,它写出的故事在内部逻辑、节奏和叙事弧线上保持一致,效果优于或接近 Claude Haiku,甚至在相似提示下、较低 effort 设置中可与 Sonnet 相比。对于一个完全运行在用户自有硬件上、且没有 API 成本的模型来说,报道认为这已经相当值得一提。相关故事文件也已上传至其 Github repository。

PrismML发布 Bonsai 27B,可在 iPhone 上本地运行 5

DSpark 解码层与苹果接触

PrismML 还随模型一同提供了 DSpark speculative decoding layer。这是一个轻量级 drafter,会先提出一批候选 token 块,再由主模型在单次 forward pass 中统一验证,而不是逐 token 生成。报道称,在 H100 上,这项设计可把吞吐量提升 1.37 倍,同时不改变输出质量,因为验证过程会保留完全一致的输出分布。在 Apple Silicon 上,这一功能目前还未默认启用,但对于 GPU 服务场景,文中认为它带来了实际收益。

苹果的兴趣则给这项技术增加了商业层面的想象空间。PrismML CEO Babak Hassibi 向 CNBC 确认,公司正与苹果进行早期接触,苹果正在评估这项压缩技术是否可用于潜在的端侧部署。

Hassibi 还表示,下一步产品管线中会有压缩版 Gemma 模型,之后是更大的 frontier models;1-bit Bonsai 27B 目前已经按照 Apache 2.0 协议开放免费下载。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。