Google 于 4 月 2 日发布的开源模型 Gemma 4,已经可以在 iPhone 上进行完整本地推理。用户只需从 App Store 下载 Google AI Edge Gallery,选择模型变体后即可启动,整个过程无需联网,也不经过云端。
这次落地并非停留在演示层。Google 直接把离线推理能力放进面向消费者的应用中,用户不需要开发者账号,也不需要 API 密钥,安装后就能运行。
Google把完整推理能力放进手机端
Gemma 4 采用 Apache 2.0 授权,已发布 4 个开放权重模型变体。根据现有架构选择,在 iPhone 端的推理路径主要走 GPU,而不是 Apple Neural Engine。原因在于,Neural Engine 更适合固定模式计算,例如 Face ID 这类专项任务;而大语言模型推理对浮点运算的灵活性要求更高,GPU 是更直接的实现路径。
Google AI Edge Gallery 也不只是一个文本聊天界面。应用内整合了图像识别、语音交互以及可扩展的 Skills 框架,定位更接近开发实验平台,而不是单一功能展示工具。
面向移动设备,Google默认引导E2B版本
在模型规模方面,Gemma 4 的 31B 旗舰版基准成绩与 Qwen 3.5 的 27B 版本接近,双方在不同任务中各有优劣,并未形成全面压制。素材指出,这组比较本身并不是此次部署策略的重点。
Google 官方应用默认引导用户选择 E2B 变体,原因很直接:它占用内存更低、发热和功耗更小,在移动设备的实际限制下更稳定。E2B 与 E4B 两个版本从设计开始就针对移动端离线环境做过优化,追求的是持续可用性,而不是单纯的跑分表现。
硬件门槛方面,建议设备为 iPhone 15 Pro 或更新机型。这也意味着当前适用人群仍集中在较早一批尝试本地 AI 的用户。
离线推理瞄准的是数据不能出本地的场景
本地低延迟只是表层变化,更关键的是数据处理边界被重新划定。医疗机构的病患资料、现场勘查的图像记录、企业内部的机密文件,这些场景的共同点并不是对速度要求极高,而是数据无法离开本地环境。对这类需求来说,云端 AI 的主要限制不在响应时间,而在合规性。
从这个角度看,Gemma 4 在 iPhone 上实现离线推理,提供的是一条绕开数据传输限制的可行路径,而不是单纯和云端方案比性能。素材也提到,当前实际应用仍多停留在技术验证阶段,从“能跑”走向大规模采用,后面还有安全审计、管理工具和集成成本等工程问题要处理。

