Inco 开源 Splash,本地 Mac 推理最高达 144 Token/s

Inco 开源 Splash,本地 Mac 推理最高达 144 Token/s

N
News Editor
2026-09-19 08:22:59
Inco AI 开源本地推理引擎 Splash,并展示 Qwen3.8-27B 在 M5 Max MacBook Pro 上最高 144 Token/s。LM Studio 已在 0.4.25 版本接入该引擎。Splash 基于 DFlash 思路,将小模型并行猜测与大模型批量验证扩展到整个本地推理流程,目前支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B。

Inco AI 开源了本地推理引擎 Splash,并给出一组 Mac 端演示数据:Qwen3.8-27B 在 M5 Max MacBook Pro 上最高跑到 144 Token/s。LM Studio 随后接入,0.4.25 版本已经可以直接使用。

DFlash 从加速方案扩展到本地推理引擎

Inco 此前推出的 DFlash 已经进入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也给自家模型配了 DFlash,用来加速小模型。

DFlash 的做法是,先让小模型并行猜出多个 Token,再交给大模型批量验证,以减少逐 Token 生成带来的计算开销。Splash 则把这套优化扩展到了整个本地推理引擎。

当前支持的模型与适配方式

Splash 目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B。针对这两个模型,团队分别配置了独立的 GPU kernel、内存方案和 DFlash 2 小模型。覆盖范围更窄,但对应的是更激进的性能优化。

演示数据与并发表现

144 Token/s 是 Splash 在 M5 Max 上给出的最高演示值。换到 Inco 用于横向测试的 48GB M5 Pro,Qwen3.8-27B 在单路短上下文下达到 74 Token/s;在 4 路并发时,总吞吐达到 170 Token/s,为第二名的 3.9 倍。

按 Inco 的说法,这也是 Splash 更适合 Agent 场景的一点:当一个 Agent 同时拉起多个子任务时,并发总吞吐往往比单条对话速度更重要。

开源状态与运行要求

Splash 本身已经开源,不绑定 LM Studio。目前运行条件包括 M3 或更新的 Mac、macOS 26.4 以上,以及至少 36GB 统一内存。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
1400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。