Tether公布了一项面向本地 AI 的新升级。该公司称,TurboQuant 已集成至 QVAC SDK 0.12.0,可将大模型运行中的 KV cache 内存需求最高压缩 5 倍,同时尽量不明显影响模型质量。
这次更新直指本地部署 AI 的一项老问题:内存不够。模型在处理长文档或长对话时,需要依靠 KV cache 保存上下文信息;上下文越长,缓存占用越高,普通硬件很快就会碰到瓶颈。
262,000 token上下文下,4B模型KV cache可占约8GB
按文中给出的技术基准,一个 40 亿参数模型在 262,000 token 上下文窗口下,仅 KV cache 就可能消耗约 8 GB 内存。若同时运行 4 个会话,这部分占用会升至 32 GB,还不包含模型本体所需内存。
Tether称,TurboQuant能把这部分需求压缩到原来的五分之一左右。文章还引用了谷歌研究的相关结论,称 AI 内存压缩的效率提升空间比多数人想象得更大,而这次发布的目标,是把这类突破做成可直接落地的软件能力。
更新已并入QVAC SDK 0.12.0,配套量化流程一并上线
根据介绍,TurboQuant已直接内置在 QVAC SDK 0.12.0 中,并与 QVAC 技术栈中的 Fabric 深度整合。Fabric 最初从 llama.cpp 分支发展而来,后来纳入了更广泛的研究成果。QVAC SDK则负责打包本地 AI 应用开发所需的库、工具和运行时组件,方便团队部署。
这次生产版本还包含完整量化流程、框架适配器、开发者文档,以及适配不同负载的多种配置。Tether认为,这对初创团队和独立开发者尤其关键,因为更长的上下文窗口与更强的大文档处理能力,意味着消费级硬件也能承载更复杂的本地 AI 任务。
Tether把隐私和去云依赖作为核心卖点
Tether在表述中反复强调数据隐私与减少云依赖。文章举例称,借助这项更新,用户可以在自己的笔记本电脑上审阅上百页法律合同,而不必把敏感材料上传到外部服务器。公司称,这类能力将覆盖学生、研究人员、开发者和记者等不同用户群体。
CEO Paolo Ardoino表示,用户不该每次处理私密文档或长任务时,都被迫把数据传到远端数据中心。他将 TurboQuant 视为推动“真正本地化 AI 交互”的一块基础能力。按Tether的整体路线,其AI战略更靠近个人设备和去中心化网络,而不是集中式超大基础设施;软件效率与可移植��,在下一阶段会和算力本身一样重要。

