Tether发布AI新升级:内存占用最高压缩5倍,瞄准本地模型部署

Tether发布AI新升级:内存占用最高压缩5倍,瞄准本地模型部署

N
News Editor 01
2026-07-23 05:35:13
Tether将TurboQuant集成进QVAC SDK 0.12.0,称可把AI模型KV cache内存需求最高压缩5倍,并尽量不影响模型质量,重点推动本地AI与隐私敏感场景落地。
TetherAI本地AIQVAC SDKTurboQuant

Tether公布了一项面向本地 AI 的新升级。该公司称,TurboQuant 已集成至 QVAC SDK 0.12.0,可将大模型运行中的 KV cache 内存需求最高压缩 5 倍,同时尽量不明显影响模型质量。

这次更新直指本地部署 AI 的一项老问题:内存不够。模型在处理长文档或长对话时,需要依靠 KV cache 保存上下文信息;上下文越长,缓存占用越高,普通硬件很快就会碰到瓶颈。

262,000 token上下文下,4B模型KV cache可占约8GB

按文中给出的技术基准,一个 40 亿参数模型在 262,000 token 上下文窗口下,仅 KV cache 就可能消耗约 8 GB 内存。若同时运行 4 个会话,这部分占用会升至 32 GB,还不包含模型本体所需内存。

Tether称,TurboQuant能把这部分需求压缩到原来的五分之一左右。文章还引用了谷歌研究的相关结论,称 AI 内存压缩的效率提升空间比多数人想象得更大,而这次发布的目标,是把这类突破做成可直接落地的软件能力。

更新已并入QVAC SDK 0.12.0,配套量化流程一并上线

根据介绍,TurboQuant已直接内置在 QVAC SDK 0.12.0 中,并与 QVAC 技术栈中的 Fabric 深度整合。Fabric 最初从 llama.cpp 分支发展而来,后来纳入了更广泛的研究成果。QVAC SDK则负责打包本地 AI 应用开发所需的库、工具和运行时组件,方便团队部署。

这次生产版本还包含完整量化流程、框架适配器、开发者文档,以及适配不同负载的多种配置。Tether认为,这对初创团队和独立开发者尤其关键,因为更长的上下文窗口与更强的大文档处理能力,意味着消费级硬件也能承载更复杂的本地 AI 任务。

Tether把隐私和去云依赖作为核心卖点

Tether在表述中反复强调数据隐私与减少云依赖。文章举例称,借助这项更新,用户可以在自己的笔记本电脑上审阅上百页法律合同,而不必把敏感材料上传到外部服务器。公司称,这类能力将覆盖学生、研究人员、开发者和记者等不同用户群体。

CEO Paolo Ardoino表示,用户不该每次处理私密文档或长任务时,都被迫把数据传到远端数据中心。他将 TurboQuant 视为推动“真正本地化 AI 交互”的一块基础能力。按Tether的整体路线,其AI战略更靠近个人设备和去中心化网络,而不是集中式超大基础设施;软件效率与可移植��,在下一阶段会和算力本身一样重要。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。