Tether 旗下数据与 AI 部门 QVAC 于 3 月 17 日发布一套跨平台 BitNet LoRA 微调框架,并将其整合进 QVAC Fabric。按官方说法,这是全球首个支持微软 BitNet 1-bit LLM 架构的同类框架,目标是把原本依赖数据中心和高端 GPU 的模型微调任务,下��到手机与笔记本等终端设备上完成。
这套框架瞄准的是十亿级参数模型的本地化训练。QVAC 表示,借助 BitNet 的 1-bit 架构和自身优化,模型运行时的内存占用与计算压力被压低,训练不再局限于企业级硬件。手机能跑。笔记本也能跑。
兼容多类芯片与移动 GPU
根据公告,该框架支持 NVIDIA GPU,同时兼容 Intel、AMD、Apple M 系列芯片,以及移动端的 Adreno、Mali、Apple Bionic GPU。Tether 称,边缘设备借助这套方案,可以处理比传统 Q4 量化模型大 2 倍的模型规模,重点在于内存效率的提升。
LoRA(Low-Rank Adaptation,低秩适配)微调因此被带到更广泛的终端场景。原本主要在服务器上进行的个性化训练任务,现在被压缩进更小的设备侧资源里,这也是 QVAC Fabric 此次发布的核心卖点之一。
官方披露手机实测时间
Tether 工程团队同时给出了几组手机端测试结果。对于1.25 亿参数模型,在 Samsung S25 上使用包含 300 份生物医学文档的数据集完成��调,耗时约10 分钟。
在更高规模的10 亿参数模型测试中,同样的微调任务在 Samsung S25 上耗时1 小时 18 分钟,在 iPhone 16 上耗时1 小时 45 分钟。官方还称,开发团队已在 iPhone 16 上运行过130 亿参数模型的微调,这被描述为对移动设备物理极限的一次推进。
本地优先,数据不必上传云端
Tether 首席执行官 Paolo Ardoino 在相关表述中强调,如果使用 AI 需要 API 密钥,那它并不真正属于用户。QVAC 的思路很明确,就是“本地优先”。
按其设想,用户可以让模型直接学习本地邮件、笔记和消息数据,而不必把内容上传到云端服务器。这对应的是隐私与控制权问题。对企业场景来说,敏感数据不出本地设备;对开发者来说,AI 微调对集中式算力和平台接口的依赖被压缩。
目前,QVAC Fabric LLM 已以Apache 2.0 许可开源发布,并在 Hugging Face 提供预选适配器。Tether 试图推动的是一���边缘计算路径:模型训练和个性化适配不再只发生在云端,也可以直接发生在终端设备上。

