以太坊联合创始人 Vitalik Buterin 9 月 26 日在 X 发文,分享了自己试用多款手机离线知识查询 App 的结果。他表示,这些应用比他两个月前自己尝试做的版本「好很多」,但遇到困难问题时,表现仍落后于能在笔记本上运行的模型,速度更慢,效果也更差。
他提到,表现最差的一类是专门的旅游查询。测试时,他输入的问题是「告诉我目前所在城市最好的纯素餐厅」,但试过的应用都没有答好。
Vitalik 在帖文中写道,他希望这些工具继续改进,尽快做到即使不联网,也能轻松查到任何想知道的现实世界信息。
悬赏来自 poidh,Vitalik 出资 1 ETH
他在帖文中附上的链接,指向去中心化悬赏平台 poidh 的第 31 号悬赏,题目为「打造最好的 Android 离线 AI 研究 App」。poidh 名称来自 pics or it didn’t happen,运作方式是由发起人把奖金锁进智能合约,投稿者提交成果证明后领取奖励。
根据 BlockTempo 读取的 poidh 以太坊主网合约记录,这项悬赏由一个社区地址在 9 月 18 日建立。说明中写明,这是一项受 Vitalik 帖文启发的独立悬赏,Vitalik 与悬赏本身无关,除非他本人明确表态,否则不参与评审。
不过在出资名单中,Vitalik 的公开地址 vitalik.eth 投入了 1 ETH,占总奖金 1.098 ETH 的九成以上。按文中所述 ETH 约 2,684 美元计算,这笔悬赏总额约为 2,947 美元。
悬赏源于 9 月 17 日的一则帖文
这项悬赏的起点,是 Vitalik 在 9 月 17 日发布的一则帖文。他当时表示,自己每隔几个月就会尝试一次这一方向。他想要的杀手级应用,是一款能在完全离线手机上运行的查询研究工具,效果至少达到「网络搜索加前沿 AI 模型」的一半以上,因为人们经常会把手机带到没有网络的地方。
他当时还说,自己只做到 10 亿参数模型每秒约 10 个 token,而且一旦问题变得有意思,模型就会出错。
在架构上,Vitalik 认为手机更适合走极端的混合专家模型(MoE)路线:总参数约 1,000 亿,大部分参数放在存储空间里,每个 token 只激活不到 10 亿参数。按照他的描述,MoE 会把参数拆成许多组,每次只调用其中一小部分,其余参数可以留在存储空间中,不必全部装入手机内存。
悬赏要求:12GB 内存、50GB 空间、全程离线
这项悬赏对作品提出了明确条件:
- 应用需能在 Android 和 GrapheneOS 设备上运行;
- 内存上限为 12GB;
- App、模型和数据库总大小不得超过 50GB;
- 安装后在使用期间不得发出任何网络请求;
- 原始代码需公开在 GitHub。
规则还规定,只要 Vitalik 公开确认某件作品达标,该作品就能拿走全部 1.098 ETH 奖金。若到 10 月 31 日仍没有作品获确认,发起人和出资者将退回资金,或自行选出得主。
截至 9 月 26 日共有三件投稿
链上记录显示,截至 9 月 26 日,这项悬赏共收到三件投稿,且都尚未被接受。Vitalik 发文时,这三件作品都已经提交,但他没有说明自己具体测试了哪几款。
Field Atlas
Field Atlas 于 9 月 23 日提交,使用 Qwen3 1.7B 模型搭配离线知识包,回答中会附带引用来源。
Boar
Boar 使用 Qwen2.5-1.5B 小模型配合离线维基百科搜索,也可以额外安装包含 5 万篇条目的资料包,并根据问题难度选择能够处理该问题的最小模型。
AndroidLM
AndroidLM 采用 Qwen3.6-35B-A3B 模型,并将其压缩到 2 位元。其 12.3GB 模型文件从存储空间串流读取,搭配 21GB 的英文维基百科数据库;针对旅游问题,还可额外安装 0.3GB 的 Wikivoyage 旅游指南。开发者是在 12GB 内存的 Pixel 8 Pro 上进行测试。
该模型总参数为 350 亿,每个 token 约激活 30 亿参数。三件投稿中,只有 AndroidLM 采用了 Vitalik 所建议的 MoE 路线,但无论总参数还是激活参数,都还没有达到他提出的 1,000 亿总参数和低于 10 亿激活参数的设想。
目前尚无作品获 Vitalik 公开确认
截至目前,Vitalik 还没有公开确认任何一件投稿达到要求。这项悬赏的截止时间为 10 月 31 日。
Vitalik 提出的目标与当前测试结果之间仍有差距
从他 9 月 26 日的试用反馈来看,手机离线 AI 查询工具已经较两个月前有明显进步,但在复杂问题处理、响应速度和现实世界信息查询质量上,仍与笔记本上的模型存在差距。至少在「所在城市最好的纯素餐厅」这一问题上,现有应用还没有交出让他满意的答案。

