以太坊联合创始人Vitalik Buterin在4月发布的一篇博客中透露,他已彻底放弃所有云端AI服务,转而运行一套完全本地化、沙盒化的AI系统。他强调,此举是对AI代理领域日益严重的隐私与安全问题的直接回应——数据显示,约15%的AI代理技能或插件工具包含恶意指令。
硬件选型:Nvidia 5090跑出90 token/s
Buterin的硬件是一台搭载Nvidia 5090 GPU(24 GB显存)的笔记本电脑。他通过llama-server运行阿里巴巴开源的Qwen3.5:35B模型,实现了每秒90个token的推理速度,这被他视为日常舒适使用的目标值。他还测试了AMD Ryzen AI Max Pro(128 GB统一内存,51 token/s)和DGX Spark(60 token/s),但直言后者作为桌面AI超级计算机,性价比和吞吐量均不如一台好的笔记本GPU。
操作系统方面,Buterin从Arch Linux迁移至NixOS,采用单一声明式文件定义整个系统配置。llama-server作为后台守护进程运行,暴露一个本地端口供所有应用连接。例如,Claude Code可以被指向本地llama-server实例,而非Anthropic的服务器。
安全模型:“人类+LLM”2-of-2确认
沙盒化是Buterin安全模型的核心。他使用bubblewrap从任意目录创建隔离环境,运行在沙盒内的进程只能访问明确授权的文件和受控网络端口。更关键的是,他开源了一个消息守护进程(messaging-daemon),封装了signal-cli和电子邮件功能。该守护进程可以自由读取消息,并向自己发送消息而无需确认,但任何发送给第三方的外发消息都必须经过人类明确批准。Buterin称此为“人类+LLM 2-of-2”模型,并强调同样的逻辑应应用于以太坊钱包:团队在构建AI连接的钱包工具时,应将自主交易上限设为每日100美元,超出该额度的交易或携带可能窃取数据的calldata的交易,必须获得人类确认。
本地工具链:维基百科转储加隐私优先搜索
为减少对外部搜索的依赖(Buterin视其为隐私泄露),他在本地存储了约1TB的维基百科转储,并配合技术文档使用。他还开源了一个本地音频转录守护进程(stt-daemon),基本使用无需GPU,输出会送入LLM进行修正和总结。
对于本地模型无法胜任的任务,Buterin提出了隐私保护的远程推理方案:他提及与研究员Davide合作的ZK-API提案、Openanonymity项目,以及利用mixnets防止服务器通过IP地址关联连续请求。短期内可借助可信执行环境(TEE)减少数据泄露,但完全同态加密用于私有云推理目前仍速度过慢,无法实用。
Buterin在博文末尾强调,这只是一个起点而非成品,并警告读者不要照搬他的工具组合就认为绝对安全。

