昨晚的硅谷,连续出现了三件与 AI 相关的大事。Google 发布 Gemini 3.8 Flash,Meta 发布 Muse Spark 1.3,此前几乎没人讨论过的初创公司 Mostik,则登上了《WIRED》的专访。
如果只看前两件事,这很像又一次常见的 AI 刷榜之夜。Google 刚把 Gemini 推上 DeepSWE 榜首,几个小时后,Meta 又公布了更高成绩,世界第一的位置只维持了几个小时。
但把这三件事放在一起看,焦点并不只在榜单。更值得注意的是,AI 的经济学口径正在变化。过去几年,行业谈论 AI 成本时,最常用的单位是每百万 token 的价格。Agent 出现后,这种计量方式越来越不够用。真正重要的问题,开始变成修好一个 Bug 要花多少钱、完成一份研究要花多少钱、让一个 Agent 连续工作 3 个小时又要花多少钱。
从这个角度看,昨晚的三件事分别代表了推理成本下降的不同方向:Google 正在把 frontier 级别能力压进更便宜的模型;Meta 在让 Agent 用更少 token 和更少工具调用完成同一个任务;Mostik 则更进一步,直接追问如果通信双方本来都是 AI,模型之间为什么还要继续使用为人类设计的语言。
Gemini 3.8 Flash:能力继续上探,价格仍停留在 Flash 档位
先看 Google。Google 发布了新旗舰模型 Gemini 3.8 Flash,官方称其为迄今最强的推理与代码模型。这也是 Google 在 6 周内对 Flash 系列的第 3 次更新,从 3.6 到 3.7,再到 3.8。
过去,Flash 系列给人的印象一直很明确:更快、更便宜,但能力比最强模型弱一些。Google 这次在试着改写这一定位。
Gemini 3.8 Flash 的核心提升集中在 long-horizon coding 和 agentic workflow。它在衡量 AI 长周期软件工程能力的 DeepSWE v1.1 上拿到约 74%。这类测试与传统代码 benchmark 的区别,在于它不是给模型一道算法题,而是把 Agent 直接放进一个代码仓库里,让模型理解问题、搜索代码、修改文件、调用工具、运行测试,并在失败后继续排查原因。一个完整任务可能持续几十步,甚至上百步。
在这项测试中,Gemini 3.8 Flash 一度登上世界第一。Claude Opus 5 的成绩同样约为 74%,GPT-5.6 Sol 约为 73%,此前领先的 Fable 5 约为 70%。只看能力,这几款头部模型之间的差距已经不算特别大。
真正拉开差距的是成本。Gemini 3.8 Flash 的 API 首发价格维持在输入 0.75 美元 / 1M token、输出 3.75 美元 / 1M token。在 DeepSWE 上完成一道完整任务,它的平均成本只有 2.36 美元。
对比来看,同样约 74% 的 Claude Opus 5,单任务平均成本达到 11.84 美元;约 73% 的 GPT-5.6 Sol,平均成本为 6.46 美元。也就是说,在接近同一级别的软件工程能力下,执行成本已经可以拉开数倍差距。
这一点到了 Agent 时代会更敏感。聊天机器人场景里,一次回答贵几分钱或便宜几分钱,普通用户往往没有明显感知。Agent 不一样。一个 coding agent 可能连续运行 100 步,一个 research agent 可能搜索几十个网页、读取几百页资料,企业里的 Agent 甚至可能连续工作数小时。
Google 还提到,3.8 Flash 在遇到复杂任务时会主动「work harder」,进行更多推理和工具调用。这里的变化不在于模型少想了,而在于 token 已经便宜到足以支持更长的 loop。换句话说,Google 正在把原本只属于高价 frontier model 的能力,压进 Flash 的价格区间。
Muse Spark 1.3:Meta 把竞争重点推向任务完成效率
就在 Google 发布 Gemini 3.8 Flash 后约 3 个半小时,Meta 也加入了这场竞争,推出 Muse Spark 1.3。
按照 Meta 公布的评测,Muse Spark 1.3 在 DeepSWE v1.1 上达到 75.4%,超过 Gemini 3.8 Flash、Claude Opus 5 和 GPT-5.6 Sol。相比之下,Muse Spark 1.2 在同一测试中的成绩约为 55%。从 1.2 到 1.3,这次小版本更新直接提升了约 20 个百分点。
不过,文章认为更值得看的不只是 75.4%,还有另外两个数字:工具调用减少约 20%,token 消耗减少约 25%。
这两个数字与 Agent 的商业化效率更贴近。一个 Agent 真正烧钱的地方,很多时候不是正常推理,而是走偏之后还在继续做事。比如 coding agent 在第 20 步误解需求,可能接着修改 5 个文件、运行 3 轮测试、搜索大量代码,最后才发现路线不对,只能从头再来。几十次工具调用和几万 token 就这样被浪费掉。
从这个角度看,如果模型能更早发现任务存在歧义,更早知道自己做不下去,更早向用户提问,本身就在直接降低成本。
Muse Spark 1.3 这次强化的很多能力都落在这个方向上:它可以在长 thread 中同时维护多个 workflow;遇到模糊任务时主动询问;解决不了的问题主动请求帮助;涉及不可逆操作前先确认;长任务运行很多轮后,也更不容易忘记最初约束。
Meta 还开始强调模型对自身能力边界的认知,也就是知道自己会什么,也知道自己不会什么。放在聊天机器人时代,这类能力可能没有 benchmark 提升 20 分那样直观;到了 Agent 时代,它们都可以折算为钱。Agent 少犯一次错误,本身就是一次推理优化。
把 Google 和 Meta 放在一起看,大模型竞争的计量单位正在变化。市场可能会越来越少只盯着「每百万 token 多少钱」,转而看另一个数字:把一个真实任务从头跑到尾,到底要多少钱。
Mostik:把模型之间的自然语言通信拿掉
如果说 Google 和 Meta 还在研究如何用更便宜、或更少的 token 完成任务,那么 Mostik 触碰的是更底层的问题:这些 token 是否必须存在。
Mostik 在俄语里的意思是「桥」。该公司 CEO Sasha Malysheva 是这套方法的主要开发者,首席科学家是日内瓦大学教授、2010 年菲尔兹奖得主 Stanislav Smirnov。
他们尝试做的事情听起来简单,做起来却很难:让两个 AI 模型不再通过自然语言互相交流。
当前大多数 Multi-Agent 系统的工作方式是,Model A 拿到信息后,先生成几百甚至几千个 token,用自然语言写出结论;Model B 再把这些文字重新读进去,重新理解,再建立自己的内部表示,然后继续推理。
问题在于,大模型内部真正进行计算的,并不是中文或英文,而是高维连续的数学表示。文章用一个比喻来说明这一点:两台电脑明明可以直接传数据,但电脑 A 却先把文件打印成几百页纸,再让电脑 B 用摄像头逐页 OCR 回去。过去大家更多是在研究怎么降低「打印费」,Mostik 的想法则是把「打印机」直接拿掉。
他们试图在不同模型的内部表示之间搭起一座 bridge,让模型直接交换 latent representation,而不是先生成自然语言。
《WIRED》披露的一个实验显示,Mostik 将完整版 GLM-5.2 753B 与只有 4B、可运行在移动设备上的 Qwen 3.5 进行了桥接。最终得到的混合系统,能力落在两者之间,但推理成本只有完整 GLM-5.2 的 1/20。
不过,文章也指出,现在就断言 Mostik 已经解决模型通信问题还为时过早。latent communication 并不是第一次出现。过去几年,已经有不少研究尝试交换 embedding、hidden state、KV cache 等内部表示。
真正难的地方在于,不同模型的架构、参数、训练数据和内部坐标系并不相同。如何让两个模型真正理解彼此的 latent space,本身就是一个非常困难的问题。Smirnov 也承认,目前甚至还缺少成熟的数学语言去描述不同模型之间的共同表示。
即便如此,1/20 这个数字仍然构成了一个值得关注的信号,因为它对应的是另一种可能的 AI 架构。
端侧与云端之间,可能出现新的分工方式
过去两年,围绕端侧 AI 的讨论,大多集中在如何把更大的模型塞进手机里:7B、4B、3B、1B,不断蒸馏、量化、压缩。
如果 Mostik 这条路线最终走通,另一种思路可能会出现。未来的手机也许不需要一个「什么都会」的大模型。设备里可能只需要运行一个 0.xB 或几 B 的小模型,它足够便宜,能够持续运行,负责理解用户当前处在哪个 App、刚做过什么、设备处于什么状态,并处理绝大多数简单、高频任务。
遇到真正困难的问题,再通过潜空间通信调用远程大模型。关键差别在于,它不需要像现在这样,把 10 万 token 的上下文重新发往云端,让远端模型从头再读一遍;它可能只需要传输一段高度压缩的 latent state。远端大模型完成复杂推理后,也不一定再生成几千个 token 的自然语言解释给本地模型,而是直接把新的内部表示传回来。
这样一来,本地小模型负责高频、低成本、持续运行;云端 frontier model 只处理低频但更难的推理任务;两者之间再通过某种 bridge 高效通信。文章认为,如果这件事最终成立,推理成本下降的幅度就不只会是 API 单价下调 30% 或 50%,而可能改变 AI 计算的组织方式本身。
从榜单竞争到成本竞争
回看昨晚的三件事,表面上它们分别属于不同方向:Google 发布 Gemini 3.8 Flash,把 frontier 级别能力压进 Flash 的价格区间;Meta 推出 Muse Spark 1.3,让 Agent 用更少 token 和工具调用完成更多工作;Mostik 则尝试让模型之间的一部分 token 从源头上不再产生。
它们共同指向的,是智能正在快速变得更便宜,而且这种降价已经不只是 API 单价的下降。模型价格在下降,完成任务所需的计算量在下降,模型之间交换信息的方式也开始被重新设计。
文章最后写道,比起 benchmark 再涨几个百分点,更值得在意的问题是,强大的 AI 最终可以便宜到什么程度。因为很多技术真正爆发的时刻,并不是「第一次能用」的时候,而是「终于便宜到可以随便用」的时候。今天让一个 Agent 花几十美元去完成一件普通人的小任务,也许并不划算;如果未来只需要几毛钱,很多现在根本不会被考虑的应用,可能就会成立。
文中还提到,如果推理成本再下降一到两个数量级,让几十个 Agent 24 小时持续围绕一个人运行,也许会从现在的不现实,变成一种默认状态。
对于昨晚那场连续发生的模型发布与实验披露,作者最后留下的核心问题并不是谁又拿到一次世界第一,而是:这么聪明的 AI,最后到底还能便宜到什么程度。

