谷歌 Antigravity 团队 8 月 27 日公布 Teamwork 技术长文,集中披露了数学、系统工程和开源软件三类成果。按谷歌给出的界定,7 项数学与理论计算机科学结果最初全部由 Gemini 3.1 Pro 在 Teamwork 的长证明模式下完成,其中 3 项随后被 Gemini 3.7 Flash 完整复现。谷歌将此描述为 Flash 级模型首次做出博士级数学研究成果。

这份成绩单中,最受关注的并不是更大的模型,而是主打速度和成本的小模型 Gemini 3.7 Flash。谷歌借此传递的重点并非 Flash 本身突然具备了更强的独立能力,而是多智能体的组织方式发生了变化。其核心是一套名为 Teamwork 的多智能体编排框架。
7 项理论结果由 3.1 Pro 首次完成,3 项被 Flash 复现
谷歌在技术文中对不同模型的角色作了严格区分。7 项数学与理论计算机科学结果,最初全部由 Gemini 3.1 Pro 在 Teamwork 的长证明模式下拿下。随后,Gemini 3.7 Flash 完整复现了其中 3 项成果,分别是:
- ℓp 子空间近似的 coreset 构造
- 最大内积嵌入的维度下界
- 将领先常数压低约 5.93 倍的 Hadamard 量化
其余 4 项结果仍由 Gemini 3.1 Pro 完成,包括稀疏凸优化的条件数下界、前缀矩阵分解的近似最优下界、Knuth's Cycles 难题,以及在断网条件下独立重现的 Erdős 单位距离问题。
谷歌还披露,TCSBench 评测的最高分达到 71%,由 Gemini 3.7 Flash 与 Gemini 3.1 Pro 协同取得,超过上一代 Gemini 3.6 Flash 搭配 Gemini 3.1 Pro 的 67.7% 纪录。

这组结果对应的信号很明确:在合适的编排框架下,轻量级模型可以把旗舰模型已经跑通的研究过程重新执行一遍。谷歌把重点放在协作机制,而不是单个模型参数规模。
Teamwork 的核心是制度化的相互质疑
Teamwork 由 Antigravity 团队开发。根据谷歌介绍,用户输入一个 /teamwork-preview 指令后,Gemini 会读取提示词,自行选择模式,并组织一个由多个智能体组成的「专家团」,运行时间可以持续数小时甚至数天。前述数学成果都来自其中的 Long Proof 模式。
这一模式的设计思路不是扩大参数,而是让多名智能体持续相互反驳、暴露漏洞。其流程大致分为四步。
第一步:竞争式策略搜索
系统会同时生成多套候选方案,并给每一套方案分配专门的 falsifier,用来反驳这一方案。即使某条路线被大量否定,也不会立即丢弃,而是连同反对意见一起保留在后续流程中。

第二步:按依赖关系拆解问题
当系统选出较可行的策略后,会把它拆成带有依赖关系的子问题,并构造成拓扑图。可以并行推进的子问题同步推进,存在先后依赖的部分则按顺序执行。
第三步:子问题内部锦标赛
每个子问题都会进行内部淘汰赛。节点在比较候选方案的同时,也会阅读批评意见,再整合成新的版本。如果整合失败,系统就携带此前累积的反对意见重新运行,直到漏洞被补齐。
第四步:跨轮学习
失败草稿会保留到下一轮,验证器识别出的错误会沉淀为「陷阱登记簿」。走过的无效路径和已经证明出的结论会实时写入共享知识库,供后续节点调用。
谷歌把这套机制落在一个核心问题上:避免多智能体协作时的盲目附和。按照文中的说法,Teamwork 的做法是把「互相找茬」固定成一套流程,减少错误路线在协作中被不断放大的情况。

Knuth's Cycles 并非首次被解出,谷歌给出的是新证明
7 项理论成果中,最容易被误读的是 Donald Knuth 提出的 Knuth's Cycles 难题。按照文中给出的时间线,这道题在今年春天已经由多个 AI 模型接力完成。
文章称,今年 2 月底,Claude Opus 4.6 在约 1 小时内给出了奇数情形的构造,Knuth 在论文开头连写两个「Shock!」。此后,gpt-5.3-codex 与 GPT-5.4 Pro 又补全了更难的偶数情形。到 4 月中旬,Knuth 已在论文修订版中确认偶数情形已经解决。
谷歌这次的工作,不是从零解开这道题,而是为偶数情形提供了两个更简洁的新构造,并给出两份首批长篇证明,篇幅分别超过 40 页和 70 页。其中一份 40 多页的证明通过了 Lean 形式化验证。
按原文表述,这一贡献的价值在于给出更漂亮、更扎实的证明,而不是首次破题。Teamwork 在这里展示的重点,仍是通过多智能体的博弈与编排,提升协作研究的稳定性。
Gemini 3.7 Flash 从零构建 RISC-V 模拟器并启动 xv6
同一套协作机制也被用于系统工程任务。谷歌在技术长文中明确表示,这一部分使用的是 Gemini 3.7 Flash。Teamwork 从零构建了一个周期级、乱序执行的 RISC-V CPU 模拟器。

乱序执行是高性能 CPU 的常见设计,也是模拟器开发中最容易出错的部分。按谷歌披露,Teamwork 先完成微架构功能正确性,手工写出乱序流水线和重排序缓冲区,成功将 xv6 操作系统启动到 Shell;随后再逐周期对齐时序。
谷歌把其中最困难的问题称为「静默执行鸿沟」:微架构状态可能在数百个周期里逐渐偏离,但真正到架构层报错时,已经难以追溯根因。为解决这一问题,Teamwork 将参考模拟器 Spike 沙箱化隔离,避免智能体直接抄袭,并采用锁步协同仿真,在每一步进行比对。
最终,这个模拟器跑通了 100 多个 RISC-V 标准基准。在未见过的测试负载上,它与 BOOM 硬件的平均周期误差为 0.71%。
不过,文中也明确说明,这是一套软件层面的模拟器,并不是 RTL 芯片设计,更不是流片制造。

Eigen 和 ParlayHash 优化已被上游合并
除研究和工程任务外,Teamwork 还被用于真实开源项目。谷歌列出的两个例子分别是 Eigen 和 ParlayHash。
在 C++ 线性代数库 Eigen 中,Teamwork 找到了一处单行或单列矩阵向量乘法的次优实现,并增加了一条 SIMD 快速路径。
在并发哈希表 ParlayHash 中,Teamwork 引入了 Swiss Table 的优化思路,使 64 线程初始插入吞吐翻倍,单线程整体吞吐提升 1.5 倍,同时每个元素的内存占用减少 25%。
谷歌强调,这些修改并非内部自测的封闭结果,而是经过外部人类维护者的代码评审,最终正式合并到上游分支。

谷歌把 AI 研究分工描述为探索与验收的分离
文章最后提到,一篇数学论文的作者声明写道,证明最初由谷歌内部的 Gemini 智能体系统给出,再由作者核验和编辑。谷歌据此描述当前 AI 科研中的实际分工:智能体负责大规模探索草稿空间,人类负责核验、编辑和最终签字。
谷歌的原话是,这些问题原本需要顶尖专家花几个月时间处理,Teamwork 压缩的是试错周期,而方向控制和最终签字权仍掌握在人类手中。
文中还提到,88 岁的图灵奖得主 Donald Knuth 在得知有人用 Lean 验证 Claude 找到的构造后表示:「这真是件好事」,因为自己「最近越来越容易出错」。按这篇文章的落点,随着机器承担越来越多的求解工作,验证与验收环节的重要性只会更高。
参考资料包括谷歌 Antigravity 博客文章《Teamwork: when AI becomes a research partner》,以及 Donald Knuth 相关论文。本文原载微信公众号「新智元」,作者为 ASI 启示录,编辑为元宇,由 MarsBit 发布。

