Google Research、Google DeepMind 与麻省理工学院(MIT)联合发布多代理 AI 系统 CoDaS(AI Co-Data-Scientist)。这套系统面向可穿戴设备原始数据,能够自行完成假设生成、统计分析、对抗式验证、文献推理��并输出完整论文草稿。按论文披露的数据,一项原本需要人类专家投入 37 个人天 的数据分析与写作任务,CoDaS 可在 6 至 8 小时 内完成。
从近万名参与者数据中提取心理与代谢线索
测试中,研究团队向 CoDaS 提供了覆盖近万名参与者的大型穿戴数据集,内容包括睡眠、活动、心率和手机使用习惯。在没有人工提示的前提下,系统识别出多项健康相关特征,其中一项最受关注的结果指向心理健康。
CoDaS 发现,夜间过度浏览社交平台或负面新闻的行为,与抑郁症严重程度呈显著正相关,统计结果为 ρ = 0.177、p < 0.001、n = 7,497。系统还为这一行为自行命名为 “late-night doomscrolling”,可对应为“深夜末日滑手机”。除心理健康外,它还找到了每日步数与静息心率比值,与代谢疾病中的胰岛素阻抗之间存在负相关。
对抗式验证机制用于剔除无意义结论
这套系统内置了 Adversarial Validation(对抗式验证),目的是压低 AI 在科研流程中的“科学幻觉”风险。研究举例称,系统曾提出使用“葡萄糖的平方”预测胰岛素阻抗,虽然该公式在统计上看似相关性很高,但验证模块判断这属于缺乏科学意义的循环论证,随后予以拒绝。
这一步不是装饰。它直接关系到 CoDaS 输出结果的可用性,也构成该系统与普通文本生成模型的核心差异之一。
专家盲测中拿到86%非拒绝率
除效率外,研究团队还对论文产出质量进行了盲测评审。结果显示,CoDaS 生成论文的“非拒绝率”为 86%,即评审结论落在接受、小修或大修的比例达到 86%。作为对比,其他基准 AI 科学代理生成论文的拒绝率为 85% 至 100%。
这项研究展示了多代理 AI 如何把原本偏消费级的穿戴设备数据,转化为具有临床价值的研究线索。被转发讨论的重点,不是 AI 会不会写论文,而是它已经开始独立完成从发现问题到形成研究草稿的一整套流程。

