AI BioDesign获9460万美元投入,押注蛋白设计实验闭环

AI BioDesign获9460万美元投入,押注蛋白设计实验闭环

N
News Editor
2026-09-28 02:02:08
由2024年诺贝尔化学奖得主 David Baker 与基因组学家 Jay Shendure 领衔的 AI BioDesign 于 9 月 3 日在西雅图亮相,背后获得保罗·艾伦遗产体系 9460 万美元支持。该机构不追更大的通用模型,而是把重点放在试管内高并行实验,让 AI 设计、实验测量和模型更新形成闭环,以更快生成并验证自然界从未进化出的分子。

AlphaFold 几乎把自然界 2 亿多种蛋白质结构预测了一遍,David Baker 选择走另一条路:不去预测自然造了什么,而是去造出自然从没造过的东西。

AI BioDesign获9460万美元投入,押注蛋白设计实验闭环 2

今年 8 月的一个早上,研究助理 Jack Boylan 调出了前一晚的实验结果。实验室的 DNA 测序仪旁,试管里放着一大批人工设计的 DNA 序列,都是自然界从未进化出来的。哪些能用、哪些是废品,要靠测序仪一次读完后给出结果。

不久前的一次实验中,他们把 600 万条这样的设计序列一起放进同一支试管,同时进行测量。按传统做法,仅这一批实验就要花上好几年。

Boylan 所在机构名为 AI BioDesign,9 月 3 日刚在西雅图对外亮相,地点距离艾伦研究所总部只有几分钟路程。该机构背后获得保罗·艾伦遗产体系 9460 万美元投入,领头人是 2024 年诺贝尔化学奖得主 Baker 和基因组学家 Jay Shendure。

在这个算力成为核心资源的阶段,他们没有打算把这笔接近 1 亿美元的资金用于训练一个更大的模型,而是把重点放在那支试管上。

把并行能力搬进试管

AI BioDesign 的思路,是搭建一个高速闭环:AI 提出设计,实验室完成构建并测量,结果回流给模型,再由模型决定下一轮要造什么。

这套流程看上去仍是「设计—构建—测量—学习」,区别在于它的规模化方式。这里没有铺满机械臂的自动化车间。执行总监 Jesse Gray 说:「规模不来自机器人,来自在试管内部做并行。」

Shendure 对此的解释是,利用进化留给人类的细胞流水线,在一支试管里同时制造并测量几百万个分子。具体做法是把几百万条设计序列一起放进同一支试管,让细胞分别把它们造出来,再在同样条件下跑一遍,最后交给测序仪,一次读出哪些有效、哪些无效。

AI BioDesign获9460万美元投入,押注蛋白设计实验闭环 3

这样一来,模型学习「设计规则」时面对的是海量样本,而不再只是自然界留下来的有限数据。

这类设计出来的分子并非抽象概念。Baker 实验室此前曾设计过一个结合蛋白,其中紫色与粉色部分由 AI 设计,白色部分是被其包裹的胰淀素。

实验的目标转向喂给模型更多信息

这条产线的考核标准也与传统实验室不同。实验室按五六人一组组成小队,各自处理一个具体的生物设计难题,旁边配有机器学习团队随时协作。

每一轮实验的成绩,不只看做出了多少个能用的分子,更看模型从这一轮里学到了多少。

传统实验室通常先提出假设,再设计实验去验证。AI BioDesign 则把顺序倒了过来:实验首先是模型的「练习题」,围绕「设计—构建—测量—学习」持续循环。

每轮结束后,机器学习团队会依据结果挑出模型最没有把握、也最可能带来新信息的那批序列,决定下一轮要测什么。数据回流后,模型更新,再给出下一批设计。

他们追求的是每次实验带回尽可能多的信息,而不是尽快拼出一个成品。过去是人指挥实验台,现在实验台开始按 AI 的安排运行。

这不是 Baker 第一次设计自然界没有的蛋白

这并不是一个「AI 第一次造出自然界没有的蛋白质」的故事。Baker 早在 2003 年就做到过。

AI BioDesign获9460万美元投入,押注蛋白设计实验闭环 4

当年,他的团队利用 Rosetta 软件设计出名为 Top7 的蛋白。这个蛋白由 93 个氨基酸组成,其折叠方式在当时所有已知蛋白中都找不到先例。

2024 年诺贝尔化学奖中,一半授予从事计算蛋白质设计的 Baker,另一半授予 AlphaFold 团队的 Demis Hassabis 和 John Jumper,表彰蛋白质结构预测方面的工作。2024 年 10 月 9 日,David Baker 接到了诺贝尔奖委员会的电话。

如果说 AlphaFold 解决的是「读」——预测一串氨基酸会折叠成什么形状,那么 Baker 解决的是「写」——为了实现某种功能,应该设计出什么形状。

过去几年,「读」这一路被推向中心位置。AlphaFold2 以及同期那批大模型,依赖的都是人类已经积累好的数据。可在「写」这一侧,数据库里没有自然界不存在的东西,只能自己设计、自己制造、自己测量。

这也是该领域长期受限的原因之一:AI 一晚上可以给出几十万个候选设计,而传统实验室一年做出几百个就已算高产。设计与验证之间的巨大落差,构成了长期存在的瓶颈。

Baker 说,这个项目真正的突破,是 AI 的速度第一次开始匹配合成生物学的实验能力。一边是一天生成几百万个候选设计,另一边是一支试管测掉几百万个样本,这两部分终于开始咬合。

不追通用大模型,优先建设实验基础设施

在很多团队追求一个能回答所有问题、甚至模拟整个虚拟细胞的通用大模型时,Baker 和 AI BioDesign 选择了另一条路线:围绕具体难题训练一批小模型,并为每个问题专门制造海量新数据。

AI BioDesign获9460万美元投入,押注蛋白设计实验闭环 5

按照他们的判断,自然进化留下来的样本,只是几十亿年试出来的一小部分解。仅用这些样本去学习普适的设计规则,中间存在明显空白。要补这部分空白,就要缺什么数据,自己造什么数据。

而「造数据」这件事,靠的不是单纯堆显卡,而是试管、测序仪和实验台。前一阶段竞争的是算力基础设施,下一阶段争夺的则可能是实验基础设施。

更特别的一点是,即便这条路线成功,相关成果也将开放。模型、数据集、实验方法、试剂和基准,都会公开。

对于「如果别人用这些数据做出了赚钱的药怎么办」这个问题,总裁 Rui Costa 的回答是:「如果有很多公司拿这些数据去把世界变好,那是我们的运气。」

设计能力提升,也带来生物安全问题

大规模制造自然界不存在的分子,也伴随风险,包括意料之外的生态影响和恶意滥用。

这条链条中,一个绕不过去的环节是合成 DNA。设计图再多,最后总要有人把它们做成实物。当前守在这个环节的是行业筛查系统:当用户下单合成一段 DNA,系统会把序列与已知毒素和病原体基因比对,命中后就会拦截。

2025 年 10 月发表在《Science》上的研究显示,微软团队使用公开的蛋白设计工具,把 72 种受关注蛋白改写成约 7.2 万条合成同源序列。这些序列在结构和功能上大体保留,但序列本身已经面目全非,结果导致四款筛查软件出现大量漏检。

随后,该团队联合四家合成公司修补了这一问题,检出率大幅回升。

AI BioDesign获9460万美元投入,押注蛋白设计实验闭环 6

但问题在于,补丁只能修补已经发现的漏洞。设计能力在加速前进,守门机制始终处在追赶状态。

Baker 提出的主张是,所有人工合成的 DNA 都应登记留档,既记录序列,也记录下单者身份。他认为这是一个切实可行的防滥用门槛。

18 到 24 个月拿出进展,5 年内向全球研究者开放

这场押注已经开始。Costa 给出的时间表是 18 到 24 个月拿出真正进展,5 年内向全球研究者开放。

Baker 列出的愿景包括:一种新疾病的疗法可以在几周内而不是几十年后做出来,海洋中的塑料可以被酶分解,生物计算机的能耗远低于硅芯片。

这些还只是方向。Baker 也承认,在这条路上,先出现的可能是一批能用、却还讲不清楚为什么能用的分子。

达尔文曾用「无尽之形最美」形容自然的多样性。Baker 的判断是,那些最美的形式只是几十亿年试出来的一小部分,绝大多数抽屉还没有被打开。现在,他借助 AI 把抽屉拉开,一次翻 600 万格。

AlphaFold 已经把 2 亿多种蛋白质的结构预测了一遍,「读懂自然」这条路已经走到尽头。Baker 押注的下一道关口不在模型本身,而在数据,在于能不能建立一条持续产出新数据的实验产线。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。