GPT-6 Astra在抗体可开发性测试中登顶 DDD 基准

GPT-6 Astra在抗体可开发性测试中登顶 DDD 基准

N
News Editor
2026-09-11 04:23:10
OpenAI 总裁 Greg Brockman 转发的一则消息引发科技与医药圈关注。Andrew Aiginin 在 X 上称,GPT-6 Astra 在独立基准测试中击败所有前沿模型,成为抗体可开发性预测最强 AI,并在 DDD Benchmark 抗体测试模块拿下 37.98 分。相关讨论还指向 Insilico Medicine 在 arXiv 发布的 21 页论文,该论文披露了 DDD Benchmark 的严苛评测思路,以及其在单步逆合成方向构建 URSA-expert-2026、ChemCensor 和 4560 万规模数据集等方法。

OpenAI 总裁 Greg Brockman 转发的一则消息,把 GPT-6 Astra 推上了科技与医药圈的讨论中心。科学家 Andrew Aiginin 在 X 上表示,在独立基准测试中,GPT-6 Astra 击败所有前沿模型,成为抗体可开发性预测最强 AI。

GPT-6 Astra在抗体可开发性测试中登顶 DDD 基准 2

按照 Andrew Aiginin 的说法,GPT-6 Astra 不只是拿到第一名,还在大约 1 小时内完成了一个用于展示复杂抗体机理的交互式可视化页面。

DDD Benchmark 抗体模块中拿下 37.98 分

公开信息显示,GPT-6 Astra 接入 DDD Benchmark 的抗体可开发性测试模块后,拿下 37.98 分。文中称,该模块综合了 6 种不同的抗体实验数据,Astra 由此超过全部受测模型。

AI 学者 Rim Shayakhmetov 在相关讨论中写道:『专用模型在这个任务上的常规分数是多少?这结果太有趣了,你很难在药物发现的基准测试中,看到前沿的大语言模型在「不依赖外部专用工具」的情况下如此闪耀!』

围绕这一结果,原文给出的核心判断是,通用大模型不再只是写代码、读文献的辅助工具,而是已经切入了生物医药研发里更难量化的临床前环节。

GPT-6 Astra在抗体可开发性测试中登顶 DDD 基准 3

抗体发现之外,更难的是可开发性

Andrew Aiginin 在 X 上写道:『找到一个能结合的抗体仅仅只是开始。它会聚集吗?它能保持稳定吗?它真的能像一个药物那样发挥作用吗?』

这段表述对应的是抗体研发中的可开发性问题。原文提到,过去讨论抗体药物研发时,关注点往往放在结合力,也就是抗体能否识别并结合到目标靶点。早期 AI 模型在这类预测上已经取得了较强表现,但能结合并不等于能成为药物。

文中列出的关键问题包括:

  • 抗体会不会聚集成团;
  • 结构是否稳定;
  • 能否表现得像真正的药物。

这些属性被统称为抗体可开发性。原文称,这一环节使大量在实验室中表现优异的抗体分子,最终倒在成药性评估阶段,也消耗了药企大量资金与时间。

GPT-6 Astra在抗体可开发性测试中登顶 DDD 基准 4

Insilico Medicine 论文披露 DDD Benchmark 的评测思路

这次测试结果并不是孤立出现。文中提到,构建该测试基准的 AI 制药团队 Insilico Medicine 已在 arXiv 发布一篇 21 页论文,标题为《Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis》。

原文给出的链接为:https://arxiv.org/pdf/2608.18940,参考资料中还列出了 https://arxiv.org/html/2608.18940。

报道指出,这篇论文首次揭示了测试 GPT-6 Astra 的 DDD Benchmark 的严苛性,也展示了该团队在小分子化学合成方向建立评测标准的方法。

Bogdan A. Zagribelnyy 博士指出,Astra 登顶的平台正是他们构建的 DDD Benchmark。虽然社交平台上的讨论集中在大分子抗体,但论文主要展示的是团队在小分子化学领域搭建评测体系的深度。

GPT-6 Astra在抗体可开发性测试中登顶 DDD 基准 5

论文聚焦单步逆合成,重做评测标准

在论文中,研究团队聚焦单步逆合成。按照原文解释,这是一种从目标药物分子反推化学原料的过程。

过去的 AI 评测方法通常是:给模型一个目标分子,再把模型生成的合成路径与专利数据库中的答案比对,如果完全一致,就给出高分。原文提到,这种方法依赖单一标准答案,但真实世界里的合成路径本来就是一对多,单一答案式评估会限制模型探索未知路径的能力。

为改变这一点,Insilico 团队在论文中构建了多层评测框架。

URSA-expert-2026 基准

论文提出的 URSA-expert-2026 基准包含 100 个由机器生成、再由人类化学专家手动确认合成可及性的全新分子数据集。原文称,这一数据集与任何公开训练数据完全隔离,用来避免模型通过记忆训练语料完成作答。

ChemCensor 打分系统

团队没有继续采用是否复刻已有专利路径的评估方式,而是开发了 ChemCensor 框架,从反应中心映射、官能团兼容性等底层化学规则出发,判断模型生成的反应是否具有真正的化学合理性。

GPT-6 Astra在抗体可开发性测试中登顶 DDD 基准 6

原文称,在这种更贴近物理和化学规律的考核下,传统大语言模型在早期 Top-1 测试中普遍表现不佳,即便是 GPT-5.5、Gemini 3.1 Pro,也没有超过 MHNreact、LocalRetro 等专用传统化学模型。

论文提出三项方法以释放大模型在化学中的能力

面对通用大模型在专用化学任务上的短板,论文给出的答案不是更换模型,而是更换训练与提示方式。原文总结了三项关键方法。

Top-K 提示词范式

研究团队在提示词中直接要求模型给出 15 种不同答案,而不是只生成一次结果。原文称,仅切换到 Top-K 模式后,GPT-5.5、Claude Opus 系列等多个大模型在化学合理性和多样性上都有明显提升。

其中,Gemini 3.1 Pro 在 Top-15 模式下性能显著上升,成为最强 LLM 基线。原文据此认为,大模型并非没有相关知识,而是过去的提问方式限制了表现。

GPT-6 Astra在抗体可开发性测试中登顶 DDD 基准 7

构建 4560 万规模数据集

为训练面向化学约束对齐的语言模型 C3LM,团队利用虚拟合成引擎和 ChemCensor 框架,构建了一个约含 4560 万个经过验证的真实化学反应数据集。原文将其表述为 CREED-CCV-2+USPTO-XL。

在强化学习中加入新颖性奖励

在微调 C3LM 时,研究团队引入了 GRPO 强化学习算法。按原文描述,奖励函数不仅要求模型生成的合成路径符合 ChemCensor 对化学合理性的要求,还会对那些不在 4500 万训练集里、但依然合理的新反应给予额外奖励。

最终,经过这套训练后的 C3LM 在 URSA-expert-2026 盲测中击败了 MHNreact 等传统专用 SSRS 模型。原文还提到,数据分析显示,C3LM 与其他基础大模型探索出的反应空间,与传统模型形成互补,能生成大量传统模型没有覆盖的路径。

从 C3LM 到 GPT-6 Astra,讨论延伸到大分子预测

原文将这篇论文与 GPT-6 Astra 在抗体可开发性测试中的成绩并列讨论。其逻辑是,在小分子化学合成方向,Insilico 团队需要借助 4500 万条数据、强化学习对齐以及 Top-K 提示词等方法,才让大模型超过专用模型;而当测试切换到更复杂的大分子可开发性预测时,GPT-6 Astra 在没有使用外部工具的情况下,已经能在同一 DDD Benchmark 体系下拿到 37.98 分并登顶。

GPT-6 Astra在抗体可开发性测试中登顶 DDD 基准 8

文中还提到,过去处理抗体稳定性问题,常常需要由专业团队设计专门的三维图神经网络;而现在,GPT-6 Astra 展现出跨物理、化学、生物任务的通用能力。该文据此把这次成绩视为 AlphaFold 之后又一次重要变化。

Andrew Aiginin 还补充说:『顺便提一句,这个展示抗体实际工作原理的交互式可视化页面,也是用 Astra 在大约 1 小时内建好的。』原文将这部分能力与传统药企通常需要两三周完成类似系统的流程作了对比。

参考资料与出处

原文列出的参考资料包括:

  • https://arxiv.org/html/2608.18940
  • https://x.com/gdb/status/2098167375342239957
  • https://x.com/andrewaiginin/status/2098078245350518884

本文来自微信公众号「新智元」,作者为 ASI 启示录,编辑为 Aeneas 大卫。MarsBit 页面显示发布时间为 2026-09-11T04:23:10.000Z。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。