北京大学与元空AI Agent联合实验室已将科研智能体项目 OpenAI4S(Open AI for Scientist)开源。该项目于 2026 年 7 月 6 日在 GitHub 发布,采用 MIT 许可证,定位并不是做一个“像 Claude Science 的产品”,而是沿着 Code-as-Action 的思路,用开源方式独立复现科研智能体所需的引擎、持久内核、host-RPC 协议和安全层。
据项目介绍,OpenAI4S 当前已提供完整的科研 Web 应用、数十个内置 Skills、自有算力接入能力,以及版本化科研产物管理。联合实验室给出的目标很直接:不只让模型输出一段看起来正确的回答,而是让 AI 真正进入科研工作流,把一个问题从提出推进到完成。相关页面显示为“元空AI Science”,链接为 https://www.chatexcel.com/homesite/openAI4S 。
从“调用工具”转向“代码即行动”
项目方认为,现有不少 AI Agent 的基本模式相近:模型面对一份预设好的工具菜单,判断该调用哪个工具,再逐步执行。对简单任务,这套方式可以工作;但科研任务往往不止三五步。
在实际科研中,一个流程可能涉及检索多个数据库、下载数据、清洗数据、反复改代码、调用专业算法、申请 GPU 算力、生成图表并整理报告。任一步骤出错,后续流程都可能需要回退重做。
OpenAI4S 的处理方式是 Code-as-Action,也就是“代码即行动”。它允许智能体直接生成 Python 或 R 代码,并在持续运行的内核环境里执行。循环、条件判断、批量数据处理和绘图可以在一次执行中组合完成,数据和中间结果也不需要在每一步重新交回模型,而是保留在工作环境中。

项目把这一点概括为:“代码即行动,内核即环境。”落到用户体验上,变化并不只是多了一个技术名词,而是 AI 可以把更长、更复杂的任务串起来:前一步下载的数据可以直接交给后一步分析,生成的图片、表格和报告会自动保存,研究人员也可以随时打开 Notebook,检查代码、接手分析或修改结果。
一个界面里完成从数据到结论的流程
按照项目描述,OpenAI4S 更像一张由人和 AI 共用的科研工作台。用户给出任务后,系统可以自行检索公开科研数据源、编写并运行分析代码、调用专业计算能力,再将结果整理为图片、表格、三维结构或 Markdown 报告。
整个过程不会在任务结束后散失。每一份科研产物都会被记录、保存并版本化,便于后续检查、修改和复用。
以蛋白质分析为例,OpenAI4S 可以先检索真实的蛋白质序列和结构数据,再完成特征计算与可视化,最后把分析过程、数据来源和结果一起写进论文。项目方特别强调两点:数据是真的,计算也是真的。如果外部服务无法连接,或者计算条件不满足,系统会明确提示哪里无法执行,而不会补入模拟数据,也不会凭空生成一个结果把论文补齐。

科研任务往往需要反复修改。传统流程下,研究人员可能要重新找到绘图脚本、调整参数、再次运行并导出文件;在 OpenAI4S 中,用户可以直接用自然语言提出调整要求,智能体会基于已有数据和代码重新生成产物,同时保留版本记录。
首批内置 30 多个科研 Skills
项目团队认为,通用模型要成为科研助手,仅靠“聪明”不够,还必须知道专业数据去哪里找、专业工具怎么用、复杂算法如何运行。OpenAI4S 首批内置了 30 多个科研 Skills,覆盖蛋白质结构、序列分析、蛋白设计、分子对接、单细胞分析、文献检索、开放数据检索等一批常见的计算科研场景。
其中,14 个 Skills 封装了需要 GPU 或专业模型才能完成的科学计算能力。项目将这些 Skills 描述为一组可以被智能体阅读、理解和执行的“代码配方”,而不是一张写死参数的工具表。所需数据、调用服务、代码写法以及结果检查方式,都可以沉淀在 Skill 里。后续如果出现新的数据库、算法或实验流程,开发者可以继续接入,随着科研需求变化扩展能力边界。
支持把任务派发到自有 GPU 环境
科研计算面对的另一个现实问题是算力。蛋白质折叠、突变评分、分子模拟等任务,通常不适合在普通笔记本上直接完成,很多专业计算还依赖特定模型、复杂软件环境和 GPU 资源。

OpenAI4S 支持接入自有计算环境。本地系统负责交互和任务组织,需要 GPU 的专业计算则可以派发到用户自己的服务器执行,结果完成后再回到同一套科研工作流。
项目举例称,在蛋白质结构预测和突变效应评分场景里,真正困难的部分往往不是生成调用代码,而是把输入送入正确的计算环境,并把结果完整带回工作流。按照这一设计,用户不必把所有组件都塞进一台电脑,也不必为了接入一台算力服务器重写整套流程。项目方认为,这一点对实验室和科研团队尤其重要,因为数据、模型和算力都可以保留在自己的环境中,由智能体负责把它们串联起来。
“不伪造策略”:算不了就报错
OpenAI4S 在科研结果真实性上设定了一条 no-fabrication policy,即“不伪造策略”。项目列出的禁止行为包括:使用 np.random 假装实验结果、硬编造“保守性”、拿 BLOSUM 冒充 ESM、用模拟数据集充当真实数据。
按照这条规则,系统要么调用真实服务,要么明确报错。项目给出的 INS 案例中,序列从 UniProt 获取,结构从 RCSB 下载;如果无法联网,系统会如实跳过,而不会补一份假的结果。

在需要蛋白质结构计算时,项目称其会真实调用 GPU:host.fold 会通过 ssh 连接到一台 8×A100 机器,运行单序列 Protenix 推理,项目将其描述为“AlphaFold3 级别”,并回传带 pLDDT 的结构;host.score_mutations 则运行真实的 ESM 打分来筛选突变。如果没有配置 GPU,系统会直接报错,而不是生成一个看似合理的假结构。项目方给出的态度是:宁可明确告诉用户“算不了”,也不提供伪造结果。对科研 Agent 来说,这一点可能比“什么都会”更重要。
联合实验室推动产学研协同
项目方表示,OpenAI4S 的发布不仅增加了一个开源项目,也是北京大学与元空AI推进产学研协同的一次实践。作为双方联合实验室的阶段性成果,OpenAI4S 从研发到开源,离不开张恭博的持续投入与推动。
公开介绍显示,张恭博的研究方向聚焦 AI for Science。由他担任共同第一作者的 UniGenX,探索了面向分子、材料与蛋白质的通用科学基础模型,相关研究积累也延伸到了 OpenAI4S 的研发与落地。
团队还提到,OpenAI4S 凝聚了李昊、王豫、刘宇阳、吕刘正浩、毛奕澄、林慕捷、彭莘尧、姜政祥、王一米等成员的共同努力,涉及框架设计、功能研发和开源发布等多个环节。

元空AI被介绍为一家端侧 AI 公司,专注于通过模型后训练、Agent Runtime、长期记忆与端侧推理技术,让 AI 在本地及离线环境中完成复杂任务。目前,公司已形成元空AI Work 与元空AI Science 两条产品线,分别面向智能办公与科学发现领域。
在联合实验室与元空AI看来,科研智能体不应停留在 Demo,而应成为真正可执行、可检查、可扩展的科研基础设施。因此,这次开放的不只是示例,还包括核心架构、科研 Skills 与完整应用。项目希望高校、科研机构、开发者和产业伙伴能在此基础上接入数据源、算法、工具与科研流程,推动科研 Agent 进入更多真实任务。
向社区发出贡献邀请
项目介绍称,运行 OpenAI4S 的安装流程不复杂,“三行就能启动”,而且启动项目本身不需要先配置模型 Key,进入界面后可在 Customize → Models 中填写。
项目还附带了一整套真实案例,可直接运行,包括 Live API 工作流、人胰岛素 INS 真实数据分析、一句话改图,以及计划模式下的青蒿素和紫杉醇溶解度预测、蛋白质工程等任务。

不过,项目方也表示,把项目跑起来只是第一步。真实科研横跨生命科学、化学、材料、医学、地球科学等多个领域,每个方向都有各自的数据库、专业模型和计算流程,不可能只靠一个团队一次性补齐全部能力。
基于这一判断,OpenAI4S 正式向高校、科研机构、开发者和产业团队发出 Call for Contributors。项目称,兔展智能的 Skills UI 已对该开源项目给予部分支持。
对于熟悉特定科研方向的参与者,可以围绕新科研 Skills、专业数据库、算法模型和计算平台进行接入;擅长 Agent 或软件工程的开发者,也可以参与完善核心架构、远程计算、安全机制、测试和文档。即使不写代码,提交 Issue、补充可复现案例、反馈失败任务,或向社区说明某个学科的真实需求,也被项目视为有价值的贡献。
项目仓库地址为:https://github.com/PKU-YuanGroup/OpenAI4S 。本文原文来自微信公众号“量子位”,作者署名为“关注前沿科技”。

