微软、上海交通大学等机构开源了 Argus,这是一套面向长周期研究任务的通用 Agent 推理运行时,并同步发布技术报告。项目试图解决的,不是模型会不会执行,而是在任务持续数天、又缺少密集反馈时,谁来决定系统下一步往哪里走。

原文将这一问题概括为,当前不少 Agent 已经通过 Harness 接入真实世界,能够调用工具、修改代码并运行实验,但一旦任务从几十分钟拉长到数天,系统仍需要人长期盯着屏幕,判断下一步方向。文章认为,瓶颈不只在模型能力,更在于现有 Agent 更多自动化了「执行」,却没有自动化执行之上的「驾驶」。Harness 负责让模型行动,人类仍在提供决策;人离开后,项目也会停下。
Argus 对应的目标,是让 Agent 在没有密集标准反馈的情况下,仍能在多个领域持续开展数天研究。其设计包含证据驱动、自进化、多 Agent 协作,以及核心能力与垂直领域解耦等机制。

论文标题为《Argus: Who Drives the Harness for Days?》。项目同时公开了论文、代码、项目主页、成果开源库和数学解题直播页面。
- 论文:https://arxiv.org/abs/2608.05144
- 代码:https://github.com/lbx154/Argus
- 项目主页:https://argusbot.cn/
- 项目成果开源库:https://github.com/Argus-AiTeam
- 项目数学解题直播:https://open.argusbot.cn/#counterexample-live
从 Goal-Driven 转向 Evidence-Driven
Argus 的核心变化,是把长期研究任务的控制逻辑从 Goal-Driven 转向 Evidence-Driven。原文用自动驾驶作比:模型像发动机,Harness 像传动系统,但真正决定车辆驶向哪里的,过去往往还是坐在屏幕前的人。短任务还能依赖较明确的反馈;到了持续数天的研究任务,问题本身往往既没有稳定奖励,也很难在一开始就定义清楚目标。
在这一背景下,Argus 把 Harness 之上此前没有被自动化的位置称为 Driver。它需要在计划与现实发生冲突时,仍然依据证据继续掌舵。文中指出,研究一开始写下的目标,只是信息最少阶段的初始假设;如果 Agent 只能围绕预设终点推进,甚至会在不可能完成的目标上反复消耗 Token,形成目标僵化。Evidence-Driven 的做法则相反:下一步行动由已经获得的证据决定,而不是由最初假设决定。
按照报告描述,Driver 需要持续回答四个问题:
- 工作是否已经完成,而且质量是否足够高;
- 结合当前证据,下一步最值得做什么;
- 这一轮得到的经验,应怎样改变后续系统行为;
- 剩余问题里,是否存在只能由人类作出的决定。
把长期项目组织成可持续运行的 Campaign
在运行时结构上,Argus 将长期项目组织成持久化的 Campaign,再拆成一系列边界明确的 Mission。它的基本闭环是 Manager → Planner → Engineer ⇄ Reviewer → Manager。
原文还将 Argus 与 OpenAI Codex 的 /goal 模式进行对照。/goal 是把单个 agent 的单轮循环拉长为带有 goal state 的持久循环;Argus 则把研究项目组织成多角色、多 harness、可沉淀知识的长程运行时。前者回答的是「怎么让 agent 不停下来」,后者回答的是「不停下来之后,怎样有效工作」。

四类角色分工如下:
- Manager 负责阶段转换、流程审批和全局策略;
- Planner 根据当前证据规划具体任务;
- Engineer 进入真实代码库、实验和执行环境;
- Reviewer 独立审查工件,检验创新性与有效性,再汇报给 Manager 或打回 Engineer。
报告强调,重点不在多角色本身,而在于把上下文拆开。不同角色共享工作区,但拥有各自独有的上下文,避免把规划、执行和验证全部交给单一 Agent 处理,从而提升 token 效率。基于这一结构,Argus 的单个任务中可以同时启用 Pi、Codex、Claude Code、DeepSeek Harness 等不同 harness,以实现高度客制化。
系统会保存一套完整工件。只有通过证据门槛的经验,才会进入 Wiki 和 Skill,并按照 Project、Vertical 或 Global 作用域供后续任务复用。

同时,Argus 将 Core 与 Vertical 解耦。Core 负责角色权限、证据提交和人类边界;Vertical 则由领域专家定义,在数学、GPU、材料等任务里什么才算有效证据,以及需要配套哪些人类技能和知识。原文称,这种设计既能提升研究任务交付质量,也为人类专家与 Agent 协同演进、定制工作流提供接口。
报告披露 27 个 Campaign 与 1548 小时墙钟时间
Argus 团队在技术报告中披露,整套报告覆盖 27 个 Campaign、1548 小时墙钟时间。系统平均每 40.7 小时才会主动请求一次人类干预,报告给出的工作占空比为 95.1% 至 98.7%。
文章称,这次 Argus 交付的不只是 benchmark 分数,而是一套完整的生产级成果册。团队列出的任务方向包括 AI4AI、GPU Kernel、模型训练、AI4Science、芯片设计、AI4math 和 AI4System,借此展示系统的通用性与研究级能力。

开源后一个月内披露多项研究成果
原文称,Argus 开源后不到一个月,已在基础设施、材料、芯片、数学和 AI 系统研究中做出贡献,且团队表示自己是首个公布完整端到端数学猜想解决筛选日志的团队,并开放了全部运行轨迹 session。
文章将这些成果按路径概括为三层推进。首先,Argus 在 AI4System 与基础设施方向,把持续运行转化为可验收的真实交付,完成从自动执行到自主研究的第一步;随后,任务从 AI 基础设施扩展到 AI4Science、AI4Hardware 和 AI4Math,评价标准也从「是否完成既定任务」转向「能否探索悬而未决的现实研究问题」;在此基础上,系统又在 AI4AI 方向从单点成果扩展到完整研究流程,在无需人类始终守屏的情况下,以证据持续驱动任务推进。
文中将这一过程概括为一条递进路径:从真实交付,到跨领域探索,再到全流程自主研究。

按照原文说法,上述结果均在 1 个月内取得。团队认为,把这些成果串联起来看,Argus 对自动化对象的扩展,不再只是一次执行,而是证据驱动的研究推进,由此加快研究进展,也构成了对「人离开屏幕后,谁来驾驶 Agent」这一问题的直接回答。
项目参与方与来源
作者介绍部分显示,Argus 由微软与上海交通大学研究者牵头,并由多所高校研究者共同推进。本文来自微信公众号「机器之心」,MarsBit 进行了转载发布。

