腾讯将 Qwen3.5-122B-A10B 专门用于终端 Agent 训练,推出了 T1。该模型主要处理 Linux 终端中的复杂任务,单个任务最多可连续调用工具 300 多轮。
在 Terminal-Bench 2.1 测试中,T1 的得分从底模的 43.8% 提升至 64.0%,增加了 20.2 分。按披露数据,SFT 将分数拉升至 49.4%,随后强化学习又带来 14.6 分提升,这也是总增幅的主要来源。
团队准备了约 1.5 万个终端任务,并为每个任务配备自动测试。训练中,Agent 不必完成整个任务,只要完成部分要求,也可以获得相应奖励。
针对长任务训练中的训推偏差问题,腾讯称,Agent 在实际执行任务和后续基于这段经历训练时,同一句内容可能被重新切分成不同 token,MoE 也可能切换到另一批专家处理。T1 会记录生成时的 token 和被选中的专家,训练时按原过程重放,将这类训推偏差压低了约三分之一。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

