清华团队论文登上《Science Robotics》,人形机器人学会踢足球

清华团队论文登上《Science Robotics》,人形机器人学会踢足球

N
News Editor
2026-08-24 07:44:11
清华大学自动化系赵明国教授团队联合字节跳动 Seed、中国农业大学,在《Science Robotics》发表论文《Learning Vision-Driven Reactive Soccer Skills for Humanoid Robots》。论文提出视觉驱动的反应式足球技能学习框架,并在加速进化的人形机器人平台上完成真机验证,覆盖找球、追球、调整步态和多方向射门。

登上《Science Robotics》的人形机器人足球论文

清华大学自动化系赵明国教授团队联合字节跳动 Seed、中国农业大学,在《Science Robotics》发表论文《Learning Vision-Driven Reactive Soccer Skills for Humanoid Robots》。

这篇论文提出一套视觉驱动的反应式足球技能学习框架,让人形机器人仅依靠机载视觉,在动态环境中连续完成找球、追球、调整步态和多方向射门。真机验证平台是加速进化的人形机器人。

论文链接:https://www.science.org/doi/10.1126/scirobotics.aed1152

项目主页:https://humanoid-kick.github.io/

二十二年的机器人足球接力

2004 年,赵明国带领学生成立清华火神机器人足球队。次年,团队带着自研机器人参加 RoboCup。早期机器人只有约 50 厘米高,行走缓慢,比赛时还需要保护人员防止摔倒。此后 20 多年里,火神队几乎每年参赛,机器人逐渐长到一米以上,学会自主起身、快速奔跑和大力射门。

足球场也成了团队长期检验视觉、决策、运动控制和整机可靠性的试验场。视觉识别慢了多少毫秒,落脚点偏了多少厘米,机器人在哪个方向容易踢空,都会在真实对抗中直接暴露。团队再把问题带回实验室,修改算法,下一场比赛继续验证。

清华团队论文登上《Science Robotics》,人形机器人学会踢足球 3

赵明国长期从事类脑计算与机器人控制研究。他参与研制的“天机芯”类脑芯片及无人自行车研究曾登上《Nature》封面,并入选 2019 年度中国科学十大进展。

从火神队到加速进化

随着成员一届届更替,火神队的故事也延续到产业端。加速进化创始人程昊曾是火神队第三任队长,清华毕业后经历互联网创业,并在字节跳动担任飞书产品副总裁。2023 年,他重新出发,创办加速进化。多名曾与他在火神队并肩作战的成员也加入这家初创公司。论文第一作者王与时,则来自火神队的新一代。

从 2004 年火神队创立,到 2026 年论文登上国际顶刊,这是一场跨越二十二年的技术接力。

让机器人在噪声里看见并反应

这篇论文试图解决一个长期存在的问题:在充满噪声、延迟和遮挡的真实环境里,人形机器人如何做到看见即反应。

机器人踢球时,视觉和动作要几乎同步完成。眼睛追踪足球,大脑判断距离与方向,身体持续调整重心和落脚点。足球短暂被挡住时,人还能根据此前轨迹预判下一次出现的位置。机器人则要靠摄像头、算法和关节控制完成同样的过程,难度要高得多。

清华团队论文登上《Science Robotics》,人形机器人学会踢足球 4

传统方案通常把流程拆成多个模块:视觉系统识别足球并估计位置,决策模块选择动作,运动控制器再驱动机器人执行。这样便于调试,但误差和延迟也会逐级传递,而且在仿真中训练出的策略,到了真实世界可能因光照、噪声和遮挡而性能下降。

赵明国团队提出统一的感知-运动强化学习框架,把视觉感知和运动控制放到同一个优化目标下端到端训练。

视觉噪声、历史状态与动作输出

研究团队先建立了一套虚拟感知系统。真实机器人在不同距离和视角下观察足球,累计采集约 1 小时数据,再与动捕系统记录的真实位置对照,得到位置噪声、检测成功率、更新频率和延迟等感知特征。

这些特征随后被带入仿真。足球距离越远,位置噪声越大;相机视野会随机器人头部姿态变化。即使足球出现在视野中,也可能因为运动模糊而检测失败。视觉系统以约 25Hz 更新,平均延迟约 116 毫秒。

为应对视觉短暂中断,论文设计了编码器-解码器架构。策略读取过去 50 帧、约 1 秒的历史观测,再压缩为 64 维隐藏状态。训练阶段,解码器会尝试从隐藏状态还原足球真实位置和机器人动力学参数,用来帮助去噪,并在足球短暂消失后继续估计目标位置。

负责输出动作的 Actor 只能使用真实机器人能够获得的部分观测;训练阶段的 Critic 则可以访问仿真环境中的完整状态,为策略优化提供额外信息。解码器和 Critic 在部署到真机后都会移除。

清华团队论文登上《Science Robotics》,人形机器人学会踢足球 5

从行走到射门,动作被放进同一策略

为了让动作更自然,团队还引入了对抗运动先验 AMP。训练数据包括约 76 秒的人类全向行走动作和 30 秒脚弓射门动作数据。判别器负责判断机器人动作与人类示范的接近程度,强化学习策略继续围绕追球和进球优化。

镜像对称约束进一步帮助机器人掌握左右脚射门,避免收敛到单侧踢球。最终,找球、追球、调整落脚点和射门被放进同一个策略,控制器以 50Hz 输出关节位置指令。

训练过程中还出现了不少自主行为。足球接近视野边缘时,机器人会主动转头和转身,把球重新移回视野;在球场边缘找不到足球时,它通常先朝向场地中心,再扩大搜索范围。

步态也会随足球距离变化。距离较远时,机器人采用较慢步频,每个步态周期约 0.7 至 0.8 秒,以维持稳定观察;接近足球后,周期缩短到 0.3 至 0.4 秒,通过更短、更快的步伐微调落脚点。

当球门位于身后时,策略甚至会生成一种旋转钩射动作,机器人以支撑脚为轴转身,另一条腿从侧面将球勾向球门,省去重新站位的时间。

清华团队论文登上《Science Robotics》,人形机器人学会踢足球 6

实验数据:更快、更稳,也能应对滚动足球

这些变化也体现在实验结果里。射门前 1 秒内,原始视觉观测中的足球位置误差为 0.344 米,经过策略内部状态估计后,误差降至 0.186 米,降幅约 46%。在仿真中,当视觉检测被短暂中断 0.3 秒时,机器人的触球成功率仍超过 90%,进球率超过 50%。面对静止足球,学习策略从启动到触球通常只需约 1.5 秒,传统规则系统需要约 2 至 5 秒,最高耗时降幅达到 64%。

真机测试中,机器人在前场位置的成功率达到 80% 至 90%,后场达到 60% 至 70%,测试过程中没有摔倒。面对滚动足球,当球速低于每秒 0.5 米时,策略仍能保持超过 50% 的成功率,真机实验也呈现出相似趋势。

这套策略还作为运动技能模块进入清华火神队的完整比赛系统。2025 年,火神队获得 RoboCup 成人组人形联赛和世界人形机器人运动会冠军,两项赛事累计打进 76 球,仅失 11 球。2026 年,团队又在 RoboCup Large Size 比赛中成功卫冕。

加速进化平台进入真机验证

学习策略能够从仿真直接部署到真机,算法只是一环。关节响应是否一致,控制周期是否稳定,传感器和计算单元能否按时输出结果,都会影响最终表现。任何底层误差,都可能在高速运动中被放大。

论文中的真机实验使用了加速进化的人形机器人平台,实验没有对本体进行专门改造,足球信息来自头部机载相机,感知与控制都在板载计算单元上运行。论文作者认为,这说明国产量产人形机器人已经可以承载前沿具身智能研究,研究者能够把主要精力放在算法上,再将训练结果部署到真实硬件。

清华团队论文登上《Science Robotics》,人形机器人学会踢足球 7

加速进化与火神队的关系,也由此从人才传承延伸到技术平台。2025 年 7 月,加速进化发布新一代旗舰平台 Booster T2,专业版搭载 NVIDIA Thor 芯片,端侧算力达到 2070 TFLOPS。配套的 Booster Studio 将仿真训练、算法开发和真机部署整合进同一个开发环境。

8 月 19 日,Booster T2 在世界机器人大会正式亮相,展示高爆发动作首秀。三天后,80 台 Booster T2 在机器人运动会开幕式上完成无中心自主协同,在大地书写 BEIJING、运动会会徽与三个赛项图标,没有遥控,没有口令,80 个独立决策的“脑”在同一时刻达成协同。80 台机器人的算力总和约达 17 万 TFLOPS,构成一个正在行走的算力集群。

单机感知闭环、多机协同变阵,背后依赖的是同一套底层能力:稳定的本体、实时的端侧计算、精准的运动控制。从 50 厘米高、需要人扶着才能站稳的早期机器人,到今天在球场上自主踢球、在开幕式上列阵书写的 Booster T2,二十二年的积累正在以更大的规模呈现。

参考链接:https://www.science.org/journal/scirobotics

本文来自微信公众号“机器之心”(ID:almosthuman2014),编辑:杨文

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
20

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。