机器人研究每周速递 | 2026.08.15 – 08.22

机器人研究每周速递 | 2026.08.15 – 08.22

本周概览: 人形机器人持续爆发——清华团队登顶 Science Robotics 封面,NVIDIA 发布通用世界模型 Hydra-0,多家机构推出 VLA 基础模型;手术机器人与自动驾驶领域也有重要进展。


1. Learning Vision-Driven Reactive Soccer Skills for Humanoid Robots

  • 机构: 清华大学自动化系 赵明国团队 × Booster Robotics(加速进化)
  • 核心贡献: 提出统一强化学习框架,将视觉感知与运动控制端到端整合,使人形机器人在运动模糊、光照变化、遮挡等真实视觉不确定性下仍能完成敏捷足球技能。在 Booster T1 人形机器人平台上验证。
  • 日期: 2026-08-20
  • 来源: Science Robotics 人形机器人特刊封面文章

2. Humanoid Robots in the Operating Room: A Framework for Staged Integration of Embodied AI in Surgery

  • 机构: Julius Kernbach, Gabriel Brat, Eric Topol, Pranav Rajpurkar(斯坦福等)
  • 核心贡献: 首次系统提出人形机器人分阶段融入手术室的框架,评估当前人形平台在手术场景中的能力边界与局限,为具身 AI 进入外科领域提供路线图。
  • 日期: 2026-08
  • 来源: npj Digital Medicine(Nature 子刊)

3. 2026 世界机器人大会(WRC 2026)在北京开幕

  • 核心动态: 8 月 19 日开幕,300 余家企业参展,首发新品 150 余件。银河通用发布双足人形机器人 Galbot ET1 及自研具身大模型"银河星脑";大会发布《2026 人形机器人产业发展报告》,显示 2026 上半年中国人形机器人出货量超 4 万台,全球占比 97%,全年整机产量有望突破 10 万台。
  • 日期: 2026-08-19
  • 来源: 新华网 / 环球网

4. Hydra-0: Action Flow for Generalist World Modeling and Control

  • 机构: NVIDIA(Hongyu Li, Bowen Wen, Yilun Du, Yunzhu Li, Stan Birchfield 等)
  • 核心贡献: 提出基于动作流(Action Flow)的通用世界模型与控制框架,面向通用机器人智能,项目页已开源。
  • 日期: 2026-08-19
  • 来源: arXiv:2608.18077

5. τ₀-VLA: A Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

  • 机构: 大团队(Xiaowei Cai 等,含 Xiangyu Yue 等)
  • 核心贡献: 面向长时序机器人操作,提出层次化 VLA 基础模型,引入世界模型引导的测试时计算机制,使模型能在困难决策点分配额外计算量,突破单次前向传播的局限。
  • 日期: 2026-08-18
  • 来源: arXiv:2608.16885

6. GigaBrain-WBC-0.5: A Behavior World Model for Robust Whole-Body Control with Environment Interaction

  • 机构: 清华大学 / 智源研究院等(Ziyang Cheng, Jiwen Lu 等 20 人团队)
  • 核心贡献: 面向人形机器人全身控制的行为世界模型,支持环境交互下的鲁棒控制,20 页技术报告,含项目页。
  • 日期: 2026-08-18
  • 来源: arXiv:2608.18234

7. Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

  • 机构: 微软研究院等(Xin Ding, Yunxin Liu, Ting Cao 等)
  • 核心贡献: 提出高效闭环具身智能框架,支持物理智能的自我进化,面向具身智能体的持续学习与进化。
  • 日期: 2026-08-18
  • 来源: arXiv:2608.16590

8. HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

  • 机构: Langzhe Gu, Shanghang Zhang 等
  • 核心贡献: 将通用 VLA 模型适配到人形机器人全身运动操作(loco-manipulation),通过层次化动作流与谱隐空间强化学习实现跨形态迁移。
  • 日期: 2026-08-18
  • 来源: arXiv:2608.16837

9. A Survey on Large Language Model-Powered Autonomous Driving

  • 机构: 清华大学等跨机构团队
  • 核心贡献: 全面综述 LLM 如何赋能自动驾驶两大范式(模块化管线 vs 端到端神经网络),系统梳理 LLM 在感知、决策、规划中的技术路径与开放挑战。
  • 日期: 2026-08-21
  • 来源: Engineering(中国工程院院刊)

10. NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation

  • 机构: Cong Zhao 等 14 人团队
  • 核心贡献: 提出双频 VLA 架构,引入引导动作(Guide Action)机制,提升机器人操作的精度与稳定性。
  • 日期: 2026-08-18
  • 来源: arXiv:2608.16503

11. FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

  • 机构: Omar Rayyan, Zhi Li, Chenfanfu Jiang, Yuchen Cui 等
  • 核心贡献: 从仿真经验中学习视觉人形机器人运动操作策略,项目页已发布。
  • 日期: 2026-08-21
  • 来源: arXiv:2608.16978

12. SurgVIL: Scaling Surgical Robot Imitation Learning with Open-source Surgical Videos

  • 机构: Xinhao Chen, Axel Krieger 等
  • 核心贡献: 提出利用开源手术视频扩展手术机器人模仿学习的框架,将带运动标签的仿真演示与无标签真实手术视频结合,以弱监督方式提升策略学习规模,在 da Vinci 机器人两项任务上验证。
  • 日期: 2026-08-17
  • 来源: arXiv:2608.16058

13. RoboStriker: Latent-Space Strategic Games for Autonomous Humanoid Boxing

  • 机构: Kangning Yin, Weinan Zhang 等(上海交通大学)
  • 核心贡献: 在隐空间中构建策略博弈,实现人形机器人自主拳击对抗,为人形机器人动态对抗技能学习提供新范式。
  • 日期: 2026-08-18
  • 来源: arXiv:2608.16195

14. SparkVLA: Stop-Aware Hierarchical VLA with Adaptive Action Chunking for Long-Horizon Manipulation

  • 机构: Xunyao Lei 等
  • 核心贡献: 面向长时序操作,提出带停止感知的层次化 VLA,自适应调整动作块长度,提升长任务完成率。
  • 日期: 2026-08-18
  • 来源: arXiv:2608.16172

15. G3VLA: Geometric Inductive Bias for Vision-Language-Action Models

  • 机构: 上海纽约大学 × 丹麦技术大学 × MBZUAI
  • 核心贡献: 为 VLA 模型引入几何归纳偏置,提升机器人在空间推理和几何相关操作任务中的表现。
  • 日期: 2026-08-20
  • 来源: arXivDaily 专题 / arXiv

16. Scalix: Uncertainty-Aware Scale-Consistent Monocular SLAM

  • 机构: Sebastian Barbas Laina, Stefan Leutenegger 等(慕尼黑工业大学等)
  • 核心贡献: 提出不确定性感知的尺度一致单目 SLAM 系统,解决单目 SLAM 长期存在的尺度漂移问题。
  • 日期: 2026-08-19
  • 来源: arXiv(cs.RO recent)

17. StableDrive: Not All History Helps — Velocity-Aware Selective Memory for Long-Horizon End-to-End Autonomous Driving

  • 核心贡献: 针对端到端自动驾驶长时序规划,提出速度感知的选择性记忆机制(Selective Momentum Memory),过滤过期或冲突的历史规划状态,提升跨周期规划的可靠性与一致性。
  • 日期: 2026-08-16
  • 来源: arXiv:2608.15573

18. Cyclops: LiDAR as a Camera That Dreams in Color

  • 机构: Wei Gao, Maani Ghaffari, Hui Kong 等
  • 核心贡献: 将 LiDAR 重构为"会做梦的彩色相机",探索激光雷达与视觉的新型融合感知范式。
  • 日期: 2026-08-18
  • 来源: arXiv:2608.16264

19. US-VLA: An Ultrasound Vision-Language-Action Model for Embodied Abdominal Examination

  • 机构: Cheng Zhang 等
  • 核心贡献: 将 VLA 范式扩展到超声医学影像领域,面向腹部超声检查的具身操作,是医疗具身智能的前沿探索。
  • 日期: 2026-08-18
  • 来源: arXiv:2608.16074

20. Effector-Centric NMPC of Tiltable-Multirotors for Offset-Free Omnidirectional Aerial Manipulation

  • 机构: Jinjie Li, Moju Zhao 等(东京大学)
  • 核心贡献: 面向可倾转多旋翼无人机的全向空中操作,提出以末端执行器为中心的非线性模型预测控制(NMPC),实现无偏移全向空中操作,已被 IEEE Transactions on Robotics(T-RO)录用。
  • 日期: 2026-08-19
  • 来源: arXiv:2608.17819 / IEEE T-RO

本周趋势小结:

  • 人形机器人全面升温:从 Science Robotics 封面到 WRC 产业大会,从足球到拳击到手术,人形机器人的应用场景快速扩展。
  • VLA 基础模型密集发布:一周内至少 5 个新 VLA/世界模型(τ₀-VLA、NebulaVLA、SparkVLA、G3VLA、HAF),层次化架构与测试时计算成为新焦点。
  • 通用世界模型成兵家必争:NVIDIA Hydra-0、清华 GigaBrain-WBC、微软 Zetta ζ 同台竞技。
  • 医疗机器人交叉融合:手术模仿学习(SurgVIL)、超声 VLA(US-VLA)、人形手术框架(npj Digital Medicine)三线并进。