RVT-2:从少数演示中学习精确的操作

机器人学习的终极目标之一是构建能够解决多种任务并泛化到未见环境配置的通用机器人系统。这些系统应该能够进行精确操作,并且只需要对新任务进行少量演示。例如,在工业制造环境中,可以期望一个人向机器人演示几次高精度任务,如插入销钉,之后机器人应能独立执行该任务。

NVIDIA的研究团队提出了RVT-2,这是一个多任务3D操作模型,其训练速度是前身RVT的6倍,推理速度提升2倍,在RLBench上达到了新的最佳状态,成功率从65%提高到82%。RVT-2在真实世界中也很有效,只需10次演示就能学习到如插入插头这样的高精度任务。相关的视觉效果、代码和训练模型可在提供的网址获取。

在过去,RT-1、RT-2和ALOHA等模型广泛使用相机图像进行基于视觉的操作。为了更有效的3D空间推理,通常需要深度信息,其中RGB-D图像被假定为操作策略的输入。PolarNet和M2T2直接使用从RGB-D图像重建的点云,并使用编码器加变换器来预测动作。C2F-ARM、PerAct和FourTran将点云体素化,并使用3D卷积网络作为动作推理的主干。Act3D和ChainedDiffuser将场景表示为多尺度3D特征云。为了提高时间效率和任务效果,RVT提出了使用多视图虚拟图像作为场景表示。尽管如此,这些先前的模型只被应用到不需要高精度操作的真实世界任务中。

而RVT-2允许进行三维和精确的操作。RVT-2建立在RVT的基础上,是3D对象操作的最新技术模型。与RVT类似,RVT-2基于关键帧操作的范式。但它通过一系列改进实现了更好的任务性能、精度和速度。实验员将这些改进分为两类:与神经网络变化相关的架构改进和与软件优化相关的系统改进。

相关链接(https://robotic-view-transformer-2.github.io/real_world/generalization.mp4)

通过在模拟和现实世界中对RVT-2进行了全面评估:在模拟实验中,在RLBench上进行了实验(这是一个由先前工作采用的标准多任务操作基准)。在真实世界的设置中,将RVT-2与RVT进行了比较,得出RVT-2显著提高了速度、精度和任务性能。尽管研究团队使用的技术本身并不新颖,但他们的贡献在于有效地结合它们,以推进少次3D操作的最新技术。虚拟环境中发现RVT-2在RLBench上的表现大大超过了以前的方法,同时需要的计算量要少得多。在现实世界中,发现RVT-2可以使用单个第三人称相机,并且只需10次演示就能解决涉及插入销钉和插头的高精度任务。

文章来自:
1 个赞