返回Research

机器人时间结构:机器人学习的隐藏瓶<unk>是为什么时间配合

摄像头,关联状态和机器命令之间的时间错调使机器人示范变得结构化标签噪音.RCSV的硬件同步数据基础设施将数据需求减少2-3倍.

[←研究]T2)

机器人学习社区正在扩大示范. 但大部分数据是暂时污染的,

3个

时间错调 = 23x需要更多的示范

问题: 时间不一致作为结构化标签噪音

在行为克隆中,每个训练样本都应该是一个对 (ot, at) 在时间_t_的观察与在时间_t_的行动相对.实际上,大多数收集系统实际记录的是 (ot−δo, at+δa),其中 δo和 δa是未知的,相机管道引入的可变延迟,OS安排,巴士延迟和控制循环时间.

这不是随机噪音.这是与系统的物理状态相关的结构标签噪音.时间错调的大小随着最终效应器的速度增长,接触过渡时发生变化,随着控制频率而变化,取决于摄像头的曝光时间. 在政策学习最重要的时刻, 快速运动,接触事件,精确的调整, 时机错误最严重.

算法很简单.在30fps时,一个偏移的框架为33ms.一个以0.5m/s速度运动的机器人臂每幅移动16.5mm.对于精确操纵任务,插入插孔,线缆路线,连接器对配 16.5mm的位置模糊性是灾难性的.政策学习了任务的模糊版本,平均在暂时不一致的观察-行动对. 需要23倍的更多示范,以达到相应的成功率,

在研究界广泛使用的系统,包括ALOHA,UMI和标准USB摄像头设置,显示了摄像头框架和联合状态反弹之间2080ms的不测量时机动荡.这种动荡很少报告,很少测量,几乎从未得到纠正.

为什么软件时间表不解决

传感器的反应是对所有东西进行时间印记.大多数收集代码库在每个传感器读数上调用T0T1,并假设问题已经解决.

接待者侧时刻标记是操作系统收到数据时的,而不是物理事件发生时的.在光子撞到传感器和记录时刻标记之间,多个可变延迟来源积累:

  • **USB测试延迟:**USB 2.0测试在1ms间隔;USB 3.0在125μs. 但实际的传输由主机控制器安排,并且可能会因巴士纠纷而延迟.
  • OS 计划: 核调节USB中断处理器,然后调用用户空间回调.在一个非RT Linux 核下,调节节动荡范围从150ms. Python 进程在上面添加 GIL 纠纷.
  • **摄像头滚动遮蔽器:**滚动遮蔽器传感器在不同时间暴露上层和下层排列,通常跨度为1533ms. 框架的"时间标签"模糊.
  • 网络缓冲: 如果传感器通过以太网通信 (RealSense通过USB,ROS主题通过DDS,EtherCAT电动驱动器),网络堆缓冲增加了另一个可变延迟层.
  • 联合状态巴斯延迟: CAN巴斯,连续 UART 和 EtherCAT 每个都有自己的读取延迟. 1 Mbps 的 CAN巴斯与 8 关联引入 ~ 1 ms 的连续延迟; 115200 baud 的连续 UART 更糟糕. 连续状态被连续读取,因此连接 1 和连接 6 甚至不是同时.

这些延误是个别小的,但总体变化.更糟糕的是,它们不常变.它们随着系统负载,USB拓,网络流量,甚至环境温度 (影响晶振荡器漂移) 变化.软件的时间印不能消除无法观察的延误.

机器人时间配合的四层

固定时间排列需要解决四个不同的层次,每个层次都在一个层次下面.

其他

数据集认证

每个数据集都会带有时间健康报告,以便下游消费者知道他们正在训练什么.

其他

传感器-触发器绑定

摄像头框架 联合状态 动机命令 编码器回收.训练样本中的每种模式都与相同的物理瞬间相结合,而不是同一个软件时间.

其他

硬件触发

全球幕摄像头,外部触发线,在所有视角都能同步曝光,没有幕涂料,没有自由运行的幕钟漂移.

其他

时钟同步

电脑的每一个传感器,执行器和计算节点都同意它在微秒内是什么时间,而不是毫秒.

大多数机器人学习设置都没有实现这些层.一些部分实现层1 (NTP,而不是PTP).几乎没有实现层24.结果是,培训数据的时间对齐是未知的,研究人员对数据的基本质量是未测量的,而数据的架构和超参数是优化的.

斯威尔士国家安全委员会 (RCSV) 方法:基于硬件的临时基础设施

根据RCSV的数据收集基础设施,所有四层时间调整都作为默认,而不是附加程序.

  • <5 ms在所有流域中同步. 硬件触发的全球幕摄像头与联合状态反弹相同的触发线上射击.
  • **LED + PRBS 阶段解码用于真正的捕捉延迟测量.**在相机视野中可见一个由伪随机二进制序列 (PRBS) 驱动的 LED 阵列.通过在捕获的图像中解码PRBS模式,我们测量了从触发到像素捕获的实际端到端延迟,包括相机固件引入的任何管道延迟. 这不是校准步骤,它是连续运行的.
  • ** 每个数据集的健康计量时间.** 每个RCSV提供的数据集都包含每集的时间报告:最大的升,平均同步缓解,下降的图片数量和完整的升历史图. 下游消费者可以根据时间质量过或重量样本.
  • 结果:需要的示范数量减少了23倍. 在匹配任务 (选择位置,插入,线缆路由) 上,基于硬件同步的RCSV数据训练的政策达到相等的成功率,比软件标记的USB摄像头设置所收集的同样的任务相比,示范数量减少了23倍. 它们更好,因为每个观察-行动对实际上都与相同的物理时刻相符.

相关工作

时间校准在多传感器系统中具有悠久的历史,

  • **Furgale等",多传感器系统的统一时间和空间校准" (IROS 2013) ** 卡利布框架为摄像头-IMU系统引入了联合时间和空间校准.显示,即使是几毫秒的时间抵消会显著降低视觉惰性度.
  • ** 和沈, "单光视觉内动系统在线时间校准" (2018) ** 证明,在VIO操作期间,相机-IMU时间抵消可以在线估计,消除了离线校准的需要.
  • **Tschopp等",VersaVIS:一个开放式多摄像头视觉内动传感器套件" (2019) ** 硬件触发的多摄像头+IMU系统,具有分秒次次的同步性.机器人学习数据收集需要的最接近前,设计用于SLAM而不是操纵.
  • **Zhao等人",低成本硬件使用学习精细化双手操作" (2023) ** ALOHA系统使用USB摄像头和Dynamixel连续巴士的软件时间标签.时间排列在纸上没有描述,但重复设置的测量震动是2050ms.
  • **Khazatsky等",DROID: A Large-Scale In-The-Wild Robot 操纵 Dataset" (2024) ** 76K 集在 564 场景中. 使用RealSense 摄像头与主机侧时间标签.分布式收集站点之间的时间排行并不标准化.
  • **Chi et al.,"普遍操纵界面" (2024) ** UMI使用基于SLAM的姿势估计和插射作用标签的GoPro摄像头.插射步骤隐含地缓解时间错调,但不会消除它.
  • **F2F-AP: "流向未来异步政策" (2026) 提出对异步观察行动流的学习补偿. 证明即使算法方法也从知道基础真相时机中获益,从而抵消了培训数据的分布.

接下来是什么:

根据RCSV的研究,SyncBench是直接测量时间调整条件如何影响政策绩效的基准标准.

  • 相同的任务,相同的政策架构,不同的时间. 三种条件: (1) 仅是软件时间标签, (2) 没有完全同步的硬件触发摄像头, (3) 正如上述的四层时间配线.
  • 任务频谱. 从暂时宽容 (选,块堆) 到暂时要求 (在 0.5mm宽度下插入,电缆线程,USB连接器配对).
  • 标准. 条件:升分布 (p50/p95/p99),政策成功率为50/100/200/500次示范,最低示范达到80%的成功率,失败模式的断裂 (过失,接触错误,抓滑,碰撞).

我们预计SyncBench将表明,时间对齐是比接触丰富任务的架构选择更强大的样本效率预测因素.如果得到证实,这对该领域如何优先考虑基础设施投资与算法研究有重大影响.

硬件同步数据收集

根据RCSV的数据,每样本的时间表认证,提供时间调整的示范数据.

关于数据服务的了解