机器人学习中的轨迹表示:联合空间,任务空间和达尔塔
如何存储和表示机器人轨迹在学习算法中<unk>关键角度,卡特西亚姿势,三角形行动和相对表示.
[←学习]
您所表达的机器人轨迹方式决定了您的政策能学习的内容以及它如何概括.
机器人轨迹是什么?
机器人轨迹是机器人操作的一个集中记录的状态和行动的序列. 形式:
对于培训,行动序列是政策必须学会复制的. 但"行动"不是单一的普遍格式
联合空间代表
最直接的表示:动作
角直接进入电机控制器. 确定性:相同的操作总是产生相同的联合配置. 快速执行 没有中间计算. - 缺点: 特定于手臂.在同一任务中,没有重新训练的情况下,一个在6DOF手臂上训练的政策不能转移到7DOF手臂.
- **标准使用:**ALOHA和ACT使用绝对联合空间作为主要行动表示.
卡特西亚任务空间
- **优势:**直观
操作直接指定最终效应器应该在哪里.更可转移到不同组合的机器人之间,但类似的工作空间. - 缺点: 需要IK转换为联合命令
增加延迟和单一性风险.旋转表示很棘手:尤勒角有 锁 (避免它们),四 是紧 的,但不是独特的 (SO(3) 双盖. - 旋转表示注意: 总是使用四角 (而不是尤勒角) 在代码中.对于神经网络输出,考虑6D旋转表示 (旋转矩阵的前两列)
它是连续的和无单一性.
德拉行动
作为一个绝对目标, 德尔塔行动指定了从当前状态的 _变化:
- **为什么特区更容易学习:**特区动作的 magnitud 是小的,在大约在轨道上是恒定的.网络学会比与工作空间位置不同而变化的大绝对坐标更容易预测小的,有限的值.
- 隐含安全: 切断三角形操作到最大的 magnitud 限制机器人的速度
- 标准使用: 扩散政策,RT-1,Octo,以及大多数VLA模型使用卡特西亚三角形行动作为其主要行动空间.
绝对对与对象相关表示
基本的通用问题:应该在机器人的工作空间框架中表示行动,或者与被操纵的对象相对?
- 绝对 (工作空间框架): 操作值取决于对象在工作空间中的位置. 如果表移动10厘米,则政策失败.对于固定设置好;对于部署一般化而言不好.
- ** 对象相关:** 操作以被检测到的对象姿势的偏移表达. 政策学习"从对象的5厘米上方抓住"而不是"移到 (0.3, -0.1,0.15) ". 需要可靠的对象检测或姿势估计,但将其更好地将化为新的表高度,位置甚至新环境.
轨道长度和位
任务的持续时间不同:简单的抓取可能需要2秒 (100步50Hz);多步的组装可能需要30秒 (1500步).这为批次训练带来了实际挑战.
- ** 固定长度:** 通过特殊的"无操作"行动代币,将更短的节目加到最大长度.使用基于变压器的政策掩盖注意力,以便网络忽视加
代币. 简单的实现. - **可变长度,面具:**每节目都应按照其自然长度进行处理.需要仔细批量 (按相似长度组组或使用动态填充).
- ** 行动分量:** ACT式:将轨道分解成固定长度的分量 (例如100步) 并独立地训练分量.自然处理可变的剧集长度,同时保持固定尺寸模型输入.
代表性比较
| Representation | Intuitive | Generalizable | IK Needed | Used In |
|---|---|---|---|---|
| Absolute joint angles | No | Low | No | ALOHA, ACT, RoboAgent |
| Absolute Cartesian pose | Yes | Moderate | Yes | Classic manipulation research |
| Cartesian delta actions | Yes | High | Yes (incremental) | Diffusion Policy, RT-1, Octo |
| Object-relative Cartesian | Yes | Very High | Yes | Generalizable grasping research |
| 路径点 sequences | Yes | High | Yes | Long-horizon task planning |
轨迹表示是机器人学习系统中最具影响力的设计决策之一. 在投资大规模数据收集之前,花时间考虑这个选择.查看[RCSV平台]







