返回Learn

机器人学习词典:60个关键词定义

关于机器人学习,远程操作和操纵术语的全面词典,从行为克隆到VLA,明确定义为实践者.

[←学习]

参考词典涵盖模仿学习,政策架构,数据收集,硬件和机器人实践者评估术语.

本词典涵盖了机器人学习,远程操作和操纵中使用的六类别60个关键词.每个定义都是为实践者写的.

模仿学习的术语

  • **行为克隆 (BC):**最简单的模仿学习算法 训练一个监督模型来预测给定的状态的专家行动,将其视为回归问题.
  • **DAgger (数据集集):**一个反复的IL算法,通过让专家纠正所学到的政策在实际访问的状态下所采取的行动来调整分布转移.
  • ** 行动化:** 预测K连续的未来行动一次而不是每一步一次行动. 在ACT中使用 (K=100). _ 例子:政策一次输出2秒的未来臂动作,然后重新规划打破复合错误周期._
  • **分布变化:**训练 (示范) 期间看到的状态分布与测试时间访问的分布之间的不匹配 (机器人执行).
  • 可变性转移: 特定类型的分布转移,其中输入分布 (状态) 变化,但条件输出分布 (给定的状态的行动) 保持不变.
  • ** 组合错误:** 随着时间的推移,小小一步预测错误的几何积累,成长为O(T2ε) 对于视界T和每步错误 ε.
  • 多模式性: 对于同一状态有效的示范数据集的属性. _ 例子:可以从左或右抓住红色块 两者都是正确的,但单模式模型平均将它们放在一个坏的中间抓._
  • 示范: 记录了人类专家执行机器人应该学习的任务的单个实例.
  • ** 剧情:** 一次完成任务的完整尝试,包括所有传感器数据.可能成功或失败.
  • 推广: 由学习的政策 (而不是人类) 生成的集. 用于评估,有时收集额外的培训数据.

政策架构条款

  • **变体策略:**作为变体神经网络实施的策略 使用自我注意力来模型跨时间段或图像补丁间的空间依赖.
  • **CVAE (条件变量自动编码器):**一个学习基于观察变量的隐藏分布的生成模型. 在ACT中用于将示范的多模式编码成样式变量.
  • **散策:**一个以散过程为模拟的行动分布的政策 散过程为代码的散策,以以观察为条件的可行的行动轨迹.
  • **基于能源的模型 (EBM):**一个模型,将每个 (状态,行动) 对分配到一个规模式"能量";推理发现行动最小化能量.
  • **流量匹配:**一种生成模型技术,通过持续正常化流程学习从简单的分布运输样本到复杂的目标分布.
  • 预测视野:**一个政策一次预测的未来时间步骤数量.较长的视野使得更平滑,更协调的运动成为可能,但需要更准确的模型.
  • ** 部分大小:** 在一个预测部分中的行动步骤数量 (与ACT类型的政策中的预测视野相同).
  • 举例:一个多层感知器头,采用变压器解码器输出,输出7个关角,用于6DOF臂+抓住器.

数据和收集条款

  • 远程操作: 机器人从远程接口上操作由人控制,通常用于收集示范数据.
  • 炼教学: 操作员物理地抓住和移动机器人臂 (重力补偿,可回驱模式) 进行任务的演示.
  • **领袖跟随者:**一个远程操作架构,操作员移动轻重复制臂 (领袖) 机器人臂 (后者) 能在实时反映运动.
  • **HDF5 (层次数据格式5):**一个用于存储大量数值数据集的二进制文件格式,包含碎片,压缩的数组.机器人事件数据的标准存储格式.
  • **RLDS (强化学习数据集):**基于TensorFlow的数据集格式用于机器人学习数据,标准化事件和步骤结构.
  • **LeRobot:**使用Parquet文件和标准化方案的基于HuggingFace的机器人学习框架和数据集格式.
  • 数据增强: 应用随机转换到训练数据以改善政策通用化.
  • **成功率:**政策成功完成任务的评估部署部分.操纵政策的首要评估指标.
  • 拒绝率: 收集到的集集中被丢弃的部分在质量过过程中.
  • 剧集长度: 一集的持续时间 (时间段或秒) _ 例子:每集平均长度8秒50Hz =400时间段._

机器人硬件条款

  • **DOF (自由度):**机器人臂中独立运动轴数. 6 DOF是任意终端效应的最小值; 7 DOF增加冗余.
  • ** 载荷:** 机器人臂在最终效应器上承载的最大量,同时保持名额性能.
  • ** 距离机器人底部的最大半径,最终效应器可以达到. 通过链接长度的总和来确定.
  • 重复性: 精度在重复尝试时,臂重返相同的指挥位置,测量为 ±X mm.
  • **终端效应器:**机器人臂尖端安装的设备与物体交互"手".
  • 杆:** 通过杆力抓住物体的特定类型的终端效应器.平行杆是杆最常见的杆.
  • 力/扭矩 (F/T) 传感器: 六轴手腕传感器,测量终端效应器的力 (Fx, Fy, Fz) 和扭矩 (Tx, Ty, Tz).
  • 触摸传感器: 传感器测量分布式接触压力或几何在指尖水平.
  • 关联编码器: 测量机器人关联的角度的传感器.绝对编码器报告了真实角度,而无定向.
  • ** 机器人:** 在机器人领域,一个自主的发动机+编码器+控制器单元,它接受位置,速度或扭矩指令.

学习范例

  • **强化学习 (RL):**一个学习模式,其中一个代理通过采取行动和接受尺度奖励信号学习 不需要专家示范.
  • ** 除RL:** 没有额外的环境相互作用的预先收集的数据集.
  • **在线RL:**RL与积极环境交互 政策收集新数据并立即从中学习.
  • Sim-to-Real: 训练一个模拟中的政策,然后在一个真正的机器人上部署.核心挑战是"现实差距" 模拟从来都不完全准确.
  • **域间随机化:**一个随机化模拟参数 (摩擦,照明,质量,纹理) 的仿真技术,使该政策学习适应这些变化.
  • **基础模型:**一个大型神经网络,预先训练在广泛数据 (互联网规模或跨机器人数据集) 上,可为特定任务进行精细调节.
  • **VLA (视觉语言行动模型):**一个模型,以视觉观测和自然语言指令作为输入和输出机器人操作.
  • **精细调节:**通过继续训练在一个小的任务特定数据集上,将预先训练的模型调整到一个新任务或环境中.
  • 零射击: 没有任何具体任务的培训,将训练模型应用于新任务或环境.
  • Few-Shot: 适应新任务,只使用少量的例子 (通常是120).

评估条款

  • 成功率: 政策完成任务的评估试验中的部分. 标准的初级指标.
  • ** 没有分发 (OOD):** 与训练分发不同的输入 没有在训练中看到的新物体颜色,位置或环境.
  • 一般化差距: 在分销中和在分销之外的成功率之间的差距. 很大的差距表明过度适应培训条件.
  • 基准: 标准化任务,对象和评估协议,以公平地比较算法.
  • **实体评估:**对物理机器人进行政策评估 (而不是模拟). 考虑为黄金标准;模拟指标通常不会转移.
  • Ablation Study: 试验是删除或修改系统的一个组件以衡量其贡献.
  • ** 排放集:** 数据的子集,完全与培训分开,只用于最终评估. 确保评估指标不会被过度调整膨胀.

对于本词典中的任何概念的完整解释,请浏览 [RCSV词典]T2) 或查看上述机器人图书馆文章.随着该领域的新技术的出现,此参考会不断更新.