返回Paxini Gen3 Path

培养一个敏感的政策

在ACT或扩散政策中,添加触觉作为观察方式,在数据集上训练,并根据仅视觉的基线对接触丰富的操纵任务进行评估.

5个单位5个 · 训练和部署 · ~1.5小时 (+训练时间)

通过 ACT 或 Diffusion Policy 添加触觉作为观察方式,从数据集中计算正常化统计数据,进行训练,并根据仅视觉的基线进行评估.

步骤 1 添加触觉方式

扩大政策配置

触觉观测可以作为全压力地图 (空间,每框64值) 或总量尺度 (总量_force_n) 添加.从尺度开始,它更容易正常化,并且足够用于大多数操纵任务.如果你的任务需要空间接触信息 (例如,区分边缘与中心接触).

标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签: 标签

步骤 2 计算正常化统计数据

从数据集中获取正常化统计数据

总是从您的特定数据集中计算正常化统计数据, 不要使用硬码值. Paxini SDK 为此提供了一个实用程序:

#从paxini.data输入数据集的统计数据_dataset_stats stats = compute_dataset_stats"./tactile_dataset/") print(stats.to_yaml()) #预期输出 (示例值): #观察.触动.总_force_n: #平均值: 2.84 # std: 1.93 #分钟: 0.0 #最大值: 14.2 #观察.触动.接触_area_mm2: #平均值: 22.4 # std: 18.6 \保存来配置统计数据.save"./act\paxini_stats.yaml")

为什么触觉正常化很重要 强力值 (020 N) 与关节位置 (通常是 ±π 半径) 和像素值 (0255) 的完全不同的尺度.

步骤3 培训

训练指挥部

训练时间:8GB GPU上约45分钟,CPU上约3小时.

设置LeRobot如果尚未安装 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设置Lerobot 设

在100Hz50集中,预计将近200250时代的缩. TensorBoard中的触摸_obs_loss指标应随着主动损失稳步下降.

步骤 4 评估与视觉仅基线

仅仅视力而不是视力

训练一个第二个政策,只使用视觉+自觉 (没有触觉道) 在同一数据集.这是你的基线.对每个政策进行评估,对你的目标任务进行20个推广:

训练仅视觉的基线 (相同的配置,减轻触觉键) python lerobot/scripts/train.py \ --config-name act_vision_only \ --dataset-path ./tactile_dataset/ \ --output-dir ./checkpoints/act_baseline/ # 评估两项政策 20次的推广每个 python lerobot/scripts/evall.py \ --checkpoint ./checkpoints/act_tactile/best.ck \ --num-episodes 20 \ ----name "tactile" python lerobot/scripts/evall.py --checkpoint ./checkpoints/act_baseline/best.ispt \ --num-episodes 20 \ --evall-line"

寻求抓稳定度指标的改善 具体地在易滑的物体上任务成功率和放置阶段平均持久时间.触觉意识的政策通常显示出可变和可变权重的物体上最大的改善.

如果触觉不能提高性能,该怎么办首先,检查数据集的接触事件与视频一致 (单位4质量检查). 第三,试图把压力图作为一个观察,而不是只是尺度图,它提供了更丰富的空间背景.

接下来是什么?

下一个方向

现在,

多传感器融合

手指指指触摸器的设置量可达到5个指, 手指指导包括多传感器的政策架构.

控制力循环

根据检测到的滑动事件,调整力动态.

触摸式奖励

通过触觉的质量作为强化学习的在线奖励信号,

完整的路径

你已经从第一种传感器读取到训练有素的触觉意识操纵政策了.你现在有一个完整的管道 硬件,数据和政策 ,你可以适用于任何接触丰富的任务.

第五单元完成,当...

训练完成了无错误,并产生了检查点. 触觉验证损失减少,训练期间出现了高原. 您已经对触觉政策和仅视觉基线进行了20次评估,并记录了成功率进行比较.