传播政策
<unk>散政策:机器人行为作为条件的<unk>散. 哥伦比亚. 超过之前的方法. 开源.
通过条件性指控传播来学习视觉运动政策.
概述
扩散政策表示机器人行为作为一个条件的指导扩散过程.它处理多模式行动分布,高维的行动空间,并显示出强大的训练稳定性.平均46.9%的改善超过之前的方法在15个操纵任务.
建筑
- 降落地平线控制
- 视觉调节
- 时间系列扩散变压器
- 国际经济复兴委员会2024年
官方链接
引用
查看BibTeX的项目网站.
任何VLA都能根据自己的演示进行调整.
收集演示片 → 运行它的硬件 → 评分一个政策 →