返回Glossary

抓取规划

定义

抓取规划是确定夹爪姿态(位置和方向)以及手指配置的问题,这些配置将在目标物体上产生稳定抓取。给定传感器输入——通常是来自 RGB-D 摄像头的点云或深度图像——抓取规划器输出一个或多个候选 6-DOF 抓取姿态,按预测质量排序。机器人随后执行排名最高的可行抓取,同时考虑运动学可达性和碰撞避免。

抓取是最基本的操作技能:几乎每个拾放、装配或物流任务都从抓取开始。尽管经过数十年的研究,在杂乱场景中对任意新物体的鲁棒抓取仍然是一个重大挑战。物体在形状、大小、重量、表面纹理和脆性方面各不相同。对刚性盒子完美有效的抓取在软香蕉或细笔上会失败。可能的夹爪姿态的组合空间是巨大的,抓取的物理稳定性取决于摩擦、接触几何和施加的力——所有这些都很难准确测量或预测。

现代抓取规划器在结构化料箱拣选基准上已达到 90–95% 的成功率,但在透明物体、可变形物品和极端杂乱情况下性能下降。抓取规划与学习操作策略的集成代表了当前前沿,其中抓取规划器选择抓取位置,策略处理接近、接触和抓取后操作。

解析方法与数据驱动方法

解析(基于模型)抓取规划需要目标物体的 3D 模型(CAD 或重建网格)。规划器使用物理标准评估候选抓取:力闭合(手指能否抵抗任意外部扳手?)和形状闭合(物体在几何上是否受约束?)。当模型准确时,这些方法在理论上是正确的,但当物体未知、部分遮挡或可变形时会失败。

数据驱动抓取规划使用在大型抓取数据集(模拟或真实)上训练的神经网络,直接从传感器输入预测抓取质量。网络接收点云或深度图像,并输出一组具有置信度分数的抓取姿态。不需要物体模型,网络通过学习的几何特征泛化到新物体。这种方法在现代研究和工业应用中占主导地位。

混合方法结合两者:神经网络生成粗略抓取候选,解析过滤器使用基于物理的质量指标对其进行细化。这提供了数据驱动方法的泛化能力和解析方法的可靠性保证。

关键算法

  • Dex-Net / GQ-CNN(Mahler et al., 2017)——在数百万个模拟抓取上训练的抓取质量 CNN。接收深度图像并为每个候选抓取输出抓取质量分数。Dex-Net 2.0 数据集包含 670 万个点云,带有解析计算的抓取质量标签。为平行夹爪设计。
  • GraspNet-1Billion(Fang et al., 2020)——用于从点云进行 6-DOF 抓取检测的大规模基准和模型。处理完整场景点云,在单次前向传递中输出数百个抓取提议。在 88 个物体上的 10 亿个抓取注释上训练。
  • Contact-GraspNet(Sundermeyer et al., 2021)——通过首先估计物体表面上的接触点,然后从这些接触点计算夹爪姿态来预测抓取。因为它推理局部表面几何而不是全局物体形状,所以在杂乱场景中表现良好。
  • AnyGrasp(Fang et al., 2023)——GraspNet 的后继版本,具有改进的速度(50+ FPS)和精度。支持平行夹爪和吸盘夹爪。可作为工业部署的商业 SDK 获得。

输入模态

点云:现代抓取规划器的标准输入。由一个或多个深度摄像头(Intel RealSense、Zivid、Photoneo)生成。提供 3D 几何信息但无颜色。大多数算法在原始点云或体素化表示上运行。

RGB-D(深度 + 颜色):添加颜色信息,帮助区分具有相似几何形状的物体(例如红色与蓝色杯子)。某些算法使用 RGB 进行分割,深度用于抓取姿态计算。

CAD 模型(已知物体):当物体已知时,其 CAD 模型可以通过姿态估计注册到观察到的点云。这使得解析最优抓取计算成为可能。用于零件几何提前已知的制造业。

触觉(接触后):力-扭矩和触觉传感器在初始接触后提供反馈。这使抓取调整成为可能:如果物体滑动,夹爪可以增加力或重新定位。带触觉反馈的闭环抓取比开环方法实现更高的成功率。

抓取质量指标

抓取成功率:成功提起并保持物体的尝试抓取的百分比。主要评估指标,在多个物体集上进行数百次试验测量。最先进的系统在结构化基准上达到 90–95%,在杂乱中的新物体上达到 70–85%。

Epsilon 质量(力闭合裕度):可以破坏抓取的最小扳手。Epsilon 越高,抓取对扰动的鲁棒性越强。从接触点和摩擦系数解析计算。

间隙:接近过程中夹爪与附近障碍物之间的最小距离。间隙小会增加碰撞风险。好的规划器会对需要通过狭窄间隙穿过夹爪的抓取进行惩罚。

计算时间:从传感器输入到抓取输出的时间。动态环境需要实时系统(<100 ms)。对于静态料箱拣选,批处理是可接受的。

实际要求

传感器:深度摄像头或结构光扫描仪是必需的。Intel RealSense D435/D455($200–$400)是研究标准。工业应用使用 Zivid、Photoneo 或 Ensenso 以获得更高的精度和噪声抗性。摄像头放置很重要:料箱拣选采用俯视,复杂几何采用眼在手。

计算:数据驱动抓取规划器在 GPU 上运行。GraspNet 和 Contact-GraspNet 需要 RTX 2070 或更好的配置,在 100–500 ms 内产生结果。AnyGrasp 在现代 GPU 上实现 50+ FPS。解析规划器在 CPU 上运行,但对于复杂场景较慢。

集成:抓取规划器必须与运动规划器(MoveIt、OMPL)集成,该规划器计算无碰撞接近轨迹。完整管道为:感知(深度摄像头)→ 规划抓取(GraspNet)→ 规划运动(MoveIt)→ 执行。

6-DOF 抓取姿态估计

现代抓取规划器估计完整的 6-DOF 抓取姿态:相对于物体或场景的夹爪的位置(x、y、z)和方向(滚转、俯仰、偏航)。这比平面(俯视)抓取要复杂得多,因为它必须推理接近方向、腕部旋转和手指在 3D 中的对齐。

6-DOF 抓取姿态通常参数化为 4x4 齐次变换矩阵,指定接触时刻的夹爪框架。对于平行夹爪,姿态定义手指之间的中心点、接近方向(夹爪沿其移动以接触)和闭合轴(手指沿其移动)。对于吸盘夹爪,仅需要接触点和接近法线(3-DOF)。

6-DOF 估计的关键技术挑战:(1)搜索空间巨大(每个候选抓取的 SE(3));(2)必须为每个候选检查夹爪与场景之间的自碰撞;(3)接近轨迹必须对机器人臂在运动学上可行,而不仅仅在抓取点处几何有效。集成抓取和运动规划通过联合优化抓取姿态和接近轨迹来解决最后一个挑战。

与学习策略的集成

抓取规划和学习操作策略越来越多地结合使用,而不是单独使用:

抓取 + 放置管道:抓取规划器选择初始抓取姿态,学习策略处理抓取后操作(放置、插入、堆叠)。这种劳动分工利用了抓取规划器的几何推理和策略处理复杂抓取后动力学的能力。

端到端学习抓取:ACT 和 Diffusion Policy 等策略从演示中学习整个抓取序列(接近、抓取、提起),无需显式抓取规划器。这对特定任务效果很好,但需要更多训练数据,不如专用抓取规划器对新物体泛化。

VLA 引导抓取:Vision-Language-Action 模型可以根据语言指令("用把手拿起杯子")和学习的物理直觉选择抓取策略,结合语义理解和几何推理。

在 Robotics Center of Silicon Valley,我们在我们的设施上对不同的抓取方法(解析、学习、混合)进行基准测试,帮助团队为其特定应用选择正确的方法。

在 Robotics Center of Silicon Valley 部署抓取规划

Robotics Center of Silicon Valley 为拾放应用提供深度摄像头集成、抓取规划管道设置(GraspNet、Contact-GraspNet、AnyGrasp)和运动规划配置。我们的团队可以在您的特定物体集上对不同的抓取规划器进行基准测试,并为您的部署推荐最佳方法。

探索数据服务 联系我们

Related terms