Volver a Learn

Glosario de aprendizaje de robots: 60 términos clave definidos

Glosario completo de los términos de aprendizaje de robots, teleoperatorio y manipulación <unk> desde la clonación de comportamiento hasta los VLA, claramente definidos para los profesionales.

[← Aprende]

Un glosario de referencia que cubre el aprendizaje de imitación, las arquitecturas de políticas, la recopilación de datos, el hardware y los términos de evaluación para los profesionales de la robótica.

Este glosario abarca 60 términos clave en seis categorías utilizadas en el aprendizaje de robots, la teleoperatoria y la manipulación. Cada definición está escrita para los profesionales concisa, concreta y con un breve ejemplo. Para una explicación más visual de cualquier concepto, explore el resto de la [Biblioteca de Robótica] T1 .

Términos de aprendizaje por imitación

  • Cloning de comportamiento (BC): El algoritmo de aprendizaje de imitación más simple entrena a un modelo supervisado para predecir las acciones expertas de los estados dados, tratandolo como un problema de regresión.
  • DAgger (agregación de Datasets): Un algoritmo iterativo de IL que corrige el cambio de distribución haciendo que el experto corrija las acciones de la política aprendida en los estados que la política visita realmente.
  • Acción Chunking: Previsión de K consecutivas acciones futuras a la vez en lugar de una acción por paso. Usado en ACT (K=100). Exemplo: la política de salida de 2 segundos de movimiento del brazo futuro a la vez, luego re-planes rompiendo el ciclo de error de composición.
  • Distribución de cambio: La discrepancia entre la distribución de estado observada durante el entrenamiento (demostraciones) y la distribución visitada en el tiempo de prueba (execución de robots).
  • Covariate Shift: Un tipo específico de cambio de distribución en el que la distribución de entrada (estados) cambia pero la distribución de salida condicional (acciones dadas estados) no cambia.
  • Error de composición: El fenómeno en el que los pequeños errores de predicción por paso se acumulan geométricamente con el tiempo, creciendo como O(T2ε) para el horizonte T y el error por paso ε.
  • Multi-modalidad: Propiedad de un conjunto de datos de demostración en el que varias acciones distintas son válidas para el mismo estado. Exemplo: un bloque rojo puede ser agarrado desde la izquierda o la derecha ambos son correctos, pero un modelo de modo único los promedia en un mal agarrado medio.
  • Demonstración: Una sola instancia registrada de un experto humano realizando una tarea que el robot debería aprender.
  • Episodio: Un intento completo de una tarea de principio a fin, incluidos todos los datos del sensor. Puede tener éxito o fallar.
  • Rollout: Un episodio generado por la política aprendida (en lugar de por un humano).

Términos de arquitectura de políticas

  • ** Política de transformador:** Una política implementada como red neural de transformador utilizando la autoatención para modelar dependencias temporales en pasos temporales o dependencias espaciales en parches de imagen.
  • CVAE (Conditional Variational Codificador Automático): Un modelo generativo que aprende una distribución latente condicionada a las variables observadas. Se utiliza en ACT para codificar la multimodalidad de las demostraciones en una variable de estilo. Exemplo: el codificador CVAE de ACT comprime la secuencia completa de acción en un código latente z, lo que permite al decodificador generar trozos de acción consistentes.
  • Política de difusión: Una política que modela la distribución de la acción como un proceso de difusión denonizante denonizando iterablemente el ruido aleatorio en una trayectoria de acción plausible condicionada a las observaciones. Exemplo: Chi et al. 2023 demostró que la política de difusión supera a BC en tareas multimodales representando múltiples captaciones válidas simultáneamente.
  • Modelo basado en energía (EBM): Un modelo que asigna una "energía" escalar a cada par (estado, acción); la inferencia encuentra la acción minimizando la energía.
  • Corrección de flujo: Una técnica de modelado generativo que aprende a transportar muestras de una distribución simple a una distribución meta compleja a través de flujos de normalización continua.
  • ** Horizonte de predicción:** El número de pasos futuros que una política predice a la vez. Horizontes más largos permiten un movimiento más suave y coordinado, pero requieren modelos más precisos.
  • ** Tamaño de pieza:** El número de pasos de acción en una pieza de predicción (el mismo que el horizonte de predicción en las políticas de estilo ACT).
  • Head de acción: El módulo de salida de una red de políticas que mapea las características latentes a los valores de acción.

Términos de recogida de datos

  • Teléoperación: La operación controlada por el hombre de un robot desde una interfaz remota, normalmente utilizada para recopilar datos de demostración. Exemplo: un operador con un auricular VR mueve sus manos, y el brazo robot refleja esos movimientos mientras todos los datos están registrados.
  • Enseñanza cinestética: Un método de recopilación de datos en el que el operador agarra y mueve físicamente el brazo robótico (modo de compensación por gravedad y retroceso) para demostrar una tarea.
  • Lider-Follower: Una arquitectura de teleoperación en la que el operador mueve un brazo de réplica ligero (leader) y el brazo robot (follower) refleja el movimiento en tiempo real.
  • HDF5 (Formatos de datos jerárquicos 5): Un formato de archivo binario para almacenar grandes conjuntos de datos numéricos con matrices compactadas y fragmentadas. El formato de almacenamiento estándar para los datos de los episodios de robots.
  • RLDS (Reinforcement Learning Datasets): Un formato basado en Datasets TensorFlow para el aprendizaje de datos de robots, estandarización de episodios y estructura de pasos. Usado por Octo, Open X-Embodiment.
  • LeRobot: Un marco de aprendizaje de robots basado en HuggingFace y formato de conjunto de datos utilizando archivos de Parquet y un esquema estandarizado.
  • Aumentar los datos: Aplicar transformaciones aleatorias a los datos de formación para mejorar la generalización de las políticas.
  • Caso de éxito: La fracción de implementaciones de evaluación en las que la política completa con éxito la tarea.
  • Taxa de rechazo: La fracción de episodios recogidos descartados durante el filtro de calidad.
  • Duración del episodio: La duración (en etapas de tiempo o segundos) de un episodio.

Términos de hardware de robots

  • DOF (Degres de libertad): El número de ejes de movimiento independientes en un brazo robótico. 6 DOF es el mínimo para poses de efecto final arbitrarias; 7 DOF añade redundancia.
  • Carga útil: La masa máxima que el brazo robótico puede transportar en su factor final mientras se mantiene el rendimiento nominal.
  • Racimiento: El radio máximo desde la base del robot que el efector final puede alcanzar. Determinado por la suma de las longitudes de enlace.
  • Repetible: La precisión con la que el brazo vuelve a la misma posición ordenada en repetidos intentos, medido en ±X mm.
  • Efector final: El dispositivo montado en la punta del brazo robótico que interactúa con los objetos la "mano". Exemplo: un agarre paralelo para la mandíbula, una matriz de tazas de succión o una mano hábil con varios dedos.
  • Gripper: Un tipo específico de efecto final que agarra objetos mediante la aplicación de fuerza de sujeción.
  • Sensor de fuerza/torque (F/T): Un sensor de muñeca de seis ejes que mide las fuerzas (Fx, Fy, Fz) y los par (Tx, Ty, Tz) en el factor final.
  • ** Sensor táctil:** Un sensor que mide la presión de contacto distribuida o la geometría a nivel de la punta del dedo. Exemplo: GelSight produce una imagen de alta resolución de la geometría del contacto del dedo, lo que permite la detección de deslizamientos y la evaluación de la calidad de la captura.
  • Encodificador conjunta: Un sensor que mide el ángulo de una articulación de robot. Los codificadores absolutos informan el ángulo verdadero sin orientación.
  • Servo: En robótica, un motor+encoder+controlador autónomo que acepta un comando de posición, velocidad o par. Exemplo: los servos Dynamixel se utilizan ampliamente en los brazos de investigación de bajo costo cada servo maneja su propio control PID internamente.

Los paradigmas de aprendizaje

  • Reforcement Learning (RL): Un paradigma de aprendizaje en el que un agente aprende tomando medidas y recibiendo señales de recompensa escalar no se necesitan demostraciones de expertos.
  • RL Offline: RL de un conjunto de datos fijo de experiencia precocinada, sin interacción adicional del entorno. Exemplo: formación de una política a partir de un conjunto de datos de robots recogidos por humanos utilizando el Q-learning conservador (CQL) para evitar acciones fuera de distribución.
  • **RL en línea:**RL con interacción activa del entorno la política recopila nuevos datos y aprende de inmediato de ellos. Exemplo: un robot simulado intenta captar repetidamente, actualiza su política después de cada intento y mejora gradualmente.
  • ** Sim-to-Real:** Entrenamiento de una política en la simulación y luego su implementación en un robot real. El reto principal es la "brecha de realidad" la simulación nunca es perfectamente precisa.
  • Randomization de dominio: Una técnica sim-to-real que aleatoriza los parámetros de simulación (fritación, iluminación, masa, textura) para que la política aprenda a ser robusta a estas variaciones.
  • Modelo de base: Una red neuronal grande pre-entrenada en datos amplios (Internet o conjuntos de datos de robots cruzados) que pueden ser ajustados para tareas específicas.
  • VLA (Modelo Vision-Language-Action): Un modelo que toma las observaciones visuales y las instrucciones del lenguaje natural como entradas y salidas de las acciones del robot.
  • Auroración fina: Adaptación de un modelo previamente entrenado a una nueva tarea o entorno mediante la formación continua en un pequeño conjunto de datos específico de tarea.
  • Zero-Shot: Aplicar un modelo entrenado a una nueva tarea o entorno sin ninguna formación específica de tarea. Exemplo: un VLA entrenado en muchas tareas logra una nueva instrucción "pick up the blue block" sin haber visto nunca esa instrucción específica durante la formación.
  • Poco tiempo: Adaptación a una nueva tarea utilizando sólo un pequeño número de ejemplos (normalmente 120).

Términos de evaluación

  • Tasa de éxito: Fracción de ensayos de evaluación en los que la política completa la tarea.
  • Out-of-Distribution (OOD): Ingresos que difieren de la distribución de la formación nuevos colores, posiciones o entornos de objetos no vistos durante la formación.
  • Generalización: La diferencia entre las tasas de éxito en la distribución y fuera de la distribución.
  • Bendmark: Un conjunto estandarizado de tareas, objetos y protocolos de evaluación para comparar los algoritmos de manera justa.
  • Evaluación del mundo real: Evaluación de políticas en un robot físico (no simulación). Considerado el estándar de oro; las métricas de simulación a menudo no se transfieren.
  • Estudio de ablación: Un experimento en el que se elimina o modifica un componente de un sistema para medir su contribución.
  • Seti de datos retenidos: Un subconjunto de datos mantenido completamente separado de la formación y utilizado únicamente para la evaluación final.

Para obtener explicaciones completas de cualquier concepto en este glosario, navegar en el [Glosario de RCSV]T2) o explorar los artículos de la Biblioteca de Robótica anteriores.