Aprendizaje automático para la robótica: Guía completa para principiantes (2026)
Aprenda cómo el aprendizaje automático alimenta a los robots modernos <unk> aprendizaje por imitación, aprendizaje por refuerzo, política de difusión y cómo comenzar con hardware real.
Cómo el aprendizaje automático impulsa a los robots modernos
¿Por qué el aprendizaje automático para la robótica ahora
Durante décadas, los robots fueron programados con instrucciones explícitas: moverse para coordinar X, apretar el agarre, levantar 30 mm, moverse para coordinar Y. Esto funcionó para entornos de fábrica estructurados donde cada objeto estaba en una posición conocida. Pero falló catastróficamente en entornos no estructurados
El aprendizaje automático cambió esta ecuación permitiendo que los robots aprendieran comportamientos a partir de datos en lugar de reglas escritas a mano. En lugar de programar todos los escenarios posibles, se muestran los ejemplos de robots y se dejan generalizar. El concepto no es nuevo.
Tres descubrimientos que lo hicieron práctico
- Arquitecturas de transformadores aplicadas a la robótica (2022-2024): Los mismos mecanismos de atención que impulsan los modelos de lenguaje grandes resultaron ser notablemente efectivos para procesar secuencias de observación de robots. El trabajo RT-2 de Google, ACT de Stanford y el trabajo de Política de difusión mostraron que los modelos basados en transformadores pueden aprender comportamientos de manipulación complejos de conjuntos de datos relativamente modestos. Este fue un paso de cambio de los enfoques anteriores que requerían millones de muestras de interacción.
- **Modelos de fundación y modelos de visión-lenguaje-acción (2024-2026):**Modelos como OpenVLA, RT-X y Octo demostraron que un solo modelo preentrenado puede generalizarse en diferentes encarnaciones de robots, tareas y entornos. En lugar de entrenar desde cero para cada nueva tarea, se ajusta a un modelo de fundación con unos cientos de demostraciones. Esto redujo el requerimiento de datos de decenas de miles de episodios a cientos de
haciendo práctico el aprendizaje de robots del mundo real para los equipos pequeños. - ** Hardware capaz de pagar:** Una configuración completa de aprendizaje de robots
brazo de 6 DOF con agarre, cámaras de muñeca y computación ahora cuesta menos de $ 5,000 con plataformas como [OpenArm] T0 ) y SO-101. Hace cinco años, la configuración equivalente requería $ 50,000 + de hardware industrial. La reducción de costos abrió la investigación de robots ML a laboratorios universitarios, startups y profesionales individuales que previamente no podían pagar el hardware.
El resultado: en 2026, un estudiante de posgrado o un ingeniero de startup puede entrenar a un robot para realizar una nueva tarea de manipulación en un fin de semana utilizando el aprendizaje imitativo con 50-200 demostraciones. Eso fue ciencia ficción hace cinco años. Esta guía cubre los enfoques, herramientas y pasos prácticos para llegar allí.
Los cuatro enfoques principales del robot ML
El aprendizaje automático de robots no es una sola técnica. Hay cuatro grandes familias de enfoques, cada uno con diferentes fortalezas, requisitos de datos y casos de uso.
| Approach | How It Works | Data Needed | Best For | Limitations |
|---|---|---|---|---|
| Aprendizaje por Imitación | Robot learns from human demonstrations (teleoperation recordings) | 50-500 demonstrations per task | Manipulación tasks with clear human strategy: pick-and-place, assembly, tool use | Cannot exceed demonstrator skill; struggles with tasks requiring exploration |
| Reinforcement Learning | Robot learns by trial and error, maximizing a reward signal | Millions of trials (usually in simulation) | Locomotion, dynamic tasks, behaviors that exceed human capability | Requires careful reward design; sample-inefficient; sim-to-real gap |
| Transferencia Simulación-Realidad | Train in simulation, transfer learned policy to real robot | Unlimited (simulated), plus domain randomization | Tasks where simulation is accurate: locomotion, grasping simple shapes, navigation | Reality gap for contact-rich manipulation; sim fidelity limits policy quality |
| Foundation Models / VLAs | Large pretrained models fine-tuned for robot control using vision and language | 10-100 demonstrations for fine-tuning (pretrained on millions of diverse robot episodes) | General-purpose manipulation, language-conditioned tasks, multi-task robots | Compute-heavy inference; still maturing; may not match specialist policies on specific tasks |
Para la mayoría de los principiantes, el aprendizaje por imitación es el punto de partida adecuado. Tiene la barrera de entrada más baja, produce políticas de trabajo más rápidamente y desarrolla las habilidades de recopilación y evaluación de datos que necesitará independientemente de en qué enfoque se especialice.
Inmersión profunda: aprender por imitación
El aprendizaje por imitación (también llamado aprendizaje por demostración) es el enfoque más práctico para conseguir que un robot realice una nueva tarea de manipulación. La idea principal: un humano teleopera el robot a través del comportamiento deseado muchas veces, y el robot aprende un mapeo de las observaciones (imágenes de la cámara, posiciones conjuntas) a las acciones (comando de velocidad o posición conjunta) mediante la formación en esas demostraciones.
Cloning de comportamiento
La forma más simple de aprendizaje de imitación es la clonación conductual (BC): trate el problema como aprendizaje supervisado. Recoge trayectorias de demostración (secuencias de pares de observación-acción), luego entrena una red neuronal para predecir la acción dada a la observación. En el momento de la inferencia, el robot observa el estado actual, lo alimenta a través de la red entrenada y ejecuta la acción prevista.
La clonación conductual es fácil de implementar y rápida de entrenar, pero tiene un defecto fundamental: el error de composición. Si el robot se desvía ligeramente de la trayectoria demostrada (y siempre lo hace), se encuentra con observaciones que nunca vio durante el entrenamiento, lo que lleva a predicciones cada vez más pobres. Esta es la razón por la que la clonación conductual ingenuo a menudo falla en tareas de largo horizonte. Las siguientes soluciones abordan este problema.
ACT (Acción de la pieza con transformadores)
ACT, introducido por Tony Zhao et al. en Stanford en 2023, aborda el error de composición prediciendo trozos de acciones futuras en lugar de acciones de paso siguiente. El modelo toma una secuencia de observaciones y produce los próximos 50-100 pasos de acción en un pase hacia adelante. Este "cumplimiento de acción" significa que el robot se compromete a un segmento de trayectoria, reduciendo la frecuencia en la que se acumulan errores de predicción.
ACT utiliza un codificador transformador para procesar el historial de observación y un CVAE (Conditional Variational Codificador Automático) para manejar la multimodalidad de las demostraciones
Para un tratamiento más profundo, vea nuestra [guía de aprendizaje de imitación]
Política de difusión
La Política de difusión, introducida por Cheng Chi et al. en Columbia en 2023, aplica el marco de difusión denociante (la misma idea central detrás de modelos de generación de imágenes como la difusión estable) a la predicción de la acción de los robots. En lugar de predecir directamente las acciones, el modelo aprende a denociar iterativamente una secuencia de acción aleatoria en una trayectoria coherente condicionada a la observación actual.
La ventaja de la generación de acción basada en la difusión es que maneja las distribuciones de acción multimodal de manera natural. Cuando hay múltiples formas válidas de realizar una tarea (pick desde el lado izquierdo o derecho, enfoque desde arriba o el lado), los modelos de difusión representan esta incertidumbre explícitamente en lugar de promediar, lo que produce un comportamiento robótico más suave y natural. La política de difusión logra un rendimiento de vanguardia en muchos puntos de referencia de manipulación y es particularmente eficaz para tareas ricas en contactos como la inserción, limpieza y plegado.
La diferencia es la velocidad de inferencia: generar acciones a través de desinfección iterativa requiere 5-20 pases hacia adelante por pieza de acción, en comparación con un solo pase hacia adelante para ACT. En las GPU modernas esto se ejecuta a 10-30 Hz, lo que es adecuado para la mayoría de las manipulaciones, pero puede ser limitante para tareas de alta velocidad.
Inmersión profunda: aprendizaje reforzado
El aprendizaje de refuerzo (RL) adopta un enfoque fundamentalmente diferente: en lugar de mostrarle al robot qué hacer, se define una función de recompensa que mide qué tan bien está haciendo el robot, y le permite descubrir comportamientos efectivos a través de ensayos y errores.
Algorithms clave: PPO y SAC
**PPO (Proximal Policy Optimization) ** es el algoritmo RL más utilizado para la robótica. Desarrollado por OpenAI, PPO es un método de gradiente de políticas que limita las actualizaciones de políticas para evitar caídas catastróficas en el rendimiento. Es estable, relativamente fácil de ajustar y funciona bien tanto para espacios de acción continuos como discretos. PPO es el algoritmo detrás de la mayoría de las impresionantes demostraciones de locomoción cuadrangulares (caminar, correr, parkour) de compañías como Unitree y el equipo de investigación de Boston Dynamics.
**SAC (Soft Actor-Critic) ** es un algoritmo fuera de la política que maximiza tanto la recompensa como la entropía (randomidad) en la política. El bono de entropía fomenta la exploración y produce políticas robustas para las perturbaciones. SAC es más eficiente en muestras que PPO para muchas tareas porque reutiliza la experiencia pasada de un buffer de replay. Es particularmente eficaz para las tareas de manipulación entrenadas en simulación.
Cuándo usar RL vs aprendizaje por imitación
RL se destaca en tareas en las que:
- El comportamiento óptimo es difícil de demostrar para los humanos (tirar dinámico, reorientarse en la mano, locomoción ágil)
- Quieres que el robot descubra estrategias que exceden las capacidades humanas
- Tienes un ambiente de simulación confiable donde el robot puede ejecutar millones de episodios
- La función de recompensa es sencilla de definir (alcanzar el objetivo, mantener el equilibrio, maximizar la distancia)
RL lucha cuando:
- La función de recompensa es difícil de especificar con precisión (¿qué se parece a "doblar una camisa bien" como una recompensa escalar?)
- La tarea requiere manipulación rica en contactos donde la precisión de la simulación es pobre
- Necesita una política de trabajo rápida (la capacitación de RL normalmente toma de horas a días de tiempo de GPU)
- No tiene un buen entorno de simulación y debe entrenarse en hardware real (la eficiencia de las muestras es insuficiente para la mayoría de las RL del mundo real)
Ambientes de simulación: Isaac Sim y MuJoCo
NVIDIA Isaac Sim es un simulador de física acelerado por GPU construido en Omniverse. Su ventaja clave es el paralelismo masivo: Isaac Sim puede ejecutar miles de entornos de robots simultáneamente en una sola GPU, generando millones de muestras de experiencia por hora. Esto lo convierte en la plataforma preferida para el entrenamiento RL de las políticas de locomoción y manipulación. Isaac Sim también proporciona una representación fotorrealista para la transferencia visual sim-to-real e integración nativa con Isaac Gym para el entrenamiento RL.
MuJoCo (Dynamics Multi-Joint with Contact) **, ahora de código abierto bajo DeepMind, es el motor de física más utilizado en la investigación de aprendizaje de robots. MuJoCo es rápido, numéricamente estable y produce dinámicas de contacto precisas para tareas de manipulación. Se ejecuta en CPU (y cada vez más GPU a través de MJX), se integra con todos los principales marcos RL, y tiene el mayor ecosistema de modelos de robots preconstruidos y tareas de referencia. Para los principiantes, MuJoCo es a menudo el punto de partida más fácil debido a su extensa documentación y la disponibilidad de tareas de referencia estandarizadas (entornos de robótica del gimnasio).
Requisitos de datos: ¿Cuánto es suficiente?
La pregunta más común que hacen los principiantes es "¿cuántas demostraciones necesito?" La respuesta honesta depende del enfoque, la complejidad de las tareas y la arquitectura del modelo.
Requisitos de datos para imitar el aprendizaje
- Pickup y colocación simple de un solo brazo (objetos fijos, posiciones fijas): 20 a 50 demostraciones.
- Posiciones aleatorias y lugares variables: 100-200 demostraciones.
- ** Manipulación rica en contactos (inserción, limpieza, plegado):** 200-500 demostraciones. Estas tareas tienen regiones de éxito estrechas donde los errores pequeños causan fallas, lo que requiere una cobertura de datos más densa.
- Tascas de múltiples pasos (secuencias de montaje, pasos de cocción): 300-1000 demostraciones.
Lo que hace buenos datos de entrenamiento de robots
No todas las demostraciones son igualmente valiosas.
- Diversidad en volumen: 100 demostraciones con posiciones, iluminación y ángulos de aproximación de objetos variados entrenan mejor que 500 demostraciones que se ven todas iguales.
- Calidad constante: Eliminar demostraciones fallidas, episodios de vacilación y demostraciones en las que el operador cometió y corrigió errores en mitad de la tarea.
- ** Distribución coincidente:** Los datos de entrenamiento deben coincidir con las condiciones que el robot se enfrentará en el despliegue.
- Cobreza de múltiples cámaras: Dos o tres ángulos de cámara (muñeca + cabeza, o muñeca + lado + cabeza) mejoran significativamente el rendimiento de la política en comparación con una sola cámara.
- ** Sincronización adecuada:** Los marcos de la cámara, los estados conjuntos y los comandos de acción deben alinearse temporalmente. Incluso 50 ms de dessincronización degrada el rendimiento. Utilice marcas de tiempo de hardware, no los tiempos de llegada del software.
Para obtener una guía detallada sobre la recopilación de datos de robots de alta calidad, consulte nuestra guía de recopilación de datos de robots.
Cuadro y herramientas clave
No es necesario que todo se construya desde cero. Estos marcos proporcionan implementaciones probadas de los algoritmos e infraestructura que necesita.
LeRobot (cara de abrazo)
LeRobot es el marco más amigable para principiantes para el aprendizaje de imitación de robots. Desarrollado por Hugging Face, proporciona herramientas de extremo a extremo: scripts de recopilación de datos para los brazos comunes de los robots, gestión de conjuntos de datos con formatos estandarizados, implementaciones de capacitación de ACT y Política de difusión y utilidades de evaluación. LeRobot se integra con el Hub Hugging Face para compartir conjuntos de datos y distribución de modelos. Si está comenzando su primer proyecto de ML robot, LeRobot es el punto de partida recomendado.
RoboMimic (Stanford)
RoboMimic es un marco de investigación para estudiar algoritmos de aprendizaje de imitación. Proporciona benchmarks de simulación estandarizados, múltiples implementaciones de algoritmos de BC (BC-RNN, HBC, IRIS) y protocolos de evaluación cuidadosos. RoboMimic es menos llave en mano que LeRobot para el despliegue de robots reales, pero es el marco de referencia estándar citado en la mayoría de los artículos de aprendizaje de imitación. Utilice RoboMimic cuando desee comparar rigurosamente las variantes del algoritmo o reproducir los resultados publicados.
ROS2 (Sistema Operativo de Robótico 2)
ROS2 es el middleware de facto para software de robots. Maneja la comunicación entre sensores, actuadores y nodos de computación a través de un sistema de mensajes public-subscribe. ROS2 no es un marco de ML, sino que es el pegamento que conecta su política de ML al hardware de robots reales. Necesitas ROS2 (o una alternativa más simple como la comunicación serial/USB directa) para enviar comandos de acción a los motores y recibir datos de observación de cámaras y codificadores.
NVIDIA Isaac Sim
Isaac Sim proporciona simulación acelerada por GPU tanto para el entrenamiento de RL como para la generación de datos sintéticos. Su ejecución en entorno paralelo hace que el entrenamiento de RL sea factible a la escala requerida (millones de episodios). Isaac Sim también admite la aleatorización de dominios
Líneas de base estables3
Stable Baselines3 (SB3) es una biblioteca PyTorch que proporciona implementaciones fiables de algoritmos estándar de RL: PPO, SAC, TD3, A2C y DQN. SB3 está diseñado para la facilidad de uso. Es el punto de partida recomendado para aprender conceptos de RL antes de pasar a marcos más especializados como Isaac Gym o rl_games para la formación de RL en producción.
El hardware para comenzar
Necesitas un robot para hacer ML robot. Aquí hay tres opciones de hardware a diferentes precios, cada uno con un ecosistema probado para el aprendizaje y el desarrollo.
OpenArm (Budget: 2.000 a 4.000 dólares)
[OpenArm]
SO-101 (Ordenamiento: entre 500 y 1.000 dólares)
El SO-101 (también conocido como SO-100 y sus variantes) es un brazo de 6 DOF de bajo costo construido a partir de motores de servo de materias primas y componentes impresos en 3D. Un par completo de líderes y seguidores cuesta menos de $1.000. El SO-101 se ha convertido en el brazo más popular para los proyectos de la comunidad LeRobot debido a su bajo costo y la extensa documentación de Hugging Face. La compensación es una menor precisión, capacidad de carga útil y calidad de construcción en comparación con OpenArm o armas comerciales.
Franka FR3 (Budget: 25.000-35.000 dólares)
El Franka Emika FR3 (anteriormente Panda) es el brazo robótico de grado de investigación más utilizado en laboratorios académicos de ML. Ofrece 7-DOF con excelente detección de par, repetibilidad sub-milimétrica y integración nativa con ROS2 y MuJoCo. El FR3 es el brazo utilizado en muchos documentos históricos (ACT, Política de difusión, RT-X). Si usted está en una universidad o una empresa emergente bien financiada que realiza investigaciones publicadas, la FR3 es la plataforma estándar.
Desglose presupuestario para una instalación completa
| Component | Budget Option | Mid-Range Option | Research-Grade |
|---|---|---|---|
| Robot arm + gripper | SO-101 pair: $800 | OpenArm: $3,500 | Franka FR3: $30,000 |
| Cameras (2-3x) | Logitech C920: $150 | RealSense D405: $600 | RealSense D435i: $900 |
| Compute (training) | Cloud GPU rental: $50/mo | RTX 4070 workstation: $1,800 | RTX 4090 workstation: $3,500 |
| Compute (inference) | Laptop with GPU: $0 (existing) | Same as training: $0 | Dedicated inference PC: $2,000 |
| Total | ~$1,000 + cloud | ~$6,000 | ~$36,000 |
Caminos de aprendizaje: desde cero hasta la política implementada
Aquí hay un plan de estudios de cuatro etapas que te lleva desde los fundamentos hasta la implementación de una política entrenada en hardware real.
Fase 1: Fundamentos (2-4 semanas)
Antes de tocar un robot, construye sus bases de ML:
- Aprenda los conceptos básicos de PyTorch: tensores, autograd, circuitos de entrenamiento, patrones de conjunto de datos/cargador de datos.
- Comprender las redes neuronales convolucionales (CNN) para el procesamiento de imágenes
las cámaras de su robot producen imágenes que la política debe procesar. - Aprenda la arquitectura de transformadores a nivel conceptual: atención, codificación posicional, procesamiento de secuencias. No es necesario implementar un transformador desde cero, sino que debe entender lo que hace.
- Lea el documento original de ACT (Zhao et al., 2023) y el documento de Política de Difusión (Chi et al., 2023).
Fase 2: Simulación (2-4 semanas)
Practica en la simulación antes de tocar el hardware real. La simulación no cuesta nada y puedes experimentar libremente.
- Instalar MuJoCo y ejecutar los entornos de robótica estándar del gimnasio (FetchReach, FetchPush, FetchPickAndPlace).
- Entrenar una política de RL básica usando las bases estables 3 en FetchReach. Esto te enseña el ciclo de entrenamiento de RL sin ninguna complejidad de hardware.
- Utilice RoboMimic para ejecutar un experimento de clonación conductual en las tareas de elevación y puesta. Esto le enseña la línea de aprendizaje de imitación: carga de conjuntos de datos, capacitación de modelos, evaluación.
- Experimentar con hiperparámetros: velocidad de aprendizaje, tamaño de lote, número de épocas de entrenamiento, tamaño de pieza de acción. Desarrollar la intuición de lo que afecta el rendimiento.
Etapa 3: Hardware real (4-8 semanas)
Ahora transfiere sus habilidades a un robot físico:
- Configure su brazo robótico (OpenArm, SO-101, o lo que tenga acceso a) con LeRobot.
- Recoge 50 demostraciones de teleoperación de una simple tarea de pick-and-place.
- Entrenar una política de ACT sobre sus datos recopilados utilizando los guiones de entrenamiento de LeRobot.
- Evaluar la política del robot real, medir la tasa de éxito en 20 ensayos, es probable que obtenga un éxito del 40 al 70% en su primer intento.
- Iterar: recoger más demostraciones dirigidas a los modos de falla que observaste, retratar y reevaluar. El objetivo es comprender el ciclo de recopilación de datos → entrenamiento → evaluación en profundidad.
Etapa 4: Despliegue y generalización (en curso)
Avance a tareas más difíciles y un despliegue robusto:
- Prueba tareas más complejas: montaje en múltiples pasos, manipulación bimanual, tareas con objetos variables.
- Experimentar con la política de difusión y comparar los resultados con ACT en la misma tarea y conjunto de datos.
- Explorar el ajuste del modelo de base: utilizar un modelo VLA pre-entrenado y ajustar su tarea con menos demostraciones.
- Trabajar en la robustez: probar su política bajo diferentes iluminaciones, con objetos invisibles y después de perturbaciones físicas.
- Contribuir de nuevo: compartir sus conjuntos de datos en Hugging Face, publicar sus resultados y participar en las comunidades RCSV y LeRobot.
6 Errores comunes que cometen los principiantes
Vemos estos errores repetidamente de los equipos que comienzan su viaje de ML robot.
1. Salta de la calidad de los datos por la cantidad de datos
El error: Recoger cientos de demostraciones descuidadas porque "más datos siempre es mejor".
** La solución:** Curar sin piedad. Eliminar cualquier demostración en la que el operador vacila, cometa un error o utiliza una estrategia inconsistente. 100 demostraciones limpias superan consistentemente a 500 demostraciones ruidosas.
2. Formación sin rigor de evaluación
El error: Entrenar una política, ejecutarla en el robot varias veces, ver que funciona una vez y decir que se ha hecho.
** La solución:** Evaluar cada política en un mínimo de 20 implementaciones con condiciones iniciales aleatorias. Informar la tasa de éxito como X/20, no "funciona".
3. Ignorando la colocación de la cámara
El error: Colocar las cámaras donde sea conveniente en lugar de donde proporcionen la información más útil.
** La solución:** Utilice una cámara montada en la muñeca (que proporciona una visión de cerca de la manipulación) más una cámara superior o lateral (que proporciona un contexto global).
4. Complicación excesiva de la primera tarea
El error: Intentar aprender una compleja tarea de varios pasos como su primer proyecto. Cuando la política falla (y lo hará), no puede diagnosticar si el problema es el algoritmo, los datos, el hardware o la complejidad de la tarea.
** La solución:** Comience con un solo paso de pick-and-place de un solo objeto. Haz que funcione confiablemente (> 90% éxito). Luego añada complejidad incrementalmente: múltiples objetos, posiciones variadas, secuencias más largas. Cada incremento le dice exactamente lo que se rompió.
5. Desarrollo del espacio de acción
El error: Usar acciones de espacio conjunto cuando las acciones de espacio cartesiano serían más naturales, o viceversa. Usar posiciones absolutas cuando las acciones delta (incremental) producirían un movimiento más suave.
La solución: Para la mayoría de las tareas de manipulación, el control de posición del efecto final delta (cartesiano dx, dy, dz + agarre abierto/cerrado) es el espacio de acción más fácil de aprender.
6. No coinciden las condiciones de trenes y de despliegue
El error: Recopilar datos de formación con un conjunto de condiciones de iluminación, posiciones de la cámara y superficies de la mesa, luego implementar la política en un entorno diferente y preguntarse por qué falla.
La solución: Implemente en las mismas condiciones en las que se ha entrenado o cambie deliberadamente las condiciones durante la recopilación de datos para aumentar la robustez.
Recursos esenciales
Los documentos clave
- ACT
Aprendizaje de la manipulación bimanual de granos con hardware de bajo costo (Zhao et al., 2023): introducción de la acción de la pieza de pieza con transformadores y la plataforma de hardware ALOHA. El documento fundamental para el aprendizaje de imitación moderno. - ** Política de difusión
Aprendizaje de políticas visuales a través de la difusión de acción** (Chi et al., 2023): Modelos de difusión aplicados para la predicción de la acción de los robots. Estado de la técnica en muchos puntos de referencia de manipulación. - RT-X
Open X-Embodiment: Datasets de aprendizaje robótico y modelos de RT-X (Open X-Embodiment Collaboration, 2024): Aprendizaje demostrado de transferencia transversal de cuerpos utilizando datos de 22 plataformas robóticas. - OpenVLA
Un modelo de visión-lenguaje-acción de código abierto (Kim et al., 2024): Un modelo de VLA de peso abierto que puede ser ajustado para tareas específicas de robots.
Cursos y tutoriales
- CS 224R: Aprendizaje de refuerzo profundo (Stanford, disponible en YouTube): Cobertura integral a nivel de posgrado de la RL para la robótica.
- ** Tutorial de inicio de LeRobot** (documentación de cara en brazos): Guía paso a paso para recopilar datos y entrenar su primera política con LeRobot.
- ** Spinning Up in Deep RL** (OpenAI): excelente introducción autónoma a los algoritmos de RL con implementaciones claras.
- ** Tutoriales MuJoCo** (documentación DeepMind): Fundamentos de simulación de física para la investigación del aprendizaje de robots.
Comunidad
- Comunidad de RCSV: Únete a la Academia de RCSV para realizar talleres prácticos, acceder al hardware compartido y una comunidad de profesionales de la robótica de ML en el Área de la Bahía.
- LeRobot Discord: Comunidad activa para los usuarios de LeRobot que comparten conjuntos de datos, soluciones de problemas e ideas de proyectos.
- Echange de pilas de robótica: Preguntas y respuestas para preguntas técnicas de robótica.
Comience su viaje en el RCSV
RCSV proporciona acceso a hardware de robots, capacitación práctica y una comunidad de profesionales para acelerar su aprendizaje. Desde su primera política de selección y ubicación hasta el despliegue de producción, podemos ayudar.







