Política Condicionada por Lenguaje
Una política condicionada por lenguaje toma una instrucción en lenguaje natural (p. ej., "recoge la taza roja y colócala en la bandeja") como entrada adicional junto con observaciones visuales, permitiendo que una única red de política realice múltiples tareas seleccionadas en tiempo de ejecución sin reentrenamiento. El condicionamiento por lenguaje se implementa típicamente codificando instrucciones con un modelo de lenguaje preentrenado (CLIP, T5, PaLM) y fusionando la incrustación resultante con características de imagen. Los modelos VLA como RT-2, OpenVLA y pi0 están condicionados por lenguaje por diseño. Este enfoque reduce la necesidad de entrenar políticas separadas por tarea y respalda generalización de cero disparos a formulaciones de instrucciones novedosas. Véalo en la práctica: nuestras evaluaciones en el mundo real →







