Sprachgesteuerte Kontrollrichtlinie
Eine sprachgesteuerte Kontrollrichtlinie nimmt eine natürlichsprachliche Anweisung (z. B. "hebe die rote Tasse auf und stelle sie auf das Tablett") als zusätzliche Eingabe neben visuellen Beobachtungen auf, wodurch ein einzelnes Richtlinien-Netzwerk mehrere zur Laufzeit ausgewählte Aufgaben ausführen kann, ohne neu trainiert zu werden. Sprachsteuerung wird typischerweise durch Kodierung von Anweisungen mit einem vortrainierten Sprachmodell (CLIP, T5, PaLM) und Fusion der resultierenden Einbettung mit Bildmerkmalen implementiert. VLA-Modelle wie RT-2, OpenVLA und pi0 sind von Natur aus sprachgesteuert. Dieser Ansatz reduziert die Notwendigkeit, separate Richtlinien pro Aufgabe zu trainieren, und unterstützt Zero-Shot-Generalisierung auf neuartige Anweisungsformulierungen. Siehe dies in der Praxis: unsere realen Evaluierungen →







