Zurück zu Blog

Annotation der Roboterdaten: Wie man Roboterdemonstrationen für das Training kennzeichnet

Wie man die Demonstrationsdaten von Robotern für die Ausbildung annotert: Erfolgsflaggen, Sprachlabels, Aufgabensegmentierung, Qualitätsstandards, Tools und RCSV-Annotations-Pipeline.

Teil von: [Roboter-Daten-Sammlungsanleitung]

Annotation ist der am wenigsten glamouröse Teil des Roboterdatens und der nachfolgendste. Ein Datensatz von 500 gut annoterten Demonstrationen wird eine bessere Politik als 2.000 schlecht bezeichnetes ausbilden. Hier ist, was Annotation für Roboterdaten bedeutet und wie man es richtig macht.

Was Annotation für Roboterdaten bedeutet

Im Gegensatz zur Bildklassifizierung, bei der Anmerkung bedeutet, dass man Kisten oder Etiketten anzieht, ist die Anmerkung für die Demonstration von Robotern reicher und strukturierter. Eine einzige Roboter-Episode in der Regel 20-200 Sekunden Manipulation muss auf mehreren Ebenen gekennzeichnet werden: war die Episode ein Erfolg oder ein Misserfolg, welche Sprache die Aufgabe beschreibt, wo beginnt und endet semantisch unterschiedliche Phasen, und gibt es irgendwelche Rahmen, die aufgrund von Hardwarefehlern oder Betreiberfehlern aus dem Training ausgeschlossen werden sollten.

Annotation wird typischerweise von menschlichen Kritikern durchgeführt, die Videowiederführungen von aufgezeichneten Episoden neben Plots von Gelenkstaaten und Grifföffnung beobachten.

Annotationsarten: Eine vollständige Taxonomie

Die Roboterdemonstrationsdaten unterstützen eine Reihe von Anmerkungsarten, die jeweils unterschiedliche Abströmszwecke erfüllen.

Annotationen auf Episode-Ebene

Annotation Type Format Required For Cost per Episode
Binary success/failure Boolean flag All IL training (ACT, Diffusion Policy, VLA) $0.05-0.10
Language instruction Free-text string Language-conditioned policies, VLA fine-tuning $0.10-0.25
Task category ID Integer enum Multi-task policies, dataset organization $0.02-0.05
Demonstration quality score 1-5 integer scale Quality-weighted training, dataset curation $0.10-0.20
Object instance IDs List of string IDs Object-centric policies, diversity analysis $0.05-0.10

Annotationen auf Rahmenebene

Annotation Type Format Required For Cost per Frame
Task phase segmentation Timestamped phase boundaries Hierarchical policies, sub-task analysis $0.50-2.00/episode
Contact event labels Timestamped contact start/end Contact-aware policies, force control $0.30-0.80/episode
Object bounding boxes 2D bbox per frame per object Object detection, visual grounding $0.05-0.15/frame
Segmentation masks Per-pixel object mask Semantic segmentation, sim-to-real $0.50-2.50/frame
Keypoint annotations 2D pixel coordinates per keypoint Keypoint-based policies, pose estimation $0.10-0.30/frame
Frame exclusion flags Boolean per frame Removing hardware glitches, operator errors $0.01-0.03/frame

Die meisten Imitations-Lernprojekte benötigen nur die ersten beiden Episode-Level-Annotationen (Success Flag + Language-Instruction) und optional Task-Phase-Segmentierung. Frame-Level-Annotationen wie Segmentierungsmasken und Keypoints sind für spezifische Politikarchitekturen oder Wahrnehmungsvor-Training erforderlich.

Erfolgsflaggen: Die wichtigste Annotation

Jeder Episode eines Roboter-Training-Datensatzes muss mit einer binären Erfolgsflagge gekennzeichnet sein: Hat der Roboter die Aufgabe erfolgreich durchgeführt. Das klingt einfach, aber Erfolgskriterien müssen genau vor Beginn der Anmerkung festgelegt werden. "Platze die Tasse auf die Platte" erfordert eine Spezifikation: muss die Tasse aufrecht sein, spielt die Handgrifforientierung eine Rolle, wie viel Positionsfehler akzeptabel ist? Annotatoren, die unterschiedliche implizite Standards auf denselben Datensatz anwenden, erzeugen laute Etiketten, die die Trainingsleistung schwächen.

Schreiben Sie vor Beginn der Anmerkung ein einseitiges Erfolgs-Spezifikationsdokument mit Beispielsbildern von Erfolg und Misserfolgfällen. Verwenden Sie dieses Dokument, um Anmerker zu kalibrieren. Messen Sie die Vereinbarung zwischen den Anmerkern auf einem geteilten Teilstück Wenn die Vereinbarung unter 90% liegt, benötigen Sie eine Klärung Ihrer Erfolgskriterien. Die Anmerkungen des RCSV-Pipelines erfordern ausdrückliche Erfolgskriteriendokumente und Vereinbarungskontrollen zwischen den Anmerkern, bevor ein Datensatz für die Ausbildung bereit markiert wird.

Automatische Erfolgsklassifizierung

Bei Datenmengen von mehr als 1.000 Episoden wird manuelle Erfolgsmarkierung teuer.

  • Heristische Klassifikatoren: Regelbasierte Kontrollen mit Verwendung des Endgriffzustands, der Position des Endeffektors und der Kraft-/Torkswerte. Beispiel: bei einer Pick-Place-Aufgabe überprüfen Sie, ob der Griff offen (freigelassen) ist und der Endefektor innerhalb von 3 cm von der Zielposition im Endrahmen liegt.
  • Lernte Klassifizierer: Trainieren Sie einen leichten CNN (ResNet-18) auf den letzten 10 Bildern der Handgelenkkamera, um Erfolg/Niederlage vorherzusagen.
  • Human Review: Reserve für die 10-15% der Episoden, in denen automatisierte Klassifizierer unsicher sind (Vertrauen zwischen 0,3 und 0,7). Dieser hybride Ansatz reduziert die Annotationskosten im Vergleich zu vollständiger manueller Kennzeichnung um 5-8x.

Sprachlabels

Sprachanmerkungen befestigen die Beschreibungen der natürlichen Sprache an Episoden oder Episodegmenten. Diese sind erforderlich, um sprachbedingte Richtlinien zu trainieren Richtlinien, die Anweisungen wie "die rote Blöcke hochziehen" befolgen, anstatt die Aufgabe hart zu kodieren. Sprachanmerkungen ermöglichen auch die Kompatibilität mit Modellen für Vision-Language-Action (VLA) und ermöglichen die Suche und Filterung von Datensätzen nach Aufgabenbeschreibung.

Schreiben Sie Sprachanmerkungen auf zwei spezifischen Ebenen: einen kurzen Aufgabennamen ("Cup Placement") und eine natürliche Sprachanweisung ("Pick up the white cup and place it on the blue plate"). Die Anweisung sollte beschreiben, was ein menschlicher Beobachter vor sich geht, nicht den inneren Zustand des Roboters. Wenn Ihre Aufgabe Aufgabenvariationen verschiedene Objekte, verschiedene Zielorte jede Variation sollte eine entsprechende Anweisung haben, die sie von den anderen unterscheidet.

Sprachenannotation Beste Praktiken für VLA-Ausbildung

Wenn Sie planen, [VLA-Modelle] (T1) wie OpenVLA oder RT-2 zu feinen, benötigen Ihre Sprachanmerkungen mehr Sorgfalt als einfache Aufgabenetiketten:

  • Variante Phrasen: Kopieren und Kleben Sie nicht die gleiche Anweisung in allen Episoden. "Holt die rote Tasse hoch" und "Halte die rote Tasse und heben Sie sie auf" lehren das Modell, dass verschiedene Phrasen zu ähnlichen Aktionen führen. Zielen Sie auf 5-10 Anweisungsvarianten pro Aufgabe.
  • Begeben Sie sich mit den folgenden Ausdrücken: "Holt das Objekt links" und nicht nur "Holt die Tasse".
  • ** Beschreiben Sie die vollständige Aktion:** "Holt die rote Tasse vom Tisch und leg sie auf die blaue Platte" ist besser als "Tasche zu Platte". Die vollständigen Anweisungen zeigen die komplette Demonstrationsbahn.
  • Verwenden Sie einheitliche Objektnamen: Entscheiden Sie, ob es sich um einen "Cup", "Mug" oder "Glas" handelt und halten Sie sich an diesen innerhalb eines Datensatzes.

Kontaktetiketten für Gewaltbewusste Politiken

Bei Aufgaben mit signifikanten Kontaktkräften Einfügung, Montage, Oberfläche nach Zeitstempel auf Kontaktereignisetiketten liefern kritische Informationen, die visuelle Anmerkungen nicht erfassen können. Kontaktetiketten markieren den Rahmen, in dem der Roboter Kontakt mit einem Objekt aufnimmt oder aufnimmt, die Art des Kontakts (Anfängerberührung, nachhaltiger Greifung, Einfügungskontakt, Freisetzung) und eventuell die Kontaktkraftgröße eines F/T-Sensors.

Die Kontaktetiketten können mit Hilfe von Kraft-/ Drehmomentsensor-Daten teilweise automatisiert werden: Ein Schwellenmelder auf dem F/T-Signal identifiziert den Kontaktstart (Kraftgröße übersteigt 0,5 N von der Ausgangslinie) und die Freisetzung (Kraft sinkt unterhalb der Schwellenwerte). Die menschliche Überprüfung ist erforderlich, um den Kontakttyp (vorsätzliche Festnahme gegen Kollision) zu klassifizieren und Fälle zu erfassen, in denen der F/T-Schwelle zufällige Kontakte als Aufgabenrelevant falsch klassifiziert.

Aufgabesegmentierung

Bei langzeitigen Aufgaben mit mehreren aufeinanderfolgenden Unteraufgaben markieren Segmentierungsetiketten die Grenzen zwischen den Phasen. Eine Tabellenstellungsaufgabe kann in: Reichweite Cup, Grab Cup, Transport Cup, Place Cup, Release Cup segmentiert werden. Segmentierung ermöglicht hierarchische Politikbildung, Erfolgsmetriken auf Subtask-Ebene und selektive Datenvergrößerung. Es ermöglicht auch chirurgische Fehlerbehebung: Wenn eine Richtlinie während des Transports fehlschlägt, während sie erfasst wird, können Sie mit Segmentierungsetiketten die Erfolgsraten für Unteraufgaben messen und die Datenerhebung dort ansprechen, wo sie am meisten benötigt wird.

Segmentierungsanmerkungen sind teurer als Erfolgsmarkierung und nicht immer notwendig. Priorisieren Sie Segmentierung bei Aufgaben mit drei oder mehr semantisch unterschiedlichen Phasen oder wenn Sie eine hierarchische Politikarchitektur verwenden möchten.

Annotation Vergleiche

Tool License Video Support Time-Series Multi-Camera Sync Best For
Label Studio Apache 2.0 Yes Limited No (single video) General annotation, extensible via templates
V7 (Darwin) Commercial Yes No No Auto-labeling with SAM, managed workforce
CVAT MIT Yes No No Bounding boxes, segmentation masks on video
Custom Gradio/Streamlit Custom Full control Yes Yes (custom build) Robot-specific workflows with joint state plots
RCSV Platform SaaS Yes Yes Yes (native) Purpose-built for robot episodes with all sensors

Die Hauptbeschränkung von Allzweck-Annotationswerkzeugen (Label Studio, CVAT, V7) für Roboterdaten ist, dass sie für Bild-/Video-Annotationen entwickelt wurden, nicht für synchronisierte multimodal-Episode-Annotationen. Die meisten Teams, die ernsthafte Annotations-Pipelines bauen, haben eine benutzerdefinierte Gradio- oder Streamlit-App, die HDF5-Episoden direkt liest.

Annotationskostenbezogene Messwerte

Auf der Grundlage der Anmerkungen des RCSV sind hier realistische Kostenbenchmarks für verschiedene Anmerkungen:

Annotation Configuration Cost per Episode Time per Episode Suitable For
Success flag only (automated + spot-check) $0.05-0.10 5-10 sec ACT, Diffusion Policy (single-task)
Success + language instruction $0.15-0.35 20-40 sec VLA fine-tuning, multi-task BC
Success + language + phase segmentation $0.50-1.50 2-5 min Hierarchical policies, detailed debugging
Full annotation (all above + bboxes) $2.00-5.00 10-20 min Object detection training, perception research
Segmentation masks (per frame, SAM-assisted) $0.50-2.50/frame 30-120 sec/frame Sim-to-real domain adaptation, visual pre-training

Für einen 500-Episode-Datensatz mit Erfolgsflaggen und Sprachanweisungen (die häufigste Konfiguration für VLA-Feinabstimmung) beträgt die Gesamt-Annotationskosten etwa 75-175 USD. Dies ist ein kleiner Bruchteil der Datenerhebungskosten und sollte nie auf geschmäht werden.

Qualitätskontrolle: Vereinbarung zwischen den Anmeldern

Die Inter-Annotator-Vereinbarung (IAA) misst, wie konsequent mehrere Annotatoren dieselben Daten markieren. Für Roboterdaten ist die relevante Metrik Cohen's kappa (für zwei Annotatoren) oder Fleiss' kappa (für drei oder mehr).

Ziel-IAA-Schwellenwerte für Roboterdaten:

  • Binäre Erfolgsetiketten: Kappa > 0,85 (erreichbar mit klarem Erfolgskriterium)
  • Grenzen der Aufgabenphase: Kappa > 0,75 (einige Grenzzweideutigkeiten sind inherent)
  • Demonstrationsqualitätspunkte: Kappa > 0,65 (Qualität ist subjektiver; gewichtete Kappa ist angemessen)

Falls Ihre IAA unter diesen Schwellenwert fallen, müssen die Annotationskriterien vor der Verarbeitung verfeinert werden.

  • Niedrig erfolgreiches Etikettentwurf: Fügen Sie Fotobeispiele von Randfällen zum Erfolgskriteriendokument hinzu. Definieren Sie die genaue Positionstoleranz (z.B. "Objektzentrum innerhalb von 2 cm vom Zielzentrum").
  • Niedrige Segmentierungsabkommen: Definition von Phasenübergangs in Bezug auf beobachtbare physikalische Ereignisse ("Greifer schließt sich an einem Objekt" und nicht "Anschluss der Phasen endet").
  • Niedrige Qualitätsbewertung: Die Skala von 5 auf 3 Ebenen (gut/akzeptabel/ablehnend) zu reduzieren.

Annotation Qualitätsnormen

RCSV wendet für alle Datensätze ein dreistufiges Qualitätsgate an: Selbst-Annotation des Betreibers unmittelbar nach der Aufzeichnung, sekundäre Überprüfung durch einen geschulten Annotator und automatisierte Konsistenzkontrollen, die Annotationen mit gemeinsamen statistischen Daten vergleichen (z. B. erfolgreiche Episoden, bei denen der Griff nicht geschlossen wird, werden für die erneute Überprüfung markiert).

Automatische Konsistenzkontrollen, die häufige Fehler erkennen:

  • Erfolgsbezeichnete Episode, bei der sich der End-Effektor nie mehr als 5 cm von der Startposition bewegt → Flag
  • Erfolgsbezeichnete Episoden kürzer als 50% der mittleren Episodenlänge → Flag
  • Die Sprachanleitung erwähnt "links", aber alle Objekte befinden sich auf der rechten Seite des Arbeitsplatzes → Flag
  • Phasesegmentierung, bei der eine Phase kürzer als 0,5 oder länger als 60 s ist → Flag
  • Zwei angrenzende Episoden mit identischen Sprachanweisungen, aber unterschiedlichen Aufgabenkategorien → Flag

Annotationspipeline des RCSV

Wenn Sie die [Daten-Sammlungsdienste] von RCSV verwenden, ist Anmerkung Teil des Ergebnisses. Unsere Betreiber annoteren jede Episode mit Erfolgsflaggen und Sprachetiketten während der Aufnahme, und unser Anmerkungsteam führt eine sekundäre Überprüfung vor dem Datensatz-Export durch. Sie erhalten einen Datensatz mit hoher Vertrauens-Anmerkungen, Anmerkungsabkommen-Score und einem vollständigen Qualitätsbericht.

Für Teams, die ihre eigenen erhobenen Daten mitbringen, bietet RCSV nur Anmerkungen an:

  • Grundwert ($0,10/Prozess): Erfolgreiche Flaggenüberprüfung und Aufreinigung bestehender Etiketten
  • Standard ($0,30/Piegel): Erfolgsflaggen + Sprachanweisungen + Qualitätsscore
  • ** Vollständig ($1,50/Episode):** Alle Anmerkungen einschließlich Phasensegmentierung und Kontaktetiketten

Wir können vorhandene Datensätze verarbeiten, die auf jeder unterstützten Hardwareplattform (ALOHA, OpenArm, Franka, UR, Unitree) erhoben wurden. Datensätze müssen in HDF5- oder RLDS-Format sein, wobei Video-Streams zur Überprüfung zugänglich sind. Kontaktieren Sie uns um Ihre Datensatz-Annotationsbedürfnisse zu besprechen oder unsere Annotationsoberfläche über die [RCSV-Datenplattform](T5 zu erforschen.

Verwandte Lesungen