Annotation der Roboterdaten: Wie man Roboterdemonstrationen für das Training kennzeichnet
Wie man die Demonstrationsdaten von Robotern für die Ausbildung annotert: Erfolgsflaggen, Sprachlabels, Aufgabensegmentierung, Qualitätsstandards, Tools und RCSV-Annotations-Pipeline.
Teil von: [Roboter-Daten-Sammlungsanleitung]
Annotation ist der am wenigsten glamouröse Teil des Roboterdatens und der nachfolgendste. Ein Datensatz von 500 gut annoterten Demonstrationen wird eine bessere Politik als 2.000 schlecht bezeichnetes ausbilden. Hier ist, was Annotation für Roboterdaten bedeutet und wie man es richtig macht.
Was Annotation für Roboterdaten bedeutet
Im Gegensatz zur Bildklassifizierung, bei der Anmerkung bedeutet, dass man Kisten oder Etiketten anzieht, ist die Anmerkung für die Demonstration von Robotern reicher und strukturierter. Eine einzige Roboter-Episode
Annotation wird typischerweise von menschlichen Kritikern durchgeführt, die Videowiederführungen von aufgezeichneten Episoden neben Plots von Gelenkstaaten und Grifföffnung beobachten.
Annotationsarten: Eine vollständige Taxonomie
Die Roboterdemonstrationsdaten unterstützen eine Reihe von Anmerkungsarten, die jeweils unterschiedliche Abströmszwecke erfüllen.
Annotationen auf Episode-Ebene
| Annotation Type | Format | Required For | Cost per Episode |
|---|---|---|---|
| Binary success/failure | Boolean flag | All IL training (ACT, Diffusion Policy, VLA) | $0.05-0.10 |
| Language instruction | Free-text string | Language-conditioned policies, VLA fine-tuning | $0.10-0.25 |
| Task category ID | Integer enum | Multi-task policies, dataset organization | $0.02-0.05 |
| Demonstration quality score | 1-5 integer scale | Quality-weighted training, dataset curation | $0.10-0.20 |
| Object instance IDs | List of string IDs | Object-centric policies, diversity analysis | $0.05-0.10 |
Annotationen auf Rahmenebene
| Annotation Type | Format | Required For | Cost per Frame |
|---|---|---|---|
| Task phase segmentation | Timestamped phase boundaries | Hierarchical policies, sub-task analysis | $0.50-2.00/episode |
| Contact event labels | Timestamped contact start/end | Contact-aware policies, force control | $0.30-0.80/episode |
| Object bounding boxes | 2D bbox per frame per object | Object detection, visual grounding | $0.05-0.15/frame |
| Segmentation masks | Per-pixel object mask | Semantic segmentation, sim-to-real | $0.50-2.50/frame |
| Keypoint annotations | 2D pixel coordinates per keypoint | Keypoint-based policies, pose estimation | $0.10-0.30/frame |
| Frame exclusion flags | Boolean per frame | Removing hardware glitches, operator errors | $0.01-0.03/frame |
Die meisten Imitations-Lernprojekte benötigen nur die ersten beiden Episode-Level-Annotationen (Success Flag + Language-Instruction) und optional Task-Phase-Segmentierung. Frame-Level-Annotationen wie Segmentierungsmasken und Keypoints sind für spezifische Politikarchitekturen oder Wahrnehmungsvor-Training erforderlich.
Erfolgsflaggen: Die wichtigste Annotation
Jeder Episode eines Roboter-Training-Datensatzes muss mit einer binären Erfolgsflagge gekennzeichnet sein: Hat der Roboter die Aufgabe erfolgreich durchgeführt. Das klingt einfach, aber Erfolgskriterien müssen genau vor Beginn der Anmerkung festgelegt werden. "Platze die Tasse auf die Platte" erfordert eine Spezifikation: muss die Tasse aufrecht sein, spielt die Handgrifforientierung eine Rolle, wie viel Positionsfehler akzeptabel ist? Annotatoren, die unterschiedliche implizite Standards auf denselben Datensatz anwenden, erzeugen laute Etiketten, die die Trainingsleistung schwächen.
Schreiben Sie vor Beginn der Anmerkung ein einseitiges Erfolgs-Spezifikationsdokument mit Beispielsbildern von Erfolg und Misserfolgfällen. Verwenden Sie dieses Dokument, um Anmerker zu kalibrieren. Messen Sie die Vereinbarung zwischen den Anmerkern auf einem geteilten Teilstück
Automatische Erfolgsklassifizierung
Bei Datenmengen von mehr als 1.000 Episoden wird manuelle Erfolgsmarkierung teuer.
- Heristische Klassifikatoren: Regelbasierte Kontrollen mit Verwendung des Endgriffzustands, der Position des Endeffektors und der Kraft-/Torkswerte. Beispiel: bei einer Pick-Place-Aufgabe überprüfen Sie, ob der Griff offen (freigelassen) ist und der Endefektor innerhalb von 3 cm von der Zielposition im Endrahmen liegt.
- Lernte Klassifizierer: Trainieren Sie einen leichten CNN (ResNet-18) auf den letzten 10 Bildern der Handgelenkkamera, um Erfolg/Niederlage vorherzusagen.
- Human Review: Reserve für die 10-15% der Episoden, in denen automatisierte Klassifizierer unsicher sind (Vertrauen zwischen 0,3 und 0,7). Dieser hybride Ansatz reduziert die Annotationskosten im Vergleich zu vollständiger manueller Kennzeichnung um 5-8x.
Sprachlabels
Sprachanmerkungen befestigen die Beschreibungen der natürlichen Sprache an Episoden oder Episodegmenten. Diese sind erforderlich, um sprachbedingte Richtlinien zu trainieren
Schreiben Sie Sprachanmerkungen auf zwei spezifischen Ebenen: einen kurzen Aufgabennamen ("Cup Placement") und eine natürliche Sprachanweisung ("Pick up the white cup and place it on the blue plate"). Die Anweisung sollte beschreiben, was ein menschlicher Beobachter vor sich geht, nicht den inneren Zustand des Roboters. Wenn Ihre Aufgabe Aufgabenvariationen
Sprachenannotation Beste Praktiken für VLA-Ausbildung
Wenn Sie planen, [VLA-Modelle] (
- Variante Phrasen: Kopieren und Kleben Sie nicht die gleiche Anweisung in allen Episoden. "Holt die rote Tasse hoch" und "Halte die rote Tasse und heben Sie sie auf" lehren das Modell, dass verschiedene Phrasen zu ähnlichen Aktionen führen. Zielen Sie auf 5-10 Anweisungsvarianten pro Aufgabe.
- Begeben Sie sich mit den folgenden Ausdrücken: "Holt das Objekt links" und nicht nur "Holt die Tasse".
- ** Beschreiben Sie die vollständige Aktion:** "Holt die rote Tasse vom Tisch und leg sie auf die blaue Platte" ist besser als "Tasche zu Platte". Die vollständigen Anweisungen zeigen die komplette Demonstrationsbahn.
- Verwenden Sie einheitliche Objektnamen: Entscheiden Sie, ob es sich um einen "Cup", "Mug" oder "Glas" handelt und halten Sie sich an diesen innerhalb eines Datensatzes.
Kontaktetiketten für Gewaltbewusste Politiken
Bei Aufgaben mit signifikanten Kontaktkräften
Die Kontaktetiketten können mit Hilfe von Kraft-/ Drehmomentsensor-Daten teilweise automatisiert werden: Ein Schwellenmelder auf dem F/T-Signal identifiziert den Kontaktstart (Kraftgröße übersteigt 0,5 N von der Ausgangslinie) und die Freisetzung (Kraft sinkt unterhalb der Schwellenwerte). Die menschliche Überprüfung ist erforderlich, um den Kontakttyp (vorsätzliche Festnahme gegen Kollision) zu klassifizieren und Fälle zu erfassen, in denen der F/T-Schwelle zufällige Kontakte als Aufgabenrelevant falsch klassifiziert.
Aufgabesegmentierung
Bei langzeitigen Aufgaben mit mehreren aufeinanderfolgenden Unteraufgaben markieren Segmentierungsetiketten die Grenzen zwischen den Phasen. Eine Tabellenstellungsaufgabe kann in: Reichweite Cup, Grab Cup, Transport Cup, Place Cup, Release Cup segmentiert werden. Segmentierung ermöglicht hierarchische Politikbildung, Erfolgsmetriken auf Subtask-Ebene und selektive Datenvergrößerung. Es ermöglicht auch chirurgische Fehlerbehebung: Wenn eine Richtlinie während des Transports fehlschlägt, während sie erfasst wird, können Sie mit Segmentierungsetiketten die Erfolgsraten für Unteraufgaben messen und die Datenerhebung dort ansprechen, wo sie am meisten benötigt wird.
Segmentierungsanmerkungen sind teurer als Erfolgsmarkierung und nicht immer notwendig. Priorisieren Sie Segmentierung bei Aufgaben mit drei oder mehr semantisch unterschiedlichen Phasen oder wenn Sie eine hierarchische Politikarchitektur verwenden möchten.
Annotation Vergleiche
| Tool | License | Video Support | Time-Series | Multi-Camera Sync | Best For |
|---|---|---|---|---|---|
| Label Studio | Apache 2.0 | Yes | Limited | No (single video) | General annotation, extensible via templates |
| V7 (Darwin) | Commercial | Yes | No | No | Auto-labeling with SAM, managed workforce |
| CVAT | MIT | Yes | No | No | Bounding boxes, segmentation masks on video |
| Custom Gradio/Streamlit | Custom | Full control | Yes | Yes (custom build) | Robot-specific workflows with joint state plots |
| RCSV Platform | SaaS | Yes | Yes | Yes (native) | Purpose-built for robot episodes with all sensors |
Die Hauptbeschränkung von Allzweck-Annotationswerkzeugen (Label Studio, CVAT, V7) für Roboterdaten ist, dass sie für Bild-/Video-Annotationen entwickelt wurden, nicht für synchronisierte multimodal-Episode-Annotationen. Die meisten Teams, die ernsthafte Annotations-Pipelines bauen, haben eine benutzerdefinierte Gradio- oder Streamlit-App, die HDF5-Episoden direkt liest.
Annotationskostenbezogene Messwerte
Auf der Grundlage der Anmerkungen des RCSV sind hier realistische Kostenbenchmarks für verschiedene Anmerkungen:
| Annotation Configuration | Cost per Episode | Time per Episode | Suitable For |
|---|---|---|---|
| Success flag only (automated + spot-check) | $0.05-0.10 | 5-10 sec | ACT, Diffusion Policy (single-task) |
| Success + language instruction | $0.15-0.35 | 20-40 sec | VLA fine-tuning, multi-task BC |
| Success + language + phase segmentation | $0.50-1.50 | 2-5 min | Hierarchical policies, detailed debugging |
| Full annotation (all above + bboxes) | $2.00-5.00 | 10-20 min | Object detection training, perception research |
| Segmentation masks (per frame, SAM-assisted) | $0.50-2.50/frame | 30-120 sec/frame | Sim-to-real domain adaptation, visual pre-training |
Für einen 500-Episode-Datensatz mit Erfolgsflaggen und Sprachanweisungen (die häufigste Konfiguration für VLA-Feinabstimmung) beträgt die Gesamt-Annotationskosten etwa 75-175 USD. Dies ist ein kleiner Bruchteil der Datenerhebungskosten und sollte nie auf
Qualitätskontrolle: Vereinbarung zwischen den Anmeldern
Die Inter-Annotator-Vereinbarung (IAA) misst, wie konsequent mehrere Annotatoren dieselben Daten markieren. Für Roboterdaten ist die relevante Metrik Cohen's kappa (für zwei Annotatoren) oder Fleiss' kappa (für drei oder mehr).
Ziel-IAA-Schwellenwerte für Roboterdaten:
- Binäre Erfolgsetiketten: Kappa > 0,85 (erreichbar mit klarem Erfolgskriterium)
- Grenzen der Aufgabenphase: Kappa > 0,75 (einige Grenzzweideutigkeiten sind inherent)
- Demonstrationsqualitätspunkte: Kappa > 0,65 (Qualität ist subjektiver; gewichtete Kappa ist angemessen)
Falls Ihre IAA unter diesen Schwellenwert fallen, müssen die Annotationskriterien vor der Verarbeitung verfeinert werden.
- Niedrig erfolgreiches Etikettentwurf: Fügen Sie Fotobeispiele von Randfällen zum Erfolgskriteriendokument hinzu. Definieren Sie die genaue Positionstoleranz (z.B. "Objektzentrum innerhalb von 2 cm vom Zielzentrum").
- Niedrige Segmentierungsabkommen: Definition von Phasenübergangs in Bezug auf beobachtbare physikalische Ereignisse ("Greifer schließt sich an einem Objekt" und nicht "Anschluss der Phasen endet").
- Niedrige Qualitätsbewertung: Die Skala von 5 auf 3 Ebenen (gut/akzeptabel/ablehnend) zu reduzieren.
Annotation Qualitätsnormen
RCSV wendet für alle Datensätze ein dreistufiges Qualitätsgate an: Selbst-Annotation des Betreibers unmittelbar nach der Aufzeichnung, sekundäre Überprüfung durch einen geschulten Annotator und automatisierte Konsistenzkontrollen, die Annotationen mit gemeinsamen statistischen Daten vergleichen (z. B. erfolgreiche Episoden, bei denen der Griff nicht geschlossen wird, werden für die erneute Überprüfung markiert).
Automatische Konsistenzkontrollen, die häufige Fehler erkennen:
- Erfolgsbezeichnete Episode, bei der sich der End-Effektor nie mehr als 5 cm von der Startposition bewegt → Flag
- Erfolgsbezeichnete Episoden kürzer als 50% der mittleren Episodenlänge → Flag
- Die Sprachanleitung erwähnt "links", aber alle Objekte befinden sich auf der rechten Seite des Arbeitsplatzes → Flag
- Phasesegmentierung, bei der eine Phase kürzer als 0,5 oder länger als 60 s ist → Flag
- Zwei angrenzende Episoden mit identischen Sprachanweisungen, aber unterschiedlichen Aufgabenkategorien → Flag
Annotationspipeline des RCSV
Wenn Sie die [Daten-Sammlungsdienste] von RCSV verwenden, ist Anmerkung Teil des Ergebnisses. Unsere Betreiber annoteren jede Episode mit Erfolgsflaggen und Sprachetiketten während der Aufnahme, und unser Anmerkungsteam führt eine sekundäre Überprüfung vor dem Datensatz-Export durch. Sie erhalten einen Datensatz mit hoher Vertrauens-Anmerkungen, Anmerkungsabkommen-Score und einem vollständigen Qualitätsbericht.
Für Teams, die ihre eigenen erhobenen Daten mitbringen, bietet RCSV nur Anmerkungen an:
- Grundwert ($0,10/Prozess): Erfolgreiche Flaggenüberprüfung und Aufreinigung bestehender Etiketten
- Standard ($0,30/Piegel): Erfolgsflaggen + Sprachanweisungen + Qualitätsscore
- ** Vollständig ($1,50/Episode):** Alle Anmerkungen einschließlich Phasensegmentierung und Kontaktetiketten
Wir können vorhandene Datensätze verarbeiten, die auf jeder unterstützten Hardwareplattform (ALOHA, OpenArm, Franka, UR, Unitree) erhoben wurden. Datensätze müssen in HDF5- oder RLDS-Format sein, wobei Video-Streams zur Überprüfung zugänglich sind. Kontaktieren Sie uns um Ihre Datensatz-Annotationsbedürfnisse zu besprechen oder unsere Annotationsoberfläche über die [RCSV-Datenplattform](
Verwandte Lesungen
- [Was sind Roboter-Training-Daten?]
T6 ) -- Datentypen, Formate und Qualitätsdimensionen - Scaling Data Collection Teams --QA-Workflows in Skala
- VLA-Modelle erklärt --Language-Annotationsanforderungen für VLA-Schulungen
- Kontaktkräfte für Manipulation --Anforderungen an das Kontaktlabel
- RCSV-Datendienste -- Verwaltete Sammlung mit Anmerkung
- RCSV-Datenplattform -- Annotationsschnittstelle und Werkzeug
- Glossar -- Terminologiebezug







