Zurück zu Blog

Dreamer vs IRIS vs TD-MPC2: Weltenmodell für Ihren Roboter wählen

Dreamer v3, IRIS und TD-MPC2 verglichen Kopf-zu-Kopf. Architekturunterschiede, Schulungskosten, Schlußgeschwindigkeit, Integration mit ROS2 und LeRobot und Entscheidungsrahmen für die Wahl des richtigen Weltmodells für Ihr Robotikprojekt.

Von Jerry Huang am 22. April 2026

Drei Weltmodellarchitekturen dominieren die Robotikforschung im Jahr 2026: Dreamer v3, IRIS und TD-MPC2. Jede von ihnen nimmt einen grundlegend anderen Ansatz zur Lernumgebungsdynamik ein, und die richtige Wahl hängt von Ihrer Aufgabe, Hardware, Daten und Einsatzbedürfnissen ab. Dieser Artikel bietet einen praxisorientierten Vergleich, der Ihnen hilft, diese Entscheidung zu treffen.

Das Weltmodell: Eine schnelle Übersicht

Ein Weltmodell lernt, vorherzusagen, was als nächstes passiert: Angesichts des aktuellen Zustands und einer Aktion prognostiziert es den zukünftigen Zustand und die Belohnung. Sobald das Modell ausgebildet ist, dient es als gelernter Simulator. Ein Agent kann Tausende von Bahnen innerhalb des Weltmodells "vorstellen", um eine Politik zu erlernen, Aktionen zu planen oder Sicherheit zu bewerten - alles ohne den echten Roboter zu berühren. Eine umfassende Einführung finden Sie in unserem Begleitartikel: Weltmodelle für Robotik: Warum sie wichtig sind und wie sie funktionieren.

Die drei Modelle, die hier verglichen werden, repräsentieren drei unterschiedliche Designphilosophien:

  • Dreamer v3: Wiederholtes Raummodell mit stochastischen latenten Variablen. Lernen Sie eine Schauspieler-kritische Politik in der Vorstellungskraft.
  • IRIS: Tokenized Beobachtungen und Aktionen, die durch einen autoregressiven Transformer modelliert werden.
  • TD-MPC2: Ein einfaches auf MLP basierendes latente Dynamikmodell.

Architektur tiefstaubend

Dreamer v3: Wiederholtes Raummodell

Dreamer v3 verwendet ein Recurrent State-Space Model (RSSM), das zwei Arten von Zuständen in jedem Zeitschritt aufrechterhält: einen deterministischen wiederkehrenden Zustand h_t, der durch eine GRU berechnet wird, und einen stochastischen latenten Zustand z_t, der aus einer kategorischen Verteilung geprobt wird. Der deterministische Zustand erfasst langfristige Abhängigkeiten (was in der Episode bisher passiert ist), während der stochastische Zustand Unsicherheit über die aktuelle Situation erfasst (was das Modell nicht sicher ist).

Das Gesamtmodell besteht aus fünf gemeinsam ausgebildeten Komponenten:

  • Sequenzmodell: h_t = f(h_{t-1}, z_{t-1}, a_{t-1}) -- GRU, das Geschichte integriert
  • ** Encoder: ** z_t ~ q\_t h_t, o_t) -- hinter, das die tatsächliche Beobachtung enthält
  • ** Dynamik-Prediktor: ** z_t ~ p\ z_t h_t) -- Vorheriger, der z_t vorhergesagt, ohne o_t zu sehen (im Phantasie verwendet)
  • ** Dekoder: ** o_t ~ p\o_t ✓ h_t, z_t) -- rekonstruiert Beobachtungen für Trainingssignal
  • ** Prädiktoren für Belohnung/Fortsetzung: ** r_t ~ p\r_t h_t, z_t), c_t ~ p\c_t h_t, z_t) -- Prädiktion für Belohnung und Episodefortsetzung

Während der Vorstellungskraft wird der Encoder nicht verwendet (es gibt keine echten Beobachtungen). Der Dynamikvorhersager nimmt z_t von dem vorherigen, das Sequenzmodell voranschreitet h_t und der Schauspieler wählt Aktionen aus. Der Kritiker bewertet vorstellte Flugbahnen, um Vorteile für Schauspielerupdates mit einem Lambda-Return-Schätzer zu berechnen.

Schlüssel-Design-Wahl in v3: der stochastische Zustand verwendet 32 kategorische Variablen, jede mit 32 Klassen, die einen diskreten Latentraum von 32^32 möglichen Zuständen geben. Diese diskreten Darstellung vermeidet nachträgliche Zusammenbruchprobleme, die früheren Versionen mit Gauss latent Variablen geplagt und bietet schärfere, informativere Darstellungen.

IRIS: Tokenized Autoregressive Weltmodell

IRIS überlegt das Weltmodell als Sequenzmodellierungsproblem. Zuerst trainiert es einen VQ-VAE (Vektorquantizierte Variations-Autoenkoder), um jeden Beobachtungsrahmen in eine feste Anzahl von diskreten Token (typischerweise 16-64 Token pro Frame bei einer Codebookgröße von 512-1024) zu komprimieren. Das Weltmodell ist dann ein autoregressiver Transformer, der angesichts aller vorherigen Beobachtungs- und Aktions-Token das nächste Token vorhergesagt.

Die Sequenzstruktur für einen einzigen Übergang sieht aus wie:

Die "Action" ist ein "Action" -Token.

Die Transformer verarbeitet diese flache Sequenz mit kausaler Aufmerksamkeit und prognostiziert jedes Token von allen vorherigen Token. Dies ist architektonisch identisch mit der Sprachenmodellierung im GPT-Stil - die "Sprache" ist nur Beobachtungs- und Aktionstoken anstelle von Worttoken.

IRIS hat den Vorteil, dass es die Transformer-Skalierungseigenschaften direkt nutzt, die in NLP in enormen Maßstäben validiert wurden. Der Nachteil ist, dass die VQ-VAE-Tokenisierung verlustlos ist: Raumdetails unter der Auflösung des Codebooks werden entsorgt. Für Aufgaben, die die Unterscheidung zwischen Objektenpositionen erfordern, die sich um ein paar Pixel unterscheiden, kann dies ein Engpässigkeit sein. Die Qualität des Tokenizers setzt die Präzision des Weltmodells effektiv auf eine Höchstgrenze.

TD-MPC2: Latente Dynamik mit Online-Planung

TD-MPC2 nimmt den einfachsten architektonischen Ansatz der drei.

  • Coder: h(o_t) -> z_t -- Karten von Beobachtungen in latenten Zuständen
  • Dynamikmodell: d(z_t, a_t) -> z_{t+1} -- prognostiziert den nächsten latenten Zustand
  • ** Prädiktor für Belohnungen:** R(z_t, a_t) -> r_t -- prädikt sofortige Belohnungen
  • Wertfunktion: Q(z_t, a_t) -> v -- Schätzungen von langfristigen Werten (TD-Lernen)

Es gibt keine Wiederholung, keine Aufmerksamkeit, keine stochastischen latenten Variablen - nur Standard-Feed-Forward-Netzwerke. Das gesamte Modell ist von Ende zu Ende mit einem gemeinsamen Verlust ausgebildet, der die Konsistenz der latenten Dynamik (die vorhergesagte nächste latente sollte der kodierten nächsten Beobachtung entsprechen), die Belohnungsprozesse und das Lernen von Zeitdifferenz (TD) -Wert kombiniert.

Zur Zeit der Ableitung verwendet TD-MPC2 keine gelernte Politik, sondern führt bei jedem Kontrollschritt eine Modellvorhersage-Pfadintegral (MPPI) -Planung durch:

  1. Beispiel N Kandidaten-Aktionssequenzen (typischerweise N=512, Horizont=5 Schritte)
  2. Rollen Sie jede Sequenz durch das Dynamikmodell, um vorhergesagte latente Bahnen zu erhalten
  3. Punktzahl für jede Strecke: Summe der vorhergesagten Belohnungen + Endwert aus der Q-Funktion
  4. Berechnen Sie einen gewichteten Durchschnitt der Aktionssequenzen, gewichtet durch exponentierte Punkte
  5. Erledigt die erste Aktion aus der gewogenen Durchschnittssequenz

Dieser Planung-at-Inference-Ansatz bedeutet, dass die "Politik" implizit ist - sie entsteht aus der Kombination aus dem Weltmodell und dem Planungsalgorithmus. Der Hauptvorteil ist Flexibilität: Sie können die Belohnungfunktion zur Bereitstellung ändern, ohne etwas neu zu schulen. Die Kosten sind, dass die Planung ~10-50ms pro Steuerschritt dauert, was die Steuerfrequenz je nach GPU und Planungshorizont auf ~20-100Hz beschränkt.

Vergleich zwischen den einzelnen

Dimension Dreamer v3 IRIS TD-MPC2
Representation Discrete categorical latent (32x32) VQ-VAE discrete tokens Continuous latent vector
Temporal model GRU recurrence Causal Transformer attention Single-step MLP (no history)
Action space Continuous or discrete Discrete (continuous requires binning) Continuous (native)
Policy learning Actor-critic in imagination Actor-critic in imagination Online MPPI planning (no explicit policy)
Training cost (200 episodes) 6-24h on 1x RTX 3090 12-48h on 1x RTX 3090 2-12h on 1x RTX 3090
Inference latency ~1ms (policy forward pass) ~5ms (autoregressive decoding) ~10-50ms (MPPI planning loop)
Max control freq ~100-500Hz ~50-200Hz ~20-100Hz
Imagination horizon 15-50 steps (configurable) Limited by context window 3-10 steps (MPPI horizon)
Reward flexibility Fixed at training time Fixed at training time Changeable at deployment time
Open-source repo danijar/dreamerv3 (JAX) eloialonso/iris (PyTorch) nicklashansen/tdmpc2 (PyTorch)
License MIT MIT MIT

Wann jede zu verwenden ist

Wählen Sie Dreamer v3 Wenn:

  • Sie benötigen eine kontinuierliche Steuerung mit langen Planungshorizonen. Das RSSM des Träumers kann sich 15-50 Schritte vor sich stellen, ohne verbotene Rechenkosten, und der Schauspieler-Kritiker lernt, sich über diese langen Horizonte zu optimieren. Dies macht es zur besten Wahl für Aufgaben wie begabte Manipulation, bei denen der Roboter einen Griffansatz, Fingerplatzierung und Heben als koordinierte Sequenz planen muss.
  • Sie wollen ein bewährtes, gut dokumentiertes Framework. Dreamer v3 wurde auf mehr als 150 Aufgaben angewendet und kommt mit einem einzigen Satz von Hyperparametern, die für die meisten Domains aus der Box funktionieren.
  • Dein Aktionsraum ist kontinuierlich. Dreamer unterstützt durch seinen Gauss-Actor kontinuierliche Aktionen nativerweise.
  • Sie machen Online-RL auf einem echten Roboter. Die Probeneffizienz des Dreamer (100-1000 mal besser als modelfreie Methoden) bedeutet, dass Sie aus realen Roboter-Interaktionen in Stunden statt in Wochen lernen können.
  • Sie sind mit JAX zufrieden.** Die Referenzimplementierung ist in JAX, die eine ausgezeichnete GPU-Nutzung bietet, aber eine steile Lernkurve als PyTorch hat.

Wählen Sie IRIS Wenn:

  • Ihre Aktionen sind natürlich diskret oder Sie können sie diskretisieren. IRIS modelliert alles als Token, so dass es am besten funktioniert, wenn der Aktionsraum bereits diskret ist (Greifer offen/schließen, Navigationsbefehle) oder effektiv in eine verwaltbare Anzahl von Kategorien eingebunden werden kann.
  • Wenn Sie die Transformer-Skaling nutzen möchten. Wenn Sie Zugang zu großen Rechenfunktionen haben und das Weltmodell für verschiedene Aufgaben skalieren möchten, ist die Architektur von IRIS die natürlichste für die Skalation geeignet.
  • Sie sind an generativen Weltmodellen interessiert. Da IRIS Beobachtungs-Token autoregressiv erzeugt, können Sie verschiedene mögliche Futures für die gleiche Aktionssequenz auswählen.
  • Deine Aufgabenbereich wurde validiert. IRIS wurde vor allem bei Atari und einfachen Steuerungsaufgaben validiert. Wenn Ihre Robotik-Anwendung kontinuierliche, hochdimensionale Aktionsräume (7-DOF-Arm + Griff) beinhaltet, sollten Sie sorgfältig prototypieren und überprüfen, dass die Aktionsdiskretisierung keine Engpässe in der Leistung darstellt.

Wählen Sie TD-MPC2 Wenn:

  • Bei der Bereitstellung benötigen Sie flexible Belohnungssysteme. Da TD-MPC2 mit dem Weltmodell und einer gelernten Wertfunktion online planen kann, können Sie die Belohnungssysteme in der Testzeit ohne Umschulung ändern. Dies ist für Anwendungen, in denen das Ziel zur Laufzeit angegeben ist, einzigartig wertvoll.
  • ** Sie wollen das schnellste Training.** TD-MPC2's MLP-basierte Architektur trainiert 2-5 mal schneller als Dreamer und 5-10 mal schneller als IRIS. Für schnelle Prototypen und Iteration ist dies ein erheblicher Vorteil.
  • Ein einzelnes Modell für viele Aufgaben ist erforderlich. TD-MPC2 hat ein einzelnes Modell demonstriert, das 104 Aufgaben löst (die Variante "317M-Parameter"). Wenn Sie mit demselben Roboter viele Aufgabenvariationen einsetzen, kann ein einzelnes großes TD-MPC2-Modell praktischer sein als das Training von separaten Dreamer-Modellen pro Aufgabe.
  • Die Anforderungen an die Steuerfrequenz sind 10-50 Hz. Die MPPI-Planungsschleifen erhöhen die Latenz im Vergleich zu einem erlernten Richtlinienpass, aber für die meisten Manipulationsarbeiten (10-30 Hz-Kontrolle) ist die Planungszeit von 10-50 ms akzeptabel.
  • ** Sie bevorzugen PyTorch.** Die Referenzimplementierung ist saubere PyTorch mit minimalen Abhängigkeiten.

Integration mit vorhandenen Stacks

ROS2-Integration

Keines der drei Frameworks ist mit einer nativen ROS2-Integration ausgestattet, aber es ist einfach, sie in einen ROS2-Knoten zu wickeln.

Import rclpy von rclpy.node Import Knoten von Sensor_msgs.msg Import JointState, Bild von std_msgs.msg Import Float64MultiArray Klasse WorldModelNode(Node): def __init__(self, world_model, Planner): super((__init_('world_model_node') self.model = world_model self.planner = Planner # Abonnieren von Beobachtungen self.create_subscriptionImage, '/camera/image_image', self.image_cb, 10) self.create_subscriptionJointState, '/action_joint_states', self.joint\cb, self.b) self.control.

Für TD-MPC2 ist der Planer der MPPI-Algorithmus. Für Dreamer ist es das gelernte Akteurnetzwerk. Für IRIS ist es entweder ein gelernter Akteur oder eine Suche über den tokenierten Aktionsraum. Der Schlüsselunterschied in der ROS2-Integration ist die Latenz: Der Akteur-Forwardpass des Dreamer ist in ~1ms abgeschlossen, während TD-MPC2-MPPI-Schleife 10-50ms benötigt, was sich darauf auswirkt, wie Sie den Steuerungstimmer konfigurieren.

LeRobot-Integration

HuggingFace's LeRobot-Framework wird zum Standard für Roboter-Lernversuche. Ab Anfang 2026 unterstützt LeRobot natively Verhaltensklonung und Diffusion Policy, enthält aber keine Weltmodelltraining. Das Datensatzformat (Parquet-Episoden mit synchronisiertem Video und Zustand) ist jedoch mit allen drei Weltmodellen mit einem leichten Adapter kompatibel:

von lerobot.common.datasets.lerobot_dataset import LeRobotDataset import numpy als np # Load a LeRobot dataset dataset = LeRobotDataset("lerobot/pusht") # Konvertieren Sie zu Dreamer-kompatiblen NPZ-Episoden für episode_idx in dataset.episode_data_stack["von"": episode = dataset.hf_dataset.filter(lambda x: x["episode_index"] episode_idx) ==\savez_compressedf"episodes/episode_{episode_idx}.nodepz", image=nodep.stack ](((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((((

Für TD-MPC2 wird das Format HDF5 umgewandelt. Für IRIS müssen Sie den VQ-VAE-Tokenizer zusätzlich auf die Beobachtungsbilder trainieren, bevor Sie das Transformer-Weltmodell trainieren.

Gymnasium / Integration von MuJoCo

Alle drei Frameworks unterstützen Gymnasium (ehemals OpenAI Gym) Umgebungen nativer oder mit minimaler Konfiguration. Dies macht sie leicht zu prototypieren, bevor sie auf echte Hardware übergehen:

  • Dreamer v3: Eingebildete Unterstützung für DMControl, Atari, Minecraft und benutzerdefinierte Gymnasium-Envs über einen Wrapper.
  • IRIS: Eingebildeter Atari-Support. Die kontinuierliche Steuerung des Gymnasiums erfordert eine benutzerdefinierte Verpackung zur Diskretisierung der Aktion.
  • TD-MPC2: Eingebildete Unterstützung für DMControl, Meta-World, Maniskill und MyoSuite.

Datenanforderungen je Modell

Art der Strecken

Alle drei Modelle lernen aus Trajektoriendaten, sind aber auf verschiedene Eigenschaften empfindlich:

  • Dreamer v3 benötigt Träger mit einer klaren zeitlichen Struktur. Es profitiert von Episoden, die sowohl erfolgreiche als auch gescheiterte Versuche umfassen, da der Belohnungsprädiktor negative Beispiele benötigt, um zu kalibrieren.
  • IRIS benötigt verschiedene Flugbahnen, um ein gutes VQ-VAE-Codebook zu trainieren. Wenn alle Ihre Episoden visuell ähnlich aussehen, wird das Codebook eine schlechte Abdeckung neuer Situationen haben. Priorisieren Sie visuelle Vielfalt: verschiedene Objektsfarben, Positionen, Lichtbedingungen und Kamerawinkel.
  • TD-MPC2 ist die flexibelste Datenqualität, weil sie online-Planung und nicht eine gelernte Politik verwendet. Auch bei einem etwas ungenauen Weltmodell kann die MPPI-Planung oft gute Maßnahmen finden, indem sie viele Kandidaten bewertet.

Beobachtungsmodalität

Modality Dreamer v3 IRIS TD-MPC2
RGB images Native (CNN encoder) Native (VQ-VAE) Supported (CNN encoder)
Proprioception only Supported (MLP encoder) Requires state tokenization Native (default modality)
Multi-camera Concatenate or multi-encoder Separate VQ-VAE per view Concatenate encodings
Point clouds Custom encoder needed Not well-supported Custom encoder needed
Force/torque Concatenate with proprioception Tokenize as additional modality Concatenate with proprioception

Episodenlänge

Die drei Modelle verarbeiten die Episodelänge unterschiedlich:

  • Dreamer v3: Züge auf festen Länge (typischerweise 50-64 Schritte) aus Episoden jeder Länge. Lange Episoden (1000+ Schritte) sind in Ordnung - der wiederkehrende Zustand des RSSM behält Kontext. Dies macht Dreamer gut geeignet für lange Manipulationsarbeiten.
  • IRIS: Begrenzt durch das Kontextfenster des Transformers. Mit einem Kontext von 1024 Token und 16 Token pro Rahmen + 1 Aktionstoken erhalten Sie ungefähr 60 Rahmen von Kontext. Längere Episoden erfordern Truncation oder Chunking, was langfristige Abhängigkeiten verlieren kann.
  • TD-MPC2: Züge in kurzen Nachfolgen (typischerweise 5-10 Schritte) weil das Dynamikmodell ein Schritt ist und die Q-Funktion die langfristige Kreditzuweisung über das TD-Lernen verwaltet.

Code Quickstart

Träumer v3

# Installieren (JAX + GPU) pip Installieren jax[cuda12] jaxlib dreamerv3 # Zug auf DMControl Reacher python dreamerv3/main.py \ --konfiguriert dmc_vision \ --task dmc_reacher_easy \ --logdir ./logdir/reacher \ --steps 500000 # Zug auf benutzerdefinierten Roboterdaten (NPZ-Format) python dreamerv3/main.py \ --configuriert dmc_vision \ --task_log_robot \ --logdir ./logdir/custom \ --\data_dir /path/to/npz\episodes/ \ --steps 1000000

IRIS

# Installieren Sie git clone T9 cd iris && pip Installieren -e . # Train on Atari Breakout python src/main.py env.train.id=BreakoutNoFrameskip-v4 \ common.device=cuda:0 \ wandb.mode=offline # Schlüsselkonfiguration Überschriften für benutzerdefinierte Domains # config/trainer.yaml: # tokenizer.vocab_size: 512 # world_model.tokens_per_block: 17 # 16 obs-tokens + 1 action token # world_model._blocks: 20 # contex window in frames

TD-MPC2

# Installieren pip installieren tdmpc2 # Zug auf DMControl Walker python train.py task=dog-run-model_size=48 steps=10000000 # Zug einziges Modell auf 80 DMControl-Tasks python train.py task=mt80 model_size=317 steps=25000000 batch_size=1024 # Beurteilen Sie mit MPPI Planung python evaluate.py task=dog-run checkpoint=/path/to/model.pt \ num_samples=512 horizon=5

Häufige Fehler und Fehlerbehebung

Weltmodell sagt Unklarheit / Durchschnittliche Zukunftszeit voraus

Symptom: Entziffelte imaginäre Beobachtungen sehen aus wie ein Durchschnitt von mehreren plausiblen Ergebnissen.

** Diagnose:** Der latente Raum des Modells erfasst keine Multimodalität.

Fix: Für Dreamer stellen Sie sicher, dass Sie die diskreten kategorischen Latenten von v3 und nicht die Gaussian-Latenzen verwenden. Für IRIS erhöhen Sie die Größe des VQ-VAE-Codebooks (probieren Sie 1024 oder 2048) und die Token pro Rahmen (32 oder 64). Für TD-MPC2 ist dies weniger ein Problem, da der latente Raum auf Aufgabenbedingungen angepasst ist und keine Beobachtungen rekonstruieren muss.

Die Politik nutzt die Ungenauigkeit des Weltmodells aus

Symptom: Die Politik erreicht eine hohe vorstellte Belohnung, aber versagt beim echten Roboter. Es hat einen "Fehler" im Weltmodell gefunden - eine Zustand-Aktionssequenz, die eine hohe vorausgesagte Belohnung erhält, aber nicht mit der echten Physik entspricht.

** Diagnose:** Die Politik ist in eine Region des staatlichen Handlungsraums übergegangen, in der das Weltmodell ungenau ist und sie diese Ungenauigkeiten ausnutzt.

Fix: (1) Ein Ensemble von 3-5 Weltmodellen ausbilden und die Politik für Besucherländer, in denen die Ensembelvorhersagen nicht übereinstimmen, bestrafen. (2) den Vorstellungshorizont verkürzen, um den Kompositionsfehler zu reduzieren. (3) in den Regionen, in denen die Politik funktioniert, mehr reale Daten sammeln und das Weltmodell neu ausbilden. Für TD-MPC2 ist der Planungshorizont für MPPI bereits kurz (3-10 Schritte), was dies weniger häufig macht.

Der Klassifizierungsgrad der VQ-VAE Codebook Collapse (IRIS)

Symptom: Nur ein kleiner Teil der Codebook-Einträge wird verwendet.

** Diagnose:** Das VQ-VAE-Training ist auf die Verwendung einer Untergruppe von Codes eingeschränkt worden.

Fix: (1) Verwenden Sie die Aktualisierungen des Codebooks mit dem exponentiellen gleitenden Durchschnitt (EMA) statt auf gradientbasierten Daten. (2) Erhöhen Sie die Größe des Codebooks. (3) Fügen Sie das Codebook zurück: Regelmäßig neuartizialisieren Sie die ungenutzten Codes aus der Ausgabeverteilung des Encoder. (4) Verwenden Sie ein Verlustgewicht von 0,25 (die Standardvergabe in IRIS).

TD-Lerninstabilität (TD-MPC2)

Symptom: Q-Werte divergieren oder schwanken während des Trainings.

** Diagnose:** Das zeitliche Unterschied lernen für die Wertfunktion ist instabil, oft aufgrund einer zu hohen Lernrate oder einer unzureichenden Zielnetzwerk-Aktualisierungsfrequenz.

Fix: (1) Verringern Sie die Lernrate für die Q-Funktion (probieren Sie 3e-4 statt 1e-3). (2) erhöhen Sie den Zielnetzwerk-Soft-Update-Koeffizient tau (von 0,01 auf 0,005 für reibungslose Updates). (3) Fügen Sie die Schichtnormalität zum Q-Netzwerk hinzu. TD-MPC2-Standard-Hyperparameter sind im Allgemeinen stabil, also wenn Sie sie ändern, kehren Sie zuerst zu Standard.

Unzureichende Datenvielfalt

Symptom: Das Weltmodell macht genaue Vorhersagen über Trainingsähnliche Zustände, scheitert aber katastrophal bei leicht unterschiedlichen Anfangskonfigurationen.

** Diagnose:** Der Datensatz hat keine ausreichenden Variationen in den Anfangszuständen, Objektskonfigurationen oder Umweltbedingungen.

Fix: Dies ist ein Datenproblem, kein Modellproblem. Sammeln Sie mehr Episoden mit absichtlich randomisierten Anfangsbedingungen. RCSVs Daten-Sammlungsdienst folgt strukturierten Randomisierungsprotokollen, die speziell entwickelt wurden, um die Reichweite des Weltraum-Abdeckungsbereichs für die Weltmodellbildung zu maximieren.

Verwandte Lesungen