Distillation de connaissances
Entraîner un modèle étudiant plus petit pour correspondre aux sorties (logits souples) d'un modèle enseignant plus grand. L'étudiant apprend une version compressée des connaissances de l'enseignant. En robotique, la distillation est utilisée pour : compresser les grands modèles VLA pour l'inférence en temps réel, transférer les enseignants à information privilégiée vers les étudiants vision uniquement, et créer des modèles de perception efficaces déployables en périphérie.







