نموذج الأساس
شبكة عصبية واسعة النطاق مدربة مسبقاً على بيانات واسعة (نصوص الإنترنت والصور والفيديوهات) يمكن تكييفها للمهام اللاحقة بضبط دقيق بسيط. في الروبوتات، توفر نماذج الأساس تمثيلات بصرية (DINOv2)، وتأسيس اللغة (CLIP و LLMs)، ونماذج العالم (التنبؤ بالفيديو)، وتخرج مباشرة إجراءات الروبوت (VLAs مثل RT-2 و OpenVLA و π0). تعد بتوزيع تكلفة البيانات للتعلم عبر المهام والتجسدات.







