机器人学习的规模规则:2026年我们所知道的
基于Open X-Embodiment,RT-X,DROID的证据,以及2026年对数据收集,模型大小和计算预算的实际影响.
[←博客]
机器人学习有自己的扩展动态,它们与语言模型不同,
规模规则是什么,它们为什么重要
扩展法则描述了资源输入 (数据,计算,模型参数) 和模型性能之间的可预测关系.在大型语言模型中,辛奇拉论文 (霍夫曼等人, 2022) 确定了最佳训练需要比例地扩展模型大小和数据集大小:如果没有翻倍数据,将参数翻倍,就会产生一个低优质模型. 这种框架为 ML 团队提供了在投入资源之前分配预算和预测绩效的原则性方法.
扩展法则的实际价值不是学术的.它们告诉你是否花费更多的100万美元用于数据收集或更大的GPU集群将产生更多的能力改善.它们告诉你当你的当前方法已经达到一个天花板,需要结构性改变而不是更多资源. 他们告诉你,你走的轨迹是否会达到你的绩效目标,
机器人技术的核心问题是:是否适用类似的法律,如果是这样,它们预测什么? 到2026年,我们有足够的经验证据来提供细微但可行的答案.
机器人规模与语言模型规模不同
在检查证据之前,重要的是要理解机器人学习扩展法则为什么不能是LLM扩展动态的简单副本.
数据收集是昂贵的和缓慢的. LLM培训数据 (来自互联网的文本) 基本上没有什么成本 - - 瓶
**数据分布是多模的,与物理相结合.**语言模型训练数据采用相对均
评估是基于物理的. LLM 性能可以在规模上的保留文本基准上进行评估.机器人政策的性能只能通过运行物理硬件的政策来真正评估,这很慢,昂贵,并且受到硬件变化的影响.这使得更难准确地描述扩展曲线,并引入噪音到经验测量中.
证据:开放的X体体和RT-X
开放X体体项目 (Padalkar等同,2023年) 从33个研究机构的22种不同机器人体现中收集了超过100万次机器人操纵事件.基于这些数据训练的RT-X模型提供了跨体体体规模化的第一批大规模证据.
突出的发现是:RT-2-X,训练有素使用全套多体体数据集,在完成的通用化任务上超过了单机专家政策约50%. 这表明了不同机器人类型的数据不仅仅是噪音对模型;它包含可转移的操纵知识,可以提高通用化到新的机器人和新任务. 像LLM的
具体来说,RT-X结果显示了转移的层次结构.视觉场景理解在实施中更容易转移.高层次任务概念 (选择,位置,开放,关闭) 转移中度良好.低层次的运动控制 (特定的关节轨迹,精确的接触时间) 转移不佳,仍然需要具体的实施细节调整.
证据:DROID和数据规模化
德罗伊德数据集 (Khazatsky等,2024) 是对机器人操纵数据扩展的最全面的实验研究.在86个实验室,22个机器人类型和564个不同的环境中收集到的76,000个示范中,德罗伊德允许研究人员独立测试政策绩效如何与数据量和数据多样性进行扩展.
关键结果: 数据多样性比数据量更可靠地衡量性能. 当作者培训ACT和传播政策时,他们观察到持续改善,达到大约10,000次示范,回报率减少30,000次,分布内部性能接近50,000次. 但增加多种数据 (新环境,新物体类别) 继续改善了已经看到的情景的更多示范后的分布外性能.
语言模型规模化与语言模型规模化相比,这是一个基本的结构差异.来自同一分布的更多网络文本继续改善语言模型.在同一环境中进行更多相同任务的示范并未继续改善机器人政策,超过相对较低的限额.瓶
机器人学习的标准
**视觉表示质量.**较大的预训练的视觉编码器 (DINOv2-Large vs DINOv2-Base,SigLIP-400M vs SigLIP-100M) 始终为操纵政策提供更好的视觉功能.这里的扩展遵循计算机视觉的熟悉模式:较大的模型学习更丰富,更可通用的视觉表示.这是机器人学习中最类似LLM的扩展动态.
**预训练数据中的任务多样性.**在更多任务类别上预训练的政策更适用于新任务. 每个加入预训组合的额外任务类别都会提高已完成任务的零射击性能,但在目前数据集 (数百个任务类别) 范围内,结果会减少,但会呈积极的回报.
**跨体体转移.**在预训练组中添加其他机器人类型的数据,使其更好地将其通用到新的目标机器人,即使目标机器人与训练组中的任何机器人有动态不同. 机理是,多种实施数据迫使模型学习实施-无知操纵表示,而不是过度适应一个机器人的动力学. 这可靠地与训练集中的实施数量相衡.
环境多样性. 基于更多物理环境 (不同房间,照明条件,桌面表面) 的示范培训的政策更好地将其普遍化为新型部署环境.
什么不像清洁的尺度
**精确的精巧操作.**需要分厘米精度 (线线,插入,螺丝驱动) 的任务不会随着更多数据或更大的模型而预测得到改善. 瓶
**接触动态.**需要根据对象特性调节抓紧力 (脆弱与坚固,刚性与可变) 的政策仅仅从数据扩展中得到了有限的改善.问题是,相机无法看到与接触相关的特性:从RGB图像中无法看到对象的摩擦系数或合规性. 强力
**长远任务规划.**对于需要10多个连续子任务执行的任务,成功率与数据差异化. 复合错误问题意味着即使在每步骤成功的政策中,在10步骤任务中只有60%的成功,而在20步任务中只有36%.更多的数据提高了每步的可靠性,但不会改变复合算法. 层次规划 (高级规划师+低级技能) 缓解这一问题,但高级规划师的规模动态不如技能水平的规模.
** 粗模型参数在精细调节中计算. ** 与较大的语言模型不同,在任务特定细调后模型尺寸和操纵性能之间的关系是非单调的. OpenVLA (7B参数) 在零射任务中优于 Octo (93M),但在200多个任务特定示范中,在细调后提供了较小的优势. 对于具有专门数据收集预算的团队来说,一个精确调节的较小模型通常比一个轻松调整的更大模型更实用.
为什么工业正在争取收集机器人数据
扩展证据解释了为什么每一个主要的机器人公司和研究实验室在2026年都在大量投资于现实世界机器人数据收集基础设施.如果多样性是瓶
物理智能,谷歌深度思维,丰田研究院以及一些资金丰富的初创公司正在建立或建立大量的数据收集设施, 逻辑是直接的:谁拥有最多种机器人操纵数据,谁将训练最好的基础模型,
我们为需要多样化的,高质量的操纵数据但不想建立和人员自己的数据收集设施的团队提供数据收集基础设施和专业运营商. 我们的 [数据服务]
这对研究实验室意味着什么
校园实验室通常有1-3个机器人手臂,一个房间,对物体采购和操作员时间的预算有限. 规模化证据表明,投资的最具影响力的维度是多样性,而不是量.
- **使用基础模型.**预训练模型 (Octo, OpenVLA) 提供了单个实验室无法复制的多体化,多任务基础.
- 每美元最大化物体多样性. 购买30种不同的物体在储蓄店,而不是3种昂贵的精密物体.
- ** 收集在多个房间.** 移动您的设置在实验室,厨房和办公室之间,即使不方便,也提供了环境多样性,这大大提高了政策的强度.
- ** 贡献和从开放数据集中绘制.** 开放X-Embodiment,DROID和桥 V2是免费的扩展,你可以在没有收集任何额外的示范的情况下添加到你的训练管道.
这对公司意味着什么
生产机器人系统的公司面临不同的扩展挑战.它们通常具有特定的部署环境和特定的任务组合.
- 第一阶段:选择基础模型. 开始使用您的机器人类型和任务域的最佳预先训练模型. 这让您获得社区规模的数据多样性,而无需收集成本.
- 第二阶段:目标细节调整. 收集您在特定部署环境中200-500次具体任务示范. 专注于您的目标 SKU类别内的对象多样性,并在您的工作空间中定位多样性.
- 第三阶段:持续改进. 部署精细调整的政策,并使用记录的部署数据 (以人类成功/失败标签) 来识别故障模式.收集针对性数据来解决这些故障. 这就是多样性超越量原则最重要的:不要重新收集你已经拥有的数据;收集弥补空白的数据.
- 第四阶段:跨站点扩展. 每个新部署站点都提供了环境多样性,从而改善了基础政策. 结构化部署数据管道,以便从所有站点中数据回流到中央培训池中. 这将部署规模转化为数据扩展优势.
数据量与模型大小与性能:数字
| Configuration | Model Size | Training Data | In-Distribution Success | OOD Success |
|---|---|---|---|---|
| ACT from scratch | ~30M params | 100 demos | 75-85% | 20-35% |
| ACT from scratch | ~30M params | 500 demos | 88-93% | 35-50% |
| Octo (fine-tuned) | 93M params | OXE + 200 task demos | 85-92% | 45-60% |
| OpenVLA (fine-tuned) | 7B params | OXE + 200 task demos | 88-95% | 55-70% |
| OpenVLA (fine-tuned) | 7B params | OXE + 500 task demos | 92-97% | 60-75% |
这些数字的关键结论:一个精细调整的基础模型,包含200个具体任务示范,通常与从头开始的模型和500个示范,在分发中和在分发之外的模型匹配或超过.基础模型的优势完全在OD概括中 - 它在新物体和环境中提供了20-30个百分点的改善. 在分发中,优势较小 (5-10分),并且通常在较小的评估组中并不具有统计意义.
成本预测:数据收集与计算
| Resource | 100 Demos | 500 Demos | 2,000 Demos | 10,000 Demos |
|---|---|---|---|---|
| Data collection (RCSV rates) | $2,500 | $6,000 | $18,000 | $65,000 |
| Training compute (ACT, single A100) | $5 (2 hrs) | $10 (4 hrs) | $25 (10 hrs) | $60 (24 hrs) |
| Training compute (OpenVLA fine-tune, 4x A100) | $50 (5 hrs) | $100 (10 hrs) | $300 (30 hrs) | $800 (80 hrs) |
| Data-to-compute cost ratio | 50:1 to 500:1 | 60:1 to 600:1 | 60:1 to 720:1 | 80:1 to 1083:1 |
机器人学习的数据与计算成本比语言模型培训显著不同,计算机是主导成本.在机器人学习中,数据收集成本比训练数据的计算高50-1000倍.这直接具有战略意义:每一个边缘美元都应该用于提高数据质量和多样性,而不是用于更大的模型或更长的培训. 预算为5000美元,在花费200个不同的演示时, 能提高能力,
扩展曲线数据点:经验性性能与数据集规模
下面的表列收集了来自发表的论文和RCSV内部评估的性能数据,显示了任务成功率如何与不同架构的数据集规模相衡.所有数字都是单项任务桌面选用和位置的,在被保留的对象位置上进行评估.
| Demo Count | ACT (from scratch) | Diffusion Policy | Octo (fine-tuned) | OpenVLA (fine-tuned) |
|---|---|---|---|---|
| 10 | 15-25% | 10-20% | 40-50% | 45-55% |
| 25 | 30-40% | 25-35% | 55-65% | 60-70% |
| 50 | 55-65% | 45-55% | 70-78% | 72-80% |
| 100 | 72-82% | 65-75% | 82-88% | 84-90% |
| 200 | 82-90% | 78-86% | 86-92% | 88-94% |
| 500 | 88-93% | 85-92% | 90-95% | 92-96% |
| 1000 | 90-94% | 88-94% | 91-95% | 93-97% |
| 2000+ | 91-95% | 90-95% | 92-96% | 94-97% |
基本观察: (1) 基础模型细节调整 (Octo, OpenVLA) 在低的演示数 (10-100) 时提供了最大的优势,其中预先训练的视觉和行为前
团队规模的实用建议
根据您的资源, 扩展证据将转化为具体的指导.
单独的研究人员/爱好者 (预算:<5000美元). 使用基础模型 (Octo).在一个任务上收集50-100个示范.专注于学习数据收集管道而不是优化性能.预期结果:在分销条件上70-80%的成功率,30-40%的OOD.这足以进行研究原型或示范. 硬件: OpenArm 1 ($4,500) 或通过RCSV租
小型研究实验室 (预算:10,000-50,000美元). 在10到20个对象和2-3个环境中收集的200-500个示范中进行微调OpenVLA或Octo. 投资于系统评估 (被保留的对象,被保留的位置).预期结果:85-92%在分布,50-65%OOD. 这为控制环境部署准备好. 斯威尔士国家委员会 (RCSV) 的 [2,500美元试点]
创业/公司 (预算:每年5万至500万美元). 建立持续数据收集基础设施. 收集每项任务的1000至5000个示范,在30多个对象和5多个环境中.实施自动重新培训和评估管道.目标:90-95%在分发,70-80%OOD. 在这种规模上,数据与计算成本比率意味着您的预算应该约为90%的数据收集和10%的计算.
大型企业 (预算: > $500,000/年). 通过标准化的协议建立多站点收集. 在您的专有数据库上训练多任务基础模型.每个部署站点将数据传递到中央培训管道.在这个规模上,跨站点的多样性成为您的主要竞争优势. 预期结果: 95%以上在分发,80%以上在部署环境中OOD. 联系RCSV,以寻求企业数据收集合作伙伴关系.
什么时候应扩展数据与规模模型
基于扩展证据的实际决策框架:
- ** 规模数据 (更多示范) 当:** 您的分销成功率低于85%.您的政策在培训中未充分代表的特定对象位置或方向上失败.您的任务具有多个可行的战略,并且您正在看到模式崩
(政策与一个战略相近,而当该战略不适用时失败). - ** 规模多样性 (更多的物体/环境) 当:** 您的分销成功率超过85%,但OOD性能低于50%.您的政策在与训练物体功能相似的新物体上失败.您的部署环境与训练环境视觉不同.
- ** 规模模型 (较大的架构) 当:** 您拥有大量的多样化数据 (>2000个示范在10个对象类别) 和性能已经平稳.您的任务需要了解复杂的空间关系或长视线规划.您可以访问预训练的基础模型重量,而不是从零开始训练.
- 当: 尽管有1000多种不同的示范,成功率仍然保持在 <70% 的水平时,改变方法.您的任务需要精确的力量控制,视觉政策不能单独从图像中学习.您的任务有10个连续步骤,其中复合错误占主导地位.
跨体体尺度:你需要多少机器人?
基于已发表的
- 1实施方案: 基本线.单机专业化政策.
- **3-5体现:**最
的改进区域. 添加3-5种不同机器人类型 (不同动态,不同抓住器) 的数据可以提高目标机器人的OOD概括率15-25%. - **5-10个实施例:**持续改善,但收益率下降.每一个额外实施例增加了2-5%的OOD改善.
- **10+实施例:**每体体边缘改善小 (<2%),但累计效果很大.目前22个实施例的OXE数据集为跨体体训练提供了坚实的基础.
对于拥有单个目标机器人的团队来说,实际建议很明确:使用基于OXE或DROID预训练的基础模型 (可免费提供跨体体多样性) 并对您的任务特定数据进行细节调整.
计算预算分配:一个实用的框架
鉴于机器人学习的数据与计算成本比率极高,团队需要一个原则性的方式来分配数据收集,计算和工程时间之间的总预算.根据扩展证据,以下是根据项目阶段的建议分配.
| Project Phase | Data Collection | Compute (Training) | Engineering / Evaluation | Rationale |
|---|---|---|---|---|
| Prototype (0-50 demos) | 40% | 10% | 50% | Focus on pipeline setup; data collection validates hardware and workflow |
| Development (50-500 demos) | 70% | 10% | 20% | Maximize data diversity; compute costs are negligible relative to collection |
| Production (500-5000 demos) | 60% | 15% | 25% | Larger model fine-tuning justified; evaluation and deployment engineering critical |
| Scale (5000+ demos) | 50% | 20% | 30% | Continuous collection from deployments; multi-task training requires more compute |
根据LLM培训直观分配预算的团队 (计算是大多数成本) 将系统地对数据进行低投资,对机器人学习项目进行过度投资.
多样性乘法:量化多样性数据的价值
规模化研究最强大的实践发现是多样性乘法:与同一个量度的同质数据相比,多样性数据的超大性能增长.
对于标准的选择和位置任务,定义多样性分数为:D = (独特对象数量) x (对象的不同位置数量) x (照明条件数量) x (运营商数量).在多项任务中的RCSV评估中:
- 200个D=200的演示 (10个物体,5个位置,2个照明,2个运营商) 实现了85%的OOD成功.
- 200个D=20的演示 (1个对象,5个位置,2个照明,2个操作员) 实现了40%的OOD成功.
- 1000个D=20的演示实现了 55%的OOD成功,仍然低于多元化的200个演示组的30分.
结果是明确的:200个多样化的示范比1000个均
失败模式分析:为什么政策在不同水平上平
了解为什么一个政策高原需要诊断学习管道的哪个组成部分是瓶
| Plateau Signature | In-Dist. Rate | OOD Rate | Root Cause | Intervention |
|---|---|---|---|---|
| Low ceiling | <70% | <30% | Data quality issue (inconsistent demonstrations, high noise) | Audit and clean existing data; retrain operators; tighten QA gates |
| High in-dist, low OOD | >90% | <50% | Diversity bottleneck (overfitting to training distribution) | Add diverse environments and objects; use data augmentation; switch to foundation model |
| Mode collapse | 70-85% | 30-50% | Architecture limitation (BC averaging over multimodal demonstrations) | Switch from BC to Diffusion Policy or ACT; add action chunking |
| 精度 failures | 80-90% | 60-75% | Observation gap (task requires force/tactile data not in obs space) | Add F/T sensor; add wrist camera for close-up view; use hybrid classical+learned control |
| Long-horizon decay | 85-95% per step | N/A | Compounding error over 10+ steps | Decompose into sub-policies; add hierarchical planning; use DAgger |
| Random failures | 85-92% | 70-80% | Stochastic environment factors (object slip, lighting flicker) | Add retry mechanisms; increase action frequency; use closed-loop control |
诊断过程:运行50个评估集,分类每个失败,并确定失败是否集群在特定任务阶段 (方法,抓住,运输,放置) 或似乎均
实用规模测量实验模板
对于那些想在开始大规模数据收集活动之前, 描述自己的扩展曲线的团队来说,
# Scaling experiment protocol
# Collect demos in batches, train and evaluate after each batch
import json
from pathlib import Path
def run_scaling_experiment(task_name, max_demos=500, batch_size=50):
"""
Protocol:
1. Collect batch_size demos
2. Train policy on cumulative dataset
3. Evaluate on fixed held-out test set (20 episodes)
4. Log results and decide whether to continue
"""
results = []
cumulative_demos = 0
for batch_idx in range(max_demos // batch_size):
cumulative_demos += batch_size
# Train on all demos collected so far
model = train_policy(
dataset_path=f"data/{task_name}",
num_demos=cumulative_demos,
architecture="act", # or "diffusion_policy"
epochs=2000,
)
# Evaluate on fixed test set (same 20 configs every time)
in_dist_rate = evaluate(model, test_set="in_distribution", n=20)
ood_rate = evaluate(model, test_set="out_of_distribution", n=20)
results.append({
"demos": cumulative_demos,
"in_dist": in_dist_rate,
"ood": ood_rate,
"delta_in_dist": in_dist_rate - (results[-1]["in_dist"] if results else 0),
"delta_ood": ood_rate - (results[-1]["ood"] if results else 0),
})
# Stop if both metrics have plateaued (<2% improvement for 2 batches)
if len(results) >= 3:
recent = results[-2:]
if all(r["delta_in_dist"] < 0.02 for r in recent) and \
all(r["delta_ood"] < 0.02 for r in recent):
print(f"Plateau detected at {cumulative_demos} demos")
break
Path(f"results/{task_name}_scaling.json").write_text(json.dumps(results, indent=2))
return results
该协议通常需要3-5个收集训练评估周期 (150-250个演示) 确定给定的任务的近似平原.关键输出是: (1) 部署级分销性能的最低演示数量 (通常为85-90%), (2) OOD 性能的回报率下降的点,以及 (3) 瓶
多任务扩展:任务数量如何影响每个任务数据要求
根据最近的一项研究,一个重要的反直觉发现:同时培训一项多项任务的政策可以减少每项任务的数据需求.当任务共享视觉或运动原始性 (所有任务都涉及抓住,所有都使用相同的抓住器,所有都发生在同一表中),任务之间的共享学习会产生规范化效果,从而提高每个任务的数据效率.
基于RCSV多任务培训的经验观察:
- 1项任务,200个演示: 85%在分发中成功.
- 5个相关任务,每次200个演示 (1000个总数): 88%的平均在分发成功和 62%的OOD.
- 5个相关任务,每项100个演示 (共500个): 84%的平均分销成功率和 55%的OOD.几乎与每项任务的数据的半个相匹配.
- **5个不相关的任务,每一个200个演示 (1000个):**平均83%的分销成功.与单任务培训相比,降低较小,因为任务没有分享有用的原始性.
基本规则:如果您的任务共享至少50%的运动原始性 (相同的工作空间,相同的抓住器,类似的对象),多任务训练与语言调节可以减少每任务的数据需求30-50%.如果任务不相关 (不同工作空间,不同的抓住器), 训练单任务的单独政策. 为了实现多任务部署,RCSV的数据收集活动是为了最大限度地实现跨任务共享原始,而与独立单任务活动相比,减少了20-40%的总收集成本.
计算规模:什么时候训练更大的模型 vs 收集更多数据
机器人学习面临的计算数据交易与语言建模不同.在语言建模中,使用固定数据扩展模型大小可预测地提高性能.在机器人学习中,证据表明,数据多样性比模型大小更重要.
| Model Size | Architecture Example | Demos for Peak In-Dist | In-Dist Success | OOD Success | Training Cost |
|---|---|---|---|---|---|
| Small (5-20M params) | ACT (ResNet-18 backbone) | 200-300 | 85-92% | 40-55% | $5-15 |
| Medium (50-200M params) | ACT (DINOv2-B backbone) | 300-500 | 88-94% | 55-70% | $50-200 |
| Large (1-7B params) | OpenVLA (Llama-7B backbone) | 100-200 (fine-tune) | 90-96% | 65-80% | $500-3,000 |
关键发现:具有多样化的数据的中型模型通常与具有较少多样性的 OOD 评估数据的大型模型相匹配.在500个多样化的示范中训练的100M参数ACT与DINOv2脊柱可实现65-70%的 OOD 成功,与7B参数OpenVLA相比,在150个不多样化的示范中进行了微调. 大型模型在分销中具有更高的峰值性能,但培训数据的多样性是通用化的主导因素.
预算分配的基本规则: 如果您的项目总预算是X,则要花70%用于数据收集 (强调多样性),20%用于计算 (培训和评估),10%用于工程 (管道,整合).
通过模拟数据进行扩展:Sim可以取代多少真实数据?
模拟数据的规模便宜,但传输不完美. 实际问题是,模拟可以抵消现实数据收集的数量.
- 视觉多样性: 通过域名随机化,SIM可以提供无限的视觉多样性.对于视觉概括 (新物体,照明,背景) 具体来说,与域名随机化的10KSIM集提供相当于500-1000个真实集的好处.这是在扩展环境中SIM数据的最强的使用情况.
- 机动控制精度: 对于精度任务 (mm下插入,可变化的操作) 的Sim数据传输不佳,因为物理模拟错误复合.对于这些任务,Sim数据提供0-20%的相当的真实数据值.
- **实用混合比率:**最有效的方法是8090%的SIM数据 (视觉多样性和粗
行为) 加上10-20%的真实数据 (物理定位和精度).这种混合方法通常达到85-90%的真实数据性能,占实际数据收集成本的20-30%. - **在sim中降低的回报:**Sim数据显示了大多数任务的10K-50K集中的自己的平原.除了50K的sim集之外,额外的sim数据提供了微不足道的改善 - - 瓶
转移到sim到真实差距,而不是数据量.投资更好的域间随机化而不是更多的集.
RCSV通过我们的 [数据服务] (
开放的问题和我们还不知道的东西
尽管在2026年仍未得到答案,但机器人学习规模化问题仍存在一些重要问题. 关于跨模式数据 (人类操纵的视频,模拟示范,语言描述) 与实际机器人数据提供相同的扩展效益是否正在积极讨论,初步证据表明它有助于视觉表示,但不是精确的运动控制.
数据收集速度:您可以量度到底多快?
即使有适当的预算配置,数据收集速度也会受到物理现实的限制.
| Configuration | Demos/Hour | Demos/Day (8hr) | Time to 500 Demos |
|---|---|---|---|
| 1 arm, simple pick-place, expert operator | 60-120 | 400-800 | 1 day |
| 1 arm, multi-step assembly, expert | 15-30 | 100-200 | 3-5 days |
| Bimanual (ALOHA), simple task | 30-60 | 200-400 | 2 days |
| Bimanual, complex task, novice operator | 8-15 | 50-100 | 5-10 days |
| Remote teleop (100ms+ latency) | 10-30 | 80-200 | 3-6 days |
并行化: 规模数据收集的最快方法是同时运行多个机器人站.每个额外站都会增加近线性吞吐量 (减10-15%的协调总费用).RCSV对大型活动进行并行运行4-8个收集站,每天实现1000-2,000+的演示,用于简单任务. 增加站的成本在竞选期间被抵消,使得并行收集比运行单个站更长时间更具成本效益.
这些费率假设一个成熟的收集管道,没有硬件问题.对于第一次设置,在操作员和管道正在调试时,减少50%的吞吐量预期.RCSV的设施始终实现了"专家操作员"费率,因为我们的操作员在多个任务类别中拥有500多小时的远程操作经验.
高原问题:更多数据不再有帮助
每个团队最终都会达到一个性能高原,添加更多示范会产生微不足道的改善. 识别你达到一个高原时 - - 而数据质量或多样性是瓶
**你已经达到真正的高原的迹象:**过去3个收集培训周期的成功率在+/- 2%内.再加上200个系统性多样性变化示范并没有改善OOD性能.验证损失已经平坦化,并且随着更多的培训时代不会减少.
**区分多样性高原与多样性高原:**最常见的错误是将多样性高原解释为多样性高原. 如果不同批量提高性能,而均
**标志着高原是人工的 (可固定):**分布性能强 (>90%) 但OOD性能较弱 (<50%) - 这表明多样性瓶
当你遇到一个真正的高原时,选择是: (1) 转向一个具有跨体现预训练的基础模型,它提供了从零开始高原的新基线; (2) 添加提供信息的模式 (F/T感知,深度),该政策无法从现有的观察中提取信息;或 (3) 将任务分解成子政策,每个任务都可以独立改进,超过整个任务高原.
实用检查点:何时停止收集数据
团队最常问的问题之一是"我需要多少示范?"诚实答案取决于你的任务和目标成功率,但这些检查点提供了决策点.
- **50个演示:**管道验证检查点. 制定政策并评估20个试验.如果成功率低于30%,则可能会出现管道错误 (数据格式,操作正常化,摄像头校准) 而不是数据量问题. 在收集更多数据之前,修复管道.
- **100个演示:**可行性检查点.如果该政策在分发中取得50%以上的成功,任务可以根据您目前的架构和数据质量学习.如果在调试后低于50%的时间,请考虑该任务是否需要额外的方法 (F/T传感,深度) 或不同的算法.
- **200个演示:**多样性检查点. 评估已保留的物体/位置. 如果在分销中成功率为80%以上,但OOD成功率低于40%,问题是多样性,而不是量.
- 500个演示: 降低回报检查点.对于单任务BC在L2任务,大多数团队看到的演示 300-500比3%以下的改善.
- **1,000+演示:**仅适用于L3/L4任务 (复杂组装,多步序列) 或多任务训练,总演示数分为5到10任务. 收集成200批,并在批次之间进行评估以避免浪费.
最重要的是,DROID平原在5万次示范时是否反映了当前建筑的基本上限,测试的特定模型的限制 (ACT,扩散政策),或数据集的多样性配置文件的文物是未知的. 另有,需要进行建筑创新 (更好的行动表现,更好的时间建模或更有效地使用力扭矩数据) 才能突破当前的扩展天花板.
系统的设计是为了支持团队在这些不确定性中进行导航.我们的结构化多样性协议,标准化评估基准和灵活的数据出口格式使您能够随着该领域的理解扩展动态的不断发展,快速地进行
相关阅读
- [开放的X体:改变一切的机器人数据集]
- [一般化挑战:机器人政策在2026年仍然失败的原因]
- [机器人学习:每次示范分析的成本]
- [机器人学习视频:2026年最先进的技术]
- [活动与传播政策:何时使用哪种]
- [RCSV数据收集服务]
建立多样化的高质量数据集
汇集数据服务的结构是为了最大化多样性:实际上,这种尺寸是对机器人政策的表现进行衡量的.
[查看数据服务]







