返回Guides

机器人模仿学习:ACT,传播政策,VLAs <unk>实用指南 (2026)

完整的机器人学习模仿指南 <unk> ACT,扩散政策,OpenVLA,数据要求,培训管道和故障模式诊断.

从人类示范中训练机器人的实践者指南 涵盖ACT,传播政策,OpenVLA,数据要求,训练管道,故障模式诊断和用于现实世界操纵的部署策略.

模仿学习是什么?

模仿学习通过向机器人展示所需行为示例来训练机器人.而不是手动编程轨迹或工程奖励功能来加强学习,你通过 [远程操作]T3) 来证明任务,机器人学习从示范数据中复制你的行为.

核心想法很简单:从人类示范中收集一组数据集 (观察,行动) 双,然后训练一个神经网络来预测当前的观察所做出的正确行动.训练的网络成为机器人的政策,实时运行,以自主控制机器人.

实践中,模仿学习是让机器人在2026年完成新的操纵任务的最可靠方法.强化学习需要数百万个环境相互作用和精心塑造的奖励功能.经典运动规划需要每个对象的明确几何模型. 模仿学习只需要示范,而现代建筑,

简短的历史:从行为克隆到现代建筑

**行为克隆 (BC) **是最简单的形式:监督学习,直接将观察到行动. 训练一个神经网络 (图像,联合_位置) → (下_行动) 双重使用标准回归损失.BC在示范数据一致时运行良好,并涵盖了机器人在部署过程中遇到的状态分布. 机器人偏离了所示轨迹时失败了.

**Dagger (数据集) **,由Ross等人于2011年推出,通过在机器人实际访问的状态上反复收集新的示范来解决分布转移.训练后,你部署了最初的BC政策,让它漂移,然后让人类纠正结果的状态.这些纠正被添加到训练集中. ,它需要一个在每次训练代中可用的人类专家.

**GAIL (Generative Adversarial 模仿学习) **,由霍和埃尔蒙于2016年推出,将模仿学习与对抗训练结合在一起:一个歧视者学习如何区分机器人行为与人类行为, 盖尔处理多模式演示比BC更好,但需要在线环境交互 (通常是在模拟中) 并很难调整.它在现实机器人设置中使用的限制.

2026年占据实世界机器人操纵的三种方法都是基于行为克隆范式的 ACT,扩散政策和VLA模型,但增加了解决其核心局限性的建筑创新.

为什么模仿学习赢得了操纵

在2023年之前,大多数机器人实验室认为强化学习最终会解决操纵.这种期望并没有实现接触丰富的任务.

  • **样本效率:**可在一天内收集的50500个人类示范中训练出有用的模仿学习策略.
  • **没有奖励工程:**RL需要一个奖励功能,它能完全捕捉到"成功"意味着什么.对于操纵任务,如折叠服装或组装组件,定义奖励是非常困难的.模仿学习完全回避问题.
  • **远程运行数据是自然的:**现代远程运行硬件 (领先跟随手臂,VR控制器,外骨架手套) 简单地收集高质量的示范.数据收集过程直接映射到政策输入格式.
  • **现实世界兼容性:**RL训练在模拟方面最好,但对接触丰富的操纵的真实传输仍然不靠谱.模拟学习训练直接基于现实世界的数据,消除了训练阶段的现实差距.
  • **与基础模型的复合性:**预训练的视觉语言模型 (SigLIP,DINOv2) 提供了强大的视觉表示,模仿学习可以直接利用.RL无法轻松地纳入预训练的表示,因为奖励信号必须流通整个网络.

对于机动 (Unitree的G1,波士顿动力学的亚特拉斯) 和具有明确奖励信号的任务 (游戏玩,导航) 仍然占据了RL的主导地位.

动作与变压器的

ACT由2023年斯坦福大学的托尼等人推出,是桌面操纵的模仿学习的工作马.它预测未来的行动的_chunk_ (序列) 而不是单一的下一步行动,直接解决行为克隆中的复合错误问题.

如何执行ACT

ACT使用CVAE (条件变动自动编码器) 架构,具有变压器脊椎.编码器处理通过ResNet或ViT视觉编码器传递的当前观测摄像头图像,加上联合位置,并将其编码成隐形表示. 解码器采用了这个隐藏代码并生成了未来_k_行动的序列 (通常是 k=100,代表50 Hz控制的2秒).

关键见解是通过碎的时间平滑**:通过一次预测100个未来行动,模型必须产生一致的轨迹,而不仅仅是即时下一步的行动. 这作为一个隐含的调节剂,即使单个示范轨迹略有所不同,也会产生平稳,一致的运动.

在部署过程中,ACT使用时间组装:在每一步时,它生成一个新的100步行动部分,但执行的行动是当前部分和之前的预测行动的权重平均值.这进一步平滑了轨迹,减少了动.

什么时候使用ACT

  • 用12的机器人手臂操作桌面 (原始的ALOHA使用案例)
  • 具有相对确定性策略的任务 (选择,插入,组装)
  • 需要快速训练的管道
  • 当你需要部署在适度硬件上 (运行在单个消费者GPU, ~ 15 ms推理)

对于ACT的典型数据要求

  • 简单的选择:50次演示 → 85%+成功
  • 双手协调:100次示范 →80%以上的成功
  • 精确插入 (插孔,USB):200次示范 →70%以上成功
  • 复杂的多步骤任务:需要400800个示范

清洁的50个,一致的演示通常比有500个杂的演示更高.

训练ACT与LeRobot

2026年训练ACT的最容易使用的方法是通过抱脸的[LeRobot]T4框架.

# Install LeRobot
pip install lerobot

# Convert your dataset
python -m lerobot.scripts.convert_dataset \
  --raw-dir ./my_episodes/ \
  --repo-id my-org/my-task \
  --raw-format hdf5_aloha

# Train ACT policy
python -m lerobot.scripts.train \
  policy=act \
  dataset_repo_id=my-org/my-task \
  training.num_epochs=2000 \
  training.batch_size=8

训练通常在28小时内通过单个RTX 4090进行100200集的数据集.

行为:优势与缺点

Pros Cons
Extremely data-efficient (50 demos for simple tasks) Struggles with multi-modal action distributions
Fast inference (50+ Hz on consumer GPU) No language conditioning
Smooth trajectories via temporal ensembling Sensitive to demonstration inconsistency
Well-supported in LeRobot framework Single-task only (one policy per task)
Low training compute (single GPU, hours) Temporal ensembling weight requires manual tuning

传播政策

扩散政策由Chang Chi等人在2023年在哥伦比亚大学推出,应用了除扩散框架,像稳定扩散等图像生成模型的方法,用于机器人行动预测.它已成为示范数据中存在多个有效策略的任务的选择.

传播政策的运行方式

透政策不直接预测行动,而是学习以反复将随机噪音向量归类为清洁行动轨迹.在训练期间,它从演示中采取清洁行动轨迹,添加不同水平的高斯噪音,并训练一个网络 (通常是1D U-Net或变压器) 来预测增加的噪音. 在推断过程中,它从纯噪音开始,并反复在K步骤上进行指控 (通常使用DDIM计划) 产生清洁的行动轨迹.

透模型自然代表多种有效的解决方案.如果有两个同样好的方法来抓住一个对象 (左对右的方法),透政策可以表示两个模式,而不平均它们在一个错误的中间轨迹. 平均模式的MSE损失模式的标准行为克隆,这对双模式任务是灾难性的.

散政策还产生了非常光滑的轨迹**,因为散过程本质上产生了时间一致的行动序列.这使其非常适合在轨迹光滑直接影响成功的擦拭,倒和表面后续等接触丰富的任务.

什么时候使用传播政策

  • 具有多个有效战略的任务 (数据包含不同的方法实现相同目标)
  • 精确的力轨迹重要的地方,
  • 需要高轨迹顺度的任务 (倒,绘制,表面擦拭)
  • 当你有多个操作员的数据,
  • 当你有一个足够的计算的GPU进行反复代码时 (3080 ms推理)

传播政策的典型数据要求

  • 简单单单模任务:100200个示范
  • 多模式任务 (多个有效战略):200500次示范
  • 复杂接触式操纵:5001,000次示例

与ACT的主要区别:扩散政策对示范不一致性不那么敏感,因为它可以代表多模式分布.这使得它更宽容于多个运营商收集的数据.

传播政策:优势与缺点

Pros Cons
Handles multi-modal action distributions natively Slower inference than ACT (10-30 Hz)
Exceptionally smooth trajectories Needs more data than ACT for simple tasks
Robust to operator variation in demonstrations More hyperparameters (diffusion steps, noise schedule)
Strong performance on contact-rich tasks No language conditioning (without extensions)
Supported in LeRobot and robomimic Higher GPU memory requirements during training

开放VLA和视觉语言行动模型

视觉语言行动 (VLA) 模型代表2026年机器人学习的边界.它们结合了预训练的视觉语言模型和行动预测,使机器人能够遵循自然语言指令 ("取红杯并将其放在托盘上") 并将其通用到未见过的任务和物体中.

基础模式发生了什么变化

传统模仿学习 (ACT,扩散政策) 从零开始培训任务特定的政策.每项新任务都需要一个新的数据集和一个新的培训运行.VLA模型通过提供已经理解视觉场景和语言的预训练表示改变了这个方程.

实际结果:VLA模型可以在较少的任务具体示范下实现合理的性能,因为视觉理解和语言定位的重量在互联网规模数据和像Open X-Embodiment这样的大型跨体机器人数据集中进行了预训练,

关键的VLA模型

  • OpenVLA (伯克利, 2024):基于Llama 2 + SigLIP的开源7B参数VLA.基于开放X-Embodiment数据进行训练.与100500个示范的新机器人进行精细调.在单个A100 GPU上运行在5Hz.
  • pi0 (物理智能, 20242025):专有VLA训练在跨体体数据,包括巧妙的手. 证明了零射击转移到未见的任务.可通过物理智能的API.
  • 10月 (伯克利,2024):轻量93M参数一般主义政策. 设计用于快速调整50200个示范.开源,运行于单个消费者GPU.
  • RT-2 (谷歌深度思维, 2023):基于 PaLM-E 的 55B 参数 VLA. 最先进的通用化,但需要大量计算 (8 TPU v5e 芯片).

精细调节与从零开始训练

** 精细调节预训练的VLA** (实践路径):从OpenVLA或Octo检查点开始.在机器人上收集100500个示范.使用LoRA (7B+模型) 或全细调 (Octo-scale模型) 精细调节.训练时间:14GPU上424小时.这利用预训练的视觉和语言表示,是大多数团队所推的方法.

从零开始训练VLA (仅用于资金丰富的实验室):需要在各种机器人和任务中进行10,000100,000+的示范,加上1001,000+的GPU小时.只有当您正在为新机器人体现类构建基础模型或需要未包含现有VLA的功能时才是合理的.

VLA 模型:优势和缺点

Pros Cons
Language-conditioned task execution Slow inference (3-10 Hz)
Multi-task from a single model Requires A100-class GPU for 7B+ models
Strong generalization to new objects Fine-tuning is more complex than ACT/DP training
Leverages internet-scale pre-training Larger models are sensitive to prompt formatting
Cross-embodiment transfer potential Still maturing — fewer deployment success stories than ACT/DP

算法比较表

Algorithm Data Efficiency 泛化能力 Compute (Train) Compute (Infer) Ease of Training Best For
ACT Very high (50-200) Low (single task) 1 GPU, 2-8 hrs 50+ Hz, 1 GPU Easy Single-task tabletop, fast iteration
Diffusion Policy High (100-500) Medium (multi-strategy) 1 GPU, 4-16 hrs 10-30 Hz, 1 GPU Moderate Multi-modal tasks, contact-rich
Behavioral Cloning High (50-200) Very low 1 GPU, 1-4 hrs 100+ Hz Very easy Prototyping, baselines
GAIL Medium (100-1000) Medium Needs sim, days 50+ Hz Difficult Sim-only research, locomotion
OpenVLA / Octo High (50-500 fine-tune) High (cross-task) 1-4 A100s, 4-24 hrs 3-10 Hz, 1 A100 Moderate-Hard Multi-task, language-conditioned

培训管道:五个阶段

无论你选择哪个算法,培训管道都遵循这些阶段.

阶段1:数据收集

通过 [远程操作]T5收集人类示范. 使用领袖跟随手臂来获得最高质量的数据,或者VR控制器来实现更快的吞吐量在粗略操作任务上. 记录在50Hz的联合数据和30fps的摄像头. 存储在 HDF5格式.查看我们的 [数据收集指南]T6) 完整协议.

在这个阶段,关键的决定是:演示次数 (参见上述算法具体建议),操作员一致性 (启动带的操作员为3),启动状态随机定位 (系统地设置不同的对象位置) 和摄像头设置 (最低:1手腕+1空头摄像头).

阶段2:数据格式化和预处理

转换原始录音为准备训练的格式:

  • 图像改大小: 将相机框架改大小,达到模型预期输入分辨率 (通常为基于ViT的编码器224x224 ,为ResNet256x256).使用反缩改大小 (兰乔或双立方) 保存细节.
  • ** 行动正常化:** 将操作正常化到 [-1, 1] 范围.计算从训练集中平均和标准偏差.在部署时应用相同的正常化.
  • ** 事件过:** 删除失败的事件,异常持续时间 (>3标准偏差) 的事件,以及质量审查期间标记的事件.
  • 火车/验证分类: 保持1015%的节目进行验证. 分类按节目,从来没有按框架.
  • **格式转换:**对于LeRobot培训,使用T1将 HDF5转换为Parquet.对于robomimic,使用其本土的 HDF5加载器.查看我们的 [数据格式指南]T7) 详细信息.

第三阶段:培训

典型的训练配置按算法:

  • ACT: 2,0005,000个时代,学习率1e-5与可西斯时间表,批量大小816.训练时间:在单个RTX 4090上28小时.
  • 散政策: 5002,000个时代,学习率1e-4与可西因时间表.DDPM与100个散步步骤进行培训,DDIM与1050步骤进行推断.培训时间:416小时,单个RTX 4090.
  • VLA精细调节: 20100时代,学习率2e-5.7B+型号的LoRA (排名1664) 或1B型号的完全精细调节. 14A100GPU上训练时间:424小时.

监测训练损失和验证损失. 如果验证损失在几百个时代后与训练损失分歧,你已经过度适应了

阶段4:评估

验证损失是现实世界性能的弱预测.唯一可靠的评估是部署实际机器人的政策和测量任务成功率.运行至少20次评估试验以获得统计意义的结果 (95%的保证间隔约为20次试验的 ±20%,50次试验的 ±10%).记录每个评估事件进行故障分析.

根据两个条件进行评估: (1) 标题 与训练数据相同的对象位置,照明和摄像头角度; (2) 扰乱的 随机位置,变化的照明或未见的对象实例.名义和扰乱的成功率之间的差距显示了您的政策的概括边界.

阶段5:部署

导出训练模型到ONNX或TorchScript用于部署.在机器人的内置GPU上运行推理 (内嵌的NVIDIA Jetson Orin,工作站RTX 4060+).监测推理延迟如果该政策不能运行在机器人的控制频率,使用动作分量来预测每次推理调用的多次未来行动.

记录每一个部署事件,以获得 [数据飞行车]T8) 反.包括政策版本,观察数据,预测行动和结果标签 (成功/失败).

算法数据要求

Task Complexity ACT Diffusion Policy OpenVLA (fine-tune) Octo (fine-tune) Typical Success Rate
Simple pick-place 50 100 100 50 80-95%
Bimanual coordination 100 200 200 100 70-85%
Precise insertion 200 300 300 150 65-80%
Multi-step assembly 500 500 500 300 50-70%
Multi-task (language-cond.) N/A N/A 500-2000 200-1000 40-70%

训练硬件要求: ACT和扩散政策训练在单个RTX 3060或更好的 (16GBVRAM推).OpenVLA细调需要至少1 A100 (40GB) 或2个RTX 4090s.在单个RTX 4090上进行 octo细调.所有算法都受益于快速的NVMe存储来加载图像数据集.

5常见的失败方式和如何解决它们

1. 分布转移 (组合错误)

症状: 政策在最初几秒钟内运行,然后逐渐偏离轨道并失败.

**根源原因:**随着时间的推移,小预测错误复杂,将机器人推向训练数据中未表示的状态.

修正: 使用动作分量 (ACT预测100步分量,减少错误可能复杂的决策点数量).在训练期间添加图像增强 (随机作物,色彩震动) 让视觉编码器强大到轻微的视角变化.收集恢复示范:运行政策直到它漂移,然后从漂移状态进行远程操作完成任务. 这些"DAgger式"纠正是您可以添加的最高价值数据.

2\ 多模式崩 (模式平均)

**症状:**机器人移动到两个有效的策略之间位置,没有达到任何一个.或者机器人在决策点结冰,多个策略同样有效.

根源原因: 培训数据包含了不同的战略示范 (从左到右的方法),而MSE损失平均将它们归纳到单个错误的中间轨迹.

修正: 转换为多模式分布的扩散政策. 如果您留在ACT,则将示范策略标准化确保所有示范都遵循相同的方法. 删除使用少数策略的示范 (总计不到20%).

3. 行动预测的复合错误

**症状:**机器人产生正确的轨迹,但随着时间的推移积累了位置错误,导致13厘米的抓获.

**根源原因:**训练和部署之间的行动正常化不匹配 (不同平均/日值),或政策预测长轨道上积累浮点错误的三角形行动.

** 修复:** 检查在训练和部署期间使用相同的正常化统计数据 (平均,STD,min,max). 偏好绝对的联合位置目标,而不是多角行动.对于多角行动政策,定期将预测的轨迹重新定向当前观察到的状态,而不是纯粹集成多角.

硬件不匹配

症状: 当移动到不同的表格,不同的照明或相同机器人模型的不同实例时,在原始数据收集设置中运行良好的政策完全失败.

**根源原因:**摄像头位置转移 (即使是5毫米度的抓住),照明条件变化 (影响视觉特征),或机器人关节校准不同单位.

** 修复:** 永久安装硬灯的摄像头,在每次部署会议之前检查外观.使用校准目标 (ArUco板) 检查摄像头姿势.多机器人部署,收集每个机器人单元上的小型校准数据集 (2030个演示).在训练中应用域间随机分类:随机亮度/对比,随机摄像头作物,随机背景纹理.

5. 无法设置重置

症状: 政策似乎成功率低,但仔细检查显示,许多失败来自于已出门训练分布的状态,

根源原因: 评估协议无法正确地将场景重新设置在训练间分布状态下.

** 修正:** 定义明确的重置标准:对象位置,机器人家庭配置和场景安排. 在每个评估事件之前检查重置质量. 在数据收集期间,系统地随机地对预期部署分布进行初始状态进行排序. 作为数据集的指标,追踪初始状态覆盖.

实体对象的评估

模拟和部署在真实机器人上训练是吸引人的,因为模拟数据基本上是免费的.

模拟有什么帮助

  • **Sim预训练+真实细节调整:**训练10,000100,000模拟集,然后对50200真实集进行细节调整.Sim预训练提供了强大的初始化;真实细节调整弥合了现实差距.
  • 域间随机化: 在模拟训练中随机化视觉特性 (纹理,照明,摄像头位置) 和物理 (摩擦,质量,关节缩).强迫政策强有力的变化,其中一些与现实变化重叠.
  • 机动和全身控制: Sim-to-real对机动的操作效果比操纵更好. Unitree的G1和Go2控制器几乎完全通过 Isaac Lab进行模拟.
  • 政策验证和调试: 在在实际硬件上部署之前,在模拟中运行训练有素的政策.模拟捕获严重错误 (错误的操作空间,正常化错误,控制频率不匹配) 没有冒着硬件损坏的风险.

模拟没有帮助

  • **纯真实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实实
  • **模拟摄像头图像作为训练数据:**尽管光现实染技术取得了进展,但仅仅在模拟摄像头上训练的政策显示,在实际摄像头上,成功率降低了3050%.神经染 (基于NeRF) 正在改善,但尚未为政策培训做好生产准备.
  • 涉及可变形物体的任务: 织物,绳索和食品非常难以精确模拟.

开始检查列表

按照以下10步骤,从零到实施模仿学习政策:

  1. ** 选择您的机器人硬件.** 对于第一个项目:ViperX-300 S2,Koch v1.1或[OpenArm]T9).预算:2000美元8,000美元.您需要控制位置在50Hz最小.
  2. 设置远程操作. 领袖跟随手臂以获得最高数据质量,或VR控制器 (Meta Quest 3) 以更低的成本.
  3. 安装摄像头. 最低: 1 个手腕摄像头 (Intel RealSense D405) + 1 个空头摄像头 (RealSense D435).使用硬的安装
  4. 安装录音软件. 使用LeRobot的数据录音工具或ALOHA录音堆.验证HDF5输出包括正确频率的图像,联合位置和操作.
  5. 定义你的第一项任务. 开始简单:从一个固定位置中选出一个单个对象,将其放置在目标区.
  6. ** 收集50个示范.** 连贯操作员,一致的策略. 每20集中每次要花10分钟检查数据质量. 立即拒绝和重新记录坏集.
  7. ** 训练您的第一份ACT政策.** 使用LeRobot的训练脚本,使用默认的超参数.训练应该在24小时内完成,使用单个GPU.
  8. 运行20次评估试验. 每次试验前重置场景相同.记录成功/失败,并保存每个试验的视频用于失败分析.
  9. 诊断故障并收集针对数据. 确定最常见的故障模式. 收集2030个专门针对故障的示范. 重新训练.
  10. ** 修复到80%的成功率.** 大多数团队在23个收集培训周期内达到80%以上,然后开始扩展到 数据飞行车 操作.

常见的问题

我需要多少次演示?

对于 ACT 进行简单的选择和放置任务:50次示范通常足以实现80%以上的成功率.对于扩散政策:从100200开始.对于VLA细节调整:100500取决于任务复杂性.在所有情况下,数据质量比数量更重要.

哪个选择?

如果您的任务有一个单一的明确战略,并且您希望实现最快的途径,请使用ACT. 如果您的数据包含多种有效方法用于相同的任务 (多个运营商,模糊的把握策略),请使用扩散政策.如果您需要语言条件的多任务执行,请使用VLA. 在怀疑时, 开始使用ACT ,它训练得更快,

我可以用模拟数据吗?

模拟数据本身对于接触丰富的操纵来说是不可靠的.最有效的方法是模拟预训练+真实细调:训练在10,000+个模拟集中,然后细调在50200个真实集中.对于机动任务,纯的模拟到真实与域名随机化工作很好.对于操纵,总是计划收集一些真实数据.

我需要什么机器人硬件?

最少:一个机器人手臂,可控制50Hz的位置 (ViperX-300,Koch v1.1,OpenArm或类似),一个远程操作接口 (领袖手臂或VR控制器),23摄像头 (手腕+上部),以及一个具有NVIDIA GPU的工作站 (ACT的RTX 3060或更好的RTX 4090或A100的扩散政策和VLA).一个启动设置的总预算:5,000美元~15,000美元.

模仿学习与加强学习有什么区别?

模仿学习从人类示范中 你告诉机器人该做什么. 通过奖励信号加强学习从试验和错误中 机器人探索并学习哪些行动最大化奖励.对于操纵,模仿学习更有效的样本 (50500个示范与数百万个RL步骤) 并不需要奖励工程. 对于机动和任务,RL是主导的,具有明确的奖励信号.

训练需要多长时间?

通过RTX 4090播放200集:28小时.在500集:416小时.在500集:424小时.在14A100 GPU上,真正的瓶通常是数据收集和评估,而不是计算训练.

我应该使用哪种数据格式?

HDF5是机器人示范数据的标准格式. 存储联合位置 (qpos),速度 (qvel),摄像头图像和操作作为每个集文件中的单独数据集.与LeRobot进行训练,转换为Parquet格式.查看我们的 [数据格式指南]T12) 详细规格.

模仿学习能否有效地操纵移动?

虽然它需要更多的数据 (5002,000+示范),因为状态空间更大.OpenVLA和pi0等VLA模型更适合移动操纵,因为他们的预训练涵盖了各种实施方案.对于桌面任务,ACT和扩散政策仍然是最实用的选择.

让RCSV专家收集你的训练数据

斯威尔士国家数据集团提供端到端数据收集服务:训练有素的运营商,校准硬件,质量控制和在您的目标格式中交付.

数据收集服务 借用你的飞行员的硬件