远程机器人舰队管理:监测,诊断和运营
如何远程管理机器人 <unk>远程测量,OTA更新,远程访问,事件响应和KPI跟踪.
针对团队运行5到500台机器人在多个站点的操作指南
舰队管理堆组件
产品级舰队管理系统有五个基本组成部分.大多数团队逐步构建这些系统. 首先是远程测量和远程访问,然后添加更新系统,并随着舰队的扩大超过10台机器人,进行警报.
- 设备注册表: 机组中的每个机器人数据库
序列号,模型,固件版本,位置,分配操作员和当前状态.这是所有其他系统的真相来源.一个简单的PostgreSQL表工作;像AWS IoT或Azure IoT Hub这样的专用解决方案提供了这个规模. - 电气管道: 从机器人流向云.通常是机器人从机器人流入时间系列数据库 (InfluxDB或 TimescaleDB) 中的MQTT或gRPC. 目标为运行指标的延迟为10秒,安全关键信号为1秒.
- 远程访问层: 操作员和工程师可通过验证访问,检查和控制无人机器人.
- OTA更新系统: 推送固件,软件和政策更新的机制到现场机器人.
- 警报和调用: 随着调用工程师的升级,自动检测异常情况.
电测量收集
过度的远程测量增加了成本,产生了噪音.
- 关节温度: 关节发动机温度在°C. 70°C (警告), 85°C (紧急停机) 时. 高温是摩擦增加,轴承故障或任务过载的早期指标.
- ** 联合错误代码:** 任何由电机驱动程序输入的错误代码,记录在时刻标记和联合ID上.
- **电池电荷状态和电压:**电池%和电压在1分钟间隔.
- **任务成功/失败率:**每节目结果,任务类型,持续时间和失败模式.主要业务KPI.
- 网络延迟: 延迟从机器人到云中回路延迟在30秒间隔.
- 摄像头健康: 每个摄像头的
速和 幅数量.一个摄像头 幅超过5%的显示出硬件问题或USB带宽 度.
监测基础设施
标准的开源监控堆
- Prometheus + Grafana: 普罗梅
斯在15秒间隔内扫描每个机器人机队代理所暴露的指标终端点. Grafana可可视化机队级仪表板:总运行时间,每机器人健康,任务吞吐量和警报历史. - **InfluxDB:**对于高频遥测 (100 Hz 时的联合位置),使用InfluxDB的时间系列压缩而不是Prometheus (不适用于高卡达度,高频数据).
- PagerDuty: 管理调用时的轮换和警报升级. 集成Prometheus警报管理器 → PagerDuty用于自动创建事件. 定义安全警报 (即时页面) 与维护警报 (仅营业时间) 的分别升级政策.
- 定制机组健康仪表板: 在 [平台]
T5 中建立单屏"任务控制"视图,显示:所有机器人位置的地图,状态指标,前五项失败任务,机组队运行时间百分比和需要维护的机器人.
远程访问方法
| Method | 延迟 | Security | Best For |
|---|---|---|---|
| SSH over VPN (WireGuard) | 20–80ms depending on VPN server location | High — key-based auth, encrypted tunnel | Engineering diagnostics, log review, config changes |
| WebRTC remote desktop | 50–150ms | Medium — requires signaling server security | Operator GUI access, rviz2 visualization |
| ROS2 bridge (rosbridge_suite) | 30–100ms | Low by default — add TLS + auth explicitly | Programmatic telemetry access, remote monitoring scripts |
WireGuard VPN是所有远程访问的推
警报门
| Metric | Warning Threshold | Emergency Threshold | Automated Action |
|---|---|---|---|
| Joint temperature | >70°C | >85°C | Emergency: immediate e-stop |
| Task success rate (7-day rolling) | <80% | <60% | Emergency: suspend policy, alert on-call |
| Battery SoC | <20% | <10% | Emergency: return to charger or alert operator |
| Network latency (robot→cloud) | >200ms | >500ms | Warning: log; Emergency: disable teleoperation |
| Camera frame drop rate | >5% | >20% | Warning: log; Emergency: pause data collection |
| Consecutive task failures | 3 in a row | 5 in a row | Warning: operator alert; Emergency: suspend + escalate |
更新程序
通过空气更新是如何将改进和安全修正运送到部署的机器人,而不需要网站访问.
- ** 构建:** 每个更新 (固件,软件或政策) 都是在CI内构建,并产生一个版本的文物,具有 sha256 检查总数.文物存储在一个发布登记库 (S3桶或文物登记库).
- ** 阶段测试:** 在任何现场部署之前,更新应应用于实验室中的2
3个阶段测试机器人,并通过50次试验自动测试套件验证. - 加拿大
鱼部署 (10%): 部署到10%的机队 (或至少3台机器人) 进行48小时的部署. - **全部署:**如果加拿大指标为名义,将其部署到剩余的舰队.以每小时25%的速度将部署部署放缓,以避免同时重新启动导致整个舰队停机时间.
- 反弹功能: 每个机器人都会本地维护以前版本的文物.反弹时间 <2分钟,可从管理仪表板上启动每个机器人或整个机队.
舰队KPIs
| KPI | Definition | Target | Measurement Interval |
|---|---|---|---|
| MTBF (Mean Time Between Failures) | Average operating hours between unplanned stoppages | >200 hours | Monthly |
| MTTR (Mean Time to Repair) | Average time from incident detection to resumed operation | <2 hours | Monthly |
| Fleet uptime | % of scheduled operating hours spent in active operation | >95% | Weekly |
| Task completion rate | % of tasks completed successfully without human intervention | >90% | Daily |
| OTA update success rate | % of update deployments that succeed without rollback | >99% | Per-release |
连接选项:详细的比较
| Option | Typical 延迟 | Bandwidth | Cost/Robot/Month | Best For |
|---|---|---|---|---|
| WireGuard VPN over WiFi | 20-80 ms | 100+ Mbps | $5 (VPN server) | Lab and warehouse with existing WiFi |
| WireGuard VPN over 5G | 15-40 ms | 100-500 Mbps | $30-$80 (data plan) | Mobile robots, outdoor, no WiFi available |
| Tailscale (managed WireGuard) | 20-80 ms | 100+ Mbps | $0-$18/device | Quick setup, NAT traversal, SSO integration |
| WebRTC peer-to-peer | 50-150 ms | 10-50 Mbps | $0 (STUN/TURN server) | Browser-based remote viewing, video streams |
| Wired Ethernet (on-premise) | <1 ms | 1 Gbps | $0 (existing infra) | Fixed arm installations, highest reliability |
对于大多数部署,建议的架构是:用于机器人LAN (手臂控制器到工作站),用于远程访问的WireGuard VPN (工程师笔记本电脑到机器人),用于云远程测量上传的WiFi或5G.这为控制循环提供微秒的延迟,同时实现安全的远程访问.
错误检测和自动恢复
设计良好的舰队管理系统,在没有人干预的情况下,可以从常见故障中恢复,从而将MTTR从小时降低到几分钟:
- ** 观察狗计时器:** 机组上的机队代理每10秒发送一次心跳.如果机队经理30秒内没有收到心跳,它将标记机器人为"无法达到"并触发网络诊断序列 (ping,轨道,DNS检查).如果机器人5分钟无法达到,则创建一个PagerDuty事件.
- 自动重新启动过程: 使用系统d服务单元用于所有机器人软件 (ROS2发射,舰队代理,摄像头驱动程序).用
T1 配置 T0 . 这自动恢复过程崩 (安全漏洞,OOM 杀死).记录每一次重新启动事件到远程管道. - 摄像头恢复: USB摄像头偶尔从公共汽车中掉下来. 机队代理监测
T2 设备节点. 如果摄像头消失,代理运行 T3 在端口上,等3秒,并验证摄像头再次出现.如果没有3次尝试后,请通知操作员进行物理检查. - **网络故障:**对于具有WiFi和蜂
连接的机器人,配置自动故障:如果WiFi延迟超过200ms30秒,则将远程测量和API流量转换为蜂 备份. - 磁盘空间管理: HDF5数据收集可以快速填充磁盘 (3摄像头30fps = ~50GB/小时). 机队代理监测磁盘使用量,并在磁盘超过70%时自动将完成的集段传输到NAS或云存储器.
互联网平台
RCSV平台 提供了一个管理的舰队管理层,消除了建立定制监测基础设施的必要性:
- 舰队仪表板: 实时地图所有机器人位置,有状态指标 (绿/黄色/红).点击任何机器人,查看直播远程测量,摄像头传输和任务历史.
- **电气管道:**机器人通过MQTT向平台的InfluxDB后端发送测量.预建的Grafana仪表板用于联合健康,任务性能和舰队利用.
- OTA更新管理器: 将新固件,软件或政策文物上传到平台上.
- 警报路由: 设置警报规则 (基于
值或异常检测) 通过路由到电子邮件,Slack,PagerDuty或平台内置的通知系统.
相关指南
- 机器人API集成指南 -- 机队通信的API模式
- [政策部署到生产]
T8 ) --在整个舰队中部署和监测政策 - [预防性维护时间表]
T9 ) -- 车队运营的维护计划 - [机器人安全风险评估]
T10 ) --分布式机队部署的安全要求 - [仓库部署检查清单]
T11 ) --生产环境中的舰队部署
与RCSV合作
斯威尔士国家机器人管理委员会提供了任何规模的机器人部署的舰队管理基础设施.
从一个仪表板管理你的舰队
斯威尔士航空航天委员会平台为机器人运营商提供车队遥测,OTA更新管理以及任何规模的远程访问.
[探索平台]







