Case Studiesに戻る

政策の更なる反復のための現実世界のRL環境

RLチームはベンチマーク合格率を改善し,レグレーション問題を減らすために RCSVの実世界の環境を使用した方法

ロボット工学チームは 模擬重量テストから 持続的な現実環境に移り 基準基準の信頼性を向上させた.

挑戦

模擬は過ぎ去りますが 現実の世界の逆転です

チームでは,接触変異とリセット漂移により,シミュレーションからハードウェアに移行する際に繰り返し政策の逆転が見られました.

RCSV溶液

  • 持続的な環境セル重複リセット論理と安定したセンサー同期化
  • 失敗再プレイダッシュボードレグレーションクラスターの迅速なトリエージとシナリオレベル追跡.
  • 政策ゲートチェック 各プロモーション前にベンチマークゲートチェック

10週間後の結果

  • 基準合格率: 58% -> 84%
  • 放出ごとに逆転発生率: 47%減少**
  • 放出信頼スコア: 31%上昇

環境計画を作って

目標タスクと繰り返しのカデンスに基づいてパイロット,持続,またはパートナーシップモードを選択します.

エンゲージメントモデルを見る RCSVに連絡する