두 가지 방법 을 실행 하고 개선 하십시오
DK1 쌍방향 학습 경로 6단계. 두 팔에서 추론을 배포하고 쌍방향 평가 프로토콜을 실행하고, 일반적인 쌍방향 실패 모드를 수정하고 데이터 플라이휠을 시작하십시오. ~ 2 시간.
6개 중 6개 부대 · 배포 및 개선 · ~ 2시간
훈련된 체크포인트가 있습니다. 이제 두 팔에 동시에 배치하고, 두 손으로 만든 프로토콜을 사용하여 엄격하게 평가하고, 두 팔의 조정에 특유의 실패 모드를 이해하여 체계적으로 개선할 수 있습니다.
두 팔의 인퍼런스 설정
이중 수동 추론은 두 팔의 동작을 동시에 내보내는 단일 정책 네트워크를 실행합니다. 관찰-행동 루프는 훈련 데이터와 동일한 주파수 50Hz에서 실행됩니다. 두 팔의 팔이 각자의 동작 덩어리를 동기화하여 실행합니다.
소스 ~/dk1-env/bin/activate # 첫 3 에피소드 평가에 E-스톱 근처에 손을 유지 python -m lerobot.scripts.eval \ --policy-checkpoint ~/dk1-policy/cube-handoff-v1/checkpoint_XXXXX \ --robot-path ~/dk1-config.yaml \ --robot-type dk1_bimanual \ --device cuda \ --num-eval-episodes 10 \ --record-video \ --output-dir ~/dk1-evals/v1 #
첫 번째 평가 실행에 대해서는 물리적 충돌이 임박하지 않는 한 정책이 중단없이 실행되도록 허용하십시오. 2개 정책은 종종 실제 환경에 적응함에 따라 첫 1
양동력 평가 프로토콜
구조화된 프로토콜을 사용하십시오. 비공식적인 평가 "이런 것 같네요"는 2개 수록 정책에 대한 신뢰도가 떨어집니다. 부분적인 성공은 훨씬 더 흔하고 근본적으로 깨진 전달을 숨길 수 있기 때문입니다.
| Protocol Item | Bimanual Specification |
|---|---|
| Number of episodes | 10 minimum; 20 for high-confidence results before adding more data |
| Cube starting position | Fixed, tape-marked position — same as your Unit 4 training setup |
| Lighting | Must match training conditions. Even opening a window can shift lighting enough to affect the workspace camera |
| What counts as full success | Cube starts on right side, ends on left side, both arms return to home pose, no human contact during episode |
| What counts as partial success | Correct grasp achieved but transfer fails, or transfer succeeds but placement is off-target. Log these separately. |
| Failure classification | Log: (A) grasp failure, (B) handoff failure — arm-to-arm transfer drops, (C) placement failure, (D) timeout. The handoff failure category (B) is unique to bimanual and most informative for improvement. |
| Report metric | Full success rate (episodes with all 4 phases correct). Also report partial success rate. Example: "4/10 full, 7/10 reached handoff phase". |
일반적인 쌍방향 실패 모드
이러한 장애 모드는 단일 팔 장애와 구별되며 두 가지 수동별 수정이 필요합니다.
- 팔은 전달 지점에 비동기적으로 도착한다: 한 팔은 전달 지위에 도달하고 기다린다. 다른 팔은 늦게 도착한다. 정책은 팔 사이의 상대적 시기를 배우지 않았다. 수정: 두 팔이 전송 지점에 명시적으로 1
2 초 동안 멈추는 20 개의 시범을 추가합니다. 이 때문에 전송이 완료되기 전에 동기화 요구 사항은 데이터에 명시적으로 나타납니다. - 수포
큐브는 두 팔 사이에 떨어진다: 가장 흔한 쌍방법적 특정 장애. 수신 팔은 주류 팔의 방출에 비해 너무 일찍 또는 너무 늦게 그립을 닫는다. 수정: 특히 25%의 속도로 15개의 느린 동작 수포 시범을 수집한다. 과장된 시기는 정책에 수포 상태 전환 순서에 대한 더 명확한 신호를 준다. - 정책은 단일 팔 전략에 공감한다: 정책은 다른 팔의 능력을 무시하면서 한 팔만 가지고 작업을 완료하는 것을 배우게 된다. 이것은 한 팔의 시범이 다른 팔보다 일관성이 높을 때 발생합니다. 수정: 훈련 곡선 (부동 5) 에서 각 팔의 행동 오류를 검토하고 특히 약한 팔의 단계를 대상으로 추가 디모를 수집합니다.
- 팔간 충돌: 두 팔이 동일한 작업 공간 위치를 점유하려고 시도합니다. 이것은 안전 이벤트입니다. 평가 중에 DK1 하드웨어 서버 (
T0 dk1-config.yaml) 에서 충돌을 피하도록 합니다. 안전 팔 분리을 지속적으로 준수하는 시범에 대한 훈련은 대부분의 충돌을 방지합니다. 하드웨어 수준의 경비자는 가장자리 케이스를 처리합니다. - ** 배치 시 단계 비동렬:** 정책은 올바른 동작을 실행하지만 올바른 시간 순서로 실행하지 않습니다. 예를 들어, 왼쪽 팔이 이전하기 전에 오른쪽 팔의 위치를 수행합니다. 이것은 작업 단계 전환과 부각 경계선이 일치하지 않는 행동 조각 조각 유물입니다. 수정: 100에서 50까지
T1 을 줄이고 재 훈련합니다.
2차 수동 개선 데이터 플라이휠
단일 팔 정책에 적용되는 개선 루프는 2 수동
1
평가
10개의 에피소드를 실행하세요. 각 실패를 단계별로 분류하세요 (A/B/C/D)
2
목표
첫 번째 실패 단계를 확인하고, 그 단계를 구체적으로 다루는 20~30개의 디모를 수집
3
재훈련
데이터 세트에 목표형 디모를 추가합니다. 처음부터 다시 훈련하거나 최고의 체크포인트를 정비하십시오
4
평가
10개의 에피소드를 다시 실행하세요. 전체 성공률이 향상되었나요? 다음 실패 단계로 이동하세요.
다음은 뭐야?
이제 두 가지 수동 학습 파이프라인이 작동합니다. 큐브 전달은 훨씬 더 복잡한 작업에 대한 동일한 건축 규모의 기초입니다:
[
변속속 텔레오퍼레이션
힘 피드백이 최적의 운동 속도를 변화시키는 접촉 부적 인 작업에 대한 속도 적응형 텔레오퍼레이션
[
우아한 손 을 더 하라
손에서 정확한 조작을 필요로 하는 작업에 손가락 수준의 기술력을 위해 DK1 팔과 오르카 손을 결합하십시오.
[
데이터 세트를 확장
운영자, 작업 및 하드웨어 구성에서 쌍방향 데이터 수집을 확장하는 기술
[
결과 를 공유 하십시오
DK1 포럼에 성공률, 데이터 세트 및 정책을 게시하세요. 두 편의 결과는 커뮤니티에서 수집하는 가장 가치 있는 결과 중 하나입니다.
](
6단체 완료...
DK1는 구조화된 평가 실행에서 최소 6/10의 완전한 성공률을 가지고 자율적으로 큐브 전달 작업을 완료합니다. 모든 실패 에피소드를 단계별로 분류하고 (A/B/C/D) 대부분의 실패에 대해 책임있는 단계를 식별했습니다. 실패 비디오를 시청했습니다. 그리고 정확히 무엇이 잘못되었는지 설명 할 수 있습니다. 두 가지 수동 데이터 플라이휠을 충분히 잘 이해하고 있습니다. 다음 개선 반복을 계획할 수 있을 정도로
당신은 작동하는 2개의 로봇 학습 시스템을 만들었습니다.
리더/따라자 구조를 구성하고, 시크로네이션된 2팔 시범을 수집하고, 처음부터 조정된 정책을 훈련시키고, 실제 하드웨어에 배포했습니다. 이 수준에서 두 손으로 조작하는 것이 연구실이 작동하는 곳입니다. 여기서 구축한 기초는 이 길을 시작하기 전에 접근할 수 없었던 집합, 요리, 접촉 부양한 작업에 스케일합니다.
[← 경로 개요로 돌아가]







