개선 하고 공유
레로봇 학습 경로 6단계 데이터 플라이휠을 실행하고 데이터 세트를 혼합하고 HuggingFace Hub에 모델과 데이터 세트를 공유하고 Pi0Fast과 SmolVLA와 다음 단계를 계획합니다. ~ 1.5 시간.
6분의 6 단위 · 개선 & 공유 · ~ 1.5시간
5단위 실패 진단을 대상으로 한 데이터 수집으로 전환하세요. 데이터 세트를 혼합하여, 커뮤니티와 작업을 공유하고, 보다 효율적인 정책으로의 길을 도출하세요.
데이터 플라이휠
로봇 학습 정책을 개선하는 가장 신뢰할 수있는 방법은 모델을 변경하는 것이 아니라 데이터를 개선하는 것입니다. 데이터 플라이휠은 심각한 로봇 학습 프로젝트의 핵심 반복 루프입니다.
1
평가
20개의 실험을 해보고 성공률을 측정하고, 실패를 유형에 따라 분류해 보세요.
2
주요 오류 모드를 식별
데이터 품질 (불합동적인 데모), 분배 변화 (보이지 않는 위치) 또는 모델 용량 (정확한 궤도이지만 잘못된) 가 있습니까?
3
목표 데이터를 수집
실종 정태를 구체적으로 다루는 20~30개의 시범을 기록하세요. 작업 공간의 왼쪽쪽에 있는 객체에서 정책이 실패하면 해당 특정 위치의 20개의 시범을 기록하세요. 이미 작동하는 것을 더 많이 기록하지 마십시오.
4
재교육 및 재평가
새로운 데이터를 기존 데이터 세트와 통합하고 재 훈련하고 20개의 실험 평가 과정을 다시 실행하십시오. 진단이 올바르면 한 주기마다 10
데이터 세트를 혼합
레로봇은 여러 데이터 세트를 동시에 훈련시킬 수 있으며, 이는 목표 집합 데이터를 원래 데이터 세트와 결합하거나 같은 작업과 로봇 유형을 위한 공공 커뮤니티 데이터 세트까지 사용할 수 있습니다.
# 두 개의 데이터 세트를 새로운 결합된 데이터 세트로 통합합니다 python -m lerobot.scripts.train \ -policy-type act \ -dataset-repo-id "$HF_USER/pick-place-v1,$HF_USER/pick-place-targeted" \ --examples-repo-id-weights "1.0,2.0" -- \put-out ~ ~ ~direct-bot/pick-pics-v2sets
공공적인 데이터 세트와 혼합: 커뮤니티 데이터 세트에서 혼합하기 전에 로봇 타입과 액션 공간 크기가 당신의 데이터 세트와 일치하는지 확인합니다. 7-DOF 데이터 세트를 6DOF 훈련 실행에 혼합하면 침묵한 모양 부합 오류가 발생합니다. 항상 혼합할 계획의 데이터 세트의
HuggingFace Hub에서 모델을 공유하세요
훈련된 모델을 공유하는 것은 커뮤니티에 제공되며 다른 사람들이 당신의 정책을 출발점으로 사용할 수 있게 합니다. 표준 레로봇 형식으로 공유된 모델은
# 최고의 체크포인트를 HuggingFace Hub python -m lerobot.scripts.push_policy_to_hub \ --checkpoint-path \ ~/lerobot-policy/pick-place-v1/checkpoints/step_050000 \ --repo-id $HF_USER/act-pick-place-so100 # 모델 카드를 추가 ( 추천) # 푸시 명령은 README.md 템플릿을 생성합니다
커뮤니티와 데이터 세트를 공유
당신의 데이터 세트 (당신이 3부에서 밀어 넣은) 은 이미 HuggingFace 허브에 있습니다. 다른 사람들에게 더 발견되고 유용하게 만들기 위해:
- HuggingFace에 데이터셋 카드를 추가하여 작업, 로봇, 녹음 설정 및 에피소드 수를 설명합니다. 이것은 데이터셋 탐구성을 위해 가장 영향력 있는 일입니다.
T2 , 로봇 타입 (예를 들어, T3 ) 및 작업 카테고리 (예를 들어, T4 ) 로 태그하십시오. - [RCSV 데이터 세트 라이브러리]
T7 ) 에 제출하여 공동체의 지표에 포함합니다.
하드웨어 구성을 LeRobot에 반환하는
부위 1에 지원되지 않는 로봇에 대한 사용자 지정 하드웨어 구성 요소를 추가 한 경우 레로봇 저장소에 다시 기여하는 것을 고려하십시오. 구성 파일과 함께
다음: 더 효율적인 정책
이제 여러분은 LeRobot의 전체 작업 흐름을 가지고 있습니다. 여기서부터는 어디로 갈 것인가:
언어
SmolVLA 언어 조건 정책
ACT에서 SmolVLA로 전환하면 정책이 자연어 지침 ("블루 블록을 선택") 에 응답하거나 작업 중 일반화되도록 할 때. ~ 200+의 시범과 더 구조화된 프롬프트 형식을 필요로합니다. SmolVLA 논문 및 LeRobot 예제를 참조하십시오.
규모
Pi0Fast 고속 VLA 추론
Pi0Fast은 100Hz 추론 (ACT의 30Hz에 비해) 에서 실행되며, 더 빠른 조작 작업과 더 긴밀한 제어 루프를 가능하게 한다. 추론 시 GPU가 필요하지만, 규모에서 훨씬 더 유능한 행동을 생산한다.
일반화
다중 과제 정책
에피소드마다 다른 작업_index 값이 있는 혼합 데이터 세트를 사용하여 여러 작업에 대한 단일 정책을 훈련하십시오. SmolVLA와 Pi0Fast 모두 다 작업 훈련을 원천적으로 지원합니다. GitHub 예제에서 LeRobot 다 작업 레시피를 참조하십시오.
레로봇 경로를 완성했어
레로봇을 설치하고 데이터 세트 형식을 이해하고, 자신의 시범을 기록하고, ACT 정책을 훈련시키고, 체계적으로 평가하고, 데이터 플라이휠을 실행했습니다. 이것은 전 세계 연구실과 로봇 스타트업에서 사용되는 완전한 오픈소스 로봇 학습 작업 흐름입니다.
[포럼에서 질문을 해보세요]
질문? HuggingFace Discord #lerobot에 가입하세요.







