1인칭(egocentric) 손 동작 영상으로부터 3D MANO 손 mesh를 추정하고(HaMeR), 이를 EgoVLA 의 trajectory decoder 파인튜닝용 데이터셋으로 변환한 뒤, 직접 촬영한 소규모 데이터셋(action_01~04)으로 미래 1초 손 궤적 예측 모델을 파인튜닝/시각화하는 개인 실험 파이프라인입니다.
| Stage | 스크립트 | 역할 |
|---|---|---|
| 1 | hamer_data_preprocessing_revision.py |
원본 영상 → HaMeR 추론 → mano.npz + visualize.mp4 |
| 2 | build_vla_dataset.py |
mano.npz → EgoVLA 학습용 dataset.npz (history/future window 구성) |
| 3 | finetune_egovla.py |
EgoVLA 사전학습 체크포인트 로드 후 trajectory decoder만 파인튜닝 |
| 4 | visualize_vla_predict.py |
파인튜닝된 모델의 예측 궤적을 영상 위에 시각화 |
| - | visualize_final_video5.py |
video_05 한 편만 GT 궤적으로 최종 렌더링 (Stage 4 재사용) |
각 스크립트 상단 docstring에 입출력 포맷과 데이터 스키마가 자세히 적혀 있습니다.
용량/라이선스 문제로 아래 항목들은 git에 커밋하지 않고 .gitignore 처리했습니다.
새 환경에서 재현하려면 아래 구조로 직접 준비해야 합니다.
third_party/
├─ hamer/ # https://geopavlakos.github.io/hamer/ 클론
└─ EgoVLA_Release/ # https://rchalyang.github.io/EgoVLA 클론 (VILA, human_plan 포함)
mano_v1_2/models/ # MANO 공식 라이선스 동의 후 다운로드 (https://mano.is.tue.mpg.de)
assets/mano/MANO_RIGHT.pkl
checkpoints/
├─ hamer_ckpts/ # HaMeR demo data (hamer_demo_data.tar.gz)
├─ ego_vla_human_video_pretrained/ # HF Hub: rchal97/ego_vla_human_video_pretrained
└─ egovla_finetuned_traj_decoder/ # Stage 3 결과물 (직접 학습해서 생성)
data/
└─ action_XX_설명/video_XX_설명/video_XX_설명.mp4 # 직접 촬영한 원본 영상 (비공개)
data/ 폴더는 직접 촬영한 개인 영상이라 공개 저장소에 포함하지 않습니다.
동일한 폴더 구조(action_XX_... / video_XX_...)로 자신의 영상을 넣으면
Stage 1부터 그대로 재현할 수 있습니다.
Windows + CUDA 환경에서 개발했으며, VILA(EgoVLA 학습 프레임워크) 설치 가이드를
따르는 것 외에 아래 패키지는 Visual Studio Build Tools(vcvars64.bat) 환경에서
별도로 빌드/설치했습니다.
chumpy(pip install "chumpy @ git+https://github.com/mattloper/chumpy")mmcv-full==1.3.9(MMCV_WITH_OPS=1 FORCE_CUDA=1빌드)
logs/,scratch_*,*.log: 개발 중 생성된 디버그 로그/스크래치 파일 (git 미포함)visualize/,visualize2/,visualize_vla/,visualize_final/: 각 Stage가 생성하는 결과 영상 폴더 (용량이 커서 git 미포함, 재생성 가능)