JEPA-WAM: 로봇 매니퓰레이션을 위한 스테이지 레벨 합동 임베디드 예측 월드-액션 모델


📌 핵심 요약 (Key Takeaways)

  • 핵심 성과 1: RoboTwin 2.0 50개 태스크 환경에서 종합 성공률 90.25% 달성 및 최강 베이스라인 대비 실행 스텝 수 5.97% 단축
  • 독창적 차별점 2: 단기 물리적 미래(Short-term Physical Future)와 스테이지 레벨 의미적 미래(Stage-level Semantic Future)를 분리하여 태스크 진행도를 명시적으로 예측
  • 실무 파급력 3: V-JEPA2 백본과 Motus 월드-액션 모델(WAM)의 결합을 통해 복잡한 다단계 로봇 매니퓰레이션의 장기 계획(Long-horizon Planning) 성능 획기적 개선

제너럴리스트 로봇 정책(Generalist Robot Policies)은 다양한 멀티모달 관측 데이터와 언어 기반 작업 지시를 입력받아 실시간 액션을 생성하는 것을 목표로 한다. 그러나 기존의 대부분의 아키텍처는 미래의 상태를 고정된 길이의 단기 비디오-액션 척크(Video-action Chunk)로만 표현하는 한계를 지닌다.

이러한 단기 예측 방식은 국소적인 장면 변화와 즉각적인 액션 실행에는 적합하지만, 작업(Task)이 현재 단계에서 다음 단계로 어떻게 진행되어야 하는지를 나타내는 ‘스테이지 레벨의 미래’를 명시적으로 포착하지 못한다. 결과적으로 복잡한 다단계 매니퓰레이션 작업에서 장기적인 인과 관계를 놓치기 쉽다.

본 포스팅에서 분석하는 JEPA-WAM은 로봇 매니퓰레이션의 미래 예측 패러다임을 혁신하기 위해 단기 물리적 미래와 스테이지 레벨 의미적 미래를 이원화한 SOTA급 아키텍처다. Motus 기반 월드-액션 모델(WAM)에 목표 조건부 합동 임베디드 예측 아키텍처(JEPA)를 결합하여 구조적 한계를 극복했다.

JEPA-WAM의 아키텍처 및 핵심 메커니즘

JEPA-WAM의 가장 큰 아키텍처적 특징은 로봇이 처리해야 할 미래를 두 개의 보완적 차원으로 나누어 정의한 점이다. 첫째는 국소적 장면 진화를 추적하는 ‘단기 물리적 미래’이며, 둘째는 태스크의 거시적 진행 상태를 정의하는 ‘스테이지 레벨 의미적 미래’이다.

이를 구현하기 위해 연구진은 기존 Motus 기반 월드-액션 모델에 Stage-JEPA 모듈을 새롭게 통합했다. Stage-JEPA는 목표 조건부 합동 임베디드 예측기(Goal-conditioned JEPA predictor)로 작동하여 복잡한 환경 변화 속에서도 로봇이 올바른 작업 단계로 진입하도록 유도한다.

특히 동결된(Frozen) V-JEPA2 인코더를 활용해 현재의 관측 상태 표현(Current-state Representation)을 고효율로 추출하고, 이를 기반으로 다음에 도달해야 할 추론 스테이지의 잠재 타깃(Latent Target)을 예측한다. 이 방식은 픽셀 레벨의 불필요한 노이즈를 배제하고, 의미론적으로 중요한 특징 공간에서 태스크 진행을 제어할 수 있게 한다.

유사 선행 연구 대비 독창성 및 성능 비교

기존의 비디오 기반 행동 복제(Behavior Cloning) 모델이나 단순 단기 척크 예측 모델은 복잡한 다단계 태스크에서 에러가 누적되는 고질적 문제를 안고 있었다. 아래 표를 통해 기존 기법과 JEPA-WAM의 기술적 차별성을 비교한다.

비교 항목 기존 단기 비디오-액션 척크 모델 JEPA-WAM (본 연구) 실무적 차별성 및 한계 극복
미래 예측 범위 고정된 단기 비디오 척크 (국소적 변화만 포착) 단기 물리적 미래 + 스테이지 레벨 의미적 미래 이원화 다단계 작업에서의 장기 계획(Long-horizon) 오류 누적 방지
표현 학습 방식 픽셀 레벨 재구성 또는 일반적 엔드투엔드 지도학습 동결된 V-JEPA2 인코더 + Stage-JEPA 결합 강력한 사전학습 표현 활용으로 연산 효율성 및 일반화 성능 극대화
RoboTwin 2.0 벤치마크 평균 성공률 베이스라인 수준 (약 80~85% 대) 90.25% 종합 성공률 및 실행 스텝 5.97% 단축 청정 및 무작위화된 환경 모두에서 압도적 로버스트성 증명

상기 비교에서 확인할 수 있듯이, JEPA-WAM은 단순히 액션 생성 주기를 빠르게 가져가는 점진적 개선(Incremental Improvement)에 그치지 않고, 로봇이 수행하는 작업의 ‘의미적 진행 단계’를 명시적 잠재 공간에서 제어한다는 점에서 근본적인 아키텍처적 우위를 확보했다.

피지컬 AI 및 로보틱스 산업 현장 적용 파급력

본 연구가 제시하는 스테이지 레벨 합동 임베디드 예측 기술은 실제 산업 현장의 피지컬 AI 시스템에 다음과 같은 중대한 실무적 가치를 제공한다.

첫째, 스마트 팩토리 및 물류 자동화 분야에서의 조립 및 부품 장착 공정 효율화이다. 다단계 조립 공정 중 오배치나 예기치 않은 간섭이 발생했을 때, 시스템이 현재 어느 스테이지에 머물러 있는지 정확히 파악하고 즉각적인 궤도 수정(Re-planning)을 수행할 수 있다.

둘째, 온디바이스 하드웨어 연산 최적화 측면이다. V-JEPA2 백본을 동결(Freeze)하고 경량화된 Stage-JEPA 예측기만을 타겟팅함으로써, 고성능 서버 환경뿐만 아니라 엣지 로보틱스 온디바이스 NPU 환경에서도 실시간 추론이 가능한 실무적 토대를 마련했다.


본 기술 리서치에 대한 상세한 원문 논문 및 오픈소스 아키텍처 검토는 아래의 출처 링크를 통해 확인할 수 있습니다.
arXiv:2608.10780 – JEPA-WAM: Stage-Level Joint-Embedding Prediction for World-Action Models in Robot Manipulation

댓글 남기기