📌 핵심 요약 (Key Takeaways)
- 핵심 성과 1: RIFT 아키텍처는 LIBERO 벤치마크에서 98.8%의 성공률을 기록하며 기존 롤아웃 기반 모델 수준의 성능을 유지하는 동시에 액션 척(Action-chunk) 지연 시간을 68.2%~89.1% 대폭 단축함.
- 독창적 차별점 2: 반복적인 비디오 롤아웃 과정 없이 학습된 예측 토큰을 활용해 단 한 번의 백본 패스로 미래 K/V 캐시를 생성하는 롤아웃 프리(Rollout-free) 추론 구조를 구현함.
- 실무 파급력 3: 실시간 제어가 필수적인 피지컬 AI 및 로봇 조작 시스템에서 배포 지연을 최소화하고 엣지 디바이스 추론 효율을 극대화함.
최근 피지컬 AI 및 로보틱스 분야에서는 로봇의 행동을 예측된 미래 상태와 조건화하는 월드 액션 모델(World Action Models, WAMs)에 대한 연구가 활발히 진행되고 있습니다. 그러나 기존 WAM 아키텍처들은 반복적인 비디오 롤아웃(Iterative Video Rollout) 과정에 의존하기 때문에, 실제 로봇 시스템 배포 시 심각한 배포 지연(Deployment Latency)을 유발하는 치명적인 한계를 지니고 있었습니다.
본 기술 브리핑에서는 이러한 지연 문제를 근본적으로 해결하기 위해 제안된 RIFT(Rollout-free Imagination via Future Tokens) 아키텍처의 핵심 메커니즘을 분석합니다. 연구진은 액션 생성이 진화하는 롤아웃 궤적 전체를 필요로 하는지, 아니면 단지 그 미래 표현(Future Representation)만을 필요로 하는지에 대한 근본적인 질문에서 출발하여 새로운 추론 패러다임을 제시했습니다.
월드 액션 모델의 캐시 소비와 생산의 분리 구조
LIBERO 환경의 40가지 태스크를 대상으로 수행된 페어드 클로즈드 루프(Paired closed-loop) 개입 실험에 따르면, 미래 캐시(Future-cache) 값을 마스킹하거나 재할당할 경우 실행 결과가 크게 달라지며 성공률이 저하되었습니다. 이는 모델이 미래 값과 그 할당된 위치에 매우 민감하게 반응함을 입증합니다.
반면 Joint 및 Cosmos-2 모델의 경우, 고정된 단일 최종 클린 키/밸류(K/V) 캐시를 재플레이(Replay)하는 것만으로도 수정되지 않은 실행 결과가 거의 완벽하게 보존되었습니다. 이 실험은 end-effector 평균 변위 오차가 1.7~1.9cm에 불과하고 성공률이 97.9%~98.2%에 달함을 보여주었으며, 이는 캐시의 ‘소비(Consumption)’와 ‘생산(Production)’ 과정을 명확히 분리할 수 있음을 시사합니다.
RIFT: 미래 토큰을 통한 롤아웃 프리 상상(Rollout-free Imagination)
캐시 생산과 소비의 분리 가능성에 착안하여, 연구진은 반복적인 비디오 생성 없이 완전한 미래 K/V 캐시를 구축하는 RIFT 아키텍처를 제안했습니다. RIFT는 학습된 예측 토큰(Anticipation tokens)을 도입하여 단 한 번의 백본 패스(Single backbone pass)만으로 전체 미래 K/V 캐시를 구성하면서도, 기존의 미래 읽기 인터페이스(Future-read interface)를 그대로 유지합니다.
그 결과, RIFT는 LIBERO 태스크에서 98.8%의 성공률을 달성하여 기존 롤아웃 기반 모델인 Joint, IDM, LingBot-VA(98.4%~98.6%)와 동등 혹은 그 이상의 성능을 증명했습니다. 이와 동시에 액션 척 지연 시간을 68.2%에서 최대 89.1%까지 획기적으로 단축하는 데 성공했습니다.
ROBOTWIN 2.0 벤치마크 평가 및 강건성 검증
다양한 시뮬레이션 환경에서의 강건성을 평가하기 위해 RoboTwin 2.0 벤치마크가 활용되었습니다. 평가 결과, RIFT는 클린 및 무작위화된 장면(Clean/Randomized scenes) 각각에서 92.9% 및 92.6%의 성공률을 기록했습니다.
이 수치는 현재 평가된 모든 기존 방법론 중에서 가장 높은 관측 결과로, RIFT가 단순한 오버피팅을 넘어 시각적 변동성이 큰 복잡한 로봇 조작 환경에서도 안정적으로 작동하는 롤아웃 프리 퓨처 컨디셔닝 기술임을 명백히 보여줍니다.
유사 선행 연구 대비 독창성 및 성능 비교
| 비교 항목 | 기존/유사 논문 방식 (WAMs) | 본 연구의 제안 방식 (RIFT) | 실무적 차별성 및 한계 |
|---|---|---|---|
| 추론 방식 | 반복적 비디오 롤아웃 (Iterative Rollout) | 미래 토큰 기반 단일 패스 캐시 생성 | 실시간 제어 지연 시간을 최대 89.1% 대폭 단축 |
| 배포 지연 | 높음 (비디오 생성 오버헤드 발생) | 매우 낮음 (롤아웃 과정 생략) | 엣지 디바이스 및 온디바이스 NPU 탑재 로봇에 최적화 |
| LIBERO 성공률 | 98.4% ~ 98.6% (Joint, IDM 등) | 98.8% | 지연을 줄이면서도 정확도는 오히려 향상됨 |
| 복잡 환경 강건성 | 환경 변화에 따른 누적 오차 발생 가능 | RoboTwin 2.0 기준 92.9/92.6% 달성 | 무작위화된 시각 환경에서도 높은 적응력 확보 |
산업 현장 적용 포인트 및 파급 효과
로봇 조작(Robot Manipulation) 및 피지컬 AI 시스템 상용화에 있어 가장 큰 걸림돌 중 하나는 고성능 비전 모델의 연산 지연입니다. 기존 월드 액션 모델은 고품질의 행동 제어를 제공하지만, 비디오 롤아웃으로 인한 연산 병목 때문에 밀리초(millisecond) 단위의 정밀 제어가 요구되는 실시간 현장 적용에 한계가 있었습니다.
RIFT 아키텍처는 캐시 생산과 소비 메커니즘의 혁신을 통해, 복잡한 비디오 생성 루프를 거치지 않고도 고성능 미래 예측 기반 제어가 가능함을 입증했습니다. 이는 온디바이스 NPU 제약이 엄격한 자율 이동 로봇, 스마트 팩토리 조작 팔, 그리고 실시간 모션 플래닝이 필수적인 피지컬 AI 시스템의 상용화 시기를 앞당기는 핵심 기술적 전환점이 될 것입니다.
출처: arXiv:2608.11521 – Keep the Future, Drop the Rollout: RIFT for World Action Models