Temporal GRPO: 비전-언어-행동(VLA) 모델의 궤적 레벨 크레딧 한계를 극복하는 시간 단계별 강화학습
📌 핵심 요약 (Key Takeaways) 핵심 성과 1: RoboTwin 2.0 및 LIBERO-Long 벤치마크에서 태스크 성공률과 샘플 효율성의 동반 향상 달성 독창적 차별점 2: 기존 궤적 레벨 GRPO의 크레딧 에일리어싱 문제를 해결하여, 성공한 초기 단계의 행동이 후반 실패로 인해 부당하게 페널티를 받는 현상 원천 차단 실무 파급력 3: 멀티모달 비전-언어-행동 모델의 복잡한 장기(Long-horizon) 조작 태스크 사후 … 더 읽기