JailWAM: 로봇 제어 분야 월드 액션 모델(WAM)의 탈옥(Jailbreak) 취약점 평가 프레임워크 분석


📌 핵심 요약 (Key Takeaways)

  • 핵심 성과 1: RoboTwin 시뮬레이션 환경에서 LingBot-VA 모델 대상 84.2%의 높은 탈옥 공격 성공률(ASR)을 실증하여 WAM의 물리적 안전성 취약점 규명
  • 독창적 차별점 2: 이질적인 저수준 액션 출력을 통합하는 ‘시각-궤적 매핑(Visual-Trajectory Mapping)’과 ‘3단계 심각도 인식 리스크 판별기’ 도입
  • 실무 파급력 3: 고비용의 폐루프 물리 시뮬레이션을 최소화하고 빠른 위험 스크리닝을 수행하는 ‘듀얼 패스 검증 전략’ 제시

로봇 제어용 월드 액션 모델(WAM)과 새로운 보안 위협

최근 로보틱스 분야에서는 고수준의 언어 및 시각 지시를 직접 받아 물리적 상호작용을 수행하는 월드 액션 모델(World Action Models, 이하 WAM)이 핵심 패러다임으로 부상하고 있습니다. 이 모델들은 다양한 환경에서 복잡한 조작 작업을 능숙하게 처리할 수 있는 잠재력을 보여주지만, 동시에 적대적(adversarial)으로 설계된 지시어에 의해 의도치 않은 위험한 로봇 행동을 유발할 수 있는 구조적 취약성을 내포하고 있습니다.

기존 대형 언어 모델(LLM)에서 주로 연구되던 탈옥(Jailbreak) 개념이 물리적 실체와 결합된 피지컬 AI 시스템으로 확장되면서, 오작동은 단순히 텍스트 오류에 그치지 않고 심각한 물적 손상이나 작업 중단으로 직결될 수 있습니다. 이에 따라 WAM의 안전성을 객관적이고 체계적으로 평가할 수 있는 표준화된 평가 프레임워크의 필요성이 대두되었습니다.

JailWAM 프레임워크의 핵심 아키텍처 구성 요소

본 연구에서 제안하는 JailWAM은 WAM의 물리적 안전성 평가를 위해 세 가지 핵심 혁신 기술을 유기적으로 결합한 최초의 탈옥 평가 프레임워크입니다. 각 구성 요소는 이질적인 액션 출력의 표준화, 정밀한 위험 수준 분류, 그리고 평가 연산 비용의 최적화라는 엔지니어링적 난제를 해결합니다.

첫 번째 핵심은 **시각-궤적 매핑(Visual-Trajectory Mapping)**입니다. 모델마다 상이한 아키텍처와 저수준 액션 출력 포맷을 가졌기 때문에 일관된 위험 평가가 어렵다는 한계를 극복하기 위해, 모델의 액션 출력을 통일된 시각적 궤적 표현으로 변환하여 일관된 위험성 분석을 가능하게 합니다.

두 번째는 물리적 결과에 따라 세 가지 안전 수준(안전 준수, 모션 실패, 치명적 위험)으로 감독되는 **위험 판별기(Risk Discriminator)**의 도입입니다. 이 심각도 인식 설계는 시각적 궤적에서 서로 다른 물리적 결과를 명확히 구분하고 확장 가능한 위험 스크리닝을 지원합니다.

마지막으로 **듀얼 패스 검증 전략(Dual-Path Verification Strategy)**은 모든 적대적 후보군을 무차별적으로 시뮬레이션하는 컴퓨팅 비용을 대폭 절감합니다. 빠른 위험 스크리닝과 폐루프 물리 시뮬레이션을 결합하여, 잠재적 안전 위험이 감지된 후보군에만 고비용의 정밀 검증을 제한적으로 수행합니다.

유사 선행 연구 대비 독창성 및 성능 비교

기존의 로봇 정책 안전성 평가는 주로 규칙 기반의 제약 조건 검사나 제한적인 시나리오 내에서의 단위 테스트에 의존해 왔습니다. 반면, JailWAM은 생성형 모델 기반의 WAM 특성을 정조준하여 확장 가능한 탈옥 평가 체계를 구축했습니다.

비교 항목 기존/선행 안전 평가 방식 본 연구 (JailWAM 제안 방식) 실무적 차별성 및 한계
액션 평가 정합성 모델별 고유 액션 포맷 직접 분석 의존 시각-궤적 매핑을 통한 통합 표현 변환 이질적 WAM 아키텍처 간의 공정한 비교 가능
위험 분류 체계 이중 진단(안전/위험) 기반 단순 판정 3단계 심각도 인식 리스크 판별기 적용 물리적 결과의 심각도에 따른 세분화된 대응 설계
연산 및 검증 효율성 전체 후보군 대상 완전 폐루프 시뮬레이션 빠른 스크리닝과 시뮬레이션을 결합한 듀얼 패스 컴퓨팅 오버헤드 최소화 및 대규모 평가 확장성 확보

실험 결과 및 산업 현장 파급력 (Paper-to-Industry)

RoboTwin 시뮬레이션 환경에서 수행된 광범위한 실험 결과, JailWAM은 LingBot-VA 모델을 상대로 84.2%라는 매우 높은 공격 성공률(ASR)을 기록했습니다. 이는 현재 널리 연구되는 월드 액션 모델들이 적대적 지시어에 의해 쉽게 오동작할 수 있으며, 실제 하드웨어에 배치되기 전 엄격한 안전성 검증과 정렬(Alignment) 과정이 필수적임을 강력하게 시사합니다.

본 연구의 성과는 향후 제조 공장, 물류 센터, 그리고 서비스 로봇 현장에 배치될 피지컬 AI 시스템의 신뢰성을 확보하는 데 핵심적인 지침이 됩니다. 특히 온디바이스 NPU 환경에서 구동되는 로봇 제어 모델의 엣지 보안 강화와 악의적 조작 방어 메커니즘 설계에 직접적인 학술적·기술적 기초 자료로 활용될 것으로 기대됩니다.


출처: arXiv (Robotics) – JailWAM: Jailbreaking World Action Models in Robot Control

댓글 남기기