프록시믹스 기반 보상 모델링을 통한 심층 강화학습 기반 소셜 내비게이션 고도화


📌 핵심 요약 (Key Takeaways)

  • 핵심 성과 1: Hall의 프록시믹스 이론(Proxemics Theory)을 적용한 방사형 가우스 혼합 필드(Radial Gaussian-Mixture Field) 기반 보상 체계 도입으로 고밀도 군중 환경에서 소셜 지표 대폭 개선.
  • 독창적 차별점 2: 기존 과업 중심(Task-centric) DRL 내비게이션의 한계를 극복하고, 로봇 중심의 시야각(FoV) 기반 조밀하고 해석 가능한 소셜 학습 신호 제공.
  • 실무 파급력 3: 물류 로봇, 서비스 로봇 등 복잡한 실내·외 군중 속에서 보행자와 자연스러운 상호작용이 가능한 안전한 실시간 모션 플래닝 구현.

1. 연구 배경 및 아키텍처 개요

실세계 군중 환경에서 로봇의 자율 이동은 현대 모바일 로보틱스의 핵심 과제 중 하나입니다. 최근 심층 강화학습(DRL)은 복잡한 동적 장애물 회피에서 뛰어난 성능을 보였으나, 대부분 목적지 도달 시간 단축과 같은 ‘과업 중심(Task-centric)’ 목적에 편중되어 인간과의 상호작용 규범인 ‘소셜 컴플라이언스(Social Compliance)’를 충분히 반영하지 못하는 한계가 있었습니다.

본 연구는 Edward T. Hall의 인접 영역(Proxemics) 이론을 수학적으로 모델링하여 DRL 에이전트의 보상 함수에 통합하는 새로운 프레임워크를 제안합니다. 이를 통해 로봇은 단순히 장애물을 피하는 것을 넘어, 보행자의 개인 공간(Personal Space)을 존중하며 자연스럽고 사회적으로 수용 가능한 궤적을 실시간으로 생성할 수 있게 됩니다.

2. 프록시믹스 기반 방사형 가우스 혼합 필드 메커니즘

제안된 아키텍처의 핵심은 각 보행자의 개인 공간을 방사형 가우스 혼합 필드(Radial Gaussian-Mixture Field)로 정의하는 데 있습니다. 보행자 중심의 공간적 제약을 연속적인 확률 분포로 표현함으로써, DRL 에이전트는 거리에 따른 정량적이고 매끄러운 페널티 시그널을 학습 과정에서 지속적으로 획득합니다.

또한, 이 모델은 로봇의 시야각(Field of View, FoV) 내에서 로봇 중심의 로컬 비용(Robot-centric local cost)을 고속으로 연산합니다. 이는 방대한 연산 자원이 소모되는 글로벌 맵 업데이트 과정 없이도, 임베디드 온디바이스 환경에서 실시간 소셜 내비게이션 추론이 가능하도록 설계된 공학적 특징을 보여줍니다.

3. 시뮬레이션 성능 및 소셜 지표 검증

연구팀은 다양한 군중 시나리오, 군중 밀도(Crowd densities), 기존 보상 베이스라인(Baseline)을 바탕으로 시뮬레이션 검증을 수행했습니다. 평가는 단순히 목적지 도달률과 같은 전통적 내비게이션 메트릭뿐만 아니라, 보행자 침범 횟수 및 불편도 지표 등 소셜 메트릭을 병행하여 진행되었습니다.

실험 결과, 제안된 보상 모델은 기존 보상 모델들과 비교하여 동등한 수준의 내비게이션 효율성(이동 시간 및 성공률)을 유지하면서도, 소셜 메트릭에서 일관되고 유의미한 성능 향상을 증명했습니다. 이는 강화학습 에이전트가 효율성과 안전성 사이의 최적의 균형점을 찾았음을 시사합니다.

4. 유사 선행 연구 대비 독창성 및 성능 비교

비교 항목 기존 과업 중심 DRL 방식 본 연구의 제안 방식 실무적 차별성 및 한계
보상 설계 기준 목적지 최단 거리 및 충돌 방지 중심 (과업 지향) Hall의 프록시믹스 이론 기반 가우스 혼합 필드 사회적 규범을 반영한 조밀한(Dense) 학습 신호 제공
군중 상호작용 단순 회피 위주, 근접 조우 시 진동(Oscillation) 발생 로봇 중심 시야각(FoV) 기반 로컬 비용 산출 부드러운 궤적 생성 및 보행자 불편 최소화
연산 복잡도 상대적으로 낮음 (단순 거리 기반 페널티) 방사형 필드 연산 추가이나 실시간 제어 가능 수준 온디바이스 엣지 컴퓨팅 환경에서의 적용성 확보

5. 산업 현장 적용 포인트 및 파급 효과

본 연구의 성과는 학술적 검증에 그치지 않고, 자율주행 물류 로봇(AGV/AMR), 안내 로봇, 병원 배송 로봇 등 고밀도 인간 공존 환경에서 작동하는 피지컬 AI 시스템에 즉각적으로 응용될 수 있습니다.

기존의 로봇 내비게이션 알고리즘이 군중 속에서 종종 냉혹하거나 예측 불가능한 회피 기동으로 인해 보행자에게 불안감을 주었던 반면, 프록시믹스 기반 보상 모델은 인간 친화적이고 예측 가능한 주행 패턴을 유도합니다. 이는 향후 서비스 로봇의 사회적 수용성(Social Acceptance)을 높이는 핵심 기술적 전환점이 될 것입니다.


출처: arXiv (Robotics) – Towards Socially Compliant Navigation in Deep Reinforcement Learning via Proxemics-Based Reward Modeling

댓글 남기기