연차적 의사결정에서 대기 정책을 통한 연산 및 센싱 자원 최적화: Reinforcement Learning with Lexicographically Ordered Objectives 분석
📌 핵심 요약 (Key Takeaways) 핵심 성과: 연속적 환경 및 불연속 상태 과제에서 작업 성공률과 수행 시간을 유지가면서 전체 동작 시간의 50% 이상 센싱 및 추론 연산을 생략하는 대기 정책(Waiting Policy) 수립. 독창적 차별점: 단순 고정 간격 서브샘플링이나 리워드 셰이핑(Reward Shaping)의 파라미터 튜닝 한계를 극복하기 위해 사전식 정렬 목적함수(Lexicographically Ordered Objectives) 기반 강화학습 구조 도입. … 더 읽기