다중 궤도 위성 네트워크를 위한 다중 에이전트 강화학습 기반 핸드오버 및 전력 할당 최적화
📌 핵심 요약 (Key Takeaways) 핵심 성과 1: LEO-MEO-GEO 다중 궤도 환경에서 MAPPO 및 TarMAC 기반 다중 에이전트 강화학습을 적용하여, 단순 SNR 최대화 방식 대비 92%의 처리량을 유지하면서 핸드오버 횟수를 4배 이상 감축 독창적 차별점 2: 혼합정수 비선형계획법(MINLP) 문제를 마르코프 결정 과정 기반의 MARL 정책과 각 타임슬롯별 볼록 전력할당 서브프로블렘으로 분해하여 실시간 제어 성능 확보 … 더 읽기