DeaMoE: 실시간 소배치 디코딩을 위한 고효율 Mixture-of-Experts(MoE) 아키텍처 분석
📌 핵심 요약 (Key Takeaways) 핵심 성과 1: 단계별 로딩 가중치를 최대 50.9% 절감하고, A40 환경에서 사전 학습된 7B 모델 기준 최대 1.33배의 TPOT(Time Per Output Token) 성능 향상 달성 독창적 차별점 2: 전문가(Expert) 간 공통 파라미터를 부서(Department) 단위로 공유하고 고유 파라미터를 분리하는 구조와 중복 로딩을 방지하는 2단계 라우팅 전략 도입 실무 파급력 3: 응답 … 더 읽기