📌 핵심 요약 (Key Takeaways)
- 핵심 성과 1: HBF-GPU 직접 경로와 HBF-HBM-GPU 중계 경로의 동시 활용으로 기존 단일 경로 설계 대비 1.94배 높은 처리량(Throughput) 및 1.90배 속도 향상 달성
- 독창적 차별점 2: 전문가(Expert) 가중치를 두 경로에 분할 할당하고, 사전 결정(Early determination) 메커니즘을 통해 읽기 지연(Read latency)과 연산을 오버랩
- 실무 파급력 3: HBM 용량 한계를 극복하면서도 공유 중계 병목 현상과 트래픽 간섭을 최소화하는 고성능 AI 인프라 시스템 설계안 제시
도입: Mixture-of-Experts(MoE) 모델과 메모리 병목 현상
현대 인공지능 분야에서 대규모 Mixture-of-Experts(MoE) 언어 모델은 뛰어난 성능을 입증하고 있으나, 급증하는 전문가 가중치(Expert weights) 규모로 인해 고대역폭 메모리(HBM)의 용량 한계와 비용 효율성 문제가 극대화되고 있습니다. 모델 크기가 비약적으로 커짐에 따라 HBM 인근에 모든 가중치를 적재하는 방식은 물리적 한계에 직면했으며, 이를 해결하기 위한 대안으로 고대역폭 플래시(HBF) 메모리가 주목받고 있습니다.
그러나 기존의 일반적인 HBF 설계는 HBF에 저장된 전문가 가중치를 HBM을 거쳐서만 GPU로 전달하는 구조적 제약을 가집니다. 이 방식은 GPU와 HBF 사이에 존재하는 별도의 고속 직접 연결 경로를 충분히 활용하지 못하게 만들어 전체 시스템의 대역폭 효율을 떨어뜨리는 주원인으로 작용합니다.
이중 전문가 전달 경로(Dual Expert-Delivery Route) 아키텍처
본 연구에서 제안하는 아키텍처는 HBF와 GPU 간의 두 가지 독립적인 전문가 전달 경로를 동시에 동적으로 활용하는 혁신적인 구조를 채택하고 있습니다. 첫 번째는 HBF에서 GPU로 직접 데이터를 전송하는 직통 경로(Direct path)이며, 두 번째는 HBF에서 HBM 베이스 다이를 거쳐 GPU로 향하는 중계 경로(Relay path)입니다.
전체 전문가는 이 두 가지 경로 중 하나에 명확히 할당되며, 두 경로를 통한 데이터 전송은 상호 간섭이나 공유 중계 병목 현상 없이 동시에 진행됩니다. 이를 통해 전문가 가중치를 복제(Replication)할 필요 없이 전체 집계 전달 대역폭을 극대화할 수 있습니다.
조기 전문가 결정 및 트래픽 격리 메커니즘
대기 시간을 최소화하기 위해 본 아키텍처는 ‘조기 전문가 결정(Early expert determination)’ 기법을 도입합니다. 이 기능은 전통적인 연산 시점보다 앞서 다가올 전문가를 미리 식별하여, HBF 읽기 지연(Read latency)을 선행 연산 과정과 시간적으로 중첩(Overlap)시킵니다.
또한, 변경 불가능한(Immutable) 대규모 전문가 가중치 트래픽과 빈번하게 갱신되는(Mutable) KV-캐시 데이터 트래픽을 분리하여 관리합니다. 이 철저한 트래픽 클래스 격리를 통해 메모리 버스 상의 충돌과 간섭을 원천적으로 차단하여 전체적인 추론 파이프라인의 안정성을 높입니다.
성능 평가 및 시뮬레이션 결과
연구진은 실제 측정된 GPU 연산 지연 시간을 반영한 이벤트 기반 연속 배치(Continuous-batching) LLM 서빙 시뮬레이터를 활용해 해당 아키텍처를 엄밀하게 검증했습니다. 대표적인 MoE 워크로드 환경에서 두 경로를 동시에 활용한 경우, 단일 경로에만 의존하는 기존 설계 방식에 비해 일관되게 우수한 전문가 전달 효율을 기록했습니다.
특히 대표적인 실험 워크로드에서 제안된 아키텍처는 HBM 베이스 다이를 통해서만 모든 HBF 가중치를 전달하는 기존 설계 대비 **1.94배 더 높은 처리량(Throughput)**과 **1.90배 빠른 엔드투엔드 속도 향상**을 달성하는 기염을 토했습니다.
유사 선행 연구 대비 독창성 및 성능 비교
| 비교 항목 | 기존/유사 논문 방식 | 본 연구의 제안 방식 | 실무적 차별성 및 한계 |
|---|---|---|---|
| 데이터 전달 경로 | HBF ➔ HBM ➔ GPU 단일 중계 경로 의존 | HBF ➔ GPU 직통 경로 + HBF ➔ HBM ➔ GPU 중계 경로 동시 활용 | 대역폭 병목 해소, 복제 없는 자원 효율 극대화 |
| 지연 시간 은닉 | 요청 발생 시 순차적 로드 및 연산 수행 | 조기 전문가 결정(Early determination)을 통한 연산-읽기 중첩 | 플래시 메모리 고유의 읽기 지연 페널티 상쇄 |
| 트래픽 관리 | 가중치와 KV-캐시 트래픽의 공유 버스 혼잡 발생 | 불변 가중치와 가변 KV-캐시의 독립적 제어 및 격리 | 트래픽 간섭 최소화로 대규모 배치 안정성 확보 |
산업 현장 적용 파급 효과 및 아키텍처 시사점
본 연구가 제시하는 고대역폭 플래시 기반 이중 경로 아키텍처는 대규모 언어 모델 서빙 인프라의 경제성과 성능 한계를 동시에 돌파하는 핵심 기술적 전환점을 제공합니다. 특히 천문학적인 HBM 비용을 절감하면서도 수백 빌리언 파라미터 이상의 거대 MoE 모델을 상용 서비스 수준의 레이턴시로 구동해야 하는 클라우드 데이터센터 및 AI 인프라 엔지니어들에게 직접적인 설계 지침이 됩니다.
시스템 아키텍처 관점에서 하드웨어 상호 연결(Interconnect) 대역폭의 비대칭성을 소프트웨어 알고리즘 레벨에서 극복한 모범적인 사례이며, 향후 고성능 온디바이스 AI 가속기 및 대규모 데이터 처리 파이프라인 설계 전반에 광범위하게 응용될 것으로 전망됩니다.