LLM 평가의 편향성: 토큰 생성 예산(Token Budget)에 따른 모델 순위 역전 현상과 실무적 대안
📌 핵심 요약 (Key Takeaways) 핵심 성과 1: 7단계 토큰 예산(64~4,096) 실험을 통해 추론 벤치마크 전반에서 모델 순위가 통계적으로 유의미하게 역전됨을 입증 ($p < 0.01$). 독창적 차별점 2: 전체 테스트 문항의 3~19%에서 예산이 증가함에도 정확도가 떨어지는 비단조(non-monotone) 거동이 모델 고유의 특성으로 나타남을 규명. 실무 파급력 3: 예산 인식 라우터(Budget-aware router) 도입을 통해 도메인 내 성능을 … 더 읽기