수치 연산 및 통합적 판단을 위한 특화형 LLM 에이전트와 강화학습 구조 분석
📌 핵심 요약 (Key Takeaways) 핵심 성과 1: 프롬프트 수준의 에이전트 분할은 수치 연산 정확도를 15.8%포인트 향상시키나, 통합적 판단 작업에는 제한적이거나 오히려 저하될 수 있음을 규명 독창적 차별점 2: Qwen3.5-9B 모델에 GRPO(Group Relative Policy Optimization) 및 구조화된 보상 함수를 적용한 사후 학습을 통해 수치 및 판단 성능을 동반 개선 실무 파급력 3: 미지의 데이터 및 … 더 읽기