LookBack: 대형 시각-언어 모델(LVLM)의 시각적 환각 극복을 위한 비전 참조 기반 신뢰도 평가 메커니즘
📌 핵심 요약 (Key Takeaways) 핵심 성과: 추가 학습 없는(Training-free) ‘Visual Lookback Score’를 도입하여 LVLM의 비전-텍스트 정렬도를 정확히 측정하고 Best-of-N 응답 선택 정밀도를 대폭 향상. 독창적 차별점: 기존 LLM 기반의 출력 텍스트 우도(Likelihood) 측정 한계를 진단하고, 입력 이미지를 제거해도 신뢰도 변화가 없는 기존 지표의 시각 무관성(Image-agnostic) 결함을 근본적으로 해결. 실무 파급력: 로봇 비전 제어 및 … 더 읽기