시각-언어 모델(VLM)의 정렬 메커니즘 변천: 명시적 거부에서 은밀한 재구성(Reframing)으로의 진화 분석
📌 핵심 요약 (Key Takeaways) 핵심 성과 1: 9개 VLM 대상 21,708회 실험을 통해 멀티모달 검열 신호를 6개 차원(거부율, 정보 완전성, 시각적 접지, 국가 정렬 재구성 등)으로 분리 측정 체계 구축. 독창적 차별점 2: 단일 거부 스코어 방식에서 벗어나 명시적 답변 거부(Refusal)는 감소하고 유연한 문맥 재구성(Reframing)이 급증하는 ‘보이지 않는 검열’ 메커니즘을 규명. 실무 파급력 3: … 더 읽기