AI 에이전트 안전성의 패러다임 전환: 훈련 시점 정렬에서 런타임 컨트랙트 기반의 예방·검증 아키텍처로
📌 핵심 요약 (Key Takeaways) 핵심 성과 1: RLHF/DPO 등 훈련 중심 안전성의 structural insufficiency를 52건의 인사이던트와 NeurIPS/ICML/ICLR 논문 오배치 분석(8-12x 불균형)을 통해 실증함. 독창적 차별점 2: 에이전트 안전의 단위를 모델 자체가 아닌 ‘검증 가능한 증거가 포함된 궤적(trajectory-with-checkable-evidence)’으로 정의하고 런타임 컨트랙트 체계를 제안. 실무 파급력 3: 샌드박스, 권한 게이트를 통한 예방적 차단과 로그, 파일 차이(diff) … 더 읽기