Harness-IF: 코딩 에이전트의 지시사항 준수 평가를 위한 AP-Acc 메트릭과 5대 설정 표면 분석


📌 핵심 요약 (Key Takeaways)

  • 핵심 성과 1: 642개 규칙 라이브러리 기반 60개의 멀티턴 코딩 항목과 256개 판정 규칙을 5대 에이전트 설정 표면에 적용하여 엄격한 지시 준수 평가 프레임워크(Harness-IF) 구축
  • 독창적 차별점 2: 우연에 의한 준수와 실제 규칙 준수를 분리하기 위해 기존 기본값에 반하는 규칙만을 평가하는 Against-Prior Accuracy(AP-Acc) 메트릭 도입
  • 실무 파급력 3: 12개 프론티어 모델 실험 결과 기존 대비 3.6~7.4 포인트 하락한 성능을 확인하며, 프롬프트 깊이가 아닌 시스템 및 프로젝트 파일 중심의 우선순위 제어 메커니즘 도출

1. 도입 배경: 코딩 에이전트 평가의 근본적 한계와 Harness-IF의 등장

최근 대규모 언어 모델 기반의 코딩 에이전트가 복잡한 소프트웨어 엔지니어링 작업을 수행하는 수준에 이르렀습니다. 그러나 기존의 평가 벤치마크들은 최종 작업의 성공 여부만을 측정하거나 사용자의 입력 턴에만 규칙을 집중시키는 한계를 지니고 있어, 에이전트가 실제로 명시된 규칙을 엄격히 따랐는지 혹은 본래 하려던 행동과 우연히 일치했는지를 구분하지 못합니다.

본 연구에서 제안하는 Harness-IF는 이러한 한계를 극복하기 위해 실행 증거(execution evidence)를 기반으로 작동 규칙을 개별 평가합니다. 642개의 방대한 규칙 라이브러리에서 추출된 60개의 사실적 멀티턴 코딩 항목과 256개의 판정 규칙을 활용하여 배포된 에이전트가 읽는 5개의 설정 표면(configurable surfaces) 전반에 걸친 지시 준수 능력을 정밀하게 측정합니다.

2. AP-Acc(Against-Prior Accuracy) 메트릭과 5대 설정 표면 아키텍처

우연에 의한 준수(Coincidence)와 엄격한 규칙 준수(Compliance)를 명확히 분리하기 위해, 연구진은 ‘Against-Prior Accuracy(AP-Acc)’라는 새로운 평가 지표를 도입했습니다. AP-Acc는 에이전트의 사전 기본값(unprompted defaults)과 대치되는 규칙만을 대상으로 평가하며, 규칙을 제외한 상태에서 9개의 프로브 빌드를 재실행하여 관측된 차이를 기반으로 점수를 산출합니다.

5대 설정 표면 분석에 따르면, 에이전트가 참조하는 시스템 프롬프트(System Prompts), 프로젝트 파일(Project Files), 사용자 지시(User Instructions)가 도구(Tool) 및 스킬(Skill) 설명보다 우선순위에서 앞서는 것으로 나타났습니다. 이는 단순한 프롬프트의 물리적 깊이(prompt depth)가 아니라 설정 표면의 구조적 특성이 에이전트의 결정에 지대한 영향을 미친다는 것을 실증적으로 증명합니다.

3. 프론티어 모델 성능 분석 및 카운터밸런스드 갈등 실험

12개의 최신 프론티어 모델을 대상으로 한 실험에서 전체 정확도는 72.1%에서 85.9%의 분포를 보였으나, AP-Acc는 66.1%에서 78.6%로 하락했습니다. 모든 모델에서 사전 기본값에 반하는 규칙(against-prior rules)에 대해 3.6에서 7.4 포인트(평균 5.81 포인트) 낮은 성능을 기록하여, 기존 집계 점수가 모델의 실제 지시 준수 능력을 과대평가하고 있음을 명확히 드러냈습니다.

또한, 9개의 별도 빌드를 통한 카운터밸런스드 갈등 파일럿 실험 결과, 풀링된 우선순위(pooled precedence)는 프롬프트 깊이에 종속되지 않는다는 사실이 밝혀졌습니다. 시스템 지시사항과 프로젝트 아키텍처 정의 파일이 하위 레벨의 툴 호출 가이드보다 강제력이 높다는 점은 복잡한 에이전트 시스템 설계에 있어 중요한 아키텍처적 시사점을 제공합니다.

유사 선행 연구 대비 독창성 및 성능 비교

비교 항목 기존/유사 벤치마크 방식 본 연구 (Harness-IF) 제안 방식 실무적 차별성 및 한계
평가 단위 최종 작업 성공 여부(Task Success) 및 단편적 사용자 턴 규칙 실행 증거 기반 256개 판정 규칙의 개별 동작 검증 우연한 성공 배제 및 정밀한 규칙 준수 추적 가능
메트릭 신뢰도 단순 정답률 (규칙 준수와 기본 행동의 혼동 유발) Against-Prior Accuracy (AP-Acc) 도입으로 편향 제거 모델의 실제 제어 능력과 과대평가 마진 분리 측정
설정 표면 분석 프롬프트 깊이 기반 단순 우선순위 가정 5대 설정 표면 및 9개 프로브 빌드 교차 검증 시스템 파일과 사용자 지시가 툴 설명보다 우위 증명

4. 산업 현장 적용 포인트 및 시스템 아키텍처 시사점

Harness-IF 프레임워크가 제시하는 평가는 대규모 코드 생성 에이전트, 자율 소프트웨어 파이프라인, 그리고 복잡한 제어 로직을 다루는 시스템 아키텍처 분야에 직접적인 실무 가치를 지닙니다. 특히 자율주행, 로보틱스 관제, 대규모 분산 시스템 구축에 사용되는 LLM 기반 에이전트가 안전 규칙이나 코딩 컨벤션을 임의로 무시하는 현상을 사전에 방지할 수 있습니다.

엔지니어링 관점에서 에이전트의 설정 표면(시스템 프롬프트, 프로젝트 파일 등)을 구조화하고 관리하는 것은 에이전트의 신뢰성과 직결됩니다. 본 연구는 단순히 성능 점수를 높이는 것을 넘어, 에이전트가 제어 명령과 규칙을 누락 없이 준수하도록 보장하는 견고한 데이터 및 제어 아키텍처 설계 지침을 제공합니다.


출처: arXiv:2608.11727 – Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

댓글 남기기