← 벤치마크 공개 정본으로 돌아가기
Case Study · LLM-as-a-Judge

블라인드 평가에서 누수 5건을 찾고,
parity 주장을 철회한 이유

공개 전 LLM-as-a-Judge 평가를 다시 검토했습니다. Haiku CLI 응답 116개 중 5개에서 자기정체·환경 노출을 발견했고, 동일 frozen subset·native prompt·seed·rubric·Opus judge 조건으로 API 재생성·재판정해 노출을 0건으로 복구했습니다. 그 결과 기존 "parity" 주장은 철회합니다.

영상

무엇이 바뀌었나

발견 Haiku CLI 응답 116개 중 5개에서 자기정체·환경(Claude Code/sandbox) 노출
→
복구 동일 frozen subset·native prompt·seed 2397·rubric·Opus judge로 API 재생성·재판정 → 노출 5→0
→
정정 Haiku 점수 2.80→3.09. 기존 "Haiku와 구분되지 않는다(parity)" 주장을 철회

5→0은 자기정체·환경 노출 건수이며 성능 점수가 아닙니다. 두 버전 공통 97건의 paired 상승(+0.34) 중 97%는 누수 5건이 아닌 나머지 92건에서 나왔습니다 — 5건만 흔든 옛 민감도 분석은 CLI 경로의 계통적 영향을 잡지 못했습니다.

수정된 평가와 두 검정

항목값
자체 호스팅 35B (frozen N=116)2.89점
Claude Haiku (frozen N=116, 재판정)3.09점
공통 90건 차이 (35B − Haiku)−0.26
Paired t 검정95% CI [−0.51, −0.01], p=0.045
Exact sign testp=0.103 (승 25 / 패 39 / 무 26)
결론과 한계
  • 두 검정이 엇갈린 경계선 결과이므로, 기존 parity 주장은 철회합니다. 이 평가에서 방어 가능한 표현은 "35B가 Haiku보다 근소하게 낮다"입니다.
  • 이 결론은 실제 운영 에이전트의 다음 행동 disposition 판단 품질에 한정되며, 범용 모델 성능 주장이 아닙니다.
  • 심판 Opus는 참가자이자 최고점 모델이라 self-preference 가능성이 있습니다.
  • 단일 도메인·rubric·judge 계열이라는 한계가 있으며, "완전 블라인드"가 아니라 "심판에 응답자 모델명 비공지"입니다.