LLM-as-a-Judge 평가를 공개 전 다시 검토했습니다. Haiku CLI 응답 116개 중 5개에서 자기정체·환경 노출을 발견했고, 동일 frozen subset·native prompt·seed·rubric·Opus judge 조건으로 API 재생성·재판정해 노출을 0건으로 복구했습니다.
수정된 frozen N=116 평가에서 자체 호스팅 35B는 2.89점, Claude Haiku는 3.09점이었습니다. 공통 90건의 차이(35B−Haiku)는 −0.26이었고, paired t 검정은 95% CI [−0.51, −0.01], p=0.045, exact sign test는 p=0.103(승 25 / 패 39 / 무 26)이었습니다.
두 검정이 엇갈린 경계선 결과이므로, 기존 parity 주장은 철회합니다. 이 평가에서 방어 가능한 표현은 "35B가 Haiku보다 근소하게 낮다"입니다. 이는 실제 운영 에이전트의 다음 행동 disposition 판단 품질에 한정되며, Opus judge self-preference 가능성 및 단일 도메인·rubric·judge 계열이라는 한계가 있습니다.
전체 과정을 98초 영상으로 정리했습니다: 영상 보기
방법·전체 수치·한계: benchmark