블라인드 평가에서 누수 5건을 찾고,
parity 주장을 철회한 이유
공개 전 LLM-as-a-Judge 평가를 다시 검토했습니다. Haiku CLI 응답 116개 중 5개에서 자기정체·환경 노출을 발견했고, 동일 frozen subset·native prompt·seed·rubric·Opus judge 조건으로 API 재생성·재판정해 노출을 0건으로 복구했습니다. 그 결과 기존 "parity" 주장은 철회합니다.
영상
무엇이 바뀌었나
→
→
5→0은 자기정체·환경 노출 건수이며 성능 점수가 아닙니다. 두 버전 공통 97건의 paired 상승(+0.34) 중 97%는 누수 5건이 아닌 나머지 92건에서 나왔습니다 — 5건만 흔든 옛 민감도 분석은 CLI 경로의 계통적 영향을 잡지 못했습니다.
수정된 평가와 두 검정
| 항목 | 값 |
|---|---|
| 자체 호스팅 35B (frozen N=116) | 2.89점 |
| Claude Haiku (frozen N=116, 재판정) | 3.09점 |
| 공통 90건 차이 (35B − Haiku) | −0.26 |
| Paired t 검정 | 95% CI [−0.51, −0.01], p=0.045 |
| Exact sign test | p=0.103 (승 25 / 패 39 / 무 26) |
결론과 한계
- 두 검정이 엇갈린 경계선 결과이므로, 기존 parity 주장은 철회합니다. 이 평가에서 방어 가능한 표현은 "35B가 Haiku보다 근소하게 낮다"입니다.
- 이 결론은 실제 운영 에이전트의 다음 행동 disposition 판단 품질에 한정되며, 범용 모델 성능 주장이 아닙니다.
- 심판 Opus는 참가자이자 최고점 모델이라 self-preference 가능성이 있습니다.
- 단일 도메인·rubric·judge 계열이라는 한계가 있으며, "완전 블라인드"가 아니라 "심판에 응답자 모델명 비공지"입니다.