실습 노트

AI 평가에 이중맹검을 적용할 때 생기는 검증 질문

Google DeepMind의 이중맹검 AI 평가 파일럿 발표를 바탕으로, 모델 비교 실험에서 평가자 편향을 줄이는 설계와 한계를 정리합니다.

보일러플레이트AI 평가 · LLM 평가 · 실험 설계 · 모델 비교

모델 A와 모델 B의 답변을 비교할 때 이름을 가리고 점수만 매기면 객관적일까요? Google DeepMind는 2026년 8월 27일 Piloting the world's first double-blind AI evaluations에서 AI 평가에 이중맹검 방식을 시험하는 파일럿을 소개했습니다. 이 발표는 특정 모델의 우열을 확정한 연구 결과라기보다, 평가 과정에 사람의 기대와 브랜드 인지가 섞이는 문제를 줄이려는 운영 실험으로 읽는 편이 정확합니다.

평가에서 두 종류의 편향을 나눈다

평가자는 모델 이름이나 제공 회사를 알면 무의식적으로 기대를 반영할 수 있습니다. 반대로 모델을 완전히 숨겨도 어떤 답변을 좋은 것으로 볼지에 대한 기준이 흔들릴 수 있습니다. 따라서 아래 두 문제를 분리해야 합니다.

문제 질문
식별 편향 평가자가 모델·회사·버전을 알고 점수를 주는가?
기준 편향 평가 기준이 업무 목적과 일치하고 평가자마다 같은가?

이중맹검은 주로 첫 번째 문제를 다룹니다. 두 번째 문제까지 자동으로 해결해 주지는 않습니다.

이중맹검의 기본 흐름

실무 평가셋을 만들 때는 다음 순서를 권할 수 있습니다.

  1. 업무에서 자주 발생하는 입력을 샘플링합니다.
  2. 모델 이름·순서·응답 길이처럼 식별 단서를 정규화합니다.
  3. 평가자에게 A/B의 정체를 공개하지 않고 동일한 루브릭을 제공합니다.
  4. 독립 점수와 자유 서술을 수집합니다.
  5. 평가가 끝난 뒤에만 모델 ID를 복원합니다.
  6. 모델별 점수뿐 아니라 평가자 간 불일치와 결측을 함께 봅니다.

모델 응답의 문체나 길이가 지나치게 다르면 눈가림이 약해질 수 있습니다. 따라서 평가 설계에는 “가렸는가”뿐 아니라 “얼마나 쉽게 추측할 수 있는가”도 포함해야 합니다.

루브릭은 점수표가 아니라 실패 정의다

“더 좋은 답변” 같은 문장은 재현하기 어렵습니다. 업무에 맞게 관찰 가능한 기준으로 바꾸어야 합니다. 예를 들어 교육자료 요약이라면 다음처럼 나눌 수 있습니다.

  • 사실 오류가 없는가
  • 원문에 없는 내용을 덧붙이지 않는가
  • 요구된 형식과 분량을 지키는가
  • 중요한 예외와 조건을 빠뜨리지 않는가
  • 사람이 후속 편집하기 쉬운가

각 기준에 0·1·2점을 주더라도 점수만 합산하지 말고 치명적 오류를 별도로 기록해야 합니다. 평균 점수가 높아도 특정 유형의 위험한 오류가 반복될 수 있기 때문입니다.

모델 비교에서 순서 효과를 통제한다

A 답변을 먼저 읽은 평가자는 다음 답변을 그 기준으로 판단할 수 있습니다. 이 문제를 줄이려면 평가자마다 A/B 표시 순서를 바꾸고, 순서별 결과를 따로 집계해야 합니다. 같은 입력에 대한 두 답변을 함께 보여줄지, 독립적으로 보여줄지도 사전에 정해야 합니다.

또한 평가자에게 모델의 출시 시기나 가격을 알려주지 않는 편이 좋습니다. 가격 대비 가치가 평가 질문에 포함되어야 한다면, 그것은 품질 평가와 별도의 축으로 수집해야 합니다.

이중맹검만으로 충분하지 않은 이유

눈가림은 평가자의 기대를 줄이는 장치이지 실제 업무 성능을 보장하는 장치는 아닙니다. 공개된 정적 평가셋에 과적합했거나, 실제 사용자의 후속 질문·도구 호출·재시도 흐름이 빠졌다면 결과는 현장과 다를 수 있습니다.

그래서 다음 검증을 함께 두는 것이 좋습니다.

  • 과거 실제 입력과 합성 입력의 성능을 분리 집계
  • 새로운 기간의 홀드아웃 샘플로 재평가
  • 사람 점수와 실제 수정·반려·재작업 비율 비교
  • 자동 점수와 사람 점수의 불일치 사례 검토
  • 모델·프롬프트·검색 인덱스 버전 고정

공식 발표의 파일럿을 우리 조직의 최종 벤치마크로 오해해서는 안 됩니다. 발표가 제공하는 것은 평가 방식의 방향과 문제의식이며, 업무별 신뢰도는 각 조직이 직접 설계하고 측정해야 합니다.

적용 판단

AI 모델을 도입하거나 교체할 때 브랜드를 가린 비교 실험은 비용 대비 효과가 좋은 첫 단계입니다. 다만 이중맹검을 도입했다는 사실만으로 평가가 객관적이라고 선언하지 말고, 루브릭·샘플링·순서 효과·치명적 오류·현장 재작업까지 함께 기록해야 합니다. 모델 이름을 숨기는 것보다 중요한 것은 무엇을 좋은 결과로 정의했는지를 공개적으로 설명할 수 있는 상태입니다.