AI 심사단, 또는 'LLM-as-a-judge'는 여러 언어 모델이 심사관 역할을 하며 응답을 평가하는 방식입니다. 서로 다른 제공업체의 모델을 교차 사용함으로써 자기 선호 편향을 줄이고, 단일 모델보다 더 견고한 평가를 얻을 수 있습니다.
원리
자기 자신을 선호하는 경향이 있는 단일 모델로 AI 응답을 평가하는 대신, 서로 다른 제공업체 출신의 여러 심사 모델로 구성된 심사단을 소집합니다. 각 모델은 정밀한 기준(노출, 정확성, 감정)에 따라 응답을 평가하고, 이후 점수를 합산합니다.
왜 여러 심사관이 필요할까요?
- 자기 선호 방지: 심사단이 다양하면 특정 모델이 자신의 응답을 편애할 수 없습니다.
- 견고성: 한 심사관의 일시적인 오류는 다른 심사관들에 의해 상쇄됩니다.
- 환각 탐지: 심사관들이 발견한 검증 불가능한 주장은 점수를 낮춥니다.
신뢰성과 추적 가능성
심사관 간의 일치도는 평가자 간 신뢰도 계수로 측정됩니다. 각 감사의 정확한 심사단 구성은 구성 지문(fingerprint)으로 기록되어 시간에 따른 비교 가능성을 보장합니다. 이 심사단은 AGS의 핵심입니다. 방법론과 데모를 참고하세요.
AI 답변에서 브랜드는 6번 중 1번만 나타납니다. 귀사는 나타납니까?
답변에 귀사의 이름이 없는 ChatGPT에 대한 모든 질문은 귀사 대신 추천되는 경쟁사입니다 — 6,820개의 실제 AI 답변에서 측정되었습니다.