알려진 한계 및 측정 변동성
생성형 AI에서 브랜드의 가시성을 측정하는 것은 정확한 과학이 아닙니다: 모델은 비결정적이며 시간이 지남에 따라 진화합니다. 이 현실을 "깨끗한" 점수 뒤에 숨기는 대신, 우리는 이를 문서화합니다 — 그리고 우리의 방법이 이를 어떻게 설명하는지 설명합니다.
1AI 응답은 실행마다 다릅니다
동일한 시나리오는 순간과 모델의 무작위성에 따라 다른 응답을 생성할 수 있습니다(관찰된 변동성은 일반적으로 특정 쿼리에서 15~20% 정도입니다).
우리의 답변 : 여러 심사위원의 배심원, 강력한 집계 및 표시된 Wilson 신뢰 구간 — 단일 수치가 아니라 불확실성의 여백을 볼 수 있습니다.
2각 모델은 고유한 동작을 가지고 있습니다
모델은 모두 동일하지 않습니다: 일부는 기술 소스를 더 쉽게 인용하고, 다른 일부는 로컬 쿼리에서 덜 안정적이며, 다른 일부는 언어에 따라 다릅니다.
우리의 답변 : 이러한 차이를 가릴 수 있는 단일 전체 등급이 아니라 보고서에 모델별 세부 정보가 포함된 다중 모델 감사(여러 심사위원, 수십 개의 쿼리된 모델)입니다.
3제공업체가 모델을 변경하면 점수가 변동됩니다
OpenAI, Google 또는 Anthropic이 모델을 업데이트하면 브랜드가 아무것도 변경하지 않았음에도 불구하고 응답과 점수가 변동될 수 있습니다.
우리의 답변 : 앵커 세트(지속적으로 재측정되는 벤치마크 브랜드)는 이러한 모델 드리프트를 브랜드의 실제 성과와 분리하며, 클라이언트의 점수는 그에 따라 보정됩니다.
4단일 시점 측정만으로는 충분하지 않습니다
AI 가시성은 시간에 따라 불안정합니다. 단일 측정은 오해를 불러일으킬 수 있습니다.
우리의 답변 : 예약/반복 감사 및 추세 추적 — 스냅샷이 아닌 진화를 살펴봅니다.
5"웹 검색" 대 "모델 메모리" 비율
모델이 웹 검색(검색)을 수행했는지 또는 내부 메모리(파라메트릭)에서 답변했는지에 따라 응답이 달라집니다.
우리의 답변 : 네이티브 대 웹 차별 진단을 통해 둘을 구분하고 어떤 레버를 당겨야 하는지 파악합니다.
6결과는 시나리오 표현 방식에 따라 달라집니다
같은 질문을 두 가지 방식으로 물어보면 다른 응답과 다른 점수가 나올 수 있습니다.
우리의 답변 : 표준화되고 버전이 지정되며 문서화된 시나리오(의도별 시나리오 분류법). 질문을 즉흥적으로 만들지 않고 재현 가능한 프로토콜을 적용하며 시간이 지나도 동일한 기준을 따릅니다.
7지리적 및 언어적 맥락이 응답을 변경합니다
AI는 국가(프랑스, 벨기에, 캐나다, 미국 등)와 언어에 따라 다르게 응답할 수 있습니다.
우리의 답변 : 각 감사는 문서화된 언어적 및 지리적 맥락에서 수행됩니다(시장 맥락화 및 현지 경쟁업체를 포함한 언어별 감사). 맥락 없는 점수가 아닌 측정이 수행된 시장을 항상 명시합니다.
이것이 정직하게 의미하는 바
AGS는 절대적 진실이 아닌 보정되고 재현 가능한 추정치입니다. 시간에 따라 비교 가능하도록(동일한 judge_config_hash) 설계되었으며 불확실성에 대해 정직합니다(신뢰 구간, GRC, 보정된 드리프트). 우리의 목표는 아첨하는 수치가 아니라 귀하와 귀하의 클라이언트가 이해하고 검증하며 이의를 제기할 수 있는 측정입니다.
방법
AI 가시성 측정은 정확한 과학이 아닙니다. 우리는 한계와 방법이 이를 어떻게 설명하는지 문서화합니다.
읽기단계별 증명
AI 응답이 실제로 AGS 점수가 되는 방법을 보여주는 익명화된 예입니다.
읽기