AGS 방법론 — AI Grading System | AI Labs Audit
AGS(AI Grading System)는 AI Labs Audit의 점수 엔진입니다. 모든 AI 응답을 서로 보정하는 5명의 AI 심사위원이 평가한 다음, 심사위원 간 신뢰도 계수를 게시하여 점수가 얼마나 방어 가능한지 정확히 알 수 있습니다.
30초 안에
AGS(AI Grading System)는 AI 응답에서 브랜드의 가시성을 측정하는 오픈 방법입니다. 각 응답에 대해 세 가지를 평가합니다 — 브랜드가 존재하는지, 말한 내용이 호의적인지, 응답이 신뢰할 수 있는지 — 여러 독립적인 AI의 배심원을 사용합니다. 최종 점수는 약점이 가려질 수 없도록 이 세 가지 등급을 결합합니다. 무엇보다도 이것은 방법입니다: 이해하고, 확인하고, 이의를 제기할 수 있습니다.
이 방법은 여러 수준에서 읽을 수 있습니다: 30초 정의, 다이어그램, 차원 설명, 공식, 마지막으로 재현성 부록. 마케팅 이사, GEO 컨설턴트 및 연구원은 각자에게 맞는 세부 수준에서 길을 찾을 수 있어야 합니다.
다이어그램
+---------------------------------------------+
시나리오 ---> | AI 모델의 응답(ChatGPT 등) |
+---------------------------------------------+
|
v
+---------------------------------------------+
| 배심원 = 여러 독립적인 AI 심사위원 |
| (다른 제공자, 자기 선호 방지) |
+---------------------------------------------+
|
+--------------------------+--------------------------+
v v v
P - 존재감 I - 영향력 Q - 품질
(M, RP, WC) (INF, UNQ, REL) (SENT, ACC)
+--------------------------+--------------------------+
v
AGS = (P x I x Q) ^ (1/3)
(기하 평균: 한 차원에서 0이면
점수가 무너집니다)
기하 평균은 의도적입니다: 존재감의 부재를 좋은 감정으로 상쇄할 수 없습니다. 기존 평균보다 부풀리기가 훨씬 어렵습니다.
AGS란 무엇입니까?
AGS는 오픈 소스 다중 심사 점수 프로토콜입니다. 단일 LLM에 의존하여 브랜드의 가시성을 평가하는 대신(편향, 환각, 모델 드리프트), AGS는 5명의 AI 심사위원(GPT-4o, Claude Sonnet, Gemini Pro, Mistral Large, Llama 3.1)을 병렬로 쿼리하고 그들 사이의 분산을 게시합니다. 분산이 작을수록 점수가 더 신뢰할 수 있습니다.
평가되는 3가지 차원
- P(정밀도): 답변이 경쟁사나 동음이의어와 혼동 없이 브랜드를 올바르게 언급합니까? 환각 및 귀속 오류를 측정합니다.
- I(정보성): 답변이 브랜드에 대한 유용하고 차별화된 정보를 제공합니까, 아니면 단순히 이름만 언급합니까? 인용의 깊이를 측정합니다.
- Q(품질): 답변이 사실적으로 정확하고 최신입니까? 정보의 신선도와 검증 가능한 사실과의 일치를 측정합니다.
공식(공개 방법, 독점 가중치)
AGS = (P x I x Q) ^ (1/3), 각 차원은 0에서 100까지 평가됩니다. 각 차원은 하위 지표의 가중 조합입니다:
- P — 존재감 = 언급(M), 순위/위치(RP) 및 커버리지(WC)의 조합입니다.
- I — 영향력 = 정보성(INF), 고유성(UNQ) 및 관련성(REL)의 조합입니다.
- Q — 품질 = 감정(SENT) 및 정확성(ACC)의 조합입니다.
정확한 가중치 값은 우리의 독점 방법론의 일부입니다: 정규화되고(합계 = 1), 보정되고, 버전이 지정되며, judge_config_hash에 의해 추적됩니다(동일한 해시를 공유하는 두 감사가 엄격하게 비교 가능함을 보장합니다). 우리는 방법 — 구조, 기하 평균, 차원, 하위 지표, 배심원, 신뢰도 — 을 게시하지만 우리의 노하우의 일부인 정확한 가중치는 공개하지 않습니다.
배심원 및 재현성
각 응답은 모델이 자신을 선호하는 것을 방지하기 위해 다른 제공자의 여러 심사 모델에 의해 평가됩니다. 게시 시점에서 배심원은 예를 들어 OpenAI, Anthropic, Google, Mistral 및 DeepSeek의 모델을 결합합니다 — 그러나 모델은 진화합니다: 이 목록은 오늘 현재의 예이지 고정된 약속이 아닙니다.
각 감사의 실제 구성(모델 + 가중치 + 루브릭)은 judge_config_hash(SHA-256)에 의해 추적됩니다: 이것이 안정적인 참조입니다. 동일한 해시를 공유하는 두 감사는 엄격하게 비교 가능하며, 배심원에 대한 모든 변경 사항이 추적됩니다.
- GRC: 각 감사에 대해 게시된 심사위원 간 신뢰도 계수(심사위원 간 일치 정도)입니다.
- Wilson 신뢰 구간이 존재감 점수에 표시됩니다: 단일 수치가 아니라 불확실성이 표시됩니다.
- 앵커 세트: 지속적으로 재측정되는 벤치마크 브랜드 패널이 모델 드리프트를 감지합니다; 고객의 점수는 이 드리프트에 대해 수정됩니다.
평가 프로토콜
감사된 각 시나리오에 대해 AGS는 동일한 지침(제로샷 점수)으로 AI 심사위원에게 5개의 병렬 호출을 실행합니다. 점수는 각 심사위원의 선언된 신뢰도를 사용하여 가중 평균을 통해 집계됩니다. 최종 결과에는 평균 점수, 심사위원 간 표준 편차 및 95% 부트스트랩 신뢰 구간이 포함됩니다.
심사위원 간 신뢰도 계수
AGS는 각 감사에 대해 Fleiss kappa 계수(다중 평가자 일치 측정)를 게시합니다. 0.80 이상의 kappa는 심사위원 간의 강력한 합의를 나타냅니다(매우 신뢰할 수 있는 점수). 0.60에서 0.80 사이: 중간 합의. 0.60 미만: 약한 합의 — 점수는 주의해서 해석해야 하며 질문을 다시 표현해야 합니다.
투명성 및 재현성
각 AGS 감사는 시나리오, 원시 응답 및 개별 점수의 암호화 해시를 생성합니다. 이 서명은 점수가 조작되지 않았음을 증명합니다. AGS 코드는 github.com/sarsator/aqa-specification에서 오픈 소스(MIT 라이선스)이며, 점수 공식은 버전이 지정되고 게시됩니다. 모든 고객은 점수를 확인하거나 이의를 제기할 수 있습니다.
AGS 약어
- GRC
- Generative Response Coverage: 적어도 한 명의 심사위원이 브랜드를 인용하는 시나리오의 백분율입니다.
- GIS
- Generative Inclusion Score: 응답에서 브랜드 위치를 기반으로 한 가중 평균 점수(첫 번째 언급 = 100%, 마지막 = 0%)입니다.
- ASR
- Answer Sentiment Rating: -1에서 +1 척도로 언급의 어조(긍정적/중립적/부정적)입니다.
- BVI
- Brand Visibility Index: 테스트된 AI 전반에 걸쳐 브랜드의 전반적인 성과를 요약하는 복합 점수(GRC × GIS × ASR), 0에서 100까지입니다.
- CIA
- Citation Inter-judge Agreement: 인용 존재에 대한 5명의 AI 심사위원 간의 일치를 측정하는 Fleiss kappa 계수입니다.
30개 고급 GEO 검사 2026
Sprint 15는 수동적으로 측정되는 30개의 새로운 GEO/AEO 신호를 제공했습니다(ToS 위반 스크래핑 없음). 이러한 신호는 6번째 카테고리 'advanced_signals'(15% 복합 가중치)를 통해 AGS 점수를 보완합니다.
6개 시장 차별화 요소
- A08 — 구체성 점수 (Princeton GEO 2024) — 1등급 출처 통계의 밀도(Princeton GEO KDD 2024: LLM 인용 +27~+40%).
- A09 — 반론 마커 — 균형 잡힌 논증 마커를 측정하는 경쟁 도구가 없습니다.
- A07 — 날짜 표시 진술
- S05 — Common Crawl 포함
- S08 — llms.txt RFC 검증
- B10 — Stack Overflow 브랜드 언급
모듈 6 — 외부 권위성 신호
외부 권위성 신호 전용 새 모듈: LinkedIn, ProductHunt, G2/Capterra, Stack Overflow, GitHub, Substack/Medium.
GEO 모듈별 검사
- SSR / 크롤링 가능성
- mainEntity · QAPage · 비디오 트랜스크립트 · Speakable · @graph @id · inLanguage · Common Crawl · llms.txt · IndexNow · ai.txt · 검증 · HTTP/3 · Brotli
- 엔티티 건전성
- Wikidata · DBpedia
- 인용 준비도
- 출처 있는 통계 · 균형 잡힌 논증 · 인라인 날짜 표시 · ItemList · Dataset · Blockquote cite · 내부 링크 · 앵커 엔트로피 · 뉴스 사이트맵
- 외부 권위성
- Stack Overflow · LinkedIn · GitHub · ProductHunt · B2B 리뷰 · 뉴스레터
모든 검사는 safe_external_call(재시도 + 캐시 + 회로 차단기)을 사용하며 결과를 audits.advanced_checks_v2(JSONB + GIN 인덱스)에 저장합니다.
블로그의 전체 기사: 30개의 새로운 GEO/AEO 2026 신호 — 최신 기술 감사.
측정 대상 — 그리고 측정하지 않는 대상
측정 대상
공식 API를 통해 AI 모델을 쿼리하며, 네이티브 모드(모델의 메모리, 브라우징 없음)와 웹 모드(온라인 검색 활성화)에서 재현 가능한 질문으로 수행합니다. 모든 감사는 구성의 암호화 지문을 계산합니다: 비교되는 두 감사는 진정으로 비교 가능합니다.
기본 패널은 대중이 실제로 사용하는 제품(ChatGPT, Gemini, Perplexity, Claude, Mistral 등)과 일치하며, 대시보드는 각 엔진의 실제 청중 점유율(Statcounter / SimilarWeb 출처, 날짜 및 수정됨)로 가중된 가시성 점수를 표시합니다.
측정하지 않는 대상
API를 통해 얻은 답변은 동일한 제품의 소비자 인터페이스와 다를 수 있습니다: 대화 메모리, 독점 지침, 지리적 위치 또는 제공자 측 A/B 테스트. 로그인한 사용자의 개인화된 세션이 아닌 엔진을 측정합니다.
AI 답변은 확률적입니다: 동일한 질문이 변형을 생성할 수 있습니다. 그렇기 때문에 단일 테스트가 아닌 신뢰 구간(Wilson)이 있는 수십 개의 질문에 걸쳐 측정합니다.
가중치에 사용되는 청중 점유율은 날짜가 지정되고 정기적으로 수정되는 제3자 추정치이며, 검증할 수 없는 내부 수치가 아닙니다.
한계를 문서화하는 이유는 무엇입니까? 범위를 알 수 없는 측정은 가치가 없기 때문입니다. 이것이 고객 앞에서 우리의 점수를 방어할 수 있게 만드는 것입니다.
한계 및 변동성
AI 가시성 측정은 정확한 과학이 아닙니다. 우리는 한계와 방법이 이를 어떻게 설명하는지 문서화합니다.
읽기단계별 증명
AI 응답이 실제로 AGS 점수가 되는 방법을 보여주는 익명화된 예입니다.
읽기