방법 및 투명성

AGS 방법론 — AI Grading System | AI Labs Audit

AGS(AI Grading System)는 AI Labs Audit의 점수 엔진입니다. 서로 보정하는 독립적인 평가 모델 풀이 AI 응답을 평가한 뒤, 평가자 간 신뢰도 계수를 공개하여 점수의 근거가 얼마나 탄탄한지 알 수 있게 합니다.

30초 안에

AGS(AI Grading System)는 AI 응답에서 브랜드의 가시성을 측정하는 오픈 방법입니다. 각 응답에 대해 세 가지를 평가합니다 — 브랜드가 존재하는지, 말한 내용이 호의적인지, 응답이 신뢰할 수 있는지 — 여러 독립적인 AI의 배심원을 사용합니다. 최종 점수는 약점이 가려질 수 없도록 이 세 가지 등급을 결합합니다. 무엇보다도 이것은 방법입니다: 이해하고, 확인하고, 이의를 제기할 수 있습니다.

이 방법은 여러 수준에서 읽을 수 있습니다: 30초 정의, 다이어그램, 차원 설명, 공식, 마지막으로 재현성 부록. 마케팅 이사, GEO 컨설턴트 및 연구원은 각자에게 맞는 세부 수준에서 길을 찾을 수 있어야 합니다.

다이어그램

                 +---------------------------------------------+
   시나리오  --->  |   AI 모델의 응답(ChatGPT 등)                |
                 +---------------------------------------------+
                                     |
                                     v
                 +---------------------------------------------+
                 |  배심원 = 여러 독립적인 AI 심사위원           |
                 |  (다른 제공자, 자기 선호 방지)               |
                 +---------------------------------------------+
                                     |
          +--------------------------+--------------------------+
          v                          v                          v
     P - 존재감                  I - 영향력                  Q - 품질
     (M, RP, WC)              (INF, UNQ, REL)             (SENT, ACC)
          +--------------------------+--------------------------+
                                     v
                        AGS = (P x I x Q) ^ (1/3)
                     (기하 평균: 한 차원에서 0이면
                      점수가 무너집니다)

기하 평균은 의도적입니다: 존재감의 부재를 좋은 감정으로 상쇄할 수 없습니다. 기존 평균보다 부풀리기가 훨씬 어렵습니다.

AGS란 무엇입니까?

AGS는 오픈 소스 멀티 모델 스코어링 프로토콜입니다. 단일 LLM에 의존해 브랜드 가시성을 평가하는 대신(편향, 환각, 모델 드리프트 문제), AGS는 서로 다른 제공업체의 모델 풀에 평가를 분산하고 그 편차를 공개합니다. 편차가 작을수록 점수의 신뢰도가 높습니다.

평가되는 3가지 차원

  • P(정밀도): 답변이 경쟁사나 동음이의어와 혼동 없이 브랜드를 올바르게 언급합니까? 환각 및 귀속 오류를 측정합니다.
  • I(정보성): 답변이 브랜드에 대한 유용하고 차별화된 정보를 제공합니까, 아니면 단순히 이름만 언급합니까? 인용의 깊이를 측정합니다.
  • Q(품질): 답변이 사실적으로 정확하고 최신입니까? 정보의 신선도와 검증 가능한 사실과의 일치를 측정합니다.

공식(공개 방법, 독점 가중치)

AGS = (P x I x Q) ^ (1/3), 각 차원은 0에서 100까지 평가됩니다. 각 차원은 하위 지표의 가중 조합입니다:

  • P — 존재감 = 언급(M), 순위/위치(RP) 및 커버리지(WC)의 조합입니다.
  • I — 영향력 = 정보성(INF), 고유성(UNQ) 및 관련성(REL)의 조합입니다.
  • Q — 품질 = 감정(SENT) 및 정확성(ACC)의 조합입니다.

정확한 가중치 값은 우리의 독점 방법론의 일부입니다: 정규화되고(합계 = 1), 보정되고, 버전이 지정되며, judge_config_hash에 의해 추적됩니다(동일한 해시를 공유하는 두 분석이 엄격하게 비교 가능함을 보장합니다). 우리는 방법 — 구조, 기하 평균, 차원, 하위 지표, 배심원, 신뢰도 — 을 게시하지만 우리의 노하우의 일부인 정확한 가중치는 공개하지 않습니다.

배심원 및 재현성

각 응답은 모델이 자신을 선호하는 것을 방지하기 위해 다른 제공자의 여러 심사 모델에 의해 평가됩니다. 게시 시점에서 배심원은 예를 들어 OpenAI, Anthropic, Google, Mistral 및 DeepSeek의 모델을 결합합니다 — 그러나 모델은 진화합니다: 이 목록은 오늘 현재의 예이지 고정된 약속이 아닙니다.

각 분석의 실제 구성(모델 + 가중치 + 루브릭)은 judge_config_hash(SHA-256)에 의해 추적됩니다: 이것이 안정적인 참조입니다. 동일한 해시를 공유하는 두 분석은 엄격하게 비교 가능하며, 배심원에 대한 모든 변경 사항이 추적됩니다.

  • GRC: 각 분석에 대해 게시된 심사위원 간 신뢰도 계수(심사위원 간 일치 정도)입니다.
  • 존재감 점수에 신뢰구간을 표시합니다. 숫자만이 아니라 불확실성까지 보여 줍니다.
  • 앵커 세트: 지속적으로 재측정되는 벤치마크 브랜드 패널이 모델 드리프트를 감지합니다; 고객의 점수는 이 드리프트에 대해 수정됩니다.

평가 프로토콜

분석된 각 시나리오에 대해 AGS는 평가 모델들에 동일한 지침(제로샷 스코어링)을 전달합니다. 평가는 풀 전체에 순환 방식으로 배분되며, 그중 일부는 중복 평가하여 평가자 간 일치도를 측정합니다. 이후 점수를 집계하고 보정합니다. 최종 결과에는 평균 점수, 평가자 간 편차, 95% 부트스트랩 신뢰구간이 포함됩니다.

심사위원 간 신뢰도 계수

AGS는 각 분석에 대해 Fleiss kappa 계수(다중 평가자 일치 측정)를 게시합니다. 0.80 이상의 kappa는 심사위원 간의 강력한 합의를 나타냅니다(매우 신뢰할 수 있는 점수). 0.60에서 0.80 사이: 중간 합의. 0.60 미만: 약한 합의 — 점수는 주의해서 해석해야 하며 질문을 다시 표현해야 합니다.

투명성 및 재현성

각 AGS 분석은 시나리오, 원시 응답 및 개별 점수의 암호화 해시를 생성합니다. 이 서명은 점수가 조작되지 않았음을 증명합니다. AGS 코드는 github.com/sarsator/aqa-specification에서 오픈 소스(MIT 라이선스)이며, 점수 공식은 버전이 지정되고 게시됩니다. 모든 고객은 점수를 확인하거나 이의를 제기할 수 있습니다.

AGS 약어

GRC
Generative Response Coverage: 적어도 한 명의 심사위원이 브랜드를 인용하는 시나리오의 백분율입니다.
GIS
Generative Inclusion Score: 응답에서 브랜드 위치를 기반으로 한 가중 평균 점수(첫 번째 언급 = 100%, 마지막 = 0%)입니다.
ASR
Answer Sentiment Rating: -1에서 +1 척도로 언급의 어조(긍정적/중립적/부정적)입니다.
BVI
Brand Visibility Index: 테스트된 AI 전반에 걸쳐 브랜드의 전반적인 성과를 요약하는 복합 점수(GRC × GIS × ASR), 0에서 100까지입니다.
CIA
Citation Inter-judge Agreement: 인용 존재 여부에 대한 평가 모델 간 일치도를 측정하는 Fleiss 카파 계수입니다.

30개 고급 GEO 검사 2026

Sprint 15는 수동적으로 측정되는 30개의 새로운 GEO/AEO 신호를 제공했습니다(ToS 위반 스크래핑 없음). 이러한 신호는 6번째 카테고리 'advanced_signals'(15% 복합 가중치)를 통해 AGS 점수를 보완합니다.

6개 시장 차별화 요소

  • A08 — 구체성 점수 (Princeton GEO 2024) — 1등급 출처 통계의 밀도(Princeton GEO KDD 2024: LLM 인용 +27~+40%).
  • A09 — 반론 마커 — 균형 잡힌 논증 마커를 측정하는 경쟁 도구가 없습니다.
  • A07 — 날짜 표시 진술
  • S05 — Common Crawl 포함
  • S08 — llms.txt RFC 검증
  • B10 — Stack Overflow 브랜드 언급

모듈 6 — 외부 권위성 신호

외부 권위성 신호 전용 새 모듈: LinkedIn, ProductHunt, G2/Capterra, Stack Overflow, GitHub, Substack/Medium.

GEO 모듈별 검사

SSR / 크롤링 가능성
mainEntity · QAPage · 비디오 트랜스크립트 · Speakable · @graph @id · inLanguage · Common Crawl · llms.txt · IndexNow · ai.txt · 검증 · HTTP/3 · Brotli
엔티티 건전성
Wikidata · DBpedia
인용 준비도
출처 있는 통계 · 균형 잡힌 논증 · 인라인 날짜 표시 · ItemList · Dataset · Blockquote cite · 내부 링크 · 앵커 엔트로피 · 뉴스 사이트맵
외부 권위성
Stack Overflow · LinkedIn · GitHub · ProductHunt · B2B 리뷰 · 뉴스레터

모든 검사는 safe_external_call(재시도 + 캐시 + 회로 차단기)을 사용하며 결과를 audits.advanced_checks_v2(JSONB + GIN 인덱스)에 저장합니다.

블로그의 전체 기사: 30개의 새로운 GEO/AEO 2026 신호 — 최신 기술 분석.

측정 대상 — 그리고 측정하지 않는 대상

측정 대상

공식 API를 통해 AI 모델을 쿼리하며, 네이티브 모드(모델의 메모리, 브라우징 없음)와 웹 모드(온라인 검색 활성화)에서 재현 가능한 질문으로 수행합니다. 모든 분석은 구성의 암호화 지문을 계산합니다: 비교되는 두 분석은 진정으로 비교 가능합니다.

기본 패널은 대중이 실제로 사용하는 제품(ChatGPT, Gemini, Perplexity, Claude, Mistral 등)과 일치하며, 대시보드는 각 엔진의 실제 청중 점유율(Statcounter / SimilarWeb 출처, 날짜 및 수정됨)로 가중된 가시성 점수를 표시합니다.

측정하지 않는 대상

API를 통해 얻은 답변은 동일한 제품의 소비자 인터페이스와 다를 수 있습니다: 대화 메모리, 독점 지침, 지리적 위치 또는 제공자 측 A/B 테스트. 로그인한 사용자의 개인화된 세션이 아닌 엔진을 측정합니다.

AI의 응답은 확률적입니다. 같은 질문이라도 답변이 달라질 수 있습니다. 그래서 단일 테스트가 아니라 수십 개의 질문을 대상으로, 신뢰구간과 함께 측정합니다.

가중치에 사용되는 청중 점유율은 날짜가 지정되고 정기적으로 수정되는 제3자 추정치이며, 검증할 수 없는 내부 수치가 아닙니다.

한계를 문서화하는 이유는 무엇입니까? 범위를 알 수 없는 측정은 가치가 없기 때문입니다. 이것이 고객 앞에서 우리의 점수를 방어할 수 있게 만드는 것입니다.

AI 답변에서 브랜드의 실제 가시성을 측정하십시오

AGS 분석을 실행하고 검증 가능한 점수, 공개적으로 명시된 한계 및 구체적인 실행 계획을 받으십시오.

가격 보기