학습 데이터(Training Data)는 언어 모델(LLM)을 훈련시키는 데 사용되는 방대한 텍스트 코퍼스를 가리킵니다. GPT-4는 웹, 도서, 기사, 대화 등에서 수집된 수천억 개의 단어로 학습되었습니다. 이 데이터는 모델이 무엇을 "알고" 있는지, 나아가 답변에서 자연스럽게 어떤 브랜드와 정보를 언급할 수 있는지를 결정합니다.

학습 데이터의 구성

Common Crawl: 수십억 개 페이지 규모의 방대한 웹 아카이브입니다.

도서 및 출판물: 디지털화된 서적과 학술 출판물입니다.

Wikipedia 및 위키: 구조화되고 검증된 출처입니다.

소스 코드: GitHub 등의 저장소입니다.

대화 및 포럼: Reddit, Stack Overflow 등입니다.

데이터 컷오프: 핵심 개념

모든 모델에는 "데이터 컷오프"가 존재하며, 이 시점 이후로는 새로운 정보를 학습하지 않습니다. RAG가 없는 경우, 컷오프 이후에 발생한 사건은 모델에게 알려지지 않습니다.

학습 데이터에 영향을 미치는 방법

  • 핵심 출처(Wikipedia, Wikidata, 기술 포럼)에 존재감을 유지합니다
  • 권위 있는 사이트(언론, 업계 간행물)에서 언급되도록 합니다
  • 귀사 브랜드와 관련 주제를 연결하는 풍부하고 색인화된 콘텐츠를 제작합니다
AI 답변에서 브랜드는 6번 중 1번만 나타납니다. 귀사는 나타납니까?

답변에 귀사의 이름이 없는 ChatGPT에 대한 모든 질문은 귀사 대신 추천되는 경쟁사입니다 — 6,820개의 실제 AI 답변에서 측정되었습니다.

더 알아보기

이 주제에 대한 심층 아티클을 확인해 보세요

아티클 읽기