토큰은 LLM이 처리하는 가장 기본적인 단위로, 단어 전체일 수도 있고 단어의 일부, 하나의 문자 또는 기호일 수도 있습니다. 예를 들어 "Optimisation(최적화)"이라는 단어는 "Optim"과 "isation"으로 나뉘어 2개의 토큰이 될 수 있습니다. LLM은 토큰 단위로 표현되는 컨텍스트 한도를 가지고 있습니다(GPT-4o의 경우 128K 토큰). 토큰을 이해하면 AI가 콘텐츠를 효율적으로 처리할 수 있도록 구조화하는 데 도움이 됩니다.

토큰화는 어떻게 작동하나요

일반적인 단어 = 1토큰: 프랑스어의 "Le", "est", "pour"나 영어의 "the", "and" 같은 단어가 해당됩니다.

긴 단어 = 여러 토큰: 예를 들어 프랑스어 "Anticonstitutionnellement" 같은 긴 단어는 여러 조각으로 나뉩니다.

대략적인 규칙: 1토큰 ≈ 4자, 또는 영어 기준 ≈ 0.75단어입니다.

컨텍스트 한도

모델컨텍스트
GPT-3.54K - 16K
GPT-4o128K
Claude 3.5 Sonnet200K
Gemini 1.51M

토큰과 AEO 가시성

RAG는 토큰 수가 제한된 구간(passage)을 추출합니다. 독립적인 블록으로 구조화된 콘텐츠는 관련성 높은 구간을 추출하기 쉽게 만들어줍니다.

AI 답변에서 브랜드는 6번 중 1번만 나타납니다. 귀사는 나타납니까?

답변에 귀사의 이름이 없는 ChatGPT에 대한 모든 질문은 귀사 대신 추천되는 경쟁사입니다 — 6,820개의 실제 AI 답변에서 측정되었습니다.

더 알아보기

이 주제에 대한 심층 아티클을 확인해 보세요

아티클 읽기