トレーニングデータとは、言語モデル(LLM)をトレーニングするために使用される膨大なテキストコーパスを指します。GPT-4は、Web、書籍、記事、会話から数千億の単語でトレーニングされました。これらのデータは、モデルが「知っている」ことを決定し、ひいてはモデルが回答で自然に言及できるブランドや情報を決定します。
トレーニングデータの構成
Common Crawl:Webの大規模アーカイブ(数十億のページ)。
書籍と出版物:デジタル化された書籍、学術出版物。
Wikipediaとウィキ:構造化され検証されたソース。
ソースコード:GitHubおよびその他のリポジトリ。
会話とフォーラム:Reddit、Stack Overflow。
カットオフ日:重要な概念
各モデルには「カットオフ日」があり、それ以降は新しい情報を学習していません。カットオフ後のイベントは、(RAGなしでは)モデルには未知です。
トレーニングデータに影響を与える
- 主要ソースでの存在(Wikipedia、Wikidata、技術フォーラム)
- 権威あるサイトでの言及(報道機関、業界出版物)
- あなたのブランドをトピックに関連付ける豊富でインデックス化されたコンテンツ
AIの回答では、ブランドが登場するのは6回に1回だけです。あなたのブランドは?
ChatGPTへの質問の回答にあなたの名前がなければ、その分だけ競合があなたの代わりに推奨されています——実際のAI回答6,820件で測定。