I dati di addestramento indicano il corpus massiccio di testi utilizzato per formare un modello linguistico (LLM). GPT-4 è stato addestrato su centinaia di miliardi di parole provenienti dal web, da libri, articoli e conversazioni. Questi dati determinano ciò che il modello "sa" e, di conseguenza, quali brand e informazioni può menzionare naturalmente nelle sue risposte.

Composizione dei dati di addestramento

Common Crawl: archivio massiccio del web (miliardi di pagine).

Libri e pubblicazioni: opere digitalizzate, pubblicazioni accademiche.

Wikipedia e wiki: fonti strutturate e verificate.

Codice sorgente: GitHub e altri repository.

Conversazioni e forum: Reddit, Stack Overflow.

Data di cutoff: un concetto chiave

Ogni modello ha una "data di cutoff" oltre la quale non ha più appreso nuove informazioni. Gli eventi successivi al cutoff sono sconosciuti al modello (in assenza di RAG).

Influenzare i dati di addestramento

  • Presenza sulle fonti chiave (Wikipedia, Wikidata, forum tecnici)
  • Menzioni su siti autorevoli (stampa, pubblicazioni di settore)
  • Contenuti abbondanti e indicizzati che associano il tuo brand ai tuoi argomenti
Nelle risposte AI, un brand appare solo 1 volta su 6. Il tuo compare?

Ogni domanda posta a ChatGPT senza il tuo nome nella risposta è un competitor raccomandato al posto tuo — misurato su 6.820 risposte AI reali.

Per saperne di più

Scopri il nostro articolo approfondito su questo argomento

Leggi l'articolo