Il file robots.txt è un file di testo collocato nella radice di un sito web che indica ai robot di scansione (crawler) quali pagine possono o non possono esplorare, inclusi ormai i crawler delle IA.
Cos'è il file Robots.txt?
Il file robots.txt è un file di testo standard collocato nella radice di un sito web (esempio.com/robots.txt) che comunica ai robot di scansione (crawler) le direttive di accesso: quali parti del sito esplorare e quali ignorare. È la prima cosa che consultano Googlebot, GPTBot e gli altri crawler prima di esplorare il tuo sito.
Robots.txt e crawler IA
Con l'ascesa dell'IA, sono comparsi nuovi crawler:
- GPTBot : Il crawler di OpenAI per alimentare ChatGPT
- ClaudeBot : Il crawler di Anthropic per alimentare Claude
- PerplexityBot : Il crawler di Perplexity AI
- Google-Extended : Il crawler di Google per Gemini
- Bytespider : Il crawler di ByteDance (TikTok)
Configurazione consigliata per la visibilità IA
Per massimizzare la tua visibilità sulle IA, il tuo robots.txt dovrebbe autorizzare i crawler IA:
# Autorizzare i crawler IA
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Sitemap
Sitemap: https://esempio.com/sitemap.xml
Errori comuni
- Bloccare tutti i bot : "User-agent: * / Disallow: /" blocca anche i crawler IA
- Dimenticare i crawler IA : Se GPTBot è bloccato, ChatGPT non può indicizzare i tuoi contenuti
- Non avere un robots.txt : I crawler esplorano tutto, senza priorità
Robots.txt e AI Labs Audit
Il Punteggio GEO di AI Labs Audit verifica automaticamente il tuo file robots.txt e ti avvisa se crawler IA importanti sono bloccati.
Ogni domanda posta a ChatGPT senza il tuo nome nella risposta è un competitor raccomandato al posto tuo — misurato su 6.820 risposte AI reali.