Le robots.txt est un fichier texte placé à la racine du site qui indique aux crawlers (Google, Bing, GPTBot) quelles pages ils peuvent ou non explorer et indexer.
Le fichier robots.txt se trouve à l'adresse votredomaine.com/robots.txt et contient des instructions pour les robots web (crawlers). Avec les directives « User-agent » (identifie le crawler) et « Disallow » ou « Allow » (précisent ce qui est accessible), vous pouvez contrôler quelles sections du site sont accessibles. Important : le robots.txt ne garantit pas que Google n'indexera pas les pages bloquées s'il existe des liens vers elles — utilisez « noindex » pour empêcher réellement l'indexation. Google recommande d'autoriser l'accès à GPTBot et ClaudeBot pour bénéficier d'une visibilité en IA.
Un robots.txt mal configuré peut bloquer accidentellement l'indexation de tout un site ou de sections importantes. C'est l'une des premières vérifications de tout audit SEO technique. De plus, autoriser explicitement les crawlers IA (GPTBot, ClaudeBot, PerplexityBot) augmente vos chances d'être cité dans les réponses IA.
Source : Google Search Central — Robots.txtLe SEO technique englobe les optimisations de l'infrastructure de votre site — crawlabilité, indexation, vitesse de chargement, HTTPS et structure des données — qui permettent à Google de trouver et comprendre vos pages.
La crawlabilité est la capacité des robots de Google à accéder, naviguer et lire les pages de votre site — une condition préalable essentielle à l'indexation et au classement.
La balise canonique (rel="canonical") indique à Google quelle est la version principale d'une page lorsque des URL similaires ou dupliquées existent, évitant les pénalités pour contenu dupliqué.
Un sitemap XML est un fichier qui liste toutes les URL importantes de votre site, aidant Google à les découvrir et à les indexer plus vite et plus complètement.
Découvrez comment appliquer ce concept à votre secteur et votre ville.