La crawlabilité est la capacité des robots de Google à accéder, parcourir et lire les pages de votre site — condition préalable à l'indexation et au classement.
La crawlabilité décrit la facilité avec laquelle Googlebot — le robot d'indexation de Google — peut accéder à votre site et le parcourir. Facteurs qui l'affectent : un robots.txt restrictif, des liens internes manquants ou cassés, des chaînes de redirections, des erreurs serveur (5xx), des structures de pagination complexes, un JavaScript excessif qui masque le contenu et un budget de crawl épuisé (sur les très grands sites). La crawlabilité est la première condition d'indexation — ce qui ne peut être crawlé ne peut être indexé, et ce qui n'est pas indexé ne peut se classer.
Googlebot dispose d'un budget de crawl limité par site. Si vous gaspillez du temps de crawl sur des pages sans valeur (pages de filtres dupliquées, URL à paramètres), Google n'atteint pas les pages importantes. Les grands sites peuvent perdre des dizaines de milliers de pages de l'index à cause de problèmes de crawlabilité.
Source : Google Search Central — CrawlingLe SEO technique regroupe les optimisations de l'infrastructure du site — crawlabilité, indexation, vitesse, HTTPS et structure des données — pour aider Google.
Un sitemap XML est un fichier qui liste toutes les URL importantes de votre site, aidant Google à les découvrir et à les indexer plus vite et plus complètement.
Le robots.txt est un fichier texte à la racine du site qui indique aux crawlers (Google, Bing, GPTBot) quelles pages explorer et indexer ou non.
La balise canonique (rel="canonical") indique à Google la version principale d'une page quand des URL similaires ou dupliquées existent, évitant les pénalités.
Découvrez comment appliquer ce concept à votre secteur et votre ville.
