Die robots.txt ist eine Textdatei im Stammverzeichnis der Website, die Crawlern (Google, Bing, GPTBot) mitteilt, welche Seiten sie indexieren dürfen.
Die robots.txt-Datei liegt unter deinedomain.com/robots.txt und enthält Anweisungen für Web-Roboter (Crawler). Mit den Direktiven „User-agent" (identifiziert den Crawler) und „Disallow" oder „Allow" (legen fest, worauf er zugreifen darf) kannst du steuern, welche Bereiche der Website zugänglich sind. Wichtig: Die robots.txt garantiert nicht, dass Google blockierte Seiten nicht indexiert, wenn Links darauf verweisen — verwende „noindex", um die Indexierung tatsächlich zu verhindern. Google empfiehlt, GPTBot und ClaudeBot Zugriff zu gewähren, um von KI-Sichtbarkeit zu profitieren.
Eine falsch konfigurierte robots.txt kann versehentlich die Indexierung einer ganzen Website oder wichtiger Bereiche blockieren. Sie ist eine der ersten Prüfungen in jedem technischen SEO-Audit. Zugleich erhöht das explizite Erlauben von KI-Crawlern (GPTBot, ClaudeBot, PerplexityBot) deine Chancen, in KI-Antworten zitiert zu werden.
Quelle: Google Search Central — Robots.txtTechnisches SEO umfasst die Optimierungen der Website-Infrastruktur — Crawlbarkeit, Indexierung, Ladegeschwindigkeit, HTTPS und Datenstruktur — für Google.
Crawlbarkeit ist die Fähigkeit der Google-Roboter, die Seiten deiner Website aufzurufen und zu lesen — Voraussetzung für Indexierung und Ranking.
Der Canonical-Tag (rel="canonical") nennt Google die Hauptversion einer Seite, wenn ähnliche oder doppelte URLs existieren, und verhindert Strafen.
Eine XML-Sitemap listet alle wichtigen URLs deiner Website auf und hilft Google, sie schneller und vollständiger zu entdecken und zu indexieren.
Entdecke, wie du dieses Konzept auf deine Branche und Stadt anwendest.
