Die robots.txt ist eine Textdatei im Stammverzeichnis der Website, die Crawlern (Google, Bing, GPTBot) mitteilt, welche Seiten sie aufrufen und indexieren dürfen und welche nicht.
Die robots.txt-Datei liegt unter deinedomain.com/robots.txt und enthält Anweisungen für Web-Roboter (Crawler). Mit den Direktiven „User-agent" (identifiziert den Crawler) und „Disallow" oder „Allow" (legen fest, worauf er zugreifen darf) kannst du steuern, welche Bereiche der Website zugänglich sind. Wichtig: Die robots.txt garantiert nicht, dass Google blockierte Seiten nicht indexiert, wenn Links darauf verweisen — verwende „noindex", um die Indexierung tatsächlich zu verhindern. Google empfiehlt, GPTBot und ClaudeBot Zugriff zu gewähren, um von KI-Sichtbarkeit zu profitieren.
Eine falsch konfigurierte robots.txt kann versehentlich die Indexierung einer ganzen Website oder wichtiger Bereiche blockieren. Sie ist eine der ersten Prüfungen in jedem technischen SEO-Audit. Zugleich erhöht das explizite Erlauben von KI-Crawlern (GPTBot, ClaudeBot, PerplexityBot) deine Chancen, in KI-Antworten zitiert zu werden.
Quelle: Google Search Central — Robots.txtTechnisches SEO umfasst die Optimierungen der Website-Infrastruktur — Crawlbarkeit, Indexierung, Ladegeschwindigkeit, HTTPS und Datenstruktur — die es Google ermöglichen, deine Seiten zu finden und zu verstehen.
Crawlbarkeit ist die Fähigkeit der Google-Roboter, die Seiten deiner Website aufzurufen, zu navigieren und zu lesen — eine wesentliche Voraussetzung für Indexierung und Ranking.
Der Canonical-Tag (rel="canonical") sagt Google, welche die Hauptversion einer Seite ist, wenn ähnliche oder doppelte URLs existieren, und verhindert Strafen wegen doppelter Inhalte.
Eine XML-Sitemap ist eine Datei, die alle wichtigen URLs deiner Website auflistet und Google hilft, sie schneller und vollständiger zu entdecken und zu indexieren.
Entdecke, wie du dieses Konzept auf deine Branche und Stadt anwendest.