El robots.txt es un archivo de texto colocado en la raíz del sitio que indica a los crawlers (Google, Bing, GPTBot) qué páginas pueden o no rastrear e indexar.
El archivo robots.txt se encuentra en tudominio.com/robots.txt y contiene instrucciones para los robots web (crawlers). Con las directivas «User-agent» (identifica el crawler) y «Disallow» o «Allow» (especifican qué puede acceder), puedes controlar qué secciones del sitio son accesibles. Importante: el robots.txt no garantiza que Google no indexe las páginas bloqueadas si hay enlaces hacia ellas — usa «noindex» para evitar realmente la indexación. Google recomienda permitir el acceso a GPTBot y ClaudeBot para beneficiarte de la visibilidad en IA.
Un robots.txt mal configurado puede bloquear accidentalmente la indexación de todo un sitio o de secciones importantes. Es una de las primeras comprobaciones en cualquier auditoría SEO técnica. Además, permitir explícitamente los crawlers de IA (GPTBot, ClaudeBot, PerplexityBot) aumenta tus posibilidades de ser citado en las respuestas de IA.
Fuente: Google Search Central — Robots.txtEl SEO técnico abarca las optimizaciones de la infraestructura de tu sitio — rastreabilidad, indexación, velocidad de carga, HTTPS y estructura de datos — que permiten a Google encontrar y entender tus páginas.
La rastreabilidad es la capacidad de los robots de Google de acceder, navegar y leer las páginas de tu sitio — un requisito previo esencial para la indexación y el posicionamiento.
La etiqueta canónica (rel="canonical") indica a Google cuál es la versión principal de una página cuando existen URL similares o duplicadas, evitando penalizaciones por contenido duplicado.
Un sitemap XML es un archivo que lista todas las URL importantes de tu sitio, ayudando a Google a descubrirlas e indexarlas más rápido y de forma más completa.
Explora cómo aplicar este concepto a tu sector y tu ciudad.