Qué es el robots.txt y por qué es clave para SEO y GEO
El archivo robots.txt es un documento de texto plano ubicado en la raíz de un dominio que ofrece directivas a los agentes automatizados (user-agents) sobre qué rutas pueden rastrear y cuáles no.
En la era del GEO (Generative Engine Optimization), este archivo ha pasado de gestionar únicamente el crawl budget de los motores de búsqueda tradicionales a ser el cortafuegos estratégico que define si los modelos de lenguaje (LLMs) y los motores de respuesta con IA pueden citar tu contenido o utilizarlo para entrenar sus sistemas.
Antes de tocarlo, debes tener claros tres principios:
- No es un sistema de seguridad: Es un protocolo voluntario (RFC 9309). Los bots legítimos lo respetan; los maliciosos lo ignoran.
- Controla el rastreo, no la indexación: Bloquear una URL en
robots.txtimpide que el bot descargue la página, pero si esa URL recibe enlaces externos, los motores pueden indexarla sin contenido (mostrándola como resultado vacío o solo con el texto de anclaje). Para desindexar, la página debe ser rastreable y contener la metaetiquetanoindex. - Bloquear recursos rompe la interpretación: Impedir el acceso a carpetas de CSS, JavaScript o APIs no ahorra recursos útiles; impide que Google y las IAs rendericen tu web, destruyendo la evaluación de experiencia de usuario y arquitectura de datos.
El nuevo rol del robots.txt en GEO (Generative Engine Optimization)
A diferencia del SEO tradicional, donde el objetivo principal es ganar clics en las SERPs, el GEO busca que tu marca y contenido sean extraídos, sintetizados y citados como fuente de verdad en las respuestas generadas por IA (Google Gemini/AI Overviews, ChatGPT Search, Perplexity, Copilot o Claude).
En este escenario, debes distinguir entre dos tipos de rastreo generativo:
- Bots de búsqueda en tiempo real (RAG / Search Bots): Consultan tu web al instante cuando un usuario hace una pregunta para citar fuentes. Bloquearlos te hace invisible en las respuestas generadas.
- Bots de recopilación de datos (Training Crawlers): Descargan la web de forma masiva para entrenar futuros modelos fundacionales sin atribución directa ni tráfico recurrente.
| Motor / Empresa | Bot de búsqueda / Cita (Recomendado Permitir) | Bot de entrenamiento masivo (Opcional Bloquear) |
| OpenAI | OAI-SearchBot | GPTBot |
Googlebot (búsqueda y AI Overviews) | Google-Extended (Gemini training) | |
| Anthropic | Claude-Web | ClaudeBot / anthropic-ai |
| Perplexity | PerplexityBot | PerplexityBot (usa el mismo bot) |
| Common Crawl | (No aplica) | CCBot (base para múltiples LLMs) |
Si tu modelo de negocio depende de captar tráfico y ganar visibilidad de marca en IA, debes permitir el paso a los bots de búsqueda y citación (OAI-SearchBot, PerplexityBot), valorando si bloqueas los de entrenamiento (GPTBot, Google-Extended, CCBot) para proteger tu propiedad intelectual sin perder presencia en respuestas sintéticas.
Sintaxis básica y cómo leen las directivas los motores
El archivo se compone de bloques estructurados mediante directivas clave:
User-agent:Identifica el bot al que se dirigen las órdenes (*aplica como comodín para todos).Disallow:Bloquea el rastreo de un patrón de URL o carpeta.Allow:Concede permiso explícito a una subruta dentro de un bloqueo más general.Sitemap:Señaliza la ubicación absoluta del mapa del sitio XML.
Plaintext
# Permitir motores tradicionales y búsqueda con IA
User-agent: *
Disallow: /wp-admin/
Disallow: /checkout/
Disallow: /search/
Allow: /wp-admin/admin-ajax.php
# Bloquear scrapeo de entrenamiento para OpenAI sin perder presencia en SearchGPT
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
# Ubicación del Sitemap (fundamental para SEO y GEO)
Sitemap: https://tudominio.com/sitemap_index.xml
La regla de especificidad (RFC 9309):
A diferencia de lo que se creía tradicionalmente, los robots compatibles no aplican la directiva por orden de arriba a abajo. Cuando existen directivas contradictorias (Allow y Disallow), prevalece la directiva que tenga la ruta más larga y específica.
Por ejemplo:
Plaintext
Disallow: /categoria/
Allow: /categoria/subcategoria/articulo
El bot rastreará /categoria/subcategoria/articulo sin importar el orden en que estén escritas ambas líneas, ya que la regla Allow contiene más caracteres coincidentes.
Buenas prácticas para evitar desastres
- Nunca uses
"Disallow: /» en producción: Bloquea el sitio completo. Un simple fallo tipográfico aquí desindexa dominios completos. - No bloquees scripts ni hojas de estilo: Si el motor de renderizado de Google o Perplexity no puede cargar el CSS o JS, no podrá validar si tu sitio es responsive ni extraer entidades schema estructuradas.
- Omite
crawl-delaypara Google: Googlebot no procesa esta directiva. Si un bot satura tu servidor, gestiona la frecuencia de rastreo en Search Console o mediante balanceadores de carga / WAF (como Cloudflare), no confiando ciegamente encrawl-delay. - Prueba siempre antes de publicar: Utiliza el informe de robots.txt en Google Search Console para validar que no existan errores de sintaxis ni bloqueos accidentales a recursos críticos.
Bibliografía
Estándares y especificaciones técnicas (SEO)
- Koster, M., Illyes, G., & Zeller, H. (2022). Robots Exclusion Protocol. Internet Engineering Task Force (IETF), RFC 9309. Ver especificación
- Google Search Central. Introducción a robots.txt y especificación de directivas de rastreo. Google for Developers. Consultar guía oficial
- Google Search Central. Lista de rastreadores y User-Agents de Google. Google for Developers. Ver documentación
Documentación sobre rastreadores de Inteligencia Artificial (GEO)
- OpenAI Developer Docs. Overview of OpenAI Crawlers: GPTBot, OAI-SearchBot and ChatGPT-User. Documentación técnica sobre rastreo para entrenamiento vs. búsqueda en tiempo real. Leer especificaciones
- Google for Developers. Control de rastreo con el token Google-Extended para productos de IA generativa (Gemini). Consultar documentación
- Anthropic Support. ClaudeBot and Web Crawling FAQs. Directivas de rastreo e indexación para modelos Claude. Ver guía oficial
- Perplexity AI. PerplexityBot Documentation. Funcionamiento del bot de indexación y citas en respuestas sintéticas. Consultar fuente
Investigación académica fundacional (GEO)
- Aggarwal, P., Murahari, V., Rajpurohit, T., Kalyan, A., Narasimhan, K. R., & Deshpande, A. (2023). GEO: Generative Engine Optimization. arXiv:2311.09735 [cs.LG]. Acceder al paper en arXiv





