Una introducción al robots.txt

Qué es el robots.txt y por qué es clave para SEO y GEO

El archivo robots.txt es un documento de texto plano ubicado en la raíz de un dominio que ofrece directivas a los agentes automatizados (user-agents) sobre qué rutas pueden rastrear y cuáles no.

En la era del GEO (Generative Engine Optimization), este archivo ha pasado de gestionar únicamente el crawl budget de los motores de búsqueda tradicionales a ser el cortafuegos estratégico que define si los modelos de lenguaje (LLMs) y los motores de respuesta con IA pueden citar tu contenido o utilizarlo para entrenar sus sistemas.

Antes de tocarlo, debes tener claros tres principios:

  1. No es un sistema de seguridad: Es un protocolo voluntario (RFC 9309). Los bots legítimos lo respetan; los maliciosos lo ignoran.
  2. Controla el rastreo, no la indexación: Bloquear una URL en robots.txt impide que el bot descargue la página, pero si esa URL recibe enlaces externos, los motores pueden indexarla sin contenido (mostrándola como resultado vacío o solo con el texto de anclaje). Para desindexar, la página debe ser rastreable y contener la metaetiqueta noindex.
  3. Bloquear recursos rompe la interpretación: Impedir el acceso a carpetas de CSS, JavaScript o APIs no ahorra recursos útiles; impide que Google y las IAs rendericen tu web, destruyendo la evaluación de experiencia de usuario y arquitectura de datos.

El nuevo rol del robots.txt en GEO (Generative Engine Optimization)

A diferencia del SEO tradicional, donde el objetivo principal es ganar clics en las SERPs, el GEO busca que tu marca y contenido sean extraídos, sintetizados y citados como fuente de verdad en las respuestas generadas por IA (Google Gemini/AI Overviews, ChatGPT Search, Perplexity, Copilot o Claude).

En este escenario, debes distinguir entre dos tipos de rastreo generativo:

  • Bots de búsqueda en tiempo real (RAG / Search Bots): Consultan tu web al instante cuando un usuario hace una pregunta para citar fuentes. Bloquearlos te hace invisible en las respuestas generadas.
  • Bots de recopilación de datos (Training Crawlers): Descargan la web de forma masiva para entrenar futuros modelos fundacionales sin atribución directa ni tráfico recurrente.
Motor / EmpresaBot de búsqueda / Cita (Recomendado Permitir)Bot de entrenamiento masivo (Opcional Bloquear)
OpenAIOAI-SearchBotGPTBot
GoogleGooglebot (búsqueda y AI Overviews)Google-Extended (Gemini training)
AnthropicClaude-WebClaudeBot / anthropic-ai
PerplexityPerplexityBotPerplexityBot (usa el mismo bot)
Common Crawl(No aplica)CCBot (base para múltiples LLMs)

Si tu modelo de negocio depende de captar tráfico y ganar visibilidad de marca en IA, debes permitir el paso a los bots de búsqueda y citación (OAI-SearchBot, PerplexityBot), valorando si bloqueas los de entrenamiento (GPTBot, Google-Extended, CCBot) para proteger tu propiedad intelectual sin perder presencia en respuestas sintéticas.

Sintaxis básica y cómo leen las directivas los motores

El archivo se compone de bloques estructurados mediante directivas clave:

  • User-agent: Identifica el bot al que se dirigen las órdenes (* aplica como comodín para todos).
  • Disallow: Bloquea el rastreo de un patrón de URL o carpeta.
  • Allow: Concede permiso explícito a una subruta dentro de un bloqueo más general.
  • Sitemap: Señaliza la ubicación absoluta del mapa del sitio XML.

Plaintext

# Permitir motores tradicionales y búsqueda con IA
User-agent: *
Disallow: /wp-admin/
Disallow: /checkout/
Disallow: /search/
Allow: /wp-admin/admin-ajax.php

# Bloquear scrapeo de entrenamiento para OpenAI sin perder presencia en SearchGPT
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

# Ubicación del Sitemap (fundamental para SEO y GEO)
Sitemap: https://tudominio.com/sitemap_index.xml

La regla de especificidad (RFC 9309):

A diferencia de lo que se creía tradicionalmente, los robots compatibles no aplican la directiva por orden de arriba a abajo. Cuando existen directivas contradictorias (Allow y Disallow), prevalece la directiva que tenga la ruta más larga y específica.

Por ejemplo:

Plaintext

Disallow: /categoria/
Allow: /categoria/subcategoria/articulo

El bot rastreará /categoria/subcategoria/articulo sin importar el orden en que estén escritas ambas líneas, ya que la regla Allow contiene más caracteres coincidentes.

Buenas prácticas para evitar desastres

  • Nunca uses "Disallow: /» en producción: Bloquea el sitio completo. Un simple fallo tipográfico aquí desindexa dominios completos.
  • No bloquees scripts ni hojas de estilo: Si el motor de renderizado de Google o Perplexity no puede cargar el CSS o JS, no podrá validar si tu sitio es responsive ni extraer entidades schema estructuradas.
  • Omite crawl-delay para Google: Googlebot no procesa esta directiva. Si un bot satura tu servidor, gestiona la frecuencia de rastreo en Search Console o mediante balanceadores de carga / WAF (como Cloudflare), no confiando ciegamente en crawl-delay.
  • Prueba siempre antes de publicar: Utiliza el informe de robots.txt en Google Search Console para validar que no existan errores de sintaxis ni bloqueos accidentales a recursos críticos.

Bibliografía

Estándares y especificaciones técnicas (SEO)

  • Koster, M., Illyes, G., & Zeller, H. (2022). Robots Exclusion Protocol. Internet Engineering Task Force (IETF), RFC 9309. Ver especificación
  • Google Search Central. Introducción a robots.txt y especificación de directivas de rastreo. Google for Developers. Consultar guía oficial
  • Google Search Central. Lista de rastreadores y User-Agents de Google. Google for Developers. Ver documentación

Documentación sobre rastreadores de Inteligencia Artificial (GEO)

  • OpenAI Developer Docs. Overview of OpenAI Crawlers: GPTBot, OAI-SearchBot and ChatGPT-User. Documentación técnica sobre rastreo para entrenamiento vs. búsqueda en tiempo real. Leer especificaciones
  • Google for Developers. Control de rastreo con el token Google-Extended para productos de IA generativa (Gemini). Consultar documentación
  • Anthropic Support. ClaudeBot and Web Crawling FAQs. Directivas de rastreo e indexación para modelos Claude. Ver guía oficial
  • Perplexity AI. PerplexityBot Documentation. Funcionamiento del bot de indexación y citas en respuestas sintéticas. Consultar fuente

Investigación académica fundacional (GEO)

  • Aggarwal, P., Murahari, V., Rajpurohit, T., Kalyan, A., Narasimhan, K. R., & Deshpande, A. (2023). GEO: Generative Engine Optimization. arXiv:2311.09735 [cs.LG]. Acceder al paper en arXiv

Miguel Carreira López
Miguel Carreira López

Trabajo en análisis web y SEO desde hace diez años. Creo que no hay nada que se pueda decir sobre el tráfico de una página web que no se pueda explicar mejor con un gráfico. Trabajo sobre todo con las herramientas de Google (GSC, Looker, Analytics) pero hay vida más allá. En los ratos libres escribo sobre libros en https://www.enestadocritico.com/

Miguel Carreira López
Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.