Hay una pregunta que parece simple y no lo es: ¿pueden los modelos de lenguaje leer mi web?
Vale, aquí me enrollo un poco, pero creo que hay un par de cosas que viene bien comentar antes de usar la herramienta. En todo caso, si quieres ir directo al tomate vete por aquí
La respuesta intuitiva es mirar el robots.txt. Si dice Allow: /, todo en orden. Pero el robots.txt es una declaración de intenciones, no una garantía de acceso. Entre esa declaración y el bot hay un cortafuegos, unas reglas de red y un sistema de detección de bots. Para este análisis he montado una herramienta para responder a esa pregunta con datos en vez de con suposiciones. Es gratuita y está más abajo.
Qué comprueba
Introduces una URL y la herramienta hace dos cosas por cada crawler de IA relevante.
- Primero lee el
robots.txtdel dominio y determina si esa ruta concreta está permitida para ese user agent. No se limita a buscar el nombre del bot: aplica el criterio de coincidencia más larga, entiende comodines y$, y resuelve qué grupo de reglas se aplica cuando hay varios. UnDisallow: /productos/con unAllow: /productos/publico/da resultados distintos según la URL, y eso importa. - Después hace la petición de verdad, presentándose con el user agent de cada bot, y mira qué contesta el servidor. Aquí es donde aparecen las sorpresas.
- Además revisa las cabeceras
X-Robots-Tagy las etiquetas<meta name="robots">, e identifica si hay un cortafuegos de aplicación delante, de los que se usan habitualmente para proteger sitios corporativos.
Los tres grupos de bots, y por qué no son intercambiables
Los resultados salen separados en tres bloques, porque bloquear uno u otro tiene consecuencias muy distintas.
Búsqueda. Rastreo programado. Estos bots pasan por su cuenta, guardan tu página y la citan más tarde, cuando alguien pregunta algo relacionado. Son OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot, bingbot, Applebot y Amazonbot. Bloquearlos te deja fuera del índice del que salen las respuestas.
A petición del usuario. Aquí no hay nada programado. Alguien está escribiendo en ChatGPT ahora mismo y pega tu URL, o pregunta por tu marca y el asistente va a mirar tu web en directo para poder responder. Son ChatGPT-User, Claude-User y Perplexity-User.
Este es el grupo que más duele bloquear y el que más se bloquea sin querer. Cuando está cerrado, alguien que te estaba buscando explícitamente recibe un «no he podido acceder a esa página». No pierdes una posición en un ranking: pierdes a una persona que ya había preguntado por ti. Y se bloquea por accidente porque los sistemas antibot lo ven como tráfico automatizado sin más contexto.
Entrenamiento. Recopilación para entrenar modelos: GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent y CCBot. No influye en que te citen hoy, sino en lo que los modelos sepan de ti mañana. Es el grupo que más gente decide bloquear a propósito, y es una decisión legítima.
Un apunte técnico: Google-Extended y Applebot-Extended no son crawlers. Son tokens de control de uso, así que solo se comprueban en el robots.txt. La herramienta lo indica en lugar de fingir que ha hecho una petición.
El caso que cambió la herramienta
Durante las pruebas analicé una página alojada tras un cortafuegos corporativo. Resultado: dieciséis bots accesibles, cero bloqueados, todo en verde.
Solo había un detalle raro. La ficha informaba de una directiva noindex en una página que estaba perfectamente indexada en Google.
Ese noindex no era de la página. Era de la página de bloqueo que devolvía el cortafuegos, que llevan esa directiva precisamente para no acabar indexadas. Y ese bloqueo se servía con código HTTP 200.
No es una rareza. Devolver el bloqueo con un 200, en lugar de con un 403, es una configuración habitual y tiene su razón de ser, evita que un atacante deduzca por el código que ha topado con una defensa. El efecto colateral es que cualquier comprobación automática que solo mire el estado da un resultado falso.
La versión actual lee el cuerpo de la respuesta y reconoce las páginas de bloqueo y los retos de verificación por sus firmas. Si detecta una, el veredicto es «bloqueado» aunque el código sea 200, y avisa arriba del todo de que lo que ha recibido no es tu página. Las meta robots y el X-Robots-Tag dejan de mostrarse en ese caso, porque son del muro, no tuyas.
Si tu web está detrás de un cortafuegos de aplicación, esto es probablemente lo más útil que te va a contar la herramienta.
Lo que esta herramienta no puede decirte
Prefiero ser explícito con los límites, porque un falso «todo correcto» es peor que no medir nada y esta herramienta no es más que un testeo
- Suplanta el user agent, no la IP. Los bots legítimos publican sus rangos de direcciones, y muchos cortafuegos los verifican por DNS inverso además de por el nombre del agente. Si tu WAF hace esa verificación, puede devolver un bloqueo a esta prueba y dejar pasar al bot auténtico. Un «bloqueado» es una señal para investigar, no una sentencia.
- No comprueba si tu rango de IP está permitido en el cortafuegos. Eso solo se sabe mirando la configuración, y esa configuración la tiene tu equipo de seguridad. Para que un bot entre de verdad hacen falta tres cosas: que el
robots.txtlo permita, que el servidor le responda, y que el WAF acepte su rango. Esta herramienta cubre las dos primeras. - Un
noindexreal anula lo demás. Si tu página pide no ser indexada, da igual que los dieciséis bots puedan entrar: se les está diciendo que no guarden lo que ven. La herramienta te avisa cuando lo detecta. - Mide un momento concreto. Las reglas de los cortafuegos cambian, los rangos de los proveedores también, y algunos sistemas antibot ajustan su comportamiento según el volumen de tráfico. Un resultado de hoy no es una garantía de la semana que viene.
Sobre el límite de uso
Puedes comprobar hasta diez URLs cada veinticuatro horas, en un solo lote o repartidas.
El motivo es sencillo: cada URL implica unas quince peticiones salientes hacia tu servidor y hacia el dominio analizado. No es una herramienta cara de usar, pero sí puede ser cara de servir, y sin límite acabaría siendo un escáner masivo.
Si llegas al tope, puedes desbloquear diez más respondiendo a tres preguntas rápidas. Me sirven para entender quién usa esto y para qué.
Cómo leer el resultado
Empieza por el recuento de arriba. Si ves algún bloqueo, mira primero si viene del robots.txt o de la respuesta real, porque se arreglan en sitios distintos: el primero lo cambias tú en un archivo de texto, el segundo requiere hablar con quien gestione el cortafuegos.
Presta atención especial al bloque de peticiones a petición del usuario. Es el que tiene consecuencias más inmediatas y el que más veces sale bloqueado por accidente.
Y si aparece la franja roja avisando de una página de bloqueo, para todo lo demás: mientras eso siga así, el resto de la información no es fiable.
El tomate
Has alcanzado el límite de hoy
Parece que tienes mucho interés en esta herramienta
Eso es genial. ¿Te importaría contarnos un poco más sobre por qué? Completa el formulario y tendrás acceso a otras diez comprobaciones.





