Guía técnica

Cómo comprobar si ChatGPT puede leer tu web

Cuatro comprobaciones que puedes hacer tú mismo en cinco minutos, sin herramientas de pago y sin saber programar.

Antes de optimizar nada para la IA, hay que responder a una pregunta más básica: ¿pueden los modelos acceder siquiera a tu contenido? Es sorprendentemente frecuente que la respuesta sea no, y que el dueño de la web no lo sepa.

La causa casi nunca es una decisión consciente. Suele ser una línea heredada de una plantilla, una casilla marcada en un plugin, o una configuración que alguien puso hace años por otro motivo.

Estas cuatro comprobaciones no requieren instalar nada. Solo un navegador.


1. ¿Bloquea tu robots.txt a los crawlers de IA?

Escribe en el navegador la dirección de tu web seguida de /robots.txt:

https://tunegocio.es/robots.txt

Verás un fichero de texto plano. Busca estos nombres, que son los rastreadores que usan los principales motores de respuesta:

  • GPTBot, OAI-SearchBot, ChatGPT-User — OpenAI
  • ClaudeBot, Claude-User, Claude-SearchBot — Anthropic
  • PerplexityBot, Perplexity-User — Perplexity
  • Google-Extended — controla el uso de tu contenido en los productos de IA de Google
  • Applebot-Extended, Bingbot-Extended, Amazonbot, Meta-ExternalAgent

Un bloqueo tiene esta pinta:

User-agent: GPTBot
Disallow: /

Esa barra sola significa "todo el sitio". Si la ves, ChatGPT no puede leerte.

El bloqueo más habitual no es explícito. Es este:

User-agent: *
Disallow: /

El asterisco significa "cualquier rastreador que no tenga una regla propia". Si tu fichero tiene esa regla y ninguna regla específica para GPTBot, entonces GPTBot está bloqueado aunque su nombre no aparezca por ningún lado. Es el fallo que más veces pasa desapercibido, porque para verlo hay que saber que el asterisco arrastra a todos los demás.

Si no existe el fichero y ves un error 404, no hay bloqueo — pero tampoco control. No es urgente, pero conviene crearlo.

Qué hacer si están bloqueados

Decide primero si el bloqueo era intencionado. Hay motivos legítimos para no querer que los modelos usen tu contenido, sobre todo si vendes el contenido en sí. Pero si tu web existe para que te encuentren clientes, el bloqueo juega en tu contra. Permitir el acceso es añadir, por cada rastreador:

User-agent: GPTBot
Allow: /

2. ¿Existe tu contenido sin JavaScript?

Los crawlers de IA no ejecutan JavaScript. Esta es la diferencia técnica más importante entre ellos y Googlebot, que sí lo ejecuta (con limitaciones y retraso).

Significa que, si tu web genera el contenido en el navegador del visitante, tú ves tu página perfecta y el modelo recibe un documento prácticamente vacío.

Para comprobarlo, pulsa Ctrl+U en tu web (o Cmd+U en Mac). Se abrirá el código fuente tal y como sale del servidor, antes de que el navegador ejecute nada.

Ahora busca dentro de ese código, con Ctrl+F, una frase concreta de tu página — el titular principal, por ejemplo.

  • Si encuentras el texto: tu contenido llega. Comprobación superada.
  • Si no lo encuentras y en su lugar ves poco más que un <div id="root"></div> y varias etiquetas <script>: tu contenido se monta en el navegador y los modelos no lo ven.

Ojo con la trampa: "ver el código fuente" (Ctrl+U) y "inspeccionar elemento" (F12) no muestran lo mismo. El inspector enseña el resultado después de ejecutar JavaScript, así que ahí el texto siempre aparece. Para esta comprobación tiene que ser Ctrl+U.

Qué hacer si el contenido no está

Es el hallazgo más caro de arreglar de los cuatro, porque afecta a cómo está construida la web. La solución es el renderizado en servidor (SSR) o la generación estática. En algunos frameworks es un cambio de configuración; en otros implica rehacer parte del proyecto. No es algo que se resuelva con un plugin.


3. ¿Tienes datos estructurados?

Los datos estructurados son un bloque de código que declara, en un formato que las máquinas entienden, qué tipo de negocio eres: nombre, ubicación, servicios, horarios. El formato recomendado es JSON-LD.

Sin ellos, ni Google ni los modelos leen esos datos declarados: tienen que deducirlos del texto, y a veces se equivocan.

En el mismo código fuente de antes (Ctrl+U), busca con Ctrl+F:

application/ld+json

Si aparece, tienes datos estructurados. Para comprobar que son válidos y no tienen errores de sintaxis, pega la URL en la herramienta de validación de schema.org, que es gratuita.

Si no aparece nada, no tienes. Es de lo más rentable que se puede añadir: no toca el diseño, no cambia lo que ve el visitante, y es de las pocas mejoras que se implementan en horas.


4. ¿Tienes llms.txt?

Es un fichero de texto plano, situado en la raíz del dominio, que resume qué es tu negocio y qué contiene tu web, en un formato pensado para que los modelos de lenguaje lo procesen con facilidad.

https://tunegocio.es/llms.txt

Es un estándar emergente: no está garantizado que todos los modelos lo consulten hoy, y conviene decirlo claro en lugar de venderlo como obligatorio. Pero es un fichero de texto que se escribe en un rato, no tiene ningún inconveniente técnico, y casi ninguna web española lo tiene todavía.

Esa combinación — coste bajo, riesgo nulo, adopción escasa — es lo que lo hace interesante ahora y no dentro de dos años.


Qué te dice todo esto, y qué no

Estas cuatro comprobaciones responden a una sola pregunta: ¿puede un modelo de IA acceder a tu contenido y entender su estructura? Es la condición necesaria. Sin ella, nada de lo demás importa.

Pero no responden a la que viene después: ¿va a citarte? Eso depende de cosas que no se comprueban con un fichero — si tu contenido está redactado de forma citable, si otras fuentes te mencionan, si eres una entidad reconocible, y de lo que estén haciendo tus competidores.

Dicho de otro modo: superar estas cuatro comprobaciones te pone en la carrera. No te hace ganarla.

Si prefieres no hacerlo a mano, hago estas comprobaciones gratis sobre tu web y te mando lo que salga. Sin compromiso y sin segunda parte de pago.

Pedir la revisión gratuita →