Ir al contenido

Glosario Rastreadores de IA

Qué son los rastreadores de IA

Definición

Los rastreadores de IA son los agentes automáticos con los que OpenAI, Anthropic, Perplexity y Google descargan páginas web, ya sea para entrenar modelos, para construir un índice de búsqueda propio o para consultar una página en directo mientras un usuario escribe su pregunta.

En esta página 5
  1. Qué significa rastreador de IA
  2. Cómo se controlan desde robots.txt
  3. Por qué importa
  4. Buenas prácticas
  5. Errores frecuentes
En breve

Agentes automáticos de OpenAI, Anthropic, Perplexity y Google que descargan páginas web para entrenar modelos, alimentar índices de búsqueda propios o consultar una URL en directo durante una conversación.

Qué significa rastreador de IA

La etiqueta agrupa cosas distintas, y ahí empieza el problema. Un rastreador de IA no es una categoría técnica: es cualquier agente automático operado por una empresa de modelos de lenguaje. Lo que los diferencia entre sí no es la tecnología, sino la finalidad, y esa finalidad determina qué pasa cuando lo bloqueas.

Hay tres finalidades y conviene nombrarlas por separado. La primera es el entrenamiento: descargar texto para alimentar futuros modelos. La segunda es el índice de búsqueda propio, el que permite a un asistente devolver enlaces cuando responde. La tercera es la recuperación en directo, cuando el usuario pega una URL o pregunta algo que obliga al asistente a ir a buscar la página en ese mismo instante.

Cada proveedor usa un agente distinto para cada finalidad y los documenta por separado. OpenAI separa GPTBot, OAI-SearchBot y ChatGPT-User. Anthropic separa ClaudeBot, Claude-SearchBot y Claude-User. Perplexity separa PerplexityBot y Perplexity-User. Google rompe el esquema: no tiene ningún agente propio en esta lista. Rastrea con Googlebot y ofrece Google-Extended como testigo de control, no como robot. Google documenta que carece de cadena de agente de usuario propia y que la descarga la siguen haciendo sus agentes de siempre, de modo que ese nombre no aparecerá nunca en un registro de acceso. Lo único que decide es si el contenido ya rastreado puede usarse para el entrenamiento y el grounding de Gemini.

Tratar todo esto como un bloque, con una sola regla que los tape a todos, es la causa de la mayoría de decisiones equivocadas en este terreno.

Cómo se controlan desde robots.txt

El control se ejerce con el archivo de siempre: robots.txt en la raíz del dominio, con un bloque por agente. El nombre que se escribe tras User-agent es el testigo que publica cada proveedor, y una regla dirigida a un testigo no afecta a los demás.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Cada línea hace algo concreto. Bloquear GPTBot indica que el contenido no debe usarse para entrenar modelos generativos, según la documentación de OpenAI. Permitir OAI-SearchBot es la vía que OpenAI recomienda para que el sitio pueda aparecer en las respuestas con enlaces de ChatGPT, y los cambios en robots.txt tardan unas 24 horas en surtir efecto en ese sistema. Bloquear Google-Extended retira el contenido del entrenamiento y del grounding de Gemini, y Google documenta que ese testigo no afecta ni a la inclusión en su buscador ni al posicionamiento; conviene recordar que aquí la regla no frena ninguna descarga, porque el testigo no emite peticiones propias. Anthropic acepta además Crawl-delay para ClaudeBot y publica sus rangos de IP para verificar peticiones.

Hay una excepción que rompe el esquema. Perplexity documenta que su agente Perplexity-User, el que actúa cuando alguien pregunta, ignora por lo general las reglas de robots.txt, porque considera que la petición la inicia una persona. OpenAI usa una fórmula parecida para ChatGPT-User: al tratarse de acciones iniciadas por el usuario, las reglas de robots.txt pueden no aplicarse. Es decir, una directiva de bloqueo detiene el rastreo sistemático, pero no garantiza que nadie recupere la página en directo.

Por qué importa

La decisión que cuelga de esto tiene dos caras, y quien solo cuente una está vendiendo algo. Bloquear a los agentes de entrenamiento saca al sitio del material con el que se construyen los modelos futuros. Bloquear a los agentes de índice hace algo distinto: retira al sitio del conjunto de páginas que el asistente puede citar y enlazar cuando responde. Se puede querer lo primero sin querer lo segundo, y esa separación es justamente lo que permite la documentación de cada proveedor.

Un medio con contenido de pago o una editorial que negocia licencias tendrá razones para cerrar el entrenamiento. Una tienda o una empresa de servicios que quiere aparecer citada en las respuestas suele tener el interés contrario respecto al índice. La regla equivocada más cara es la que bloquea con un comodín todo lo que empieza por el nombre del proveedor y, de paso, deja fuera al rastreador de búsqueda.

Queda un tercer factor, el consumo de recursos. En sitios grandes estas peticiones se acumulan y pueden encarecer el ancho de banda sin generar visitas. Eso se mide en los registros de acceso del servidor antes de decidir, no se estima de memoria. La conversación sobre qué bloquear empieza por saber quién está pidiendo qué en tu dominio, y con qué volumen.

Buenas prácticas

  • Escribe un bloque de robots.txt por testigo y por finalidad; evita comodines que confundan al agente de entrenamiento con el de búsqueda.
  • Antes de bloquear nada, filtra treinta días de registros de acceso por cada testigo y calcula peticiones, bytes servidos y páginas afectadas.
  • Verifica la identidad del agente contra las listas de rangos de IP que publican los proveedores; el campo user agent lo escribe quien envía la petición y se falsifica en un segundo.
  • Deja escrita la decisión y su motivo junto al archivo, con fecha, para que quien la revise dentro de un año sepa qué se quiso conseguir.
  • Si necesitas un bloqueo que no dependa de la buena voluntad del agente, aplícalo en el servidor o en el proveedor de CDN, no solo en robots.txt.
  • Revisa el archivo cada trimestre: los proveedores añaden testigos nuevos y una regla escrita hace dos años ya no cubre lo que crees que cubre.

Errores frecuentes

  • Usar User-agent con comodín y Disallow total para frenar a la IA, lo que también saca al sitio de los buscadores clásicos.
  • Bloquear Google-Extended esperando desaparecer de AI Overviews. Ese testigo cubre el entrenamiento y el grounding de Gemini, mientras las respuestas del buscador se nutren del índice que llena Googlebot. Para salir de esas superficies, Google anunció el 3 de junio de 2026 un ajuste propio en Search Console.
  • Dar por hecho que robots.txt detiene la recuperación en directo, cuando Perplexity y OpenAI documentan que sus agentes de usuario pueden no aplicar esas reglas.
  • Identificar el tráfico solo por el nombre del agente, sin comprobar la dirección IP de origen contra la lista del proveedor.
  • Copiar una lista de bloqueo encontrada en un foro, con testigos obsoletos o inventados, y no volver a revisarla nunca.
Manuel Riveiro Rodriguez CEO & Digital Strategist

Una auditoría técnica revisa esto y el resto en un solo paso.

Solicitar auditoría

Preguntas frecuentes

¿Bloquear los rastreadores de IA me saca de ChatGPT o de Perplexity?

Depende del agente. Bloquear GPTBot o ClaudeBot afecta al entrenamiento de modelos. Bloquear OAI-SearchBot, Claude-SearchBot o PerplexityBot retira el sitio del índice con el que esos asistentes citan y enlazan páginas. Si quieres seguir apareciendo en las respuestas, esos tres se dejan permitidos.

¿Respetan robots.txt?

Los agentes de rastreo sistemático declaran respetarlo. Los de recuperación en directo, no siempre: Perplexity documenta que Perplexity-User suele ignorar esas reglas y OpenAI señala que pueden no aplicarse a acciones iniciadas por el usuario. Cloudflare publicó en agosto de 2025 un informe según el cual Perplexity usaba además agentes no declarados.

¿Qué hace exactamente Google-Extended?

Controla si el contenido rastreado puede usarse para entrenar los modelos Gemini y para el grounding en Gemini y en Vertex AI. Google documenta que no influye en la inclusión en su buscador ni funciona como señal de posicionamiento. No es el interruptor de AI Overviews: para eso Google añadió en junio de 2026 un ajuste en Search Console.

¿Cómo distingo un rastreador legítimo de uno falsificado?

Por la dirección IP. Los proveedores publican archivos con los rangos desde los que operan sus agentes, y basta comprobar la IP de la petición contra esa lista. El campo user agent lo escribe quien envía la petición, así que cualquiera puede presentarse como GPTBot sin serlo.

¿Cuánto tarda en aplicarse un cambio en robots.txt?

No es inmediato. OpenAI indica que sus sistemas de búsqueda tardan alrededor de 24 horas en recoger un cambio. Otros proveedores no publican plazo. Cuenta con varios días antes de dar el efecto por hecho, y compruébalo en los registros de acceso en lugar de suponerlo.

Fuentes

  1. Documentación de OpenAI sobre sus agentes: GPTBot para entrenamiento, OAI-SearchBot para el índice de búsqueda y ChatGPT-User para acciones iniciadas por el usuario, con el aviso de que robots.txt puede no aplicarse a estas últimas.
  2. Documentación de Anthropic sobre ClaudeBot, Claude-SearchBot y Claude-User, con el ejemplo de robots.txt, la opción Crawl-delay y la lista de IP para verificar peticiones.
  3. Documentación de Perplexity: PerplexityBot respeta robots.txt, mientras que Perplexity-User, activado por la pregunta de un usuario, ignora por lo general esas reglas.
  4. Documentación de Google: Google-Extended gobierna el entrenamiento y el grounding de Gemini y no afecta a la inclusión en Google Search ni al posicionamiento.
  5. Informe de Cloudflare del 4 de agosto de 2025 según el cual Perplexity recurría a agentes no declarados y a IP rotatorias para acceder a dominios de prueba que prohibían todo rastreo.
  6. Ayuda de Search Console sobre el ajuste «Search generative AI control», que excluye un sitio de AI Overviews, AI Mode y las funciones generativas de Discover sin actuar como señal de posicionamiento en el resto de la búsqueda.