Qué significa rastreador de IA
La etiqueta agrupa cosas distintas, y ahí empieza el problema. Un rastreador de IA no es una categoría técnica: es cualquier agente automático operado por una empresa de modelos de lenguaje. Lo que los diferencia entre sí no es la tecnología, sino la finalidad, y esa finalidad determina qué pasa cuando lo bloqueas.
Hay tres finalidades y conviene nombrarlas por separado. La primera es el entrenamiento: descargar texto para alimentar futuros modelos. La segunda es el índice de búsqueda propio, el que permite a un asistente devolver enlaces cuando responde. La tercera es la recuperación en directo, cuando el usuario pega una URL o pregunta algo que obliga al asistente a ir a buscar la página en ese mismo instante.
Cada proveedor usa un agente distinto para cada finalidad y los documenta por separado. OpenAI separa GPTBot, OAI-SearchBot y ChatGPT-User. Anthropic separa ClaudeBot, Claude-SearchBot y Claude-User. Perplexity separa PerplexityBot y Perplexity-User. Google rompe el esquema: no tiene ningún agente propio en esta lista. Rastrea con Googlebot y ofrece Google-Extended como testigo de control, no como robot. Google documenta que carece de cadena de agente de usuario propia y que la descarga la siguen haciendo sus agentes de siempre, de modo que ese nombre no aparecerá nunca en un registro de acceso. Lo único que decide es si el contenido ya rastreado puede usarse para el entrenamiento y el grounding de Gemini.
Tratar todo esto como un bloque, con una sola regla que los tape a todos, es la causa de la mayoría de decisiones equivocadas en este terreno.