Ir al contenido

Glosario Crawler

¿Qué es un Crawler o Rastreador Web?

  • SEO Técnico
Definición

Un crawler o rastreador web es un programa automatizado que visita páginas de internet de forma sistemática, lee su contenido y sigue los enlaces que encuentra, para reunir información destinada a un buscador o a otro sistema.

La rueda de un odómetro de latón con la ventanilla vacía, junto al título Crawler
El contador avanza con la rueda, no con la intención
En esta página 6
  1. ¿Qué es un crawler?
  2. Los crawlers más conocidos en 2026
  3. Cómo funciona
  4. Por qué importa
  5. Buenas prácticas
  6. Errores frecuentes
En breve

Cómo funciona un rastreador web, qué tipos existen en 2026 (indexación clásica, entrenamiento de IA, respuestas de IA) y qué controla realmente el archivo robots.txt sobre ellos.

La rueda de un odómetro de latón con la ventanilla vacía, junto al título Crawler
El contador avanza con la rueda, no con la intención

¿Qué es un crawler?

Un crawler, también llamado rastreador web, araña web o bot de indexación, es un programa que visita páginas de internet de forma automática y sistemática. Empieza con una lista de URLs conocidas, la llamada lista semilla, entra en cada una, lee el contenido y detecta los enlaces que contiene. A partir de ahí sigue esos enlaces hacia páginas nuevas, y repite el proceso sin intervención humana.

El término se usa a veces como sinónimo de "bot", pero no todos los bots son crawlers. Un crawler explora y descubre contenido de forma amplia, mientras que un scraper extrae datos concretos de una página ya conocida para reutilizarlos en otro sitio. Google usa "rastreador" como término oficial en Search Console y en su documentación para desarrolladores.

Un crawler recorre, en teoría, toda la World Wide Web, aunque en la práctica cada operador decide cuánta parte visita y con qué frecuencia. De esa exploración depende que un sitio llegue a aparecer en un buscador o sea citado por un sistema de inteligencia artificial, y por eso el crawler es uno de los primeros conceptos de cualquier SEO Técnico.

Rastreador y scraper — la misma petición, distinta intención

Los crawlers más conocidos en 2026

No todos los crawlers persiguen el mismo objetivo. Unos indexan contenido para un buscador clásico, otros lo usan para entrenar modelos de IA, y otros lo rastrean para poder citarlo en una respuesta generada al momento. La tabla resume los cinco más habituales y para qué sirve cada uno.

CrawlerOperadorPara qué sirve
GooglebotGoogleIndexación clásica para el buscador de Google
BingbotMicrosoftIndexación clásica para el buscador Bing
GPTBotOpenAIEntrena los modelos de IA de OpenAI; no indexa para búsqueda
Google-ExtendedGoogleControla si el contenido entrena Gemini y Vertex AI; no influye en el posicionamiento en Search
PerplexityBotPerplexityRastrea e indexa contenido para poder citarlo en las respuestas del buscador de Perplexity

La confusión más frecuente es tratar a todos los crawlers de IA por igual. GPTBot y Google-Extended sirven para entrenar modelos, y bloquearlos no saca a un sitio de ningún buscador. PerplexityBot es distinto: alimenta directamente el producto de búsqueda de Perplexity, así que bloquearlo sí puede sacar un sitio de sus respuestas.

No todos los bots buscan lo mismo

Cómo funciona

El proceso empieza con una lista semilla de URLs, obtenida de sitemaps, enlaces externos o rastreos anteriores. El crawler visita cada URL, descarga el HTML y, si lo soporta, ejecuta el JavaScript de la página antes de leer el resultado. Googlebot renderiza JavaScript de forma habitual desde hace años, pero crawlers más simples o antiguos solo leen el HTML inicial, así que un sitio que depende por completo de JavaScript para mostrar su contenido puede quedar invisible para ellos.

Antes de pedir una página, un crawler respetuoso consulta el archivo robots.txt del dominio y respeta las reglas Disallow y las directivas por user-agent que encuentre ahí, además de cualquier crawl-delay indicado. No todos los crawlers cumplen esas reglas al pie de la letra: distintos rastreadores interpretan su sintaxis de forma distinta, según reconoce la propia documentación de Google.

User-agent: *
Disallow: /admin/
Disallow: /*?sort=
Allow: /wp-content/uploads/

Sitemap: https://zds.es/sitemap.xml

Cada enlace que el crawler encuentra en una página es una pista sobre qué visitar después, y también una señal para calcular el PageRank de la página de destino, salvo que el enlace lleve el atributo nofollow en vez de dofollow. Además del HTML, un crawler moderno puede leer los datos estructurados de la página para entender mejor de qué trata. Las páginas que consigue leer con éxito se envían a la fase de indexación; las que devuelven un error 400 o un error 500 se descartan por ahora, y las que ya no existen y devuelven un error 404 acaban saliendo del índice.

El recorrido de un rastreador — y dónde se detiene en cada caso

Por qué importa

Google reserva a cada dominio un presupuesto de rastreo o crawl budget: una cantidad limitada de peticiones que está dispuesto a hacerle en un periodo dado, según la calidad de las páginas, el rendimiento del servidor y la popularidad del sitio. En una web pequeña ese límite casi nunca se nota. En una web con decenas de miles de URLs, sobre todo si genera muchas variantes por filtros o parámetros, gastar ese presupuesto en páginas irrelevantes deja menos margen para las páginas que sí importan.

De ahí depende buena parte de la búsqueda orgánica: una página que el crawler no visita no puede indexarse, y una página que no está indexada no puede aparecer en ningún resultado. Con los crawlers de IA pasa algo parecido, aunque con matices: bloquear el que alimenta un producto de respuestas corta la visibilidad ahí mismo, mientras que bloquear uno de entrenamiento solo afecta a futuros modelos, no a la posición actual en ningún buscador.

Decidir qué crawlers entran y cuáles no es, en el fondo, una decisión de negocio tanto como técnica.

Adónde va el presupuesto de rastreo — proporciones, no valores absolutos

Buenas prácticas

  • Mantener el archivo robots.txt actualizado y probarlo tras cada cambio grande de estructura, para no bloquear por error secciones enteras del sitio.
  • Publicar un sitemap.xml actualizado, para que el crawler descubra páginas nuevas sin depender solo de encontrarlas por enlaces.
  • Evitar cadenas largas de redirecciones internas, porque cada salto adicional gasta parte del presupuesto de rastreo sin aportar contenido nuevo.
  • Comprobar que los recursos CSS y JavaScript necesarios para renderizar la página no queden bloqueados por error en robots.txt.
  • Revisar los logs del servidor para ver qué crawlers visitan realmente el sitio, en lugar de asumirlo solo por lo que dice robots.txt.
  • Decidir de forma consciente, no por defecto, si se permite el acceso a crawlers de entrenamiento de IA como GPTBot.

Errores frecuentes

  • Creer que bloquear una URL en robots.txt la saca de Google: puede seguir apareciendo en resultados, sin descripción, si otro sitio enlaza a ella.
  • Bloquear sin darse cuenta los archivos CSS o JavaScript que el crawler necesita para renderizar la página correctamente.
  • Tratar a todos los crawlers de IA como si fueran lo mismo, cuando unos entrenan modelos y otros alimentan un producto de respuestas en vivo.
  • Confundir un crawler con un scraper: dos programas con propósitos distintos, aunque ambos accedan a las mismas páginas.
  • Ignorar el presupuesto de rastreo en sitios grandes con miles de URLs generadas por filtros, dejando páginas importantes sin visitar.
Lo que robots.txt puede hacer y lo que no
Manuel Riveiro Rodriguez CEO & Digital Strategist

Una auditoría técnica revisa esto y el resto en un solo paso.

Solicitar auditoría

Preguntas frecuentes

¿Un crawler y un scraper son lo mismo?

No. Un crawler explora la web de forma amplia, sigue enlaces y descubre páginas nuevas para indexarlas. Un scraper visita una página concreta, ya conocida, para extraer datos específicos y reutilizarlos en otro sitio. Ambos son programas automatizados, pero persiguen objetivos distintos y no siempre respetan las mismas reglas.

¿Bloquear un crawler en robots.txt saca la página de Google?

No necesariamente. El archivo robots.txt gestiona el tráfico de rastreo, pero Google lo dice de forma explícita: no es un mecanismo para mantener una página fuera de Google. Una URL bloqueada puede seguir apareciendo en resultados, sin descripción, si otro sitio enlaza a ella.

¿Qué diferencia hay entre GPTBot y PerplexityBot?

GPTBot rastrea contenido para entrenar los modelos de OpenAI; bloquearlo no afecta a ningún buscador. PerplexityBot alimenta directamente el producto de búsqueda de Perplexity, así que bloquearlo sí puede sacar el sitio de sus respuestas. Confundir ambos lleva a decisiones equivocadas sobre qué permitir.

¿Por qué algunos crawlers no ven bien una web hecha con JavaScript?

Googlebot ejecuta el JavaScript de la página antes de leerla, pero no todos los crawlers lo hacen. Los más simples o antiguos solo leen el HTML inicial que llega del servidor. Si el contenido principal se genera después, con JavaScript, esos crawlers pueden no llegar a verlo nunca.

¿Qué es el presupuesto de rastreo o crawl budget?

Es la cantidad de peticiones que Google está dispuesto a hacerle a un dominio en un periodo dado, según la calidad de sus páginas, el rendimiento del servidor y su popularidad. En sitios pequeños casi no se nota; en sitios grandes con miles de URLs puede decidir qué acaba indexado y qué no.

Fuentes

  1. Google Search Central, "Googlebot": describe cómo rastrea Google, el renderizado de JavaScript y los límites de tamaño de archivo aplicados durante el rastreo. Actualizado el 3 de febrero de 2026.
  2. Google Search Central, "Introduction to robots.txt": aclara que robots.txt gestiona el tráfico de rastreo y no es un mecanismo para excluir una página de los resultados de Google. Actualizado el 10 de diciembre de 2025.
  3. OpenAI, "Overview of OpenAI Crawlers": distingue el propósito de GPTBot (entrenamiento de modelos) frente a OAI-SearchBot y ChatGPT-User, y cómo controlar cada uno por separado en robots.txt.