¿Qué es un crawler?
Un crawler, también llamado rastreador web, araña web o bot de indexación, es un programa que visita páginas de internet de forma automática y sistemática. Empieza con una lista de URLs conocidas, la llamada lista semilla, entra en cada una, lee el contenido y detecta los enlaces que contiene. A partir de ahí sigue esos enlaces hacia páginas nuevas, y repite el proceso sin intervención humana.
El término se usa a veces como sinónimo de "bot", pero no todos los bots son crawlers. Un crawler explora y descubre contenido de forma amplia, mientras que un scraper extrae datos concretos de una página ya conocida para reutilizarlos en otro sitio. Google usa "rastreador" como término oficial en Search Console y en su documentación para desarrolladores.
Un crawler recorre, en teoría, toda la World Wide Web, aunque en la práctica cada operador decide cuánta parte visita y con qué frecuencia. De esa exploración depende que un sitio llegue a aparecer en un buscador o sea citado por un sistema de inteligencia artificial, y por eso el crawler es uno de los primeros conceptos de cualquier SEO Técnico.
Dos programas que abren la misma página
Intención
Descubrir lo que existe.
Método
Sigue enlaces sin parar, de forma amplia.
Resultado
Un índice de páginas.
Intención
Extraer datos concretos.
Método
Solicita páginas que ya conoce.
Resultado
Datos para reutilizar en otro sitio.
Ambos solicitan la misma URL. La diferencia no está en la petición, sino en lo que ocurre después.
