Was ist ein Crawler?
Ein Crawler, auch Webcrawler, Spider oder Indexierungs-Bot genannt, ist ein Programm, das automatisiert und systematisch Webseiten besucht. Er startet mit einer Liste bekannter URLs, der sogenannten Seed-Liste, ruft jede davon auf, liest den Inhalt und erkennt die darin enthaltenen Links. Von dort folgt er diesen Links zu neuen Seiten und wiederholt den Vorgang ohne menschliches Zutun.
Der Begriff wird manchmal als Synonym für „Bot" verwendet, aber nicht jeder Bot ist ein Crawler. Ein Crawler erkundet und entdeckt Inhalte breit angelegt, während ein Scraper konkrete Daten von einer bereits bekannten Seite gezielt ausliest und anderswo weiterverwendet. Google selbst nutzt „Crawler" beziehungsweise „Rastreador" als offiziellen Begriff in der Search Console und in seiner Entwickler-Dokumentation.
Ein Crawler durchquert theoretisch das gesamte World Wide Web, in der Praxis entscheidet aber jeder Betreiber selbst, welchen Teil er wie oft besucht. Davon hängt ab, ob eine Seite überhaupt in einer Suchmaschine erscheint oder von einem KI-System zitiert wird. Deshalb gehört der Crawler zu den ersten Konzepten in jedem Technischen SEO.
Zwei Programme, die dieselbe Seite aufrufen
Absicht
Entdecken, was es gibt.
Vorgehen
Folgt Links immer weiter, breit angelegt.
Ergebnis
Ein Verzeichnis von Seiten.
Absicht
Bestimmte Daten holen.
Vorgehen
Ruft bereits bekannte Seiten gezielt ab.
Ergebnis
Daten zur Weiterverwendung anderswo.
Beide rufen dieselbe URL ab. Der Unterschied liegt nicht im Abruf, sondern darin, was danach damit geschieht.
