Syntax: User-agent, Disallow, Allow, Sitemap und Wildcards
Die Datei liegt immer an derselben Stelle: im Root der Domain, erreichbar unter https://deinedomain.de/robots.txt. Ein Crawler, der die Regeln respektiert, ruft sie vor jeder anderen URL der Website ab, deshalb muss sie ohne Weiterleitung und ohne Sperre erreichbar sein.
Jeder Regelblock beginnt mit User-agent, das festlegt, für welchen Crawler das Folgende gilt: ein konkreter Name wie Googlebot, oder ein Sternchen für alle. Danach kommen die eigentlichen Direktiven. Disallow sperrt einen Pfad oder ein ganzes Verzeichnis; eine leere Zeile hinter Disallow, ohne Pfad dahinter, sperrt gar nichts. Allow macht das Gegenteil und dient vor allem dazu, innerhalb eines gesperrten Verzeichnisses eine Ausnahme zu öffnen, eine einzelne Datei, die trotz gesperrtem Ordner gecrawlt werden soll. Die optionale Direktive Sitemap mit der vollständigen URL sagt dem Crawler, wo er die Sitemap findet; sie lässt sich mehrfach wiederholen, wenn es mehrere Sitemaps gibt.
Zwei Wildcards erweitern, was sich mit wenigen Zeilen ausdrücken lässt: der Stern (*) steht für eine beliebige Zeichenfolge innerhalb eines Pfads, das Dollarzeichen ($) markiert das exakte Ende einer URL. Kombiniert lassen sich damit etwa alle URLs sperren, die auf einen bestimmten Parameter enden, ohne sie einzeln aufzulisten.
User-agent: *
Disallow: /admin/
Disallow: /warenkorb/
Disallow: /*?filter=
Allow: /wp-content/uploads/
User-agent: Googlebot-Image
Disallow: /private-fotos/
Sitemap: https://deinedomain.de/sitemap.xml
Wenn mehrere Regeln im selben Block dieselbe URL betreffen, wendet Google die spezifischere an, die mit dem längeren Pfad, nicht die zuerst genannte in der Datei. Das erklärt, warum ein einzelnes Allow neben einem breiteren Disallow im selben Block bestehen kann, ohne sich zu widersprechen.
Pfade bei Disallow und Allow unterscheiden Groß- und Kleinschreibung, /Admin/ und /admin/ sind für den Crawler zwei verschiedene Regeln, auch wenn der Server sie technisch auf dasselbe Verzeichnis abbildet. Zeilen, die mit einer Raute (#) beginnen, sind Kommentare, der Crawler ignoriert sie vollständig, praktisch, um festzuhalten, warum eine bestimmte Regel existiert, ohne das Verhalten der Datei zu ändern.
