Was ist noindex?
Noindex ist eine an Crawler gerichtete Direktive, die festlegt, dass eine bestimmte URL nicht in den Index der Suchmaschine aufgenommen werden soll. Die Seite existiert weiter, bleibt für jeden mit dem Link erreichbar, und der Server liefert sie ganz normal aus. Sie verschwindet nur aus den Suchergebnissen, weil Google, Bing oder eine andere Suchmaschine sie aus der durchsuchbaren Datenbank ausschließt.
Die Direktive lässt sich auf zwei technisch gleichwertigen, aber unterschiedlich einsetzbaren Wegen setzen: über das Meta-Robots-Tag im <head> des HTML-Dokuments oder über den HTTP-Header X-Robots-Tag, den der Server zusammen mit der Antwort ausliefert. Beide akzeptieren kombinierbare Werte: noindex,follow schließt die Seite aus dem Index aus, lässt den Crawler aber ihren internen Links folgen, während noindex,nofollow beides gleichzeitig blockiert.
Ein oft übersehener Punkt: noindex löscht keine Seite und verhindert nicht, dass sie im Browser geladen wird. Die Direktive weist die Suchmaschine nur an, die Seite aus den Ergebnissen zu entfernen oder gar nicht erst aufzunehmen. War die Seite bereits indexiert, muss Google sie erneut crawlen, um das Tag zu lesen und den Ausschluss umzusetzen, ein Vorgang, der je nach Crawl-Frequenz der Seite Tage bis Wochen dauern kann.
Google ist zwar die Referenz-Suchmaschine in den meisten Audits, aber noindex gehört zum branchenüblichen Standardprotokoll für den Ausschluss von Inhalten und funktioniert gleichwertig bei Bing, Yandex oder jeder anderen Suchmaschine, die diese Konventionen respektiert. Es handelt sich nicht um eine proprietäre Funktion eines einzelnen Anbieters, sondern um eine Branchenübereinkunft, wie sich mitteilen lässt, welcher Content nicht in Suchergebnissen erscheinen soll.
Ein weiterer Punkt, der in der Praxis oft für Verwirrung sorgt: noindex ist keine Absicherung gegen versehentliches Verlinken. Wer eine Seite mit noindex versieht, aber weiterhin prominent aus der Navigation oder anderen Seiten darauf verlinkt, sorgt trotzdem dafür, dass Nutzer und Crawler regelmäßig darauf stoßen, die Seite bleibt nur aus dem Suchindex draußen, nicht aus dem Rest des Sites.
