Wer die Zahl erhebt und aus welchem Datenbestand
SimilarWeb ist ein privates Unternehmen für digitale Datenanalyse, kein Google-Dienst und keine offizielle Quelle für Website-Traffic. Die Zahl, die für eine beliebige Domain angezeigt wird, stammt in der Regel nicht aus einer direkten Verbindung zu deren Analytics, mit einer konkreten Ausnahme: wenn der Website-Betreiber SimilarWeb selbst Zugriff auf seine Daten gewährt hat. Für den Rest, die überwältigende Mehrheit aller in dem Tool abgerufenen Websites, darunter fast jede Website eines Wettbewerbers, ist die Zahl eine Schätzung aus anderen Quellen.
Laut der offiziellen Dokumentation von SimilarWeb kombiniert das Unternehmen vier Arten von Quellen. Die erste ist eigene Analytics, die Millionen Websites und Apps freiwillig mit SimilarWeb teilen, weil sie ihre Daten direkt angebunden haben: die einzige Quelle, die einer echten Messung nahekommt. Die zweite ist ein Nutzerpanel, Browser-Erweiterungen und eigene Anwendungen, installiert auf Millionen Geräten weltweit, die anonymisiert das Surfverhalten der Personen erfassen, die sie installiert haben. Die dritte ist das Crawling der öffentlichen Web-Seiten mit einem eigenen Crawler, der fortlaufend Seiten indexiert. Die vierte sind Datenvereinbarungen mit externen Partnern, darunter Internet-Provider, Werbeplattformen und Messunternehmen, die bereits aggregierte Verhaltensdaten zu Websites und Apps beisteuern.
Für eine Website ohne direkte Anbindung, was beim Blick auf einen Wettbewerber der Regelfall ist, misst SimilarWeb den Traffic nicht: Es modelliert ihn aus dem, was im eigenen Panel sichtbar ist, aus dem, was die Datenpartner beisteuern, und aus dem, was der Crawler findet, und extrapoliert daraus eine Zahl. Je größer die Präsenz dieser Website im Panel und in den Partnerdaten, desto näher kommt das Modell an eine belastbare Zahl heran. Je kleiner diese Präsenz, desto stärker hängt das Ergebnis von statistischer Extrapolation ab statt von direkter Beobachtung.