Was Googlebot auf deiner Website findet, crawlt und indexiert — und warum die Lücke zwischen deiner Sitemap und Googles tatsächlichem Crawl-Verhalten der wichtigste blinde Fleck im technischen SEO ist.

Daniel Domeracki
Geschäftsführer und SEO-Experte von DieDigitalen
Eine Seite, die in der Sitemap steht, aber intern nicht verlinkt ist, sendet ein widersprüchliches Signal: „Diese Seite ist wichtig genug für den Index, aber nicht wichtig genug für interne Links.“ Google glaubt den Links — nicht der Sitemap.
Eine Website kann technisch einwandfrei aussehen, schnell laden und exzellente Inhalte haben — und trotzdem bei Google unsichtbar sein. Der häufigste Grund dafür ist nicht schlechter Content oder fehlende Backlinks: Es ist eine Lücke zwischen dem, was du für deine Website hältst, und dem, was Googlebot tatsächlich sieht, crawlt und indexiert.
Die Crawl-Analyse schließt genau diese Lücke. Sie ist ein systematisches Durchleuchten der Website aus der Perspektive des Suchmaschinen-Crawlers — mit dem Ziel, technische Fehler, Indexierungshindernisse, Ressourcenverschwendung und strukturelle Schwächen zu identifizieren, bevor sie Rankings kosten.

Grundlagen: Was eine Crawl-Analyse misst
Vier Dimensionen, die jede systematische Analyse abdecken muss
Crawling und Indexierung sind zwei verschiedene Schritte in Googles Verarbeitungsprozess — und beide können unabhängig voneinander scheitern. Google crawlt eine URL (besucht sie), rendert sie (führt JavaScript aus), versteht den Inhalt und entscheidet dann, ob sie indexiert wird. An jedem dieser Punkte kann etwas schiefgehen. Die Crawl-Analyse deckt alle vier Schichten auf.
2xx
erreichbar
Seite antwortet korrekt. Crawlbar und indexierbar — vorausgesetzt, kein noindex-Tag und kein robots.txt-Ausschluss.
3xx
Weiterleitungen
Redirect-Ketten und -Schleifen kosten Crawl-Budget und verzögern Link-Equity-Transfer. Jeder Hop ist ein verlorenes Signal.
4xx
Fehlerseiten
404-Fehler auf intern verlinkten Seiten verschwenden Crawl-Budget und signalisieren mangelnde Site-Pflege — besonders kritisch bei externen Backlinks.
5xx
Server-Fehler
5xx-Fehler sind das schwerwiegendste Signal. Googles Crawler zieht sich zurück und crawlt seltener, wenn Server wiederholt mit Fehlern antwortet.
Crawlen ≠ Indexieren
Google crawlt eine URL nicht automatisch in den Index. Zwischen Crawlen und Indexieren steht Googles Qualitätsbewertung: Ist der Inhalt einzigartig genug? Hat die Seite ausreichend Autorität? Ist kein noindex gesetzt? Eine saubere Crawl-Analyse unterscheidet deshalb zwischen gecrawlten, indexierten und nicht-indexierten URLs — und analysiert die Ursachen für jede Kategorie.
Die wichtigsten Crawl-Probleme und ihre SEO-Auswirkungen
Was Analysen in der Praxis regelmäßig aufdecken
| Problem | Beschreibung | SEO-Auswirkung | Priorität |
|---|---|---|---|
| Redirect-Ketten | URL A → URL B → URL C statt direkter 301 auf Ziel | Link-Equity-Verlust bei jedem Hop, langsameres Crawling | Hoch |
| Interne 404-Links | Interne Verlinkungen zeigen auf nicht mehr existierende Seiten | Crawl-Budget-Verschwendung, schlechte UX, verlorene Link-Equity | Hoch |
| Doppelte Title Tags | Mehrere Seiten mit identischem oder sehr ähnlichem Title | Kannibalisierung, Google wählt eigene Canonical-Version | Hoch |
| Fehlende Canonical Tags | Keine Canonical auf duplizierten oder parametrisierten URLs | Google verteilt Autorität auf mehrere URL-Varianten | Hoch |
| Orphan Pages | Seiten ohne interne Verlinkung — von keiner anderen Seite erreichbar | Googlebot findet und crawlt diese Seiten kaum oder gar nicht | Hoch |
| Zu tiefe URL-Struktur | Wichtige Seiten mehr als 4 Klicks von der Startseite entfernt | Seltener gecrawlt, weniger interne Link-Equity | Mittel |
| Noindex auf wichtigen Seiten | Versehentlich gesetztes noindex auf Kategorie- oder Produktseiten | Seite aus Google-Index entfernt, kein organischer Traffic | Hoch |
| Langsame Server-Antwort | TTFB über 500ms signalisiert Google ressourcenintensives Crawling | Google crawlt weniger Seiten pro Session — schlechteres Crawl-Budget | Mittel |
| Broken Canonical Tags | Canonical zeigt auf nicht-existierende URL oder falsche Zielseite | Google ignoriert fehlerhaften Canonical und entscheidet selbst | Mittel |
| Inkonsistente hreflang | Hreflang-Tags ohne gegenseitige Bestätigung (x-default fehlt) | Falsche Sprachversion in falschen Märkten ausgespielt | Situativ |
Das unterschätzte Problem: Orphan Pages
Warum Seiten ohne interne Verlinkung unsichtbar für Googlebot sind
Eine der häufigsten Entdeckungen in Crawl-Analysen sind Orphan Pages — Seiten, die zwar auf der Website existieren und oft sogar in der Sitemap stehen, auf die aber keine andere interne Seite verlinkt. Für Googlebot sind sie de facto unsichtbar: Der Crawler folgt Links. Wenn keine Links zu einer Seite führen, wird sie nur über die Sitemap sporadisch gecrawlt — und meist selten indexiert.
Orphan Pages entstehen häufig durch CMS-Migrationen, gelöschte Navigationspunkte, alte Kampagnenseiten ohne laufende Verlinkung oder Content, der angelegt aber nie in die Seitenstruktur integriert wurde. Die Lösung ist in den meisten Fällen einfach: interne Links aus thematisch verwandten Seiten, Einbindung in die Navigation oder in Footer-Bereiche. Wenige interne Links können ausreichen, um gecrawlte und indexierte Seiten signifikant zu erhöhen.
Tools: Die richtigen Werkzeuge für die Crawl-Analyse
Was welches Tool zeigt — und warum kein einzelnes Tool ausreicht
Screaming Frog SEO Spider
Crawler · Desktop · Marktstandard
Crawlt die gesamte Website wie Googlebot und zeigt Status-Codes, Title Tags, Meta Descriptions, Canonicals, hreflang, interne Links und Redirect-Ketten. Unverzichtbares Werkzeug für technische Audits.
Status-Codes – Redirect-Ketten – Canonicals – Orphan Pages – Custom Extraction
Google Search Console
Kostenlos · Originaldaten · Google-Perspektive
Einzige Quelle mit echten Google-Crawl-Daten: welche URLs gecrawlt wurden, welche indexiert sind, welche Fehler Google sieht. Coverage-Report und URL-Inspection Tool sind Pflicht in jeder Analyse.
Coverage-Report – URL Inspection – Crawl-Statistiken – Index-Status
Ahrefs / Semrush Site Audit
Cloud-basiert · Umfassend · Monitoring
Kombiniert Crawl-Daten mit Backlink-Informationen. Besonders wertvoll für: Seiten mit externen Links aber technischen Fehlern (hohe Priorität), sowie für kontinuierliches Crawl-Monitoring über Zeit.
Issue-Priorisierung – Historical Crawls – Backlink-Kontext – Alerts
Log File Analyse
Server-Logs · Erweitert · Tiefste Einsicht
Die tiefste Crawl-Analyse: echte Server-Logs zeigen, welche URLs Googlebot tatsächlich besucht hat, wie oft und wann — unabhängig von Tool-Crawls. Deckt Crawl-Budget-Muster auf, die kein Spider sieht.
Echter Googlebot – Crawl-Frequenz – Budget-Muster – Zeitverlauf
Empfohlene Kombination
Screaming Frog für die vollständige technische Bestandsaufnahme der eigenen Website. Google Search Console für den Abgleich mit Googles tatsächlichem Crawl-Verhalten. Ahrefs oder Semrush für die Priorisierung nach SEO-Impact. Log-File-Analyse bei konkretem Verdacht auf Crawl-Budget-Probleme oder nach großen Migrations- und Relaunch-Projekten.
Der Crawl-Analyse-Workflow in 6 Schritten
Wie eine systematische Analyse von der Datenbeschaffung zur priorisierten Maßnahmeliste führt
01: Vollständigen Crawl durchführen
Screaming Frog mit JavaScript-Rendering aktiviert crawlt die gesamte Website. Alle internen URLs, Status-Codes, Meta-Daten und Verlinkungsstrukturen werden erfasst. Gleichzeitig: Export der indizierten URLs aus der Google Search Console für den späteren Abgleich.
02: Crawl-Daten mit Search-Console-Daten abgleichen
Die gecrawlten URLs werden mit dem GSC-Coverage-Report verglichen. Ziel: Identifikation der Lücke. Welche URLs crawlt Screaming Frog, aber nicht Google? Welche indexiert Google, die technisch problematisch erscheinen? Diese Lücke ist der wichtigste Ausgangspunkt.
03: Fehler nach Priorität klassifizieren
Nicht alle Crawl-Probleme haben gleiche SEO-Relevanz. Priorisierungsrahmen: (1) Fehler auf Seiten mit externen Backlinks oder hohem organischem Traffic — kritisch. (2) Fehler auf wichtigen Kategorie- und Landingpages — hoch. (3) Fehler auf Seiten ohne Traffic und ohne Links — niedrig.
04: Orphan Pages identifizieren und einordnen
Alle URLs aus dem Crawl werden mit der internen Verlinkungsstruktur abgeglichen. Seiten ohne eingehende interne Links werden isoliert. Für jede Orphan Page: Hat sie Traffic? Externe Links? Organischen Wert? Basierend darauf: in Struktur integrieren, 301 auf relevante Seite oder löschen und 410 setzen.
05: Redirect-Ketten bereinigen
Jede Redirect-Kette (A→B→C) wird auf direkte Weiterleitung (A→C) verkürzt. Redirect-Schleifen (A→B→A) werden aufgelöst. Externe Links, die auf alte URLs zeigen, werden in Ahrefs/Semrush geprüft — Ziel-URLs müssen korrekt erreichbar sein ohne Zwischenstopps.
06: Sitemap gegen Crawl-Realität validieren
Die Sitemap.xml wird gegen den tatsächlichen Crawl-Status geprüft: Enthält sie 404-URLs? Non-Canonical-URLs? Noindex-Seiten? Redirects? Alle diese Fälle sind Fehler — die Sitemap darf ausschließlich indexierbare, kanonische 200-URLs enthalten. Alles andere ist ein Signal an Google, das Verwirrung erzeugt.
Checkliste: Crawl-Analyse Prüfliste
Die vollständige Checkliste für technische SEO-Audits
Crawl-Analyse – Screaming Frog – Orphan Pages – Redirect-Ketten – Crawl-Budget – Indexierung – Search Console – Log-File-Analyse – Status-Codes – Sitemap-Validierung – Technisches SEO – Site Audit
Crawl-Analyse für Bremer Unternehmen
In der Praxis mit Bremer Unternehmen zeigt jede Crawl-Analyse dasselbe Muster: Die größten technischen Probleme sind nicht die spektakulären — sie sind die stillen. Orphan Pages, die über Jahre gecrawlt aber nie indexiert wurden. Redirect-Ketten aus drei oder vier Hops, entstanden nach CMS-Migrationen, die nie konsolidiert wurden. Noindex-Tags, die versehentlich beim letzten Relaunch auf Kategorieseiten gesetzt wurden und seitdem stillen Schaden anrichten. Keines dieser Probleme ist bei einer manuellen Website-Inspektion sichtbar — alle sind in einem systematischen Crawl sofort erkennbar.
Was die Bremer Unternehmenslandschaft dabei auszeichnet: Viele lokale KMU und mittelständische Unternehmen haben ihre Websites über Jahre gewachsen lassen — mit Agenturwechseln, CMS-Migrationen, und inhaltlichen Erweiterungen, die nie technisch konsolidiert wurden. Das Ergebnis sind oft Websites mit exzellentem Content und guter Reputation, die technisch weit unter ihrem Ranking-Potenzial performen. Eine Crawl-Analyse macht dieses Potenzial sichtbar und messbar. Und in einem Markt wie Bremen, wo die Wettbewerbsdichte in vielen Branchen noch handhabbar ist, können technische Bereinigungen allein spürbare Ranking-Gewinne auslösen.
DieDigitalen führt für Bremer Unternehmen vollständige technische Crawl-Analysen durch: Screaming-Frog-Crawl mit JavaScript-Rendering, Abgleich mit Google-Search-Console-Daten, Priorisierung nach SEO-Impact, Log-File-Analyse bei komplexen Projekten und eine konkrete, umsetzbare Maßnahmeliste — keine abstrakten Berichte, sondern klare technische Handlungsempfehlungen mit direktem Bezug zu Rankings und organischem Traffic.
Deine Website. Vollständig durchleuchtet.
DieDigitalen liefert deinen technischen Crawl-Audit — kostenlos und konkret.