Was Googlebot auf deiner Website findet, crawlt und indexiert — und warum die Lücke zwischen deiner Sitemap und Googles tatsächlichem Crawl-Verhalten der wichtigste blinde Fleck im technischen SEO ist.

Online Marketing Agentur Bremen Geschäftsführer Daniel Domeracki

Daniel Domeracki

Geschäftsführer und SEO-Experte von DieDigitalen

Eine Seite, die in der Sitemap steht, aber intern nicht verlinkt ist, sendet ein widersprüchliches Signal: „Diese Seite ist wichtig genug für den Index, aber nicht wichtig genug für interne Links.“ Google glaubt den Links — nicht der Sitemap.

Eine Website kann technisch einwandfrei aussehen, schnell laden und exzellente Inhalte haben — und trotzdem bei Google unsichtbar sein. Der häufigste Grund dafür ist nicht schlechter Content oder fehlende Backlinks: Es ist eine Lücke zwischen dem, was du für deine Website hältst, und dem, was Googlebot tatsächlich sieht, crawlt und indexiert.

Die Crawl-Analyse schließt genau diese Lücke. Sie ist ein systematisches Durchleuchten der Website aus der Perspektive des Suchmaschinen-Crawlers — mit dem Ziel, technische Fehler, Indexierungshindernisse, Ressourcenverschwendung und strukturelle Schwächen zu identifizieren, bevor sie Rankings kosten.

Crawl-Analyse & SEO 
crawl_log.txt
09:14:02
200
/
09:14:03
200
/leistungen/
09:14:03
301
/ueber-uns → /team/
09:14:04
404
/produkte/alt-2019/
09:14:05
200
/blog/
09:14:06
500
/shop/?filter=neu&sort=preis
09:14:07
404
/kontakt/impressum/
09:14:08
200
/blog/seo-tipps/
09:14:09
noindex
/danke/?ref=form
09:14:10
200
/kontakt/

Grundlagen: Was eine Crawl-Analyse misst

Vier Dimensionen, die jede systematische Analyse abdecken muss

Crawling und Indexierung sind zwei verschiedene Schritte in Googles Verarbeitungsprozess — und beide können unabhängig voneinander scheitern. Google crawlt eine URL (besucht sie), rendert sie (führt JavaScript aus), versteht den Inhalt und entscheidet dann, ob sie indexiert wird. An jedem dieser Punkte kann etwas schiefgehen. Die Crawl-Analyse deckt alle vier Schichten auf.

2xx

erreichbar

3xx

Weiterleitungen

4xx

Fehlerseiten

5xx

Server-Fehler

Crawlen ≠ Indexieren

Google crawlt eine URL nicht automatisch in den Index. Zwischen Crawlen und Indexieren steht Googles Qualitätsbewertung: Ist der Inhalt einzigartig genug? Hat die Seite ausreichend Autorität? Ist kein noindex gesetzt? Eine saubere Crawl-Analyse unterscheidet deshalb zwischen gecrawlten, indexierten und nicht-indexierten URLs — und analysiert die Ursachen für jede Kategorie.

Die wichtigsten Crawl-Probleme und ihre SEO-Auswirkungen

Was Analysen in der Praxis regelmäßig aufdecken

ProblemBeschreibungSEO-AuswirkungPriorität
Redirect-KettenURL A → URL B → URL C statt direkter 301 auf ZielLink-Equity-Verlust bei jedem Hop, langsameres CrawlingHoch
Interne 404-LinksInterne Verlinkungen zeigen auf nicht mehr existierende SeitenCrawl-Budget-Verschwendung, schlechte UX, verlorene Link-EquityHoch
Doppelte Title TagsMehrere Seiten mit identischem oder sehr ähnlichem TitleKannibalisierung, Google wählt eigene Canonical-VersionHoch
Fehlende Canonical TagsKeine Canonical auf duplizierten oder parametrisierten URLsGoogle verteilt Autorität auf mehrere URL-VariantenHoch
Orphan PagesSeiten ohne interne Verlinkung — von keiner anderen Seite erreichbarGooglebot findet und crawlt diese Seiten kaum oder gar nichtHoch
Zu tiefe URL-StrukturWichtige Seiten mehr als 4 Klicks von der Startseite entferntSeltener gecrawlt, weniger interne Link-EquityMittel
Noindex auf wichtigen SeitenVersehentlich gesetztes noindex auf Kategorie- oder ProduktseitenSeite aus Google-Index entfernt, kein organischer TrafficHoch
Langsame Server-AntwortTTFB über 500ms signalisiert Google ressourcenintensives CrawlingGoogle crawlt weniger Seiten pro Session — schlechteres Crawl-BudgetMittel
Broken Canonical TagsCanonical zeigt auf nicht-existierende URL oder falsche ZielseiteGoogle ignoriert fehlerhaften Canonical und entscheidet selbstMittel
Inkonsistente hreflangHreflang-Tags ohne gegenseitige Bestätigung (x-default fehlt)Falsche Sprachversion in falschen Märkten ausgespieltSituativ

Das unterschätzte Problem: Orphan Pages

Warum Seiten ohne interne Verlinkung unsichtbar für Googlebot sind

Eine der häufigsten Entdeckungen in Crawl-Analysen sind Orphan Pages — Seiten, die zwar auf der Website existieren und oft sogar in der Sitemap stehen, auf die aber keine andere interne Seite verlinkt. Für Googlebot sind sie de facto unsichtbar: Der Crawler folgt Links. Wenn keine Links zu einer Seite führen, wird sie nur über die Sitemap sporadisch gecrawlt — und meist selten indexiert.

Orphan Pages entstehen häufig durch CMS-Migrationen, gelöschte Navigationspunkte, alte Kampagnenseiten ohne laufende Verlinkung oder Content, der angelegt aber nie in die Seitenstruktur integriert wurde. Die Lösung ist in den meisten Fällen einfach: interne Links aus thematisch verwandten Seiten, Einbindung in die Navigation oder in Footer-Bereiche. Wenige interne Links können ausreichen, um gecrawlte und indexierte Seiten signifikant zu erhöhen.

Tools: Die richtigen Werkzeuge für die Crawl-Analyse

Was welches Tool zeigt — und warum kein einzelnes Tool ausreicht

Screaming Frog SEO Spider

Crawler · Desktop · Marktstandard

Crawlt die gesamte Website wie Googlebot und zeigt Status-Codes, Title Tags, Meta Descriptions, Canonicals, hreflang, interne Links und Redirect-Ketten. Unverzichtbares Werkzeug für technische Audits.

Google Search Console

Kostenlos · Originaldaten · Google-Perspektive

Einzige Quelle mit echten Google-Crawl-Daten: welche URLs gecrawlt wurden, welche indexiert sind, welche Fehler Google sieht. Coverage-Report und URL-Inspection Tool sind Pflicht in jeder Analyse.

Ahrefs / Semrush Site Audit

Cloud-basiert · Umfassend · Monitoring

Kombiniert Crawl-Daten mit Backlink-Informationen. Besonders wertvoll für: Seiten mit externen Links aber technischen Fehlern (hohe Priorität), sowie für kontinuierliches Crawl-Monitoring über Zeit.

Log File Analyse

Server-Logs · Erweitert · Tiefste Einsicht

Die tiefste Crawl-Analyse: echte Server-Logs zeigen, welche URLs Googlebot tatsächlich besucht hat, wie oft und wann — unabhängig von Tool-Crawls. Deckt Crawl-Budget-Muster auf, die kein Spider sieht.

Empfohlene Kombination

Screaming Frog für die vollständige technische Bestandsaufnahme der eigenen Website. Google Search Console für den Abgleich mit Googles tatsächlichem Crawl-Verhalten. Ahrefs oder Semrush für die Priorisierung nach SEO-Impact. Log-File-Analyse bei konkretem Verdacht auf Crawl-Budget-Probleme oder nach großen Migrations- und Relaunch-Projekten.

Der Crawl-Analyse-Workflow in 6 Schritten

Wie eine systematische Analyse von der Datenbeschaffung zur priorisierten Maßnahmeliste führt

01: Vollständigen Crawl durchführen

Screaming Frog mit JavaScript-Rendering aktiviert crawlt die gesamte Website. Alle internen URLs, Status-Codes, Meta-Daten und Verlinkungsstrukturen werden erfasst. Gleichzeitig: Export der indizierten URLs aus der Google Search Console für den späteren Abgleich.

02: Crawl-Daten mit Search-Console-Daten abgleichen

Die gecrawlten URLs werden mit dem GSC-Coverage-Report verglichen. Ziel: Identifikation der Lücke. Welche URLs crawlt Screaming Frog, aber nicht Google? Welche indexiert Google, die technisch problematisch erscheinen? Diese Lücke ist der wichtigste Ausgangspunkt.

03: Fehler nach Priorität klassifizieren

Nicht alle Crawl-Probleme haben gleiche SEO-Relevanz. Priorisierungsrahmen: (1) Fehler auf Seiten mit externen Backlinks oder hohem organischem Traffic — kritisch. (2) Fehler auf wichtigen Kategorie- und Landingpages — hoch. (3) Fehler auf Seiten ohne Traffic und ohne Links — niedrig.

04: Orphan Pages identifizieren und einordnen

Alle URLs aus dem Crawl werden mit der internen Verlinkungsstruktur abgeglichen. Seiten ohne eingehende interne Links werden isoliert. Für jede Orphan Page: Hat sie Traffic? Externe Links? Organischen Wert? Basierend darauf: in Struktur integrieren, 301 auf relevante Seite oder löschen und 410 setzen.

05: Redirect-Ketten bereinigen

Jede Redirect-Kette (A→B→C) wird auf direkte Weiterleitung (A→C) verkürzt. Redirect-Schleifen (A→B→A) werden aufgelöst. Externe Links, die auf alte URLs zeigen, werden in Ahrefs/Semrush geprüft — Ziel-URLs müssen korrekt erreichbar sein ohne Zwischenstopps.

06: Sitemap gegen Crawl-Realität validieren

Die Sitemap.xml wird gegen den tatsächlichen Crawl-Status geprüft: Enthält sie 404-URLs? Non-Canonical-URLs? Noindex-Seiten? Redirects? Alle diese Fälle sind Fehler — die Sitemap darf ausschließlich indexierbare, kanonische 200-URLs enthalten. Alles andere ist ein Signal an Google, das Verwirrung erzeugt.

Checkliste: Crawl-Analyse Prüfliste

Die vollständige Checkliste für technische SEO-Audits

  • Vollständiger Crawl mit JS-Rendering durchgeführt — nur mit aktiviertem JavaScript-Rendering werden SPAs und moderne Frameworks korrekt erfasst.
  • GSC Coverage-Report exportiert und mit Crawl-Daten abgeglichen — die Lücke zwischen gecrawlten und indexierten URLs ist das primäre Analyseziel.
  • Alle 4xx- und 5xx-URLs priorisiert: Seiten mit externen Backlinks oder internen Links von wichtigen Seiten haben höchste Reparaturpriorität.
  • Redirect-Ketten auf Direktweiterleitung verkürzt — maximal ein Hop von Quell- zur Ziel-URL, keine Schleifen.
  • Orphan Pages identifiziert und je nach SEO-Wert in Sitestruktur integriert, 301 gesetzt oder mit 410 gelöscht.
  • Sitemap.xml validiert: nur kanonische 200-URLs, keine Redirects, keine noindex-Seiten, keine 404-URLs enthalten.
  • Duplicate Title Tags und Meta Descriptions identifiziert und auf einzigartigen, keyword-relevanten Content optimiert.
  • Canonical Tags auf Vollständigkeit geprüft: Jede indexierbare Seite hat einen Self-Canonical, alle Duplikat-URLs zeigen auf die kanonische Version.
  • noindex-Tags auf kritischen Seiten prüfen: Versehentlich gesetzte noindex-Tags auf Kategorie- oder Produktseiten sind ein häufiger und folgenreicher Fehler nach Relaunches.
  • URL-Tiefe prüfen: Wichtige Seiten sollten in maximal 3–4 Klicks von der Startseite erreichbar sein. Tiefere Strukturen werden seltener gecrawlt.
  • Log-File-Analyse nicht vergessen: Bei Verdacht auf Crawl-Budget-Probleme oder nach Migrationen sind echte Server-Logs die einzige verlässliche Quelle für Googlebots tatsächliches Verhalten.

Crawl-Analyse – Screaming Frog – Orphan Pages – Redirect-Ketten – Crawl-Budget – Indexierung – Search Console – Log-File-Analyse – Status-Codes – Sitemap-Validierung – Technisches SEO – Site Audit

Crawl-Analyse für Bremer Unternehmen

In der Praxis mit Bremer Unternehmen zeigt jede Crawl-Analyse dasselbe Muster: Die größten technischen Probleme sind nicht die spektakulären — sie sind die stillen. Orphan Pages, die über Jahre gecrawlt aber nie indexiert wurden. Redirect-Ketten aus drei oder vier Hops, entstanden nach CMS-Migrationen, die nie konsolidiert wurden. Noindex-Tags, die versehentlich beim letzten Relaunch auf Kategorieseiten gesetzt wurden und seitdem stillen Schaden anrichten. Keines dieser Probleme ist bei einer manuellen Website-Inspektion sichtbar — alle sind in einem systematischen Crawl sofort erkennbar.

Was die Bremer Unternehmenslandschaft dabei auszeichnet: Viele lokale KMU und mittelständische Unternehmen haben ihre Websites über Jahre gewachsen lassen — mit Agenturwechseln, CMS-Migrationen, und inhaltlichen Erweiterungen, die nie technisch konsolidiert wurden. Das Ergebnis sind oft Websites mit exzellentem Content und guter Reputation, die technisch weit unter ihrem Ranking-Potenzial performen. Eine Crawl-Analyse macht dieses Potenzial sichtbar und messbar. Und in einem Markt wie Bremen, wo die Wettbewerbsdichte in vielen Branchen noch handhab­bar ist, können technische Bereinigungen allein spürbare Ranking-Gewinne auslösen.

DieDigitalen führt für Bremer Unternehmen vollständige technische Crawl-Analysen durch: Screaming-Frog-Crawl mit JavaScript-Rendering, Abgleich mit Google-Search-Console-Daten, Priorisierung nach SEO-Impact, Log-File-Analyse bei komplexen Projekten und eine konkrete, umsetzbare Maßnahmeliste — keine abstrakten Berichte, sondern klare technische Handlungsempfehlungen mit direktem Bezug zu Rankings und organischem Traffic.

Deine Website. Vollständig durchleuchtet.

DieDigitalen liefert deinen technischen Crawl-Audit — kostenlos und konkret.