Crawl architecture

Robots- und Sitemap-Kreuzprüfung

Robots.txt und Sitemap-XML gemeinsam lesen und Blockierungen, Redirects, noindex, defekte Antworten sowie Canonical-Konflikte finden.

Der öffentliche Crawl ist auf 20 URLs begrenzt.

Tool richtig interpretieren

Methode, Daten und Grenzen

Was macht das Tool?

robots.txt, Sitemap-Deklarationen, Sitemap-XML und die Indexierbarkeit stichprobenartig geprüfter Seiten abgleichen.

Wie funktioniert es?

Der Prüfer liest die robots.txt, folgt einem begrenzten Sitemap-Index und untersucht dann nur die konfigurierte Stichprobengröße.

Welche Daten werden analysiert?

Robots-Direktiven, Speicherorte der Sitemap-XML, HTTP-Status, Weiterleitungen, Meta-Robots und Canonical-Tags.

Wie ist das Ergebnis zu lesen?

Sitemap-URLs sollten erreichbar, indexierbar, nicht blockiert und selbstkanonisch sein.

Einschränkungen

  • — Der öffentliche Scan ist bewusst begrenzt.
  • — Per JavaScript erzeugte Direktiven werden nicht ausgewertet.
  • — Große Crawls gehören in den warteschlangenbasierten Prüfablauf.

Datenschutz und Speicherung

  • — Es wird nur der von Ihnen eingereichte Origin kontaktiert, von unserem Server aus und innerhalb des konfigurierten Crawl-Limits.
  • — Wir speichern den Werkzeugschlüssel, den Origin, den Wert und die Anzahl der geprüften URLs – nicht die gecrawlten Dokumente.
  • — Query-Parameter, die wie Zugangsdaten aussehen, werden vor der Aufzeichnung geschwärzt.
  • — Ihre IP-Adresse wird ausschließlich als nicht umkehrbarer Hash zum Missbrauchsschutz gespeichert.
  • — Ergebnisse werden nicht veröffentlicht, nicht indexiert und erscheinen nie in unserer XML-Sitemap.