Crawl architecture

Robots + Sitemap Çapraz Kontrolü

Robots.txt ve sitemap XML’i birlikte okuyun; örneklenen URL’lerde engel, redirect, noindex, kırık yanıt ve canonical çakışmasını bulun.

Public tarama en fazla 20 URL ile sınırlıdır; kontrolsüz site crawl yapılmaz.

Aracı doğru yorumlayın

Yöntem, veri ve sınırlar

Araç ne yapıyor?

Robots.txt, sitemap bildirimleri, XML ve örneklenen sayfaların indexlenebilirliğini çapraz kontrol eder.

Nasıl çalışıyor?

Robots.txt okunur, sınırlı sitemap index’i izlenir ve yalnızca belirlenen örneklem taranır.

Hangi veriyi analiz ediyor?

Robots kuralları, sitemap konumları, HTTP durumları, yönlendirmeler, meta robots ve canonical etiketleri.

Sonuç nasıl yorumlanır?

Sitemap URL’leri erişilebilir, indexlenebilir, engellenmemiş ve self-canonical olmalıdır.

Sınırlamalar

  • — Public tarama bilinçli olarak sınırlıdır.
  • — JavaScript ile üretilen sinyaller değerlendirilmez.
  • — Büyük taramalar queue tabanlı audit akışına aittir.

Gizlilik ve veri saklama

  • — Yalnızca gönderdiğiniz origin, sunucumuzdan ve tanımlı tarama limiti içinde ziyaret edilir.
  • — Yalnızca araç anahtarı, origin, skor ve örneklenen URL sayısı saklanır; taranan dokümanlar saklanmaz.
  • — Kimlik bilgisi benzeri query parametreleri kayıttan önce maskelenir.
  • — IP adresiniz yalnızca kötüye kullanım koruması için geri döndürülemez hash olarak tutulur.
  • — Sonuçlar yayımlanmaz, indexlenmez ve XML sitemap’e girmez.