Robots.txt Oluşturucu
Hazır şablonlar, özel kurallar, yapay zekâ botu engelleme ve sitemap satırıyla doğru bir robots.txt kurun — indirmeye hazır.
1.102 görüntülenme
robots.txt Gerçekte Ne Yapar?
robots.txt, alan adınızın kökünde duran ve arama motoru botlarına hangi URL'leri taramaması gerektiğini söyleyen düz bir metin dosyasıdır; bunu birkaç direktifle yapar: User-agent (kuralın hangi bot için geçerli olduğu), Disallow (atlanacak yol), Allow (daha geniş bir Disallow içinden açılan istisna) ve Sitemap (sitemap.xml'inizin adresi). Googlebot gibi kurallara uyan botlar, taramaya başlamadan önce bu dosyayı okur ve ona uyar — tarama bütçesini korumak, yönetim sayfalarını, arama sonucu sayfalarını ve filtrelenmiş URL'leri tarama kuyruğundan uzak tutmak için tam olarak bu şekilde işe yarar.
Somut örnek: Disallow: /admin/ ve Disallow: /search? eklerseniz, Googlebot sınırlı tarama bütçesini giriş ekranlarınıza ve iç arama sonuçlarınıza harcamayı bırakır, bu bütçeyi asıl dizine girmesini istediğiniz sayfalara ayırır. Ama bu aracın öğretmek için var olduğu kritik uyarı şudur: robots.txt bir güvenlik önlemi değildir. Yalnızca iyi niyetli botlara rehberlik eder — kötü niyetli bir scraper, bir rakibin botu ya da tarayıcısı olan herhangi biri dosyayı görmezden gelip yasaklı URL'yi doğrudan isteyebilir, çünkü dosyanın kendisi isteyen herkese alanadiniz.com/robots.txt adresinden herkese açık şekilde sunulur.
Bilinmesi Gerekenler
Bu, gerçek bir tuzak yaratır: hassas bir yolu arama sonuçlarından uzak tutmak için Disallow: /gizli-yonetim-paneli/ eklemek, aslında onun tam adresini dosyayı okuyan her kişiye ya da bota açıkça ilan eder — bu da onu gizlemenin tam tersidir. Bir sayfanın gerçekten gizli kalması gerekiyorsa, tek gerçek koruma erişim kontrolüdür: şifre, kimlik doğrulama kontrolü ya da sayfayı herkese açık barındırmadan tamamen kaldırmak — asla robots.txt değil. Ayrıca, robots.txt'te bir URL'yi engellemek, o URL zaten dizindeyse ya da dışarıdan bağlantı alıyorsa onu arama dizininden silmez; engellenen bir sayfa yine sonuçlarda görünebilir, genelde açıklamasız, çünkü tarayıcının içeriği okumasına hiç izin verilmemiştir. Dizine girmeyi gerçekten engellemenin doğru yolu noindex meta etiketi ya da HTTP başlığıdır, bu da sayfanın öncelikle taranabilir olmasını gerektirir.
- Dosya tam olarak alan adı kökünde bulunmalıdır (ornek.com/robots.txt) — alt klasörlere konan kopyalar yok sayılır, her alt alan adının kendi dosyasına ihtiyacı vardır.
- Bu oluşturucunun ele aldığı güncel konu, yapay zekâ eğitim botlarını (GPTBot, CCBot, Google-Extended ve benzerleri) engelleyip engellememektir. Engellemek içeriğinizi gelecekteki model eğitim verilerinden uzak tutar, ama sizi sitenize atıf yapıp bağlantı verebilecek yapay zekâ üretimi cevaplardan da çıkarır — evrensel olarak doğru bir seçim yoktur, yalnızca hedeflerinize dayalı bir takas vardır.
- Her zaman sitemap.xml'inize işaret eden Sitemap direktifini ekleyin — bu, dosyadaki botlara neyi atlayacaklarını söylemek yerine içeriğinizi bulmalarına aktif olarak yardımcı olan tek satırdır.
Sıkça Sorulan Sorular
robots.txt dosyası tam olarak nereye konmalı?
Tam olarak alan adı köküne — alanadiniz.com/robots.txt. alanadiniz.com/blog/robots.txt gibi bir alt klasör içindeki kopya botlar tarafından basitçe yok sayılır, magaza.alanadiniz.com gibi her alt alan adı kendi ayrı dosyasına ihtiyaç duyar.
robots.txt'i özel ya da hassas bir sayfayı gizlemek için kullanabilir miyim?
Hayır, ve bunu yapmak geri tepebilir. Dosya herkese açıktır, yani hassas bir yolu Disallow altında listelemek, onu okuyan herkese tam URL'sini ilan eder. Gerçek gizlilik, giriş ya da kimlik doğrulama kontrolü gibi erişim kontrolü gerektirir, bir tarayıcı direktifi değil.
Bir URL'yi yasaklarsam arama sonuçlarından kaybolur mu?
Şart değil. Disallow yalnızca taramayı durdurur, dizine girmeyi değil — sayfa başka yerden bağlantı alıyorsa yine dizine girebilir, genelde görünür açıklama olmadan. Bir sayfayı arama sonuçlarından gerçekten kaldırmak için, botların hâlâ ulaşabildiği bir sayfada noindex meta etiketi ya da HTTP başlığı kullanın.
GPTBot gibi yapay zekâ eğitim botlarını engellemeli miyim?
Bu gerçek bir takastır. Engellemek içeriğinizin gelecekteki model eğitiminde kullanılmasını önler, ama sizi sitenize atıf yapıp bağlantı verebilecek yapay zekâ üretimi cevaplardan da çıkarır. Yayıncılar kabaca yarı yarıya bölünmüş durumda — yapay zekâ yönlendirme trafiğinin işiniz için önemli olup olmadığına göre karar verin.
Kötü niyetli botlar ya da scraper'lar robots.txt'e uyar mı?
Hayır, ve bu dosyanın en büyük sınırlamasıdır. robots.txt tamamen gönüllü uyuma dayanır — Googlebot gibi saygın tarayıcılar ona uyar, ama içerik, fiyat verisi ya da e-posta toplamak için yapılmış scraper'lar genelde onu tamamen görmezden gelir. Bu, iyi niyetli aktörler için bir rehberdir, kötü niyetliler için bir engel değil.
Benzer Araçlar
Sorun Bildir
Robots.txt Oluşturucu
Yorumlar
Henüz yorum yok — ilk yorumu siz yazın!