Robots.txt Nedir? Nasıl Oluşturulur, Nasıl Test Edilir?

Robots.txt nedir ve ne işe yarar?
Robots.txt, sitenizin kök dizininde duran ve arama motoru botlarına hangi URL'lere girebileceklerini söyleyen düz metin dosyasıdır. Temel amacı tarama trafiğini yönetmektir. Bir sayfayı Google sonuçlarından gizlemek için tasarlanmamıştır; bu iş için noindex ya da parola koruması gerekir.
Dosya, botlar için bir kapı görevlisi işlevi görür. Bot siteye gelir, önce bu dosyayı okur, ardından izin verilen alanlarda dolaşır. Yani robots.txt bir yasak levhasıdır, kilit değildir. Kurallara uyan botlar levhayı dinler; kötü niyetli botlar ise genellikle görmezden gelir.
Bu dosyayı genellikle üç nedenle kullanırsınız. Sunucunuzun gereksiz isteklerle yorulmasını önlersiniz. Tarama bütçenizi değerli sayfalara yönlendirirsiniz. Ayrıca iç arama sonuçları gibi sonsuz URL üreten alanları kapatırsınız.
Robots.txt dosyası nasıl çalışır?
Bir bot sitenize geldiğinde ilk isteği alanadiniz.com/robots.txt adresine yapar. Dosyayı bulursa kuralları okur ve kendi adına uygun grubu seçer. Bulamazsa, yani sunucu 404 dönerse, botlar sitenin tamamını taranabilir kabul eder.
Kuralları gruplar halinde yazarsınız. Her grup bir user-agent satırıyla başlar ve altında izin ya da yasak satırları taşır. Google'ın dokümanına göre bir tarayıcı yalnızca en özel eşleşen tek grubu uygular. Bu yüzden genel grubunuzdaki kurallar, özel bir gruba otomatik geçmez.
Sunucu yanıt kodu da önemlidir. Dosya 200 dönerse kurallar geçerlidir. 4xx hatalarında botlar genellikle kısıtlama yokmuş sayar. 5xx hatalarında ise Google, dosyayı okuyana kadar taramayı durdurabilir. Bu nedenle dosyanın sağlıklı yanıt vermesini izlemeniz gerekir.
Bu akışı birkaç örnekle somutlaştıralım. Yeni bir blog yazısı yayımladığınızda bot önce robots.txt dosyasını kontrol eder. Yazının yolu yasaklı değilse sayfayı indirir, içindeki bağlantıları çıkarır ve sonraki adımlara geçer. Yasaklı bir yola rastlarsa o adrese hiç istek göndermez.
Kaynak olarak Google'ın robots.txt tanıtım sayfasını ve bot davranışlarını standartlaştıran RFC 9309 belgesini inceleyebilirsiniz.
Robots.txt dosyasında hangi komutlara yer verirsiniz?
Temel söz dizimi dört komuttan oluşur. Hepsini alan: değer biçiminde, satır başına bir komut olacak şekilde yazarsınız. Komut adları büyük küçük harfe duyarsızdır; ancak yol kısmı duyarlıdır.
- User-agent: Kuralın hangi bota ait olduğunu belirtir. Yıldız işareti tüm botları kapsar.
- Disallow: Botun girmemesi gereken yolu verir. Değeri boş bırakırsanız hiçbir yolu yasaklamamış olursunuz.
- Allow: Yasakladığınız bir klasörün içinde belirli bir yola izin verir.
- Sitemap: XML site haritanızın tam adresini bildirir.
Ayrıca iki joker karakter kullanırsınız. Yıldız (*) herhangi bir karakter dizisini, dolar işareti ($) ise adresin bittiği yeri temsil eder. Örneğin Disallow: /*.pdf$ satırı, .pdf ile biten tüm adresleri kapsar.
Yorum satırları kare işaretiyle başlar. Ekibinize not bırakmak için bunları kullanın, çünkü altı ay sonra hangi kuralın neden eklendiğini hatırlamak zor olur.
Robots.txt dosyasını nasıl oluşturursunuz?
Dosyayı oluşturmak için düz metin editörü açın, UTF-8 kodlamasıyla robots.txt adıyla kaydedin ve sitenizin kök dizinine yükleyin. Google'ın belgesine göre bir sitede yalnızca bir robots.txt olabilir ve adresi alan adının hemen altında durmalıdır.
Adım adım ilerleyelim. Bu sıra, ekibimizin yeni projelerde uyguladığı akışa yakındır.
- Taranmasını istemediğiniz alanları listeleyin: yönetim paneli, sepet, filtre sonuçları, iç arama.
- Her alan için hangi bota uygulanacağına karar verin.
- Kuralları user-agent gruplarına bölerek yazın.
- Sitemap satırını sona ekleyin.
- Dosyayı kök dizine yükleyin ve tarayıcıdan açıp kontrol edin.
- Search Console'daki robots.txt raporuyla doğrulayın.
Elle yazmak istemezseniz robots.txt oluşturucu aracımız seçimlerinize göre hazır bir taslak üretir. Yine de çıktıyı kendi sitenizin yapısına göre gözden geçirmelisiniz.
Robots.txt dosyasını nereye yüklersiniz?
Dosya, alt alan adı ve protokol dahil sitenin kökünde durmalıdır. Örneğin https://www.ornek.com/robots.txt yalnızca o adresin kurallarını belirler. Alt dizine koyduğunuz bir dosyayı botlar dikkate almaz.
Her alt alan adı kendi dosyasına ihtiyaç duyar. Yani blog.ornek.com için ayrı, ornek.com için ayrı bir robots.txt hazırlarsınız. Aynı şekilde Google, http ve https sürümlerini ayrı değerlendirir. Bu yüzden tek bir sürüme yönlendirme yapmak işinizi kolaylaştırır.
WordPress gibi sistemlerde dosyayı bazen sistem sizin yerinize sanal olarak üretir. Fiziksel bir dosya yüklediğinizde sanal olan devre dışı kalır. Hangisinin yanıt verdiğini, adresi tarayıcıda açarak görürsünüz.
Google, dosyanın ilk 500 KiB'lık bölümünü işler. Bu sınırı aşan kuralları Google yok sayar. Dosyanız bu boyuta yaklaşıyorsa kurallarınızı sadeleştirmeniz gerekir.
Robots.txt örnekleri nelerdir?
Aşağıdaki örnekler yaygın senaryoları gösterir. Hepsini kendi sitenizin yollarına göre uyarlayın, çünkü kopyalayıp yapıştırmak çoğu zaman yanlış alanları kapatır.
Her şeye izin veren temel dosya. Küçük bir kurumsal site için çoğu zaman yeterlidir:
- User-agent: *
- Disallow:
- Sitemap: https://www.ornek.com/sitemap.xml
E-ticaret sitesi için örnek. Sepet, ödeme ve iç arama sayfalarını kapatır:
- User-agent: *
- Disallow: /sepet/
- Disallow: /odeme/
- Disallow: /arama/
- Sitemap: https://www.ornek.com/sitemap.xml
Bu örneklerde dikkat edilmesi gereken bir nokta var: yol ifadeleri eğik çizgiyle başlar. Klasörleri kapatırken sondaki eğik çizgiyi unutmayın, çünkü /arama yazarsanız /arama-sonuclari gibi alakasız adresler de kapsama girer. Bu küçük ayrıntı, sahada en çok yanlış yorumlanan konulardan biridir.
Yönetim alanı örneği. WordPress sitelerinde çok sık kullanırız. Admin-ajax dosyasına izin vermek, bazı temaların çalışması için gerekir:
- User-agent: *
- Disallow: /wp-admin/
- Allow: /wp-admin/admin-ajax.php
Siteyi tamamen kapatma. Yalnızca test ortamlarında kullanın: Disallow: / satırı tüm siteyi tarama dışı bırakır. Canlı siteye yanlışlıkla taşındığında ciddi trafik kaybı yaşatır.
Robots.txt ile noindex arasındaki fark nedir?
Robots.txt taramayı, noindex ise dizine eklenmeyi kontrol eder. İkisi farklı aşamalara etki eder. Bot önce sayfayı tarar, sonra dizine ekleyip eklemeyeceğine karar verir. Robots.txt birinci aşamayı, noindex ikinci aşamayı etkiler.
Kritik nokta şudur: robots.txt ile engellediğiniz bir sayfayı Google hiç taramadığı için sayfadaki noindex etiketini de göremez. Sonuçta başka sitelerden link alan bu sayfa, içeriği okunmadan yine de sonuçlarda görünebilir. Google'ın dizine eklemeyi engelleme belgesi bu yüzden noindex için sayfanın taranabilir olmasını ister.
| Özellik | Robots.txt | Noindex |
|---|---|---|
| Kontrol ettiği şey | Tarama | Dizine ekleme |
| Uygulama yeri | Kök dizindeki dosya | Sayfa meta etiketi veya HTTP başlığı |
| Sayfayı sonuçlardan kaldırır mı? | Hayır | Evet, Google yeniden taradığında |
| Bot sayfayı okumalı mı? | Hayır, okumaz | Evet, okuması gerekir |
| Tercih nedeni | Tarama yükünü azaltmak için | Sayfayı sonuçlardan çıkarmak için |
Robots.txt ile engellenen sayfa Google'dan neden kalkmaz?
Çünkü Google bir sayfayı, içeriğini okumadan da URL olarak dizine ekleyebilir. Başka sitelerin o adrese verdiği bağlantılar yeterlidir. Bu durumda sonuçta başlık ve açıklama yerine genellikle "bu sonuç için bilgi yok" benzeri bir görünüm çıkar.
Bu, sahada en sık gördüğümüz yanlış anlamadır. Müşteriler bir klasörü Disallow ile kapatır ve sayfaların birkaç gün içinde kaybolacağını sanar. Oysa kapatmak, sayfayı dizinden silmez; yalnızca Google'ın içeriği güncellemesini engeller.
Doğru sıra şöyledir. Önce sayfaları taranabilir bırakın ve noindex ekleyin. Search Console'da sayfaların dizinden çıktığını doğrulayın. Bundan sonra isterseniz robots.txt ile tarama yükünü azaltırsınız. Hassas veri söz konusuysa noindex de yetmez; parola koruması ya da sayfayı tamamen kaldırmak gerekir.
Robots.txt ile hangi sayfaları engellemelisiniz?
Engellemeniz gereken alanlar, arama sonucunda değeri olmayan ve tarama bütçesini tüketen adreslerdir. Her sitede liste farklı olsa da, aşağıdaki gruplar sık karşımıza çıkar.
- Yönetim ve giriş sayfaları.
- Sepet, ödeme ve hesap sayfaları.
- İç arama sonuç sayfaları.
- Sonsuz kombinasyon üreten filtre ve sıralama parametreleri.
- Oturum kimliği ya da izleme parametresi taşıyan adresler.
- Test ve hazırlık alanları.
Bununla birlikte her kısıtlama risk taşır. Örneğin filtre sayfaları bazı e-ticaret sitelerinde gerçek arama talebini karşılar ve dizinde kalmalıdır. Bu yüzden kural yazmadan önce Search Console verisine ve sayfa başına organik trafiğe bakın.
Sahadan bir örnek verelim. Bir mağaza, renk ve beden filtrelerinin her kombinasyonunu ayrı URL olarak üretiyor olsun. Bu durum, binlerce benzer sayfa demektir. Bu adreslerin botları oyalaması sizin açınızdan bir kayıptır; bu yüzden filtre parametrelerini kapatmayı değerlendirirsiniz. Ancak hangi filtrelerin gerçek arama talebi taşıdığını önce ölçmeniz gerekir.
Ekibimiz bu kararı verirken tarama istatistiklerini inceler. Googlebot'un hangi klasörlere en çok istek attığına bakmak, engelleyeceğiniz alanları netleştirir. Tarama sıklığı sorunları için Googlebot neden daha az tarar yazımıza göz atabilirsiniz.
Robots.txt ile hangi sayfaları engellememelisiniz?
CSS, JavaScript ve görsel dosyalarını engellememeniz gerekir. Google sayfanızı tarayıcı gibi görüntüler; stil ve betik dosyalarına erişemezse sayfayı yanlış yorumlayabilir. Bundan hem mobil uyumluluk hem içerik değerlendirmesi zarar görür.
Ayrıca sıralamada görünmesini istediğiniz hiçbir sayfayı kapatmayın. Kategori, ürün, blog ve hizmet sayfaları taranabilir kalmalıdır. Kural yazarken geniş bir yol kullanırsanız, farkında olmadan bu alanları da kapsayabilirsiniz.
Kanonik etiketi taşıyan sayfaları da engellemek sorun yaratır. Google, kanonik sinyalini görmek için sayfayı okumak zorundadır. Bu nedenle yinelenen içeriği tarama yoluyla değil, kanonik etiketle yönetin.
Sitemap'inizde yer alan bir adresi Disallow ile kapatmak da çelişkili bir sinyaldir. Search Console bu durumda uyarı verir ve sayfaların dizindeki durumu tutarsızlaşır.
Robots.txt ve sitemap birlikte nasıl çalışır?
İkisi birbirini tamamlar. Robots.txt botlara nereye girmemeleri gerektiğini söyler; sitemap ise önemli adreslerin listesini sunar. Sitemap satırını robots.txt'nin sonuna eklemek, botların haritanızı ilk ziyaretlerinde bulmasını sağlar.
Sitemap adresini tam URL olarak yazmalısınız, göreli yolu Google kabul etmez. Birden fazla harita varsa her birini ayrı satıra yazarsınız. Büyük sitelerde harita dizin dosyasını tek satırla bildirmek yeterlidir.
Haritayı elle hazırlamak zor olduğunda XML sitemap oluşturucu aracımızı kullanabilirsiniz. Haritadaki tarih alanları için sitemap lastmod yazımız ayrıntılı bilgi verir.
Haritada yalnızca dizine girmesini istediğiniz, 200 döndüren ve kanonik adreslere yer vermeniz gerekir. Engellediğiniz, yönlendiren ya da noindex taşıyan adresleri haritadan çıkarın. Böylece Google'a tutarlı bir sinyal gönderirsiniz.
Son olarak haritanızı Search Console'a da göndermenizi öneririz. Böylece hem robots.txt üzerinden hem de doğrudan bildirim yapmış olursunuz.
Robots.txt dosyasını nasıl test edersiniz?
Dosyayı yayına aldıktan sonra üç kontrol yapın. İlk olarak adresi tarayıcıda açıp metnin doğru göründüğünü doğrulayın. İkinci olarak sunucunun 200 döndüğünü kontrol edin. Üçüncü olarak Search Console'daki robots.txt raporuna bakın.
Bu rapor, Google'ın dosyayı en son ne zaman okuduğunu ve hangi satırlarda sorun bulduğunu gösterir. Google'ın robots.txt oluşturma belgesi de test için açık kaynaklı robots.txt kütüphanesini önerir.
Kritik bir kural değişikliğinden sonra URL Denetimi aracıyla önemli sayfaları tek tek deneyin. Örneğin bir kategori sayfası "robots.txt tarafından engellendi" uyarısı veriyorsa, kuralınız gereğinden geniş demektir. Arama Konsolu'nu ilk kez kullanıyorsanız Google Search Console rehberimiz size yol gösterir.
Test sırasında mobil ve masaüstü botu için ayrı sonuçlara bakın. Bazı kurallar yalnızca belirli bir bot grubunu etkiler ve bu farkı yalnızca iki ayrı denemeyle görürsünüz.
Ayrıca sürüm kontrolü kullanın. Dosyanın eski hallerini saklamak, bir hata olduğunda geri dönmenizi hızlandırır.
Robots.txt'de en sık yapılan hatalar nelerdir?
En sık hata, canlı siteye test ortamındaki Disallow: / kuralını taşımaktır. Bunun yanında yollarda yazım hatası, eksik eğik çizgi ve büyük küçük harf karışıklığı ile sık karşılaşırız. Her birinin ayrıntılı çözümünü robots.txt hataları yazımızda anlattık; burada tekrar etmeyeceğiz.
Yine de kısa bir kontrol listesi işinize yarar:
- Dosya kök dizinde mi, yoksa alt klasörde mi?
- Kodlama UTF-8 mi?
- Sitemap satırı tam URL mi?
- CSS ve JS klasörleri açık mı?
- Noindex etiketli sayfaları taramaya açtınız mı?
Bir başka sık hata, dosyayı farklı alt alan adlarında aynı sanmaktır. Mağaza alt alan adınız varsa onun kendi dosyasına ihtiyacı vardır. Ana alan adındaki kurallar, alt alan adını hiçbir şekilde kapsamaz.
Ayrıca robots.txt içine "noindex" yazmak da işe yaramaz. Google bu komutu desteklemez. Noindex için sayfa etiketini ya da HTTP başlığını kullanmanız gerekir.
Robots.txt ile yapay zeka botlarını nasıl yönetirsiniz?
Yapay zeka botlarını yönetmek için her bota ait user-agent adını ayrı bir grup olarak yazarsınız. Örneğin GPTBot ya da ClaudeBot için ayrı gruplar açıp Disallow veya Allow verirsiniz. Bu botlar kurallara uyduğunu belirtir; ancak uyum tamamen onların inisiyatifindedir.
Karar verirken iş hedefinizi düşünün. İçeriğinizin yapay zeka yanıtlarında kaynak gösterilmesini istiyorsanız erişimi kapatmak bu olasılığı azaltabilir. Telif ve veri politikası öncelikliyse kapatmak mantıklı olur. Bu, teknik değil stratejik bir tercihtir.
Bot adlarının güncel listesi, hangi botun eğitim hangisinin arama için çalıştığı ve ekibimizin önerdiği yapılandırma için AI crawler rehberimize bakabilirsiniz. Her botun resmi dokümanını da kontrol etmenizi öneririz, çünkü adlar zamanla değişebilir.
Robots.txt dizine eklenme sorunlarını nasıl etkiler?
Robots.txt, doğrudan dizine eklemeyi değil, taranabilirliği etkiler; ancak dolaylı sonuçları büyüktür. Yanlışlıkla kapattığınız bir klasördeki sayfaları Google güncelleyemez, yeni sayfaları da geç keşfeder. Bu yüzden "Dizinde yok" raporlarında ilk bakacağınız yerlerden biri robots.txt olmalıdır.
Search Console'da "robots.txt tarafından engellendi" durumu görürseniz önce bunun bilinçli bir tercih olup olmadığını sorun. Sayfa dizinde kalmalıysa kuralı daraltın ve URL denetimiyle yeniden tarama isteyin. Sürecin tamamı için indexlenmeyen sayfaları tespit etme yazımıza göz atın.
E-ticaret sitelerinde durum daha karmaşıktır. Ürün sayfalarının dizine girmemesinin birçok nedeni var. Bunları ürün sayfaları neden indekslenmez yazımızda topladık.
Robots.txt dosyasını ne sıklıkla gözden geçirmelisiniz?
Dosyayı her büyük site değişikliğinde ve en az üç ayda bir gözden geçirin. Yeni bir bölüm eklediğinizde, sitenizi taşıdığınızda ya da tema ve eklenti değiştirdiğinizde kurallar geçerliliğini yitirebilir.
Google genellikle dosyanın kopyasını önbellekte tutar ve günlük civarında yeniler. Yani bir değişikliğin etkisi hemen görünmeyebilir. Acil bir hata düzelttiyseniz Search Console'dan yeniden tarama isteyin.
Site taşıma projelerinde robots.txt kontrolü, yayına geçiş listesinin ilk maddelerinden biri olmalıdır. Sürecin diğer adımları için SEO migration kontrol listemize bakın.
Kurumsal bir sitede bu işi düzenli bir rutine bağlamak gerekir. Teknik denetimleri sizin yerinize yürüten ekip arıyorsanız SEO danışmanlığı hizmetimiz bu kontrolleri kapsar.
Robots.txt için en iyi uygulamalar nelerdir?
En iyi uygulama, dosyayı kısa ve okunabilir tutmaktır. Her satırın bir gerekçesi olmalı. Gerekçesini açıklayamadığınız kuralı silmek çoğu zaman daha güvenlidir.
- Önce neyi engellemek istediğinizi yazılı hale getirin.
- Kuralları olabildiğince dar yazın.
- Yorum satırlarıyla her grubu açıklayın.
- Değişiklikleri önce hazırlık ortamında deneyin.
- Yayın sonrası Search Console raporunu kontrol edin.
- Sitemap adresini dosyaya ekleyin.
Ayrıca robots.txt'yi tek başına bir SEO stratejisi gibi görmeyin. Başlık etiketleri, kanonik yapı ve site mimarisi de aynı derecede önemlidir. Sayfa başlıkları için meta etiket oluşturucumuzu kullanabilirsiniz. Geniş çerçeve için de teknik SEO rehberimize göz atın.
Robots.txt sürekli değişiyorsa ne yapmalısınız?
Dosya sık sık değişiyorsa sorun genellikle süreçtedir, dosyada değildir. Birden fazla kişi kayıt tutmadan düzenleme yaparsa beklenmedik kapanmalar yaşarsınız.
Bu nedenle değişiklik sorumlusu belirleyin ve her düzenlemeyi kısa bir notla kaydedin. Dosyayı sürüm kontrolüne alın. Kritik kurallar için bir izleme uyarısı kurarsanız, dosya beklenmedik şekilde değiştiğinde haberiniz olur.
Bazı içerik yönetim sistemleri ve eklentiler dosyayı otomatik yazar. Bu durumda hangi aracın son sözü söylediğini netleştirin. Aksi halde bir eklenti güncellemesi, elle yazdığınız kuralları sessizce silebilir.
Robots.txt içinde user-agent grupları nasıl çalışır?
Her user-agent satırı yeni bir kural grubu başlatır. Googlebot için ayrı bir grup yazarsanız, Googlebot yıldızlı genel grubu tamamen bırakır ve yalnızca kendi grubunu okur. Bu yüzden genel kurallarınızı özel gruba da kopyalamanız gerekir.
Google'ın birden fazla botu vardır. Görsel botu, haber botu ve reklam botu ayrı adlarla çalışır. Örneğin AdsBot, yıldızlı genel grubu dikkate almaz; onu adıyla çağırmanız gerekir. Reklam hedef sayfalarınız varsa bu ayrımı bilmek önemlidir.
Bu ayrımı pratik bir örnekle düşünün. Genel grupta /arama/ klasörünü kapattınız. Sonra görseller için bir Googlebot-Image grubu ekleyip içine yalnızca bir görsel klasörü yazdınız. Görsel botu artık /arama/ kapısını da görmez, çünkü yalnızca kendi grubunu uygular.
Kısacası grupları az tutun. Her özel bot için ayrı grup açmadan önce gerçekten farklı davranış isteyip istemediğinizi sorun. Gereksiz gruplar, bakımı zorlaştırır ve hataya davetiye çıkarır.
Robots.txt joker karakterleri ve eşleşme kuralları nasıl işler?
Google, birden fazla kural aynı adrese uyduğunda en özel, yani en uzun yola sahip kuralı seçer. Allow ile Disallow çakışırsa ve uzunlukları eşitse, daha az kısıtlayıcı olan Allow kazanır. Bu mantığı bilmek, karmaşık dosyaları okumanızı kolaylaştırır.
Örneğin Disallow: /urunler/ ve Allow: /urunler/populer/ yazdıysanız, popüler klasörü açık kalır. Çünkü Allow satırının yolu daha uzun ve daha özeldir. Kalan ürün klasörleri ise kapalıdır.
Yıldız işareti yanlış kullanıldığında şaşırtıcı sonuçlar verir. Disallow: /*? satırı, soru işareti içeren tüm adresleri kapatır. Bu, filtre parametrelerini hedeflerken işinize yarar. Ancak sayfalama ya da kampanya parametresiyle açılan gerçek sayfaları da etkileyebilir.
Bu nedenle joker karakter kullandığınız her kuralı, etkilediği adres örnekleriyle birlikte test edin. Hangi adreslerin kapsandığını görmeden kuralı yayına almayın.
Robots.txt tarama bütçesini nasıl etkiler?
Robots.txt, Googlebot'un sitenizde harcadığı isteği değerli sayfalara yönlendirerek tarama bütçesini dolaylı olarak iyileştirir. Yine de bu etkiyi çoğu küçük sitede fark etmezsiniz. Google, tarama bütçesi konusunun asıl olarak çok büyük ve sık güncellenen siteleri ilgilendirdiğini belirtir.
Bu nedenle kendi sitenizin ölçeğini değerlendirin. Birkaç yüz sayfalık bir kurumsal sitede robots.txt ile yapacağınız ince ayar, sıralamaları değiştirmez. Buna karşılık yüz binlerce filtre kombinasyonu üreten bir mağazada, bu kontrol belirgin fark yaratır.
Tarama verisini izleyin. Search Console'daki tarama istatistikleri raporu, Google'ın günlük kaç istek attığını ve yanıt sürelerini gösterir. Bir klasöre orantısız istek gidiyorsa, o klasörü kapatmayı düşünebilirsiniz.
Son olarak şunu unutmayın: bir sayfayı engellemek, o sayfanın bütçesini otomatik olarak diğer sayfalara aktarmaz. Sunucunuz yavaşsa ya da site mimariniz zayıfsa, önce bunları düzeltmeniz daha verimli olur.
WordPress sitesinde robots.txt dosyasını nasıl düzenlersiniz?
WordPress, fiziksel bir dosya bulamazsa kendi sanal robots.txt yanıtını üretir. Bu yanıtı tema ya da SEO eklentisi üzerinden düzenleyebilirsiniz. Birçok SEO eklentisi, panelde bir dosya düzenleyici sunar ve kurallarınızı doğrudan buradan yazmanıza izin verir.
Ayrıca sunucuya fiziksel bir dosya yükleyerek de ilerleyebilirsiniz. Fiziksel dosya varsa WordPress'in sanal yanıtı devreye girmez. Eklenti ve dosya aynı anda bulunduğunda hangisinin geçerli olduğunu, tarayıcıda adresi açarak kontrol edin.
WordPress sitelerinde ayarlar bölümündeki "arama motorlarının siteyi görmesini engelle" kutusuna dikkat edin. Bu seçenek, sitenin tamamını kapatan bir kural ekler. Yayına aldığınız sitede bu kutunun işaretli kalması, sık rastlanan bir kaza sebebidir.
Son olarak her eklenti güncellemesinden sonra dosyanın son halini kontrol edin. Eklentiler bazen varsayılan kuralları yeniden yazar ve sizin özel satırlarınızı siler.
Robots.txt dosyası güvenlik için kullanılabilir mi?
Hayır, kullanılamaz. Dosya herkese açıktır; adresi bilen herkes içeriğini görür. Gizli bir klasörü Disallow ile listelemek, o klasörün adını kötü niyetli kişilere ilan etmek anlamına gelir.
Bu yüzden yönetim paneli gibi hassas alanlarda gerçek koruma kullanın. Parola, iki aşamalı doğrulama ve IP kısıtlaması bu işi görür. Robots.txt yalnızca kurallara uyan botlara nazik bir yönlendirme yapar.
Ayrıca yedek dosyalar, eski sürümler ve hazırlık klasörleri gibi alanları da robots.txt'ye güvenerek açık bırakmayın. Bu dosyaları sunucudan kaldırmanız gerekir. Aksi halde bağlantıyı bulan biri dosyalara doğrudan ulaşabilir.
Ekiplerin en sık düştüğü tuzak, güvenlik ve tarama kavramlarını karıştırmaktır. Bir klasörü tarama dışı bırakmak, içeriğe ulaşımı engellemez. Dosyaya doğrudan adres yazan herkes içeriği görür. Bu yüzden gizlilik gerektiren her içerik için sunucu tarafında yetkilendirme kullanın.
Kısacası robots.txt bir trafik düzenleyicisidir, güvenlik görevlisi değildir. Güvenlik gereksinimlerinizi ayrı bir katmanda çözün.
Robots.txt dosyasıyla canlıya geçerken hangi kontrolleri yaparsınız?
Canlıya geçişte en büyük risk, hazırlık ortamındaki kısıtlamaların yayına taşınmasıdır. Bu yüzden yayın günü için kısa ve yazılı bir kontrol listesi hazırlayın. Listeyi bir kişi uygulasın, bir başkası çapraz kontrol etsin.
- Adresi açıp Disallow: / satırı olmadığını doğrulayın.
- Sitemap satırının canlı alan adını gösterdiğini kontrol edin.
- Kritik şablonlardan birer örnek URL seçip Search Console'da test edin.
- CSS ve JavaScript klasörlerinin açık olduğunu görün.
- Yayından sonraki ilk haftada tarama istatistiklerini izleyin.
Ayrıca eski adreslerden yeni adreslere yönlendirme yapıyorsanız, yönlendirmelerin robots.txt tarafından engellenmediğinden emin olun. Engellenen bir yönlendirme, Google'ın eski adresi yeni adresle ilişkilendirmesini geciktirir.
Bu disiplin küçük görünse de ciddi trafik kayıplarının önüne geçer. Ekibimizin taşıma projelerinde en çok zaman kazandıran alışkanlıklardan biri de budur.




