Yapay Zeka

AI Crawler Nedir? GPTBot, ClaudeBot ve PerplexityBot İçin robots.txt ve llms.txt Rehberi

Talha AslanTalha Aslan 14 dk okuma 2 görüntülenme

AI crawler nedir ve sitenize neden uğrar?

AI crawler, yapay zeka şirketlerinin web sayfalarını okumak için gönderdiği otomatik bottur; bir kısmı model eğitimi için içerik toplar, bir kısmı yapay zeka aramasında kaynak göstermek için sayfaları dizine alır, bir kısmı da kullanıcı sorusu anında sayfanızı açar. Bu nedenle hepsini tek kalemde engellemek yanlış bir karardır.

Sunucu loglarına baktığımda son yıllarda en belirgin değişikliği burada görüyorum: Googlebot ve Bingbot'un yanında GPTBot, ClaudeBot ve PerplexityBot gibi isimler artık düzenli olarak listede. Üstelik müşterilerin çoğu bu botlardan hangisinin ne işe yaradığını bilmeden robots.txt dosyasına ya hepsini engelleyen ya da hepsine kapıyı açan bir blok ekliyor. Bu yazıda her AI crawler için resmi dokümanlardaki bilgiyi özetliyorum, ardından robots.txt ve llms.txt ile nasıl bir politika kurabileceğinizi adım adım anlatıyorum.

AI crawler'lar klasik arama botlarından nasıl ayrılır?

Klasik bir arama botu sayfanızı tarar, dizine ekler ve arama sonucunda bağlantı olarak gösterir. Karşılığında trafik alırsınız; yani takas nettir. AI crawler dünyasında ise bu takas üç farklı biçimde işler ve her birinin size getirisi farklıdır.

Örneğin eğitim amaçlı bir bot içeriğinizi okur, ancak bir modelin genel bilgisine karıştığı için size doğrudan bağlantı döndürmez. Arama amaçlı bir bot ise ChatGPT Search ya da Perplexity gibi ürünlerde kaynak kartı olarak sitenizi gösterebilir. Kullanıcı isteğiyle gelen bir ajan da sadece o anki soruyu yanıtlamak için tek sayfa açar. Dolayısıyla karar verirken "yapay zekaya izin verelim mi" sorusu yetersiz kalır; doğru soru "hangi amaca izin veriyoruz" olmalıdır.

Bu ayrımın teknik SEO tarafındaki genel etkilerini yapay zeka sonrası teknik SEO yazımda ele aldım; burada yalnızca botlara, robots.txt kurallarına ve llms.txt dosyasına odaklanıyorum.

AI crawler'ları hangi üç göreve göre gruplamalısınız?

Resmi dokümanları yan yana koyduğunuzda şirketlerin botlarını neredeyse aynı üç kategoriye ayırdığını görürsünüz. Politikanızı da bu üç kategori üzerine kurmanızı öneririm, çünkü her kategorinin iş sonucu farklıdır.

  1. Eğitim botları: İçeriği gelecekteki modelleri eğitmek için toplar. GPTBot ve ClaudeBot bu gruptadır; Google-Extended ve Applebot-Extended ise aynı kararı bot değil, izin işareti olarak yönetir.
  2. Arama botları: Yapay zeka destekli aramada kaynak göstermek için sayfaları dizine alır. OAI-SearchBot, Claude-SearchBot ve PerplexityBot bu gruptadır.
  3. Kullanıcı ajanları: Bir kullanıcı soru sorduğunda ya da bağlantı paylaştığında sayfayı anlık açar. ChatGPT-User, Claude-User ve Perplexity-User bu gruptadır.

Kısacası eğitim botunu kapatmak aramadaki görünürlüğünüzü kendiliğinden kapatmaz. Ancak arama botunu kapatırsanız o ürünün cevaplarında kaynak olarak görünme şansınızı ciddi biçimde düşürürsünüz.

OpenAI'ın GPTBot, OAI-SearchBot ve ChatGPT-User botları ne yapar?

OpenAI, resmi bot dokümanında her botu ayrı ayrı tanımlar. GPTBot, üretken yapay zeka temel modellerinin eğitimi için içerik toplar. OAI-SearchBot ise sitelerin ChatGPT arama sonuçlarında görünmesi için çalışır. İkisi de robots.txt kurallarına uyar ve OpenAI, dosyadaki değişikliğin sistemlerine yansımasının yaklaşık 24 saat sürebileceğini belirtir.

ChatGPT-User farklıdır: ChatGPT ya da özel GPT'ler içinde kullanıcının başlattığı işlemler sırasında sayfa açar. OpenAI bu botla ilgili iki önemli not düşer. Birincisi, istek kullanıcıdan geldiği için robots.txt kurallarının uygulanmayabileceğidir. İkincisi, ChatGPT-User'ın içeriğin aramada görünüp görünmeyeceğine karar vermek için kullanılmadığıdır.

Pratikte şu sonucu çıkarıyorum: ChatGPT Search içinde kaynak olarak görünmek istiyorsanız OAI-SearchBot'a izin vermelisiniz. Öte yandan GPTBot kararını, içeriğinizin model eğitiminde kullanılmasına dair iş politikanıza göre ayrıca verebilirsiniz. Dokümanda reklam açılış sayfalarını denetleyen OAI-AdsBot da listelenir; reklam vermiyorsanız bu botla karşılaşmanız pek olası değildir.

Burada sık yapılan bir hatayı da not edeyim: bazı siteler OpenAI'ın tüm botlarını tek satırda engellemek için adı yanlış yazar ya da yalnızca eski bir bot adını listeler. Her botu dokümandaki adıyla ayrı bir User-agent satırında belirtmeniz gerekir; aksi halde kural beklediğiniz bota hiç uygulanmaz.

Anthropic'in ClaudeBot, Claude-SearchBot ve Claude-User botları neden ayrı?

Anthropic, destek sayfasında üç bot tanımlar. ClaudeBot, üretken modellerin eğitimine katkı sağlayabilecek web içeriğini toplar. Claude-SearchBot, arama sonuçlarının kalitesini ve Claude'un verdiği yanıtların isabetini artırmak için web'i gezer. Claude-User ise bir kullanıcı soru sorduğunda Claude'un web sitelerine erişmesini sağlar.

Anthropic üç botun da robots.txt kurallarına uyduğunu ve her birini ayrı ayrı engelleyebileceğinizi açıkça yazar. Ayrıca standart dışı Crawl-delay uzantısını desteklediğini belirtir; yani sunucunuz yoğunluktan zorlanıyorsa ClaudeBot için istekler arasında bekleme süresi tanımlayabilirsiniz.

Önemli bir ayrıntı daha var: Anthropic, kısıtlamak istediğiniz her alt alan adı için robots.txt dosyasını ayrı düzenlemeniz gerektiğini hatırlatır. Örneğin blog.siteniz.com ile www.siteniz.com farklı dosyalar okur. Bu nedenle çok alt alan adlı yapılarda politikayı her birine ayrı ayrı yazmanız gerekir.

PerplexityBot ile Perplexity-User arasındaki fark nedir?

Perplexity, geliştirici dokümanında iki ajan tanımlar. PerplexityBot, siteleri Perplexity arama sonuçlarında göstermek ve bağlantı vermek için tasarlanmıştır; şirket bu botun yapay zeka temel modelleri için içerik toplamadığını özellikle belirtir. Bu bot robots.txt kurallarına uyar.

Perplexity-User ise kullanıcı bir soru sorduğunda doğru yanıt vermek için sayfayı ziyaret eder. Perplexity'nin ifadesine göre bu ajan, getirme işlemini kullanıcı başlattığı için genellikle robots.txt kurallarını yok sayar. Erişimi yönetmek isterseniz Perplexity, yayımladığı IP listelerini güvenlik duvarında kullanmanızı önerir.

Dolayısıyla Perplexity'de kaynak olarak görünmek istiyorsanız PerplexityBot'u engellememelisiniz. Hatta dokümanda site sahiplerine bu bota izin vermeleri ve IP aralıklarını beyaz listeye almaları tavsiye edilir. Güvenlik duvarı ya da CDN bot koruması kullanıyorsanız bu isteği yanlışlıkla engellemediğinizi mutlaka kontrol edin.

Google-Extended ve Applebot-Extended neden gerçek bir bot değildir?

Bu iki isim en çok yanlış anlaşılan kısımdır. Google, tarayıcı dokümanında Google-Extended için ayrı bir HTTP kullanıcı aracısı olmadığını, taramanın mevcut Google kullanıcı aracılarıyla yapıldığını ve bu adın robots.txt içinde yalnızca kontrol işareti olarak çalıştığını yazar. Bu işaretle, taranan içeriğin Gemini modellerinin eğitiminde ve Gemini uygulamaları ile Vertex AI tarafındaki dayanaklı yanıtlarda kullanılıp kullanılmayacağını yönetirsiniz.

Google aynı sayfada Google-Extended'ın Google Arama'ya dahil olmayı etkilemediğini ve sıralama sinyali olarak kullanılmadığını açıkça belirtir. Yani bu işareti kapatmak organik sıralamanıza zarar vermez.

Burada bir inceliğe dikkat etmelisiniz: Google-Extended, Googlebot'un taramasını durdurmaz. Sitenizi Googlebot yine tarar ve dizine ekler; işaret yalnızca taranan içeriğin yukarıdaki yapay zeka kullanımları için kullanılıp kullanılmayacağını belirler. Bu nedenle Googlebot'u engelleyerek Gemini eğitiminden çıkmaya çalışmak, organik trafiğinizi kaybetmenin en kısa yoludur.

Apple tarafı benzer mantıkla çalışır. Apple'ın Applebot sayfasına göre Applebot-Extended web sayfalarını taramaz; standart Applebot'un topladığı verinin Apple'ın üretken modellerini eğitmekte kullanılıp kullanılmayacağını belirler. Üstelik Applebot-Extended için yazdığınız kurallar arama sıralamasında dikkate alınmaz.

AI crawler karşılaştırma tablosu

Aşağıdaki tabloda yalnızca resmi dokümanlarda yazan bilgileri topladım. Satır satır okuyup kendi politikanızı işaretlemenizi öneririm.

İsimŞirketGörevrobots.txt
GPTBotOpenAIModel eğitimiUyar
OAI-SearchBotOpenAIChatGPT arama sonuçlarıUyar
ChatGPT-UserOpenAIKullanıcı işlemiUygulanmayabilir
ClaudeBotAnthropicModel eğitimiUyar, Crawl-delay destekli
Claude-SearchBotAnthropicArama kalitesiUyar
Claude-UserAnthropicKullanıcı sorusuUyar
PerplexityBotPerplexityPerplexity arama sonuçlarıUyar
Perplexity-UserPerplexityKullanıcı sorusuGenellikle yok sayar
Google-ExtendedGoogleGemini eğitimi ve dayanak için izin işaretiYalnız işaret, ayrı bot yok
Applebot-ExtendedAppleApple modelleri eğitimi için izin işaretiYalnız işaret, tarama yapmaz

Tablodan çıkan en net ders şudur: kullanıcı ajanlarını robots.txt ile tam olarak kontrol edemezsiniz. Bu nedenle gerçekten gizli kalması gereken içerik için robots.txt yerine giriş duvarı ya da sunucu tarafı erişim kontrolü kullanmalısınız.

robots.txt AI crawler'ları gerçekten durdurur mu?

robots.txt bir erişim kilidi değil, bir davet ve ret listesidir. Robots Exclusion Protocol, RFC 9309 ile yazıya dökülmüş olsa da uyum botun sahibine bağlıdır. Yukarıda andığım şirketler resmi olarak robots.txt kurallarına uyduklarını beyan eder; ancak bu beyan kendi adını dürüstçe kullanan botlar için geçerlidir.

Bu yüzden robots.txt'yi iki amaçla kullanmanızı öneririm. Birincisi, kurallara uyan şirketlere niyetinizi açıkça bildirmek. İkincisi, tarama bütçenizi ve sunucu kaynaklarınızı düzenlemek. Öte yandan hassas veri, müşteri paneli ya da ücretli içerik için robots.txt tek başına koruma sağlamaz; üstelik dosya herkese açık olduğu için gizli dizinlerin adını da ilan etmiş olursunuz.

Bir diğer nokta da önbellektir. OpenAI değişikliklerin yaklaşık 24 saatte yansıyacağını söyler; diğer botlar da dosyayı belirli aralıklarla yeniden okur. Kısacası bir kuralı değiştirdikten sonra etkisini ertesi gün ölçmelisiniz.

Model eğitimini kapatıp yapay zeka aramasında görünmek mümkün mü?

Evet, resmi dokümanlara göre bu ayrım mümkündür ve birçok marka için en dengeli seçenek de budur. Eğitim botlarına Disallow, arama botlarına Allow yazarsınız. Böylece içeriğiniz gelecekteki modellerin eğitim verisine girmez, ancak ChatGPT Search, Claude ve Perplexity cevaplarında kaynak olarak görünme şansınızı korursunuz.

Yine de şunu dürüstçe belirtmeliyim: eğitim verisine girmemenin marka bilinirliğine uzun vadeli etkisini kimse kesin olarak ölçemiyor. Bir modelin markanızı tanıması kısmen eğitim verisinden gelir. Dolayısıyla bilinirlik peşindeki yeni bir marka için eğitim botlarına izin vermek mantıklı olabilir; özgün araştırma ya da ücretli içerik satan bir yayıncı içinse eğitim botunu kapatmak daha savunulabilir bir karardır.

Markanızın yapay zeka cevaplarında nasıl anıldığını izlemek ayrı bir iştir; bunu markanızın ChatGPT ve Gemini'de nasıl göründüğü üzerine yazdığım yazıda anlattım.

Üç farklı politika için robots.txt nasıl yazılır?

Aşağıdaki üç şablonu müşterilerimle en sık konuştuğumuz senaryolara göre hazırladım. Kendi dosyanızı elle yazmak yerine robots.txt oluşturucu aracını kullanarak kuralları seçip çıktıyı kopyalayabilirsiniz.

Senaryo 1, tam açık: Hiçbir AI crawler için özel kural yazmazsınız; genel User-agent: * kuralınız geçerli olur. Bilinirlik hedefleyen yeni markalar için uygundur.

Senaryo 2, eğitim kapalı, arama açık: Aşağıdaki gibi ayrı bloklar yazarsınız.

  • User-agent: GPTBot, ardından Disallow: /
  • User-agent: ClaudeBot, ardından Disallow: /
  • User-agent: Google-Extended, ardından Disallow: /
  • User-agent: Applebot-Extended, ardından Disallow: /
  • User-agent: OAI-SearchBot, Claude-SearchBot ve PerplexityBot için Allow: /

Senaryo 3, seçici: Blog ve rehberlerinizi açık bırakır, fiyat listesi, müşteri alanı ya da arama sonucu sayfaları gibi dizinleri tüm botlara kapatırsınız. Böylece yapay zeka ürünleri en değerli, kamuya açık içeriğinizi okur; düşük değerli ya da özel sayfalar ise dışarıda kalır.

Her blokta botun adını dokümandaki yazımıyla kullanın. Örneğin "Claude-SearchBot" yerine "ClaudeSearchBot" yazarsanız kural hiçbir bota uymaz.

Crawl-delay ve alt alan adları konusunda nelere dikkat etmelisiniz?

Crawl-delay, RFC 9309 kapsamındaki temel kurallar arasında yer almaz; bu yüzden her bot bu satırı okumaz. Anthropic ClaudeBot için bu uzantıyı desteklediğini yazar. Google ise Crawl-delay satırını dikkate almaz. Yani sunucu yükü sorununu yalnızca bu satırla çözemezsiniz; gerekirse CDN ya da web sunucusu tarafında hız sınırı tanımlamanız gerekir.

Alt alan adlarında ise sık gördüğüm bir hata var: şirket ana sitede eğitim botlarını kapatır, ancak aynı içeriği yayınlayan yardım merkezi ya da blog alt alan adı açık kalır. Her alt alan adı kendi kökündeki robots.txt dosyasını okur. Bu nedenle politikayı yazdıktan sonra tüm alan adlarınızı tek tek listeleyip dosyalarını kontrol etmelisiniz.

Ayrıca robots.txt dosyanızın 200 durum koduyla döndüğünden emin olun. Dosya sunucu hatası veriyorsa botların davranışı değişebilir ve istemediğiniz bir sonuçla karşılaşabilirsiniz.

Sahte AI crawler isteklerini nasıl ayırt edersiniz?

Kullanıcı aracısı metni herkesin kopyalayabileceği bir etikettir. Loglarınızda "GPTBot" yazan her istek gerçekten OpenAI'dan gelmeyebilir. Özellikle agresif kazıyıcılar, engellenmemek için bilinen bot adlarını taklit eder.

Doğrulama için şirketlerin yayımladığı IP aralıklarını kullanırsınız. Örneğin Perplexity, dokümanında PerplexityBot ve Perplexity-User için ayrı JSON dosyalarında IP aralıkları paylaşır; OpenAI da bot sayfasında botları için IP listelerine bağlantı verir. Google ise kendi tarayıcılarını ters DNS ve yayımlanan IP aralıklarıyla doğrulamanızı önerir.

  • Kullanıcı aracısı adı resmi dokümandakiyle birebir eşleşiyor mu?
  • İstek IP adresi şirketin yayımladığı aralıkta mı?
  • İstek sıklığı ve sayfa deseni beklenen davranışa uyuyor mu?

Bu üç soruya olumsuz cevap veren istekleri sahte kabul edip güvenlik duvarında engelleyebilirsiniz. Böylece gerçek botlara açık kalırken kaynak tüketen taklitçileri dışarıda tutarsınız.

llms.txt nedir ve neden bir standart değildir?

llms.txt, bir web sitesinin kökünde yer alan ve büyük dil modellerine sitenin en önemli sayfalarını Markdown biçiminde özetleyen bir dosya önerisidir. Jeremy Howard tarafından Eylül 2024'te llmstxt.org üzerinden önerilmiştir ve sitenin kendisi de metni açıkça bir "öneri" olarak tanımlar.

Bunu vurgulamamın sebebi şu: llms.txt, robots.txt gibi bir IETF standardı değildir ve bir izin mekanizması da değildir. Hiçbir botu engellemez, hiçbir bota izin vermez. Ayrıca OpenAI, Anthropic, Perplexity ve Google'ın yukarıda andığım bot dokümanlarında tarama davranışlarının llms.txt dosyasına göre değiştiğine dair bir ifade bulunmaz.

Peki neden yine de hazırlıyorum? Çünkü maliyeti düşük, zararı yok ve özellikle kodlama asistanları, dokümantasyon araçları ya da kullanıcının doğrudan dosyayı gösterdiği ajanlar için sitenizin haritasını temiz bir biçimde sunar. Kısacası llms.txt'yi bir sıralama faktörü değil, düzenli bir tanıtım belgesi gibi düşünmelisiniz.

llms.txt dosyası nasıl yapılandırılır?

Öneri metni basit bir Markdown sırası tanımlar. Dosyayı sitenizin kök dizinine /llms.txt adıyla koyarsınız ve aşağıdaki düzeni izlersiniz.

  1. Sitenin ya da projenin adını taşıyan bir H1 başlığı; öneride zorunlu olan tek bölüm budur.
  2. Sitenin ne yaptığını birkaç cümleyle anlatan bir alıntı bloğu.
  3. İsteğe bağlı olarak ek açıklama paragrafları.
  4. H2 başlıklarıyla ayrılmış dosya listeleri; her satırda Markdown bağlantısı ve isteğe bağlı kısa not.
  5. Geleneksel olarak "Optional" adlı, ikincil bilgileri içeren bir bölüm.

Öneri ayrıca bilgi içeren sayfaların temiz bir Markdown sürümünü aynı adresin sonuna .md ekleyerek sunmayı teşvik eder. Bu kısım tamamen isteğe bağlıdır ve çoğu kurumsal site için şart değildir.

Dosyayı sıfırdan yazmak yerine llms.txt oluşturucu aracıyla başlık, özet ve bağlantı gruplarını doldurup çıktıyı alabilirsiniz. Ardından dosyayı yayına almadan önce bağlantıların 200 döndüğünü kontrol etmelisiniz.

llms.txt yazarken hangi hatalardan kaçınmalısınız?

Müşteri sitelerinde incelediğim llms.txt dosyalarında aynı hataları tekrar tekrar görüyorum. Çoğu, dosyanın ne olduğunu yanlış anlamaktan kaynaklanıyor.

  • İzin kuralı yazmak: llms.txt içine "Disallow" satırı eklemek hiçbir şeyi engellemez; engelleme işini robots.txt yapar.
  • Tüm siteyi dökmek: Sitemap'teki bin bağlantıyı kopyalamak dosyanın amacını bozar. Öneri, seçilmiş ve açıklamalı bir liste ister.
  • Pazarlama dili: Özet bölümünü slogan cümleleriyle doldurmak modele bilgi vermez. Ne sattığınızı, kime hizmet ettiğinizi ve hangi sayfanın neyi anlattığını düz cümlelerle yazın.
  • Güncelliği unutmak: Kaldırdığınız sayfalar dosyada kalırsa ajanlar 404 alır. Bu yüzden dosyayı site haritası güncellemelerinizle birlikte gözden geçirin.
  • Mucize beklemek: llms.txt yayınladınız diye trafik artmaz; bu dosya içerik kalitesinin yerini tutmaz.

Site haritanız zaten düzenliyse llms.txt hazırlamak çok daha kolaylaşır. Bu nedenle önce XML sitemap oluşturucu ile haritanızı temizlemenizi, ardından llms.txt için en önemli sayfaları seçmenizi öneririm.

Sunucu loglarında AI crawler trafiğini nasıl okursunuz?

Politika yazmadan önce mevcut durumu görmeniz gerekir. Web sunucusu erişim loglarında kullanıcı aracısı alanını filtreleyerek hangi AI crawler'ın, hangi sayfaları, hangi sıklıkla istediğini çıkarabilirsiniz. Google Analytics gibi JavaScript tabanlı araçlar bu botları genellikle göstermez, çünkü botların çoğu sayfadaki betikleri çalıştırmaz.

Loglarda özellikle üç şeye bakmanızı öneririm. İlk olarak durum kodlarına: arama botları 403 ya da 429 alıyorsa güvenlik katmanınız onları farkında olmadan engelliyor olabilir. Ardından en çok istenen sayfalara: botlar değerli içeriğiniz yerine filtre ve parametre sayfalarında dolaşıyorsa tarama yapınızı düzeltmelisiniz. Son olarak istek hacmine: sunucuyu zorlayan bir bot varsa hız sınırı ya da Crawl-delay gündeme gelir.

Bu analizi yaptıktan sonra robots.txt kararlarınız tahmine değil veriye dayanır. Ayrıca aynı veriyi birkaç hafta sonra tekrar çekerek değişikliğin etkisini karşılaştırabilirsiniz.

Hangi site türü hangi AI crawler politikasını seçmeli?

Tek doğru politika yok; iş modeliniz kararı belirler. Ekibimle danışmanlık verdiğimiz projelerde genel olarak şu çerçeveyi kullanıyoruz.

  • Yerel hizmet işletmeleri ve B2B firmalar: Genellikle tüm botlara açık kalmak mantıklıdır. Yapay zeka cevaplarında önerilmek, içeriğin eğitimde kullanılmasından daha değerlidir.
  • E-ticaret siteleri: Ürün ve kategori sayfalarını arama botlarına açık tutmak, sepet, hesap ve filtre kombinasyonlarını ise kapatmak iyi bir başlangıçtır.
  • Yayıncılar ve özgün araştırma üretenler: Eğitim botlarını kapatıp arama botlarını açık bırakmak çoğu zaman en savunulabilir dengedir.
  • Ücretli içerik ve üye alanları: Bu bölümleri robots.txt ile değil, giriş duvarıyla korumalısınız.

Hangi grupta olursanız olun, kararı yazılı hâle getirmenizi öneririm. Böylece yeni bir bot duyurulduğunda aynı mantıkla hızlıca kural ekleyebilirsiniz.

Tarama izni tek başına yapay zeka görünürlüğü sağlar mı?

Hayır. AI crawler'lara kapıyı açmak yalnızca ön koşuldur. Bir yapay zeka ürününün sizi kaynak olarak göstermesi için içeriğinizin soruyu net yanıtlaması, güvenilir sinyaller taşıması ve sayfanın teknik olarak okunabilir olması gerekir. Örneğin önemli metni yalnızca istemci tarafında JavaScript ile yüklüyorsanız, betik çalıştırmayan botlar boş bir sayfa görebilir.

İçerik tarafındaki bu işi GEO, yani üretken motor optimizasyonu başlığı altında anlattım. SEO, GEO ve AEO arasındaki farkı merak ediyorsanız bu karşılaştırma yazısı iyi bir başlangıçtır. Yapısal verinin rolü için de schema oluşturucu aracını deneyebilirsiniz.

Kısacası robots.txt ve llms.txt kapıyı düzenler; içeriğin kalitesi ise içeride ne bulunacağını belirler.

robots.txt değişikliğini yayına almadan önce nasıl test edersiniz?

robots.txt dosyasındaki tek bir yanlış satır, tüm sitenizi istemediğiniz botlara kapatabilir. Bu yüzden değişikliği doğrudan canlı dosyaya yazmak yerine önce bir kopya üzerinde denemenizi öneririm. Özellikle User-agent: * bloğuna yanlışlıkla Disallow: / eklemek, gördüğüm en pahalı hatalardan biridir.

Test sürecinde ilk olarak her bot için hangi bloğun geçerli olacağını kontrol edersiniz. RFC 9309'a göre bir bot, kendi adıyla eşleşen en belirgin grubu uygular ve bu grubu bulduğunda genel yıldız bloğunu dikkate almaz. Dolayısıyla GPTBot için ayrı bir blok yazdıysanız, genel blokta tanımladığınız dizin kısıtlamalarını o bloğa da tekrar eklemeniz gerekir.

Ardından Google Search Console içindeki robots.txt raporuyla dosyanın Google tarafından okunduğunu doğrulayabilirsiniz. Diğer botlar için ise en güvenilir test, değişiklikten bir iki gün sonra sunucu loglarında ilgili kullanıcı aracısının hangi yollara istek attığını görmektir. Böylece kuralın teoride değil, pratikte çalıştığından emin olursunuz.

Yeni bir AI crawler duyurulduğunda ne yapmalısınız?

Bot listesi sabit değildir. Şirketler yeni ürün çıkardıkça yeni kullanıcı aracıları duyurur, eskilerini yeniden adlandırır ya da görevlerini değiştirir. Örneğin Anthropic ve OpenAI, arama ile eğitim işlerini zaman içinde ayrı botlara böldü. Bu yüzden bir kez yazıp unuttuğunuz robots.txt dosyası birkaç ay içinde eksik kalabilir.

Benim önerim, yazılı politikanızı kategori bazlı tutmanızdır. Yeni bir bot duyurulduğunda önce resmi dokümanını okursunuz, ardından botun eğitim, arama ya da kullanıcı ajanı kategorilerinden hangisine girdiğini belirlersiniz. Sonra aynı kategorideki diğer botlara uyguladığınız kuralı ona da eklersiniz. Böylece her yeni isim için sıfırdan tartışma açmak zorunda kalmazsınız.

Ayrıca üç ayda bir log taraması yapmanızı öneririm. Loglarda tanımadığınız ve yüksek hacimli bir kullanıcı aracısı görürseniz, adını şirketin resmi dokümanında aratarak kimliğini doğrulayabilirsiniz; bulamazsanız temkinli davranmak daha doğrudur.

AI crawler denetimi için 30 dakikalık kontrol listesi

Bu yazıyı okuduktan sonra aşağıdaki listeyi sırayla uygulayabilirsiniz. Çoğu site için yarım saat yeterlidir; çok alt alan adlı ya da büyük e-ticaret sitelerinde ise süre uzayabilir, bu yüzden işi birkaç oturuma bölebilirsiniz.

  1. Tüm alan adı ve alt alan adlarınızın robots.txt dosyasını açın ve 200 döndüğünü doğrulayın.
  2. Dosyada GPTBot, ClaudeBot, Google-Extended ve Applebot-Extended için bilinçli bir karar olup olmadığına bakın.
  3. OAI-SearchBot, Claude-SearchBot ve PerplexityBot'un yanlışlıkla engellenmediğini kontrol edin.
  4. CDN ya da güvenlik duvarındaki bot kurallarının bu botlara 403 döndürmediğinden emin olun.
  5. Son iki haftanın loglarını filtreleyip AI crawler isteklerini sayfa ve durum koduna göre gruplayın.
  6. llms.txt dosyanızı hazırlayın ya da mevcut dosyadaki bağlantıları doğrulayın.
  7. Değişiklikten sonra en az 24 saat bekleyip logları yeniden karşılaştırın.

Bu adımları kendi başınıza uygulamak istemiyorsanız, SEO danışmanlığı kapsamında ekibimle birlikte log analizinden robots.txt politikasına kadar tüm süreci sizin için yürütebiliriz. Teknik temelleri genel olarak gözden geçirmek isterseniz teknik SEO ipuçları yazıma da göz atabilirsiniz.

Sıkça Sorulan Sorular

GPTBot'u engellersem ChatGPT Search'te görünmez miyim?
Hayır, görünmeye devam edebilirsiniz. OpenAI dokümanına göre GPTBot model eğitimi için, OAI-SearchBot ise ChatGPT arama sonuçları için çalışır. GPTBot'a Disallow yazıp OAI-SearchBot'u açık bırakırsanız içeriğiniz eğitime girmez ancak ChatGPT Search cevaplarında kaynak olarak gösterilme şansınız korunur. Değişikliğin yansıması yaklaşık 24 saat sürebilir.
Google-Extended'ı kapatmak Google sıralamamı düşürür mü?
Hayır, düşürmez. Google, Google-Extended'ın Google Arama'ya dahil olmayı etkilemediğini ve sıralama sinyali olarak kullanılmadığını resmi olarak belirtir. Bu işaret yalnızca taranan içeriğin Gemini modellerinin eğitiminde ve Gemini uygulamaları ile Vertex AI tarafındaki dayanaklı yanıtlarda kullanılıp kullanılmayacağını yönetir; ayrı bir bot da değildir.
llms.txt dosyası SEO sıralamasını artırır mı?
Artırdığına dair resmi bir kanıt yok. llms.txt, Jeremy Howard'ın 2024'te llmstxt.org üzerinden sunduğu bir öneridir, standart değildir. Büyük yapay zeka şirketlerinin bot dokümanlarında tarama davranışının bu dosyaya göre değiştiği yazmaz. Yine de düşük maliyetli olduğu için ajanlara sitenizi düzenli tanıtmak amacıyla hazırlayabilirsiniz.
robots.txt ile tüm yapay zeka erişimini durdurabilir miyim?
Tam olarak durduramazsınız. Resmi botlar robots.txt kurallarına uyar, ancak OpenAI ChatGPT-User için bu kuralların uygulanmayabileceğini, Perplexity de Perplexity-User'ın genellikle robots.txt'yi yok saydığını yazar. Kurallara uymayan kazıyıcılar da vardır. Gizli kalması gereken içeriği giriş duvarı veya sunucu tarafı erişim kontrolüyle korumalısınız.
Loglarda GPTBot görüyorum, gerçekten OpenAI mi?
Her zaman değil. Kullanıcı aracısı metni kolayca taklit edilebilir. İsteğin IP adresini şirketin yayımladığı IP listeleriyle karşılaştırarak doğrulama yapmalısınız. OpenAI ve Perplexity bot dokümanlarında IP aralıklarına bağlantı verir. Adres listede değilse isteği sahte kabul edip güvenlik duvarında engelleyebilirsiniz; böylece gerçek botlara zarar vermezsiniz.
ClaudeBot için tarama hızını sınırlayabilir miyim?
Evet, sınırlayabilirsiniz. Anthropic, standart dışı Crawl-delay uzantısını desteklediğini belirtir; robots.txt içinde User-agent: ClaudeBot bloğuna Crawl-delay satırı ekleyerek istekler arasına bekleme süresi koyabilirsiniz. Ancak her bot bu satırı okumaz; Google örneğin dikkate almaz. Genel yük sorunları için CDN veya sunucu tarafında hız sınırı daha güvenilirdir.
#ai crawler#GPTBot#ClaudeBot#PerplexityBot#robots.txt#llms.txt#teknik SEO
Paylaş:
Talha Aslan
Talha Aslan

Google Partner dijital pazarlama uzmanı. 2012’den beri SEO, Google Ads, web tasarım ve e-ticaret projelerinde sahada; bu blogda gördüğünüz her yazı o deneyimden çıkar.

Sıradaki proje

Projenizi konuşalım.

Talebiniz doğrudan Talha Aslan ve ekibine ulaşır: stratejiyi Talha kurar, uygulamayı deneyimli ekip yürütür. İlk istişare ücretsizdir; hedefinizi dinler, net bir yol haritasıyla döneriz.

WhatsApp Hemen Ara