AI Bot Trafiği Nasıl Ölçülür? GEO İçin Sunucu Log Rehberi

AI Bot Trafiği Nasıl Ölçülür? GEO İçin Sunucu Log Rehberi
AI bot trafiği sunucu loglarından nasıl ölçülür?
AI bot trafiği; sunucunun erişim kayıtlarında crawler user-agent’larını bulup kaynak IP’leri resmi aralıklarla doğrulayarak ölçülür. Sağlam bir denetim, yalnız kaç istek geldiğini değil; hangi botun hangi URL’yi, ne zaman, hangi durum koduyla ve kaç bayt veri aktararak ziyaret ettiğini de gösterir.
Bu ölçüm, markanın bir yapay zekâ cevabında görünmesini tek başına garanti etmez. Yine de içeriklerin cevap motorları tarafından erişilebilir olup olmadığını kanıtlayan en doğrudan teknik sinyaldir. Yönlendirme trafiği ile erişim logu birlikte okunduğunda, GEO odaklı PR çalışmasının teknik erişim katmanı görünür hale gelir.
Tarayıcı panelindeki oturum verileri çoğu crawler isteğini göstermez; çünkü bu isteklerde JavaScript çalışmayabilir ve analitik etiketi tetiklenmeyebilir. Kaynak olarak CDN, yük dengeleyici, web sunucusu veya WAF logları kullanılmalıdır. Her kayıt en az zaman damgası, kaynak IP, istek yolu, HTTP yöntemi, durum kodu, user-agent, referer, aktarılan bayt ve yanıt süresi alanlarını içermelidir.
- Erişim: Bot hedef URL’ye gerçekten ulaşmış mı?
- Kimlik: User-agent ve kaynak IP resmi kayıtlarla eşleşiyor mu?
- Sonuç: Sunucu 200, 301, 403, 404 veya 429 kodlarından hangisini döndürmüş?
- Kapsam: Bot yalnız ana sayfayı mı, uzman sayfalarını ve yeni makaleleri de mi taramış?
- Sıklık: İlk yayın ile ilk doğrulanmış ziyaret arasında kaç saat veya gün geçmiş?
Hangi crawler hangi amaçla çalışır?
Arama görünürlüğü, model eğitimi ve kullanıcı tarafından başlatılan erişim için çalışan botlar aynı görevi yapmaz; bu nedenle ayrı ayrı sınıflandırılmalıdır. Bir crawler’ı yalnız “AI botu” etiketi altında toplamak, erişim izni ve raporlama kararlarını hatalı hale getirir.
OpenAI’nin resmi bot açıklamasına göre OAI-SearchBot, sitelerin ChatGPT arama sonuçlarında gösterilmesi için kullanılır. GPTBot ise modelleri geliştirmek amacıyla kullanılabilecek içeriği tarar. ChatGPT-User otomatik ve sürekli bir crawler değildir; bir kullanıcının veya özel GPT’nin başlattığı belirli bir erişimi gerçekleştirir.
Bu ayrım, bir markanın arama görünürlüğüne izin verirken eğitim kullanımını ayrıca yönetebilmesini sağlar. OAI-SearchBot’a izin verip GPTBot’u engellemek teknik olarak mümkündür. Robots.txt değişikliğinin OpenAI arama sistemlerine yansıması yaklaşık 24 saat sürebilir; bu nedenle değişiklik sonrası ilk saatlerde görülen istekler politika ihlali olarak yorumlanmamalıdır.
Perplexity’nin resmi crawler belgeleri de iki ayrı işlev tanımlar. PerplexityBot arama sonuçlarını üretmek için web içeriğini tarar ve model eğitimi amacı taşımaz; Perplexity-User ise bir kullanıcı isteği sonucunda belirli bir sayfaya erişir. Kullanıcı tarafından başlatılan erişimler, otomatik tarama olmadığı için robots.txt davranışından farklı değerlendirilebilir.
Google tarafında kritik ayrım daha farklıdır. Google-Extended ayrı bir HTTP user-agent değildir; robots.txt içinde Gemini eğitimi ve bazı grounding kullanımları için kontrol belirtecidir. Bu nedenle sunucu loglarında “Google-Extended” aramak sonuç vermez. Googlebot erişimini ve Google-Extended politikasını aynı metrik gibi raporlamak teknik olarak yanlıştır.
User-agent bilgisi neden tek başına yeterli değildir?
User-agent metni kolayca taklit edilebildiği için tek başına bot kimliğini kanıtlamaz. Kötü niyetli bir istek kendisini GPTBot, Googlebot veya başka bir bilinen crawler olarak tanıtabilir; rapora doğrulanmadan eklenen bu trafik, hem görünürlük ölçümünü hem güvenlik kararını bozar.
Doğrulama için en güvenilir yöntem, sağlayıcının yayımladığı resmi IP aralıklarını düzenli olarak indirip kaynak IP ile eşleştirmektir. OpenAI; OAI-SearchBot, GPTBot ve ChatGPT-User için ayrı JSON listeleri yayımlar. Perplexity de PerplexityBot ve Perplexity-User için güncel IP aralıklarını makine tarafından okunabilir dosyalar halinde sunar.
Google, otomatik doğrulama için yayımlanmış CIDR listelerini; manuel doğrulama için ise ters DNS ve ardından ileri DNS kontrolünü önerir. Google’ın doğrulama sürecinde kaynak IP’den elde edilen ana makine adı izin verilen Google alan adlarından biriyle bitmeli, bu ad tekrar çözümlendiğinde ilk IP’ye dönmelidir. İki aşamadan biri başarısızsa istek doğrulanmış crawler sayılmamalıdır.
Bir üretim sisteminde IP listeleri elle kopyalanmamalıdır. Listeler günlük veya haftalık görevle çekilmeli, değişiklikler sürüm bilgisiyle saklanmalı ve eşleştirme en güncel liste üzerinden yapılmalıdır. WAF kuralı yalnız user-agent’a değil, user-agent ile resmi IP aralığının birlikte eşleşmesine dayanmalıdır.
- Doğrulanmış: User-agent beklenen kalıpla ve IP resmi aralıkla eşleşir.
- Şüpheli: User-agent bilinen bir botu söyler, IP resmi aralıkta değildir.
- Tanımsız: IP veya user-agent sağlayıcının yayımladığı belgelerle ilişkilendirilemez.
- Kullanıcı tetiklemeli: Otomatik tarama yerine açık bir kullanıcı eylemiyle gelen fetch isteğidir.
30 günlük AI crawler log denetimi nasıl kurulur?
30 günlük bir denetim; veri toplama, kimlik doğrulama, URL sınıflandırma, hata analizi ve karar raporu olmak üzere beş aşamada kurulur. Bir aydan kısa örnekler yeni yayınların taranma gecikmesini, haftalık trafik dalgalanmasını ve robots.txt değişikliklerinin etkisini ayırmak için yetersiz kalabilir.
İlk aşamada CDN, WAF ve origin loglarının saat dilimleri UTC’ye çevrilir; sorgu parametreleri normalize edilir ve kişisel veri içerebilecek alanlar raporlama katmanından çıkarılır. İkinci aşamada bot adı user-agent’tan aday olarak belirlenir, fakat kayıt ancak IP doğrulamasından sonra ilgili sağlayıcıya yazılır. Böylece sahte botlar ayrı bir güvenlik kuyruğunda kalır.
Üçüncü aşamada URL’ler ana sayfa, hizmet, uzman profili, vaka çalışması, makale, kategori ve teknik dosya olarak etiketlenir. Bu sınıflandırma, “kaç istek geldi?” sorusunu “hangi bilgi alanlarına erişildi?” sorusuna dönüştürür. SEO ile PR verisini birlikte okumak, taranan sayfaların iletişim hedefiyle ilişkisini kurmayı kolaylaştırır.
Dördüncü aşamada 2xx, 3xx, 4xx ve 5xx durumları ayrı incelenir. 200 kodu erişimin başarılı olduğunu; 301 ve 302 yönlendirme zinciri riskini; 403 politika veya WAF engelini; 404 kopuk kaynağı; 429 ise hız sınırı sorununu gösterir. Aynı URL’ye kısa sürede tekrarlanan 5xx yanıtları, görünürlük probleminden önce altyapı sorunu olarak ele alınmalıdır.
Son aşamada her sağlayıcı için haftalık bir temel çizgi oluşturulur. Rapor; doğrulanmış istek, benzersiz URL, başarılı yanıt oranı, yeni içerikte ilk ziyaret süresi, indirilen bayt, hata dağılımı ve şüpheli taklit istek sayısını içermelidir. Ham logların süresiz saklanması gerekmez; güvenlik ve mevzuat politikasıyla uyumlu bir saklama süresi belirlenmelidir.
Robots.txt ve WAF kararları nasıl ayrılmalı?
Robots.txt tarama tercihini bildirir, WAF ise teknik erişimi uygular; iki katman aynı kontrol değildir. İyi niyetli crawler’lar robots.txt kurallarını okuyabilir, fakat taklit veya kötü amaçlı istemciler bu dosyayı görmezden gelebilir.
Arama görünürlüğü hedefleyen bir marka, önce hangi kullanım türüne izin vereceğini içerik ve hukuk ekipleriyle belirlemelidir. Örneğin ChatGPT arama görünürlüğü için OAI-SearchBot erişimi açık tutulurken GPTBot eğitimi ayrı bir politika olarak yönetilebilir. Google-Extended engellense bile Google Search taraması ve sıralaması etkilenmez; çünkü Googlebot ayrı kontroldür.
WAF katmanında resmi IP aralığı ile doğru user-agent eşleşen isteklere izin verilir, taklit eşleşmeler hız sınırına veya engel kuralına alınır. Crawler trafiğinin ani yükselmesi altyapıyı etkiliyorsa önce oran sınırlaması ve önbellek politikası düzenlenmelidir. Tüm botları topluca engellemek, istenen arama keşfini de ortadan kaldırabilir.
Değişiklikler kontrollü yayınlanmalıdır: önce mevcut loglardan etkilenecek trafik ölçülür, sonra kural deneme modunda çalıştırılır, 24–72 saat gözlenir ve ancak hatalı engel olmadığı doğrulanınca zorunlu hale getirilir. PR ve SEO stratejisinin ortak ölçüm planı, teknik erişim kararlarının içerik hedeflerinden kopmasını önler.
Log verisi GEO kararına nasıl çevrilir?
Log verisi, crawler erişimi ile içerik otoritesi arasındaki boşluğu gösteren bir teşhis aracına çevrilmelidir. Bir sayfa doğrulanmış botlar tarafından düzenli tarandığı halde cevaplarda görünmüyorsa sorun artık erişimden çok kanıt kalitesi, konu kapsamı, kaynak güveni veya varlık tutarlılığı tarafındadır.
Tersi durumda güçlü editoryal referanslara sahip bir uzman sayfası 403, 404 ya da uzun yönlendirme zinciri döndürüyorsa iletişim yatırımı teknik engel nedeniyle değerlendirilemiyor olabilir. Öncelik, yüksek değerli URL’lerde başarılı crawler erişimini yüzde 95’in üzerine çıkarmak; yeni içeriklerin ilk doğrulanmış ziyaret süresini haftalık olarak izlemek ve hata veren sayfaları sahiplerine atamaktır.
GEO raporu yalnız bot ziyaretlerini başarı olarak sunmamalıdır. Teknik erişim metriği; ChatGPT kaynak gösterimi, Perplexity atfı, AI Overviews görünümü, markalı soru doğruluğu, editoryal kaynak çeşitliliği ve nitelikli yönlendirme oturumlarıyla birlikte değerlendirilmelidir. AEO ve global otorite yaklaşımı, crawler erişimini bir sonuç değil, alıntılanabilir kanıta giden yolun ilk kontrol noktası olarak ele alır.
FL PR & Communications için sağlıklı çalışma modeli üç ekibi aynı tabloda buluşturur: altyapı ekibi erişim ve hata verisini, içerik ekibi sayfa kapsamını, iletişim ekibi ise güvenilir dış kaynakları ve sözcü görünürlüğünü yönetir. Aylık karar toplantısında her teknik sorun bir URL ve sorumluya; her içerik açığı bir soru kümesine; her otorite açığı ise doğrulanabilir earned media fırsatına bağlanır.
Sık Sorulan Sorular
AI crawler log analiziyle ilgili en sık sorulan beş sorunun kısa yanıtları aşağıdadır.
OAI-SearchBot ile GPTBot arasındaki fark nedir?
OAI-SearchBot, web sayfalarının ChatGPT arama sonuçlarında bulunmasına yardımcı olur; GPTBot ise modelleri geliştirmek için kullanılabilecek içeriği tarar. Robots.txt içinde iki bot için ayrı kurallar tanımlanabilir.
AI bot trafiği Google Analytics’te görünür mü?
Çoğu crawler JavaScript analitik etiketini çalıştırmadığı için trafik Google Analytics’te eksik veya hiç görünmeyebilir. Doğru kaynak CDN, WAF, yük dengeleyici ya da origin sunucu erişim loglarıdır.
Bir AI crawler kimliği nasıl doğrulanır?
User-agent aday kimliği verir; kaynak IP ise sağlayıcının resmi JSON veya CIDR listesiyle eşleştirilir. Google crawler’ları için ters DNS ve ileri DNS kontrolü de kullanılabilir.
Google-Extended neden erişim loglarında görünmez?
Google-Extended ayrı bir HTTP user-agent değildir; robots.txt içinde Gemini eğitimi ve grounding kullanımını yöneten ürün belirtecidir. Google Search taraması Googlebot üzerinden gerçekleşir.
Crawler engeli kaldırıldıktan sonra ne zaman yeniden ölçüm yapılmalı?
İlk kontrol 24 saat sonra, anlamlı karşılaştırma ise 7–14 günlük yeni log verisiyle yapılmalıdır. Yeni içeriklerin ilk ziyaret süresi ve 403 ya da 429 oranındaki değişim birlikte izlenmelidir.
