Taranabilirlik ve İndekslenme Sorunları Nasıl Tespit Edilir?

Googlebot'un sayfalarınıza erişimini engelleyen sorunları ve indekslenme hatalarını tespit etmek için pratik kontrol rehberi.

Taranabilirlik ve indekslenme, iki ayrı kavram. Ama çoğu kişi bunları birbirine karıştırıyor. Taranabilirlik, arama motoru botlarının sitenize ulaşıp sayfalarınızı okuyabilmesi. İndekslenme ise taranan içeriğin Google'ın devasa veritabanına dahil edilmesi. Bir sayfa pekâlâ taranabilir ama indekslenmeyebilir; ya da robots.txt'teki tek bir satır yüzünden bot kapıda geri dönebilir. Sonuç her iki durumda da aynı: o sayfa arama sonuçlarında yok. İçerik ne kadar iyi olursa olsun, fark etmez.

Sayfa hızı, backlink profili, içerik kalitesi; hepsi önemli. Ama taranabilirlik çalışmıyorsa bunların hiçbirinin kıymeti yok. Google sayfanızı göremiyorsa sıralamanız sıfır.

Googlebot tarama süreci ve indekslenme kontrol ekranı

Robots.txt dosyasındaki engeller

Sitenizin kök dizininde duran küçük bir metin dosyası, robots.txt. Görevi basit: arama motoru botlarına hangi sayfaları tarayıp hangilerini atlayacaklarını söylemek. Ama bu basitlik aldatıcı. Yanlış yapılandırılmış bir robots.txt, sitenizi arama sonuçlarından tamamen silebilir.

CSS veya JavaScript dosyalarını engellemek hâlâ şaşırtıcı derecede yaygın. Eski alışkanlık. Bazı siteler Disallow: /wp-includes/ veya Disallow: /assets/ gibi kurallarla bu kaynakları bloke ediyor, Google'ın sayfayı düzgün render etmesini imkânsız hale getiriyor. Bot CSS'e ve JS'e erişemezse mobil uyumluluğu da görsel yapıyı da değerlendiremez; sayfanız onun gözünde yarım kalır.

Daha tehlikeli bir senaryo var. Staging ortamında Disallow: / kuralını bırakıp siteyi canlıya almak. Tek satır. Tüm site taramaya kapanır ve siz fark edene kadar günler, belki haftalar geçer. Bu arada indeksten sessizce düşersiniz.

Kontrol etmesi kolay aslında. siteniz.com/robots.txt adresini açın, kuralları gözden geçirin. Search Console'daki robots.txt Test Aracı'yla spesifik URL'lerin engellenip engellenmediğini doğrulayabilirsiniz. Hızlı bir site:siteniz.com araması da Google'ın kaç sayfanızı gördüğünü kabaca ortaya koyar. Sayı beklediğinizden düşükse, ilk bakacağınız yer robots.txt olmalı.

Bir şeyi gözden kaçırmayın: robots.txt taramayı engeller, indekslemeyi değil. Garip ama gerçek. Bir sayfayı robots.txt ile bloke etseniz bile, dışarıdan o sayfaya link veren siteler varsa Google URL'yi indeksleyebilir, içeriğini görmeden, sırf URL ve anchor text bilgisiyle. Sayfanın indeksten tamamen çıkmasını istiyorsanız noindex meta etiketi şart.

Search Console ile indekslenme durumunu kontrol etmek

İndekslenme sorunlarını tespit etmek için en güvenilir kaynak Google Search Console. Üçüncü parti araçlar tahmin yürütür; Search Console doğrudan Google'dan veri çeker. Aradaki fark büyük.

"Sayfalar" raporu (eskiden "Kapsam" raporu deniyordu) sitenizin indekslenme durumunun genel fotoğrafını verir. Geçerli sayfalar, uyarılı sayfalar, hariç tutulanlar ve hatalılar olmak üzere dört ana kategori. Her birinin altında spesifik nedenler sıralanır ve bu nedenler genellikle sorunun tam olarak nerede olduğunu gösterir.

Kafa karıştıran uyarılardan biri: "Tarandı, şu anda indekslenmedi." Google sayfayı görmüş ama indekslemeye değer bulmamış. Neden? İçerik zayıf olabilir. Sayfa çok taze olabilir, Google henüz karar vermemiş olabilir. Ya da sitedeki benzer sayfalar yüzünden gereksiz bulunmuş olabilir. Bu uyarıyı alan sayfalara iç link desteği vermek veya içeriği güçlendirmek çoğu zaman işe yarıyor.

"Noindex etiketi nedeniyle hariç tutuldu": bu kasıtlıysa sorun değil. Bilinçli bir tercihse geçin. Ama farkında olmadan, bir CMS ayarı veya eklenti yüzünden noindex eklenmişse? Acil müdahale gerektirir.

Bir de "Yinelenen sayfa, kullanıcı tarafından seçilen standart URL yok" var. Canonical sorunu. Google aynı içeriğe birden fazla URL'den ulaşabiliyor ama hangisinin asıl versiyon olduğunu çözemiyor. Canonical etiket eklemek veya mevcut olanı düzeltmek bu belirsizliği ortadan kaldırır.

Tek tek sayfa kontrolü için URL Denetimi aracını kullanın. Bir URL giriyorsunuz; Google'ın o sayfayı indeksleyip indekslemediğini, son tarama tarihini, canonical URL'yi ve varsa sorunları anında görüyorsunuz. Yeni yayınladığınız bir sayfanın indekslenmesini hızlandırmak mı istiyorsunuz? Aynı araçtaki "İndeksleme İste" butonu tam bunun için.

XML sitemap sorunları

Sitemap, Google'a "şu sayfalar var, bunlara bak" diyen bir yol haritası. Taranabilirliği garanti etmez, hiçbir şey garanti etmez, ama keşif sürecini ciddi ölçüde hızlandırır.

İçinde olmaması gereken URL'ler en yaygın sorun. 404 dönen adresler, noindex sayfalar, yönlendirilmiş URL'ler, parametre bazlı tekrarlar... Bunların sitemap'te bulunması Google'a tutarsız sinyaller gönderir. Kural basit: sitemap'teki her URL 200 durum kodu döndürmeli ve indekslenebilir durumda olmalı.

Güncelliğini yitirmiş sitemap de ayrı bir dert. Yeni sayfalar eklenmemiş, silinen sayfalar hâlâ listede duruyor. CMS kullanan siteler bunu genellikle otomatik halleder ama statik sitelerde elle güncelleme kaçınılmaz. Search Console'a sitemap gönderdikten sonra "Gönderilen" ve "İndekslenen" sayfa sayılarını karşılaştırın. Arada uçurum varsa bir yerde sıkıntı var.

Boyut limiti de var: tek dosyada en fazla 50.000 URL veya 50 MB. Büyük siteler sitemap index dosyası kullanır; birden fazla sitemap'i tek çatı altında toplar. Çoğu küçük-orta site için bu limit sorun olmaz, ama e-ticaret siteleri kolayca bu sınıra dayanabilir.

Canonical etiket hataları ve duplicate content

Aynı içerik birden fazla URL'den erişilebilir olduğunda Google hangisini "asıl" sayacağını bilemez. Canonical etiket tam bu noktada devreye girer: "Bu sayfanın orijinali şu adres" der. Doğru kullanıldığında duplicate content sorununu temiz bir şekilde çözer. Yanlış kullanıldığında? Sorunun ta kendisi olur.

Klasik hata: her sayfanın canonical'ını ana sayfaya yönlendirmek. Bazı temalar, bazı eklentiler bunu varsayılan olarak yapar ve kimse fark etmez. Google ne görür? Tüm sayfalarınız ana sayfanın kopyası. Hiçbirini indekslemez.

Self-referencing canonical meselesi de var. Her sayfa kendi URL'sine işaret eden bir canonical etiketi taşımalı. Bu, URL parametreleri veya session ID'leri yüzünden oluşan hayalet URL'leri engeller. Format net olmalı: <link rel="canonical" href="https://siteniz.com/sayfa.html">, tam URL, göreceli değil.

HTTP ile HTTPS, www ile www'suz varyasyonlar da bu sorunun parçası. Sitenize dört farklı adresten ulaşılabiliyorsa, yani http://, https://, www. ve www'suz varyasyonlarla, Google bunları dört ayrı site gibi görebilir. Çözüm: 301 yönlendirmeyle tek versiyona yönlendirin, canonical etiketleri de o versiyonu göstersin.

E-ticaret sitelerinde parametre bazlı URL'ler ayrı bir kabus. ?renk=mavi, ?siralama=fiyat, ?sayfa=2... Her kombinasyon yeni bir URL demek ve aynı içeriğe onlarca farklı adresten erişilebilir hale geliyor. Canonical etiketlerle parametresiz ana URL'yi işaret etmek en temiz çözüm.

Tarama bütçesi ve önceliklendirme

Google her siteye sınırsız tarama kapasitesi ayırmaz. Tarama bütçesi denen bir kavram var: Googlebot'un sitenizde belirli bir zaman diliminde tarayacağı sayfa sayısı. Bu bütçe sitenizin büyüklüğüne, sunucu kapasitesine ve içerik kalitesine göre şekillenir. 50 sayfalık bir blog için genellikle mesele değil. Ama binlerce ürün sayfası olan bir e-ticaret sitesiyseniz? İşte o zaman tarama bütçesi yönetimi kritik hale gelir.

Bütçeyi boşa harcayan şeyler belli: 404 sayfaları, yönlendirme zincirleri, parametre bazlı tekrar URL'ler, düşük kaliteli sayfalar. Bir de sonsuz tarama tuzakları var: takvim sayfaları, filtre kombinasyonları gibi yapılar Googlebot'u sonsuz döngüye sokabilir. Bot bu sayfalara vakit harcarken asıl önemli sayfalarınız taranmadan kalır.

Search Console'daki "Tarama İstatistikleri" raporu bu konuda en iyi dostunuz. Günlük tarama istekleri, ortalama yanıt süresi, indirilen dosya boyutu, hepsi orada. Ani bir düşüş mü görüyorsunuz? Muhtemelen sunucu sorunu. Ani artış? Yeni içerik keşfi veya yapısal bir değişiklik tetiklemiş olabilir.

Optimizasyon için yapılacaklar aslında sürpriz değil: gereksiz sayfaları robots.txt ile engelleyin ya da noindex yapın, yönlendirme zincirlerini kısaltın, sitemap'i taze tutun, sunucu yanıt süresini mümkün olduğunca düşürün. Düzenli SEO denetimi sırasında tarama istatistiklerine göz atmak, sorunları büyümeden yakalamanın en kolay yolu.

Sorunları tespit ettikten sonra ne yapmalı?

Sorunları buldunuz, güzel. Şimdi hepsini aynı anda düzeltmeye kalkmayın, önceliklendirme şart.

Robots.txt engelleri en acil olanı. Önemli sayfaları taramaya kapatan bir kural varsa hemen düzeltin. Tek satırlık bir değişiklik, sitenin indekslenme kaderini değiştirebilir.

Sunucu hataları ikinci sırada. Googlebot 5xx hatası aldığında o sayfayı taramayı bırakır, bir süre tekrar denemez bile. Sürekli 5xx dönen sayfalar sessizce indeksten düşer. Sunucu loglarına bakın, kaynağı bulun; genellikle ya kaynak tükenmesi ya da hatalı bir yapılandırma söz konusudur.

Canonical ve yönlendirme sorunları üçüncü sırada gelir. Yanlış canonical etiketler, 301 zincirleri, döngüsel yönlendirmeler... Acil değil gibi görünür ama düzeltilmezse uzun vadede ciddi indekslenme kaybına yol açar.

Düzeltmeleri yaptıktan sonra Search Console'dan etkilenen URL'lerin yeniden taranmasını isteyin. "Sayfalar" raporundaki sorun gruplarında "Düzeltmeyi Doğrula" butonu var. Google birkaç gün içinde sayfaları tekrar tarar ve durumu bildirir.

Taranabilirlik sorunlarının en sinsi yanı sessiz olmaları. Trafik düşüşü yaşayana kadar çoğu zaman fark etmezsiniz. SEO analizi sürecinde indekslenme kontrolünü ilk sıraya koymak bu yüzden mantıklı; diğer tüm optimizasyonların temeli burası. Search Console'daki "Sayfalar" raporuna en az ayda bir göz atın. Küçücük bir robots.txt hatası veya farkında olmadan eklenen bir noindex etiketi, haftalarca trafiğinizi eritebilir ve siz neyin değiştiğini anlamaya çalışırken vakit kaybedersiniz.