Bir Web Sitesindeki Tüm Sayfaları Bulma (Silinmiş Olanlar Dahil)
Restorix editör ekibi tarafından · 25 Mayıs 2026 · 6 dakika okuma

Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
Sitemiz kaç sayfadan oluşuyor? Bu sorunun arkasında bir veritabanı varmış gibi gelir. Genelde yoktur. Geçen yıl bir müşteri sitelerinin yaklaşık 400 sayfa olduğuna yemin ediyordu. Site haritası 1.900 sayfa gösteriyordu. Tarama 3.400 sayfa buldu. Wayback Machine'in dizini, sitenin şimdiye kadar sunduğu 11.000 URL listeledi; bunların yarısı çoktan silinmişti. Dört kaynak, dört yanıt, ve hepsi farklı konularda doğruydu.
İşte bir web sitesindeki tüm sayfaları bulmak için kullandığım dört yöntem, her birinin gerçekte neleri kapsadığı ve bunları eyleme dökebileceğiniz tek bir temiz listede nasıl birleştireceğiniz.
Bir web sitesindeki tüm sayfaları bulmak neden zordur
CMS tesadüfen bir ana liste tutmuyorsa, böyle bir liste yoktur, olsa bile yalnızca kendi içindekileri bilir. Gerçek siteler, hiçbir envanterin kapsamadığı sayfalar biriktirir: menüden bağlantı verilmeyen yetim sayfalar, eski bir taşımanın geride bıraktığı bölümler, bir e-posta kampanyasında bir kez bağlantı verilmiş yüklemeler, anında oluşturulan filtreli URL'ler, birinin 2016'da kurup unuttuğu alt alan adları.
Her keşif yöntemi bu karmaşanın farklı bir dilimini görür. Site haritası CMS'in kendi beyanıdır. Tarayıcı bağlantı grafiğini çıkarır. Wayback Machine'in CDX dizini geçmişi hatırlar. Search Console, Google'ın kullanıcılara gerçekten sunduklarını raporlar. Hiçbiri eksiksiz değildir; birlikte neredeyse tamamlanırlar.
Listeyi oluşturmadan önce ne için kullanacağınıza karar verin. Bir taşıma envanteri, bir SEO denetimi ve ölü bir sitenin kurtarılması aynı ham maddeye ihtiyaç duyar, ancak farklı temizlik gerektirir.
Site haritası: bir web sitesindeki tüm sayfaları bulmanın en hızlı yolu
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
/sitemap.xml ile başlayın. 404 dönerse, robots.txt dosyasında Sitemap: yönergesini kontrol edin, birçok site bu dosyayı alışılmadık bir yola yerleştirir. WordPress çekirdeği 5.5 sürümünden beri /wp-sitemap.xml sunar; Yoast ve Rank Math, her içerik türü için alt site haritalarına ayrılan /sitemap_index.xml oluşturur. Dizini alın, ardından her alt haritayı.
Protokol, her site haritası dosyasını 50.000 URL ve sıkıştırılmamış 50 MB ile sınırlar; bu nedenle büyük siteler her zaman dizin kullanır, bulduğunuz ilk dosyada durmayın.
Şimdi uyarılar, çünkü site haritaları eksiklikle yalan söyler. Bir site haritası yalnızca CMS'in bildiklerini listeler: yetim medya yüklemeleri, yıllar önce silinmiş sayfalar, CMS dışında çalışan eski bölümler, /old-tools/ içindeki özel betik tarafından oluşturulan hiçbir şey yoktur. Elle yazılmış veya güncelliğini yitirmiş site haritalarında, bilinen liste bile kurgudur. Son güncelleme tarihlerini yakın zamanda güncellediğiniz sayfalarla karşılaştırın; uyuşmazlarsa hiçbir şeye güvenmeyin.

Siteyi Googlebot gibi tara
Bir tarayıcı, tıpkı bir arama motoru gibi ana sayfadan başlar ve görebildiği her bağlantıyı takip eder. Screaming Frog sektör standardıdır ve 500 URL'ye kadar ücretsizdir; Sitebulb denetimler için daha kullanıcı dostudur; tam kontrol için requests ve BeautifulSoup içeren küçük bir Python betiği, veya örümcek modunda wget, hiçbir maliyet getirmez.
Tarama, site haritalarının kaçırdıklarını bulur: kimsenin site haritasına eklemediği sayfalı arşivler, etiket ve kategori sayfaları, hâlâ var olan sayfalara işaret eden kırık bağlantılar, tarama bütçesini tüketen yönlendirme zincirleri.
Kör noktaları, site haritasının tam tersidir. Bir sayfaya hiçbir bağlantı yoksa, tarayıcı onu asla bulamaz. JavaScript ile oluşturulan menüler, başsız bir tarayıcı gerektirir, yoksa tarama ana sayfada durur. Ayrıca filtreli gezinme, filtreler, takvimler, sıralama düzenleri, 500 sayfalık bir mağazayı 500.000 URL'lik bir tarama tuzağına dönüştürebilir; başlatmadan önce, sonra değil, hariç tutma kuralları belirleyin. Size ait olmayan sitelerde eşzamanlılığı düşük tutun ve robots.txt'ye uyun.
Wayback CDX API: bir web sitesindeki tüm sayfaları, geçmiş ve şimdiki, bulun
Bu, neredeyse kimsenin kullanmadığı ve en çok sonucu bulan yöntemdir. Internet Archive'in CDX sunucusu, bir ana bilgisayar için şimdiye kadar yakaladığı her URL'yi listeler, on yıl önce silinmiş sayfalar dahil, ki hiçbir canlı yöntem bunları göremez.
Tek bir curl komutu tüm envanteri getirir:
curl "https://web.archive.org/cdx/search/cdx?url=example.com/*&output=text&fl=timestamp,original,statuscode&filter=statuscode:200&collapse=urlkey&from=2010&to=2020"
Önemli parametreler: collapse=urlkey aynı URL'nin tekrarlanan yakalamalarını tekilleştirir; filter=statuscode:200, 404'leri ve yönlendirmeleri atar; matchType=domain ağı alt alan adlarına genişletir; from ve to yılları sınırlar. Ölü bir site için asıl altın, bu tarih aralığındadır.
Hacim bekleyin. Uzun ömürlü bir forum veya mağaza milyonlarca satır döndürebilir ve sorgu dizisi gürültüsü, oturum kimlikleri, izleme parametreleri, listeyi şişirir. API ücretsizdir ancak hız sınırlaması vardır; bu nedenle büyük alan adlarında sabırlı olun ve büyük çekimleri yıllık parçalara bölün.

Tesisatla uğraşmadan yanıtı istiyorsanız, Restorix ücretsiz tahmini için aynı dizini çalıştırır, bir alan adı yapıştırın, saniyeler içinde tam arşivlenmiş dosya sayısını ve toplam boyutu bildirir, sorgu gerekmez.
Google Search Console: web sitenizin Google'a gösterdiği tüm sayfaları bulun
Sahip olduğunuz siteler için Search Console, başka kimsede olmayan bir veri kümesi ekler: Google'ın gerçekten dizine eklediği ve sunduğu şeyler. Sahipliği doğrulayın, ardından iki raporla çalışın.
- Performans raporu, Sayfalar sekmesi: gösterim kazanan her URL, dışa aktarılabilir. Web arayüzü dışa aktarımları 1.000 satırla sınırlar; Search Analytics API bunun çok ötesine sayfalandırır ve BigQuery'ye toplu dışa aktarım tam veri kümesini günlük olarak sunar.
- Dizin, Sayfalar raporu: dizine eklenmiş ve taranmış-ancak-şu-anda-dizine-eklenmemiş, örnek URL'lerle, Google'ın sitenin ne kadarını saklamaya değer gördüğüne dair hızlı bir okuma.
Benzersiz değer, gösterim verileridir: gerçek kullanıcıların ulaştığı sayfalar, hiçbir bağlantı verilmeyen yetimler dahil. Unutulmuş bir açılış sayfası hâlâ ayda otuz tıklama alıyorsa, saklama listesine girer. Bing trafiği sizin için önemliyse, Bing Webmaster Tools aynı raporları sunar.
Listeyi birleştirin, tekilleştirin ve temizleyin
Dört kaynak, dört format, değer birleştirme aşamasında ortaya çıkar. Her şeyi tek bir CSV'ye dökün, ardından tekilleştirmeden önce normalleştirin, yoksa aynı sayfa altı farklı kılıkta altı kez görünür.
Bu kılıklar varsayımsal değil. Gerçek bir ürün sayfası https://www.example.com/page/?utm_source=newsletter, http://example.com/page, example.com/page/#comments, example.com/page?fbclid=abc123, www.example.com/page/index.html ve EXAMPLE.com/page olarak görünebilir, altı satır, tek belge. Büyük/küçük harf, protokol, www, parametreler, parçalar ve varsayılan dosya adlarının tümü, tekilleştirme işlemi anlamlı olmadan önce tek bir standart biçime indirgenmelidir. Bunu atlarsanız, 11.000 URL'lik envanteriniz aslında kostüm giymiş 6.000 URL'dir.
- Ana bilgisayar adını küçük harfe çevirin; parçaları (#bölüm) tamamen kaldırın.
- İzleme parametrelerini atın: utm_*, fbclid, gclid, ref. Kalan sorgu parametrelerini sıralayın.
- Bir sondaki eğik çizgi kuralı seçin ve uygulayın.
- Protokol ve www varyantlarını standart biçiminize indirgeyin.
Tekilleştirmeden sonra her URL'yi sınıflandırın: canlı 200, yönlendiriyor, şu anda 404 ama arşivlenmiş veya tamamen gitmiş. Üçüncü kova, silinmiş ancak CDX verilerinde mevcut, taşımaların unuttuğu ve pişman olduğu kovadır. Çoğu site için yirmi satırlık bir Python betiği tüm bunları halleder; elektronik tablolar birkaç bin URL'ye kadar başa çıkar.
Dört kaynağın hızlı karşılaştırması:
| Kaynak | Silinmiş sayfaları görür mü? | Site erişimi gerektirir mi? | Gerçekte neleri kapsar |
|---|---|---|---|
| sitemap.xml | Hayır | Hayır | CMS'in şu anda kabul ettiği sayfalar |
| Tarayıcı | Hayır | Hayır | Bağlantılarla erişilebilen her şey |
| Wayback CDX API | Evet | Hayır | Arşivin şimdiye kadar yakaladığı her URL |
| Search Console | Hayır | Evet | Google'ın dizine eklediği veya sunduğu URL'ler |
Her sayfayı buldunuz, şimdi ne olacak
Bir taşıma için liste, yönlendirme haritanız olur: Search Console'da gösterim alan veya CDX verilerinde yakalaması bulunan her URL, en yakın modern eşdeğerine 301 yönlendirmesi alır. Bir SEO denetimi için tarama ve dizin sütunları, zayıf bölümleri ve tarama tuzaklarını ortaya çıkarır. Her ikisi de birkaç öğleden sonralık dürüst bir iştir.
Liste geri almak istediğiniz ölü bir site içinse, elle yeniden oluşturmayı atlayın. Restorix her şeyi Wayback Machine'den geri yükler: ücretsiz tahmin, kilitli bir fiyatla tam dosya sayısını ve boyutunu gösterir; geri yüklenen dosya başına ödeme yaparsınız, ilk dosya ücretsizdir; temizleme seçenekleri eski analizleri kaldırır, bağlantıları göreli hale dönüştürür ve varlıkları küçültür. Sonuç, barındırma hizmetinize tek tıkla dağıtılır veya ham materyali tercih ederseniz tam dosya manifestosuyla XML, CSV veya JSON olarak dışa aktarılır. Her iki durumda da, az önce yaptığınız numaralandırma çalışması, iyi bir geri yüklemenin tam olarak ne içermesi gerektiğini size söyler.
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
FAQ
Site haritası bir web sitesindeki her sayfayı listeler mi?
Hayır. Site haritası yalnızca CMS'in yayınladıklarını listeler: yetim sayfalar, yüklemeler, silinmiş hiçbir şey ve CMS dışında yaşayan hiçbir şey yoktur. Bunu sitenin kendi beyanı olarak değerlendirin, nüfus sayımı olarak değil.
Kendilerine işaret eden dahili bağlantı olmayan yetim sayfaları nasıl bulurum?
Üç kaynağı birleştirin: Search Console gösterim verileri, Wayback CDX dizini ve varsa sunucu günlükleri. Hiç trafik almış veya yakalanmış yetimler, bu üçünden en az birinde görünür.
Yıllar önce silinmiş sayfaları bulabilir miyim?
Evet, Wayback CDX API'nin size tam olarak verdiği budur: Internet Archive'in şimdiye kadar yakaladığı her URL, on yıl önce kaldırılmış sayfalar dahil. Site haritaları ve tarayıcılar gibi canlı yöntemler silinmiş içeriği hiç göremez.
Başkasının web sitesini taramak yasal mı?
Genel sayfaları makul hızlarda taramak genellikle kabul görür ve çeşitli yargı bölgelerindeki mahkemeler, kamuya açık verilerin kazınmasını yasal olarak değerlendirmiştir, ancak robots.txt'ye uyun, sitenin koşullarına saygı gösterin, istek hızlarını düşük tutun ve telif hakkıyla korunan içeriği yeniden yayınlamanın, onu okumaktan ayrı bir soru olduğunu unutmayın.
Taramam neden Google'ın dizine eklediğinden daha fazla sayfa buluyor?
Taranabilir ve dizine eklenmiş farklı şeylerdir. Google, zayıf, yinelenen veya düşük değerli olarak değerlendirdiği sayfaları dizine eklemeyi reddeder ve filtreli gezinme, taramanızı neredeyse aynı URL'lerle şişirebilir. Search Console dizin raporu, her sayfanın hangi kampa düştüğünü gösterir.
Eksiksiz bir sayfa envanteri almanın en hızlı yolu nedir?
Site haritasını alın, ardından collapse=urlkey ile CDX dizinini çekin, iki listeyi birleştirin ve tekilleştirin. Çoğu site için bu bir saatten az sürer ve hem bugünü hem de tüm arşivlenmiş geçmişi kapsar.
İlgili rehberler

wayback machine downloader
Wayback Machine İndirme Araçları: Gerçekten İşe Yarayanlar
Wayback Machine indirme araçlarına dürüst bir bakış: açık kaynak betikler, gerçek sınırları ve sitenizi yeniden yayına alan hazır çözüm seçeneği.

download entire website from archive org
Archive.org'dan Sadece Anasayfayı Değil, Tüm Bir Web Sitesini İndirin
Archive.org'dan tüm bir web sitesini indirmek için her sayfaya, her görsele ve her stil dosyasına ihtiyacınız var. Varlıklar farklı zaman damgalarının altına gizlenir, nedenini ve eksiksiz bir kontrol listesini burada bulabilirsiniz.

find website history
Web Sitesi Geçmişini Bulma: Bir Sitenin Ne Söylediğini ve Ne Zaman Söylediğini Kanıtlama
Geçerli web sitesi geçmişi bulun: anlaşmazlıklar, gazetecilik ve OSINT soruşturmaları için arşivlenmiş anlık görüntüler, zaman damgaları ve doğrulayıcı kaynaklar.

restore deleted site
Silinmiş Bir Siteyi Geri Yükleme: İlk 48 Saatte Yapmanız Gerekenler
Host firmanız sitenizi mi sildi? Bu 48 saatlik triyaj planını izleyin, ardından silinmiş siteyi web arşivlerinden adım adım geri yükleyin.
