Wayback Machine'den Tüm Siteyi İndirme
Restorix editör ekibi tarafından · 26 Mayıs 2026 · 6 dakika okuma

Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
Wayback Machine'den tek bir sayfa kaydetmek iki dakika sürer. Tüm siteyi kaydetmek ise bambaşka bir iştir; körlemesine dalarsanız hafta sonunuzu yer. Arşiv sitenizi düzenli bir paket halinde tutmaz. Her biri kendi tarama zamanında dondurulmuş binlerce ayrı yakalama barındırır ve bunları tutarlı bir web sitesinde birleştirmek çoğu kişinin takıldığı noktadır. Bu kılavuz, tüm site indirmelerini gerçekten bozan tuzakları ve otomasyonun artık isteğe bağlı olmaktan çıktığı noktayı ele alıyor.
Neden Wayback Machine'den tüm siteyi indirmek tek sayfadan daha zordur
Bir sayfa tek bir yakalamadır. Site ise tarayıcının bulduğu her URL'dir ve her biri kendi takvimine göre arşivlenmiştir. Ana sayfanızın 9.000 yakalaması olabilir. Kargo iade sayfanızın üç tane olabilir ve en yenisi 2017'den kalmış olabilir. Wayback Machine'den bir site indirdiğinizde, asla birbirine uyması için yapılmamış parçalardan bir mozaik oluşturursunuz.
Varlıklar işi daha da kötüleştirir. Logo bir yakalamadır. Stil dosyası başka bir yakalamadır, muhtemelen farklı bir yıldan. Arşiv her birini yalnızca web.archive.org içinde çözümlenen yeniden yazılmış URL'lerle sunar, bu yüzden sitenin saf bir kopyası yerel olarak açtığınız anda bozulur. Tek bir sayfa bu günahları affeder. Beş yüz sayfa onları katlar.
Herhangi bir şey indirmeden önce sitenin haritasını çıkarın
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
wget ile başlamayın. CDX API ile başlayın ve arşivin gerçekte ne tuttuğunun tam envanterini çekin:
web.archive.org/cdx/search/cdx?url=example.com/*&matchType=prefix&output=json&collapse=urlkey&filter=statuscode:200
Bu tek istek size kaç benzersiz URL olduğunu, tarayıcının hangi bölümleri kapsadığını ve boşlukların nerede olduğunu söyler. Yakın zamanda yaptığım bir işte, 2009'dan kalma bir phpBB forumunda envanter 22.000 benzersiz URL gösterdi. Bunların belki 1.400'ü gerçek içerikti. Geri kalanı oturum kimlikleri, yazdırma görünümü kopyaları ve kimsenin okumadığı takvim sayfalarıydı.
Envanteri bir müteahhit gibi okuyun
- URL'leri dizine göre sayın. Kalabalık bir /images bölümü varlıkların hayatta kaldığı anlamına gelir; seyrek olanı ise sonradan baş ağrısı demektir.
- Her bölüm için tarih aralığını kontrol edin. Blogunuz 2016'da duruyor ama ana sayfa 2023'e kadar gidiyorsa, blog silinmemiş, bağlantısı kaldırılmış veya engellenmiştir.
- Çöp desenlerini erkenden arayın: oturum parametreleri, yanıt formları, sıralama düzenleri. Bunlar sayıyı ve indirme sürenizi şişirir.
- MIME türlerine dikkat edin. Çok sayıda text/html olup hiç resim girişi yoksa, arşiv iskeleti tutmuş, deriyi kaybetmiş demektir.
Tek bir istek yazmadan envanteri görmek isterseniz, Restorix'teki ücretsiz tahmin, hiçbir harcama yapmadan önce bir alan adı için tam arşivlenmiş dosya sayısını ve toplam boyutu gösterir. Bu sayı planı değiştirir. Üç yüz dosya bir kendin yap öğleden sonrasıdır. Otuz bin değildir.

Wayback Machine site indirmesini bozan tuzaklar
Bu listedeki her madde beni en az bir kez yaktı. Hiçbiri, indirmenin üçüncü saatine gelip çıktı hiçbir anlam ifade etmeyene kadar bariz değildir.
- robots.txt geçmişi. Yıllarca arşiv, robots.txt tarafından engellenen sayfaları taramayı veya sunmayı reddetti. Önceki bir sahibi yanlış yapılandırdıysa, tüm dizinler arşivde basitçe mevcut değildir ve hiçbir araç onları var edemez.
- Ana bilgisayar yayılımı. www.example.com, example.com, blog.example.com ve eski CDN ana bilgisayarı farklı yakalama kümeleridir. Bir ana bilgisayardaki ön ek sorgusu diğerlerini sessizce kaçırır, bir tarayıcı betiği de öyle.
- http ve https. Her iki şema altındaki aynı sayfa iki kez arşivlenir, bazen farklı varlıklarla. Daha iyi kapsama sahip varyantı seçin, hatırladığınızı değil.
- JavaScript ile oluşturulan sayfalar. Tarayıcı, tarama anında çalıştırabildiğini sakladı. 2019'dan kalma bir React sitesi, gerçek içerik gitmiş, boş div'lerden oluşan bir kabuk olarak geri gelebilir.
- Zaman damgası kayması. 2014, 2017 ve 2021'de yakalanan dosyalar tek bir sitede birleştirildiğinde bozuk düzenler ve uyumsuz gezinme üretir. Her şeyi tek bir hedef tarihe sabitleyin.
- Wayback kromu. Normalde sunulan anlık görüntüler arşiv araç çubuğunu ve yeniden yazılmış bağlantıları içerir. Zaman damgasına id_ son ekini ekleyerek alın veya kaydettiğiniz her dosyadan kromu temizlemeyi planlayın.
Sorgu dizgileri, sayfalama ve diğer URL tuzakları
Sorgu dizgileri, tüm site indirmelerinin sessizce başarısız olduğu yerdir. Arşiv için /shop?cat=shoes ve /shop?cat=hats farklı yakalamalara sahip farklı URL'lerdir. ?page=2 ve ?page=200 de öyle. Üzerinde çalıştığım bir müşterinin WooCommerce mağazasında 4.000 arşivlenmiş URL vardı ve yalnızca 90 gerçek ürün bulunuyordu. Geri kalanı filtre kombinasyonları, sıralama düzenleri ve izleme parametreleriydi.
Strateji mekaniktir. CDX listesini çekin, URL'leri soru işaretinden önceki yola göre gruplandırın ve hangi parametrelerin içerik taşıdığına karar verin. Ürün kimlikleri ve sayfalama: saklayın. Oturum kimlikleri, UTM etiketleri ve filtre permütasyonları: atın. Bunu bir yönde yanlış yaparsanız gerçek sayfaları kaybedersiniz. Diğer yönde yanlış yaparsanız on kat çöp indirir ve bedelini saatlerle ödersiniz.

Wayback Machine site indirmeniz deliklerle geri döndüğünde
Eksik varlıklar kuraldır, istisna değil. Şuralarda boşluklar bekleyin:
- Tarayıcının asla tetiklemediği geç yüklenen ve JavaScript ile enjekte edilen resimler
- Stil dosyalarının içinden referans verilen CSS arka plan resimleri ve web yazı tipleri
- Arşivin en iyi ihtimalle tutarsız yakaladığı video ve ses dosyaları
- Canlı bir API anahtarı gerektiren üçüncü taraf kitleri aracılığıyla yüklenen yazı tipleri ve simgeler
- Üçüncü taraf bir alan adından, reklam ağından veya oturum açma arkasından sunulan her şey
Her delik için seçenekleriniz sınırlıdır: yakın zaman damgalarını deneyin, www'li ve www'siz veya http ve https varyantlarını deneyin ya da kaybı kabul edip varlığı yeniden oluşturun. İşte bu noktada bir manifesto değerini gösterir. Restorix her geri yüklemede bir JSON veya SQLite dosya manifestosu gönderir, böylece hangi dosyaların eksik olduğunu bulmak sayfalar arasında tıklayarak geçen bir öğleden sonra yerine bir filtre sorgusuna dönüşür.
Betik yazmayı bırakıp otomatikleştirmenin zamanı
Dürüstçe hesap yapın. Dağınık bir site için sağlam bir indirme betiği oluşturmak ve hata ayıklamak bir hafta sonu alır, artı archive.org sizi 9.000 dosyanın 8.000'incisinde yavaşlattığında saatlerce yeniden çalıştırma. Sonra tamamen ikinci bir proje başlar: Wayback yeniden yazımlarını temizlemek, iç bağlantıları düzeltmek, bir kanonik ana bilgisayar seçmek, dağıtmak ve test etmek.
Otomasyon, site yalnızca diskinizde var olmaktan çıkıp yeniden çalışması gerektiği anda anlam kazanır. Restorix indirme, temizleme ve dağıtımı tek bir işte halleder: geri yüklenen dosya başına ödeme, ilk dosya ücretsiz, fiyat tahmin anında kilitlenir ve herhangi bir şey başarısız olursa bakiyenize otomatik iade yapılır. Kendin yap yolu küçük siteler, araştırma çekimleri ve bulmacadan gerçekten keyif alan kişiler için hâlâ mantıklıdır. Her iki yolu da sayamayacağım kadar çok kez yaptım ve başa baş noktası insanların beklediğinden daha hızlı, genellikle ikinci yeniden çalıştırma civarında gelir.
İndirilen dosyalardan çalışan bir siteye
- Wayback araç çubuğunu kaldırın ve her archive.org URL'sini göreli bir yola yeniden yazın.
- Bir kanonik ana bilgisayar seçin, www'li veya www'siz, ve diğerini yönlendirin.
- Modern bir yere dağıtmadan önce iç bağlantıları HTTPS'ye dönüştürün.
- Ölü üçüncü taraf betikleri kaldırın: eski analitikler, reklam etiketleri ve eve telefon eden sosyal widget'lar.
- Dağıtın, ardından tarayıcı ağ sekmesi açıkken en üst 50 sayfayı tıklayarak hâlâ 404 dönen ne varsa yakalayın.
Bu aşamada her zaman iki şey başarısız olur: iletişim formları ve arama. Her ikisi de arşivin asla yakalamadığı sunucu koduna bağlıydı. Formları barındırılan bir form hizmeti veya düz bir mailto bağlantısı ile değiştirin ve site aramasını statik bir dizin veya arama motoru kapsamlı bir kutu ile değiştirin.
Restorix tüm bunları geri yükleme seçeneklerine dahil eder: göreli iç bağlantılar, HTTPS dönüşümü, analitik temizleme, SSH, FTP veya S3'e tek tıkla dağıtım ve geri yüklenen sitenin düzenlenebilir kalması için küçük bir CMS. Elle yapın veya hizmetin yapmasına izin verin; kontrol listesi her iki durumda da aynıdır. Yalnızca saatler farklıdır.
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
FAQ
Wayback Machine'den tüm bir siteyi ücretsiz indirebilir miyim?
Evet, açık kaynak betikler ve kendi zamanınızla. İndirmenin kendisi ücretsizdir; temizlik saatlerle ödediğiniz şeydir. Küçük statik bir site için bu takas uygundur. 10.000 URL'li bir mağaza için, taahhüt etmeden önce hafta sonunuza bir fiyat biçin.
Sitemin bazı sayfaları neden arşivde yok?
Olağan nedenler: robots.txt tarayıcıyı engelledi, sayfa tarayıcının ulaştığı hiçbir yerden bağlantı almadı, oturum açma gerektiriyordu veya taramalar arasında yalnızca kısa bir süre mevcuttu. CDX API envanteri tam olarak neyin var olduğunu gösterir, bu yüzden varsaymadan önce kontrol edin.
Alan adım için arşivlenmiş her URL'nin listesini nasıl alırım?
web.archive.org/cdx/search/cdx?url=example.com/*&matchType=prefix&output=json adresini sorgulayın. URL'ye göre tekilleştirmek için collapse=urlkey ve hata yakalamalarını atmak için filter=statuscode:200 ekleyin. Sonuç gerçek site haritanızdır.
En yeni yakalamayı mı yoksa daha eski birini mi geri yüklemeliyim?
En yeni otomatik olarak en iyisi değildir. Sitenin sağlıklı olduğu zamandaki yakalamayı seçin: hacklenmeden, park edilmeden veya parçalarına ayrılmadan önce. Takvim görünümünde birkaç aday tarihi karşılaştırın ve taahhüt etmeden önce her birinin ne kadar eksiksiz göründüğünü kontrol edin.
Wayback Machine videoları ve indirilebilir dosyaları arşivler mi?
Bazen. Büyük medya tutarsız yakalanırken, PDF'ler ve resimler çok daha iyi durumdadır. Bir medya kütüphanesinin hayatta kaldığını kimseye vaat etmeden önce CDX envanterini MIME türüne göre filtreleyin.
Tüm bir siteyi indirmek ne kadar sürer?
Kibar bir betikle 500 sayfalık bir site: hız sınırlamasıyla birkaç saat. On binlerce dosya: bir gün veya daha fazla başında bekleme ve yeniden çalıştırmalar. Otomatik bir geri yükleme, siz bir gösterge panelinde ilerlemeyi izlerken başkasının altyapısında çalışır.
İlgili rehberler

download entire website from archive org
Archive.org'dan Sadece Anasayfayı Değil, Tüm Bir Web Sitesini İndirin
Archive.org'dan tüm bir web sitesini indirmek için her sayfaya, her görsele ve her stil dosyasına ihtiyacınız var. Varlıklar farklı zaman damgalarının altına gizlenir, nedenini ve eksiksiz bir kontrol listesini burada bulabilirsiniz.

wayback download
Wayback İndirme: Her Yöntem Emeye Göre Sıralandı
Her wayback indirme yöntemi emeğe göre sıralandı: tekil sayfalar, wget betikleri, CDX API ve tüm siteyi sizin için yeniden inşa eden otomatik hizmetler.

wayback machine restore
Wayback Machine Geri Yükleme: 4 Tuzak ve Bunlardan Nasıl Kaçınılır
Wayback Machine geri yüklemesi sessizce başarısız olabilir: park edilmiş sayfalar, yönlendirme zincirleri, eksik görseller, karışık zaman damgaları. Her tuzağı nasıl fark edeceğinizi ve nasıl kaçınacağınızı öğrenin.

find all pages on a website
Bir Web Sitesindeki Tüm Sayfaları Bulma (Silinmiş Olanlar Dahil)
Bir web sitesindeki tüm sayfaları, kimsenin bağlantı vermediği sayfalar dahil, bulmanız mı gerekiyor? Site haritalarını, tarayıcıları, Wayback CDX API'yi ve Search Console dışa aktarımlarını karşılaştırın.
