Archive.org'dan Sadece Anasayfayı Değil, Tüm Bir Web Sitesini İndirin
Restorix editör ekibi tarafından · 15 Temmuz 2026 · 6 dakika okuma

Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
Anasayfayı herkes kaydedebilir. Anasayfa işin kolay kısmı, 'bir kopyasını aldım' ile 'site gerçekten benim elimde' arasındaki fark, onun arkasındaki 4.000 dosyadadır. Biri benden archive.org'dan tüm bir web sitesini indirmemi istediğinde, anasayfa genellikle zaten masaüstünde duruyor olur; stil dosyası ise hiç orada değildir.
Bu yazı 'tüm' kelimesi hakkında. Eksiksiz bir kopyanın gerçekte neleri kapsadığını, arşivin varlıklarınızı neden yıllara yayılmış farklı zaman damgalarına dağıttığını ve her şeyi aldığınızı ummak yerine kanıtlamak için sonunda çalıştırabileceğiniz bir kontrol listesini ele alıyor.
Archive.org'dan tüm bir web sitesini indirirken 'tüm' ne anlama gelir
Eksiksiz bir kopya dört katmandan oluşur ve çoğu insan ilkinden sonra durur. Var olan her sayfanın HTML'i. Her sayfanın başvurduğu varlıklar: görseller, stil dosyaları, JavaScript, yazı tipleri, PDF'ler, videolar. Kopyanın archive.org'un sunucularına bağlı kalmadan kendi başına gezilebilmesi için yeniden yazılmış dahili bağlantılar. Ve neyin yakalandığını gösteren bir manifest dosyası, böylece eksikler belgelenmiş olur, müşteri tarafından çok sonra keşfedilmek yerine.
- Sayfalar: tarayıcının gördüğü her URL, sadece ana menüdekiler değil. Eski siteler unutulmuş alt bilgi bağlantılarının arkasına bütün bölümler gizler.
- Varlıklar: görseller, CSS, JS, yazı tipleri ve indirilebilir dosyalar, çoğu sitede bunlar sayfaları beşe bir oranında sayıca geçer.
- Bağlantılar: göreli yollara dönüştürülmeli, yoksa kopyanız yalnızca archive.org ayakta olduğu sürece çalışır.
- Bir manifest: elinizdekilerin dosya dosya listesi; 'her şeyi aldığımı düşünüyorum' ifadesini doğrulanabilir bir şeye dönüştürür.
Dosya sayıları insanları şaşırtır. Mütevazı 50 sayfalık bir iş sitesi rutin olarak 400-800 dosyaya ulaşır. Kullanıcı avatarları ve ekleri olan 2009 tarihli bir phpBB forumu on binleri bulabilir. Planı sayfa sayısına göre değil, dosya sayısına göre yapın.
Bir de gezilebilen kopya ile yeniden yayına alınabilecek kopya arasında bir fark vardır. Gezilebilen bir kopya yalnızca dosyaları ve çalışan bağlantıları gerektirir. Barındırmaya geri koymayı düşündüğünüz bir kopya daha fazlasını ister: tutarlı kurallı URL'ler (www veya www'siz seçin), HTTPS'ye hazır başvurular ve on yıllık analiz betikleri gibi ölü ağırlıkların temizlenmesi. Başlamadan önce hangisini inşa ettiğinize karar verin; çünkü sonradan birini diğerine uyarlamak yorucu bir iştir.
Varlıklar neden farklı zaman damgaları altında bulunur
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
Wayback Machine bir sitenin fotoğrafını bir öğleden sonra çekmez. Tarayıcıları, ulaşabildiklerini ne zaman ulaşırlarsa o zaman getirir. 2014 anasayfanız, en son 2012'de yakalanmış bir logoya, beş yıl boyunca altı kez yakalanmış bir stil dosyasına ve hiç yakalanmamış bir kapak görseline başvuruyor olabilir. O sayfayı görüntülediğinizde archive.org, her varlık için elindeki en yakın yakalamayı sessizce yerine koyar. Bu yüzden parçaları on yıla yayılmış olsa da sayfa tarayıcınızda düzgün görünür.
Bunun iki sonucu vardır. Birincisi, indirme aracını işaret edebileceğiniz tek bir 'sitenin zaman damgası' yoktur, eksiksiz bir indirme her dosyayı kendi en iyi yakalamasından çeker. İkincisi, en yakın yakalama hilesi eksikleri gizler: wayback, 2014 sayfanıza 2016 görselini hiçbir şey söylemeden sunmaktan çekinmez. Gündelik gezinme için zararsızdır, ama geri yüklenen sayfanın gerçekten 2014 sayfası olup olmadığı sizin için önemliyse bilmeye değer.
Arşivlenmiş bir sayfa bir kolajdır. HTML, görseller ve CSS her biri farklı anlarda dondurulmuştur; arşiv onları biri baktığında tekrar bir araya yapıştırır.

Kullandığınız her aracın veya betiğin bunun için bir stratejisi olmalı. Tembel strateji, her şeyi tek bir zaman damgasından çekmek, tam olarak sayfanızın kırık görsel simgeleriyle dolmasıyla sonuçlanır, çünkü varlıkların yarısının o hafta hiç yakalaması yoktur. Doğru strateji dosya bazlıdır: her varlığı kendi tarih aralığınızdaki en yakın iyi yakalamadan alın.
Archive.org'dan tüm bir web sitesi nasıl indirilir: envanterle başlayın
Tek bir dosyayı getirmeden önce, arşivin gerçekte ne barındırdığını listeleyin. CDX API, bir alan adı için tam defteri verir: zaman damgaları, MIME türü ve HTTP durumuyla birlikte yakalanan her URL. Durum kodu 200'e göre filtreleyin, yinelenen içerik özetlerini daraltın; tahmin yerine gerçekçi bir alışveriş listeniz olur.
İndirmeden önce envanteri okumak, can sıkıcı şeyleri erken öğrenmenizi sağlar. O phpBB forum işinde CDX listesi 11.000 yakalanmış URL gösteriyordu, bunların yaklaşık 3.000'i farklı sorgu dizileri altında kaydedilmiş aynı avatar GIF'iydi. Yinelenenleri daraltmak, ürkütücü bir işi sıradan bir işe dönüştürdü. Aynı liste, hiç yakalanmamış sayfaları da açığa çıkarır; yeryüzünde hiçbir indirme yöntemi onları geri getiremez. Bunu ilk gün bilmek daha iyidir.
Kalanları MIME türüne göre gruplayın, işin şekli ortaya çıkar: kaç HTML sayfası, kaç görsel, ne kadar JavaScript, PDF veya video ile uğraşmak gerekecek mi. Bu gruplama hem indirme sıranızı hem de son eksiksizlik kontrolünüzü belirler.
Archive.org'dan tüm bir web sitesini eksiksiz indirmek için kontrol listesi
- Alan adı için CDX envanterini çekin, HTTP 200 yakalamalarına filtreleyin ve tam tarih aralığınızı kapsayacak şekilde alın.
- Yinelenen içerik özetlerini daraltın; aynı dosyalar yüzlerce kez değil, bir kez indirilsin.
- Listeyi MIME türüne göre gruplayın: önce HTML sayfaları, sonra CSS, JS, görseller, yazı tipleri, belgeler, medya.
- Her dosyayı kendi en iyi yakalamasından indirin; wayback'in eklediği işaretleme olmadan orijinal baytları almak için id_ değiştiricisini kullanın.
- Dahili bağlantıları göreli yollara dönüştürün; böylece kopya dizüstü bilgisayarınız dahil herhangi bir sunucuda çalışır.
- Klasörü yerel olarak sunun ve içinde tıklayarak gezinin. Kırık bağlantılar, eksik görseller ve yazı tipi 404'leri dakikalar içinde ortaya çıkar.
- Son dosya sayısını envanterle karşılaştırın; eksik olanları ve nedenlerini yazın.

Son adım herkesin atladığı adımdır ve bir yedekle dosya yığını arasındaki farkı oluşturur. Manifest, 'her şeyi aldığımı düşünüyorum' ifadesini denetlenebilir bir listeye dönüştürür. Restorix platformu bunu işin içine entegre eder: ücretsiz tahmin, başlamadan önce arşivlenen tam dosya sayısını ve toplam boyutu raporlar; geri yükleme ise getirdiği her dosyanın JSON veya SQLite manifestini dışa aktarabilir. Böylece eksiksizlik bir his değil, bir sayıdır.
Yine de karşılaşacağınız eksikler
- Tarayıcının hiç bulamadığı sayfalar. Herhangi bir şey, halka açık web'de o sayfaya bağlantı vermediyse, wayback onu büyük olasılıkla hiç görmemiştir.
- Robots.txt dışlamaları. Eski taramalar, izin verilmeyen yolları tamamen atlamıştı; bazı siteler ise arşivlenmeyi kasten engellemişti.
- JavaScript ile oluşturulan içerik. Tarayıcılar tarihsel olarak HTML kabuğunu saklardı, betiklerin sonradan inşa ettiği şeyleri değil.
- Oturum açma, sepet ve arama sonuçları. POST isteğinin veya oturumun arkasındaki her şey, tarayıcının aşamadığı bir duvardır.
- URL gürültüsü. Oturum kimlikleri ve izleme parametreleri envanteri binlerce 'sayfa' ile şişirir; aslında bunlar birkaç gerçek sayfaya indirgenir.
Bunların hiçbiri yönteminizin başarısızlığı değildir, arşivin kendisindeki boşluklardır. Envanterin değeri, herhangi birine eksiksiz bir geri yükleme sözü vermeden önce o boşlukları göstermesidir.
Boşlukları bulduğunuzda, onları belgelendirin. Hiç yakalanmamış on iki sayfayı, yalnızca küçük resmi kalan videoyu ve robots.txt ile engellenen forum bölümünü listeleyen tek sayfalık bir not, utanç verici bir sürprizi yönetilebilir bir beklentiye dönüştürür. Müşteriler eksik dosyaları affeder. Onları kendi başlarına keşfetmeyi asla affetmezler.
Eksiksiz bir kopyanın değeri
Site, bir müşterinin mağazası ya da on yıllık gönderileri olan bir topluluk forumuysa, yarım indirme yedek gibi görünen bir sorumluluktur. Kontrol listesini kendiniz çalıştıracak saatleri bütçeleyin ya da tarama, zaman damgası eşleştirme, bağlantı yeniden yazma ve manifest oluşturma işlerini tam olarak bu iş için tasarlanmış bir araca bırakın. Tahmin ücretsizdir; alternatif ise site yayına geçtikten sonra eksik 300 görseli keşfetmektir.
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
FAQ
Archive.org'dan tüm bir web sitesini tek tıkla indirebilir miyim?
Archive.org'un kendisi tüm site dışa aktarımı sunmaz, tekil yakalamaları gezinmek için tasarlanmıştır. Tek tıkla sonuçlar, arşivin dizinini listeleyen ve her dosyayı getiren araçlardan gelir: wayback-machine-downloader gibi betikler ya da varlıkları, bağlantı yeniden yazımını ve manifesti de üstlenen Restorix gibi geri yükleme hizmetleri.
Archive.org'dan tüm bir web sitesini indirdikten sonra neden görseller eksik?
Genellikle iki nedenden biridir. Ya görsel hiç taranmamıştır, dolayısıyla hiçbir yerde kopyası yoktur; ya da aracınız sayfayı bir zaman damgasından getirmiştir ve görselin ayakta kalan tek yakalaması başka bir zaman damgası altındadır. Zaman damgaları arası varlık eşleştirmesi ikinci durumu çözer; birinci durumu çözen bir şey yoktur.
Wayback Machine bir web sitesinin her sayfasını arşivler mi?
Hayır. Tarayıcılarının ulaşabildiklerini arşivler: bir yerden bağlantı verilmiş, robots.txt tarafından izin verilmiş, oturum açma veya yoğun JavaScript olmadan oluşturulmuş sayfalar. Derin forum başlıkları, filtreli arama sayfaları ve yönetim alanları rutin olarak eksiktir. CDX envanteri, başlamadan önce tam olarak neyin var olduğunu gösterir.
Eksiksiz bir web sitesi indirme genellikle kaç dosyayı kapsar?
İnsanların beklediğinden fazla. Mütevazı 50 sayfalık bir iş sitesi, görseller, stil dosyaları, betikler ve yazı tipleri sayıldığında çoğu zaman 400-800 dosyaya ulaşır. Forumlar ve mağazalar on binleri bulur. İndirme süresini ve maliyetini belirleyen sayfa sayısı değil, dosya sayısıdır.
PDF'ler, videolar ve diğer indirilebilir dosyalar arşive dahil mi?
Çoğunlukla evet. Arşiv, ulaşabildiği belgeleri ve medyayı saklar; CDX dizini de bunları sayfaların yanı sıra MIME türüne göre listeler. Büyük videolar istisnadır, tutarsız şekilde taranmışlardır, bu yüzden hayatta kaldıklarını varsaymak yerine envanterde doğrulayın.
İlgili rehberler

download a website from archive org
Archive.org'dan Bir Web Sitesi Nasıl İndirilir: 3 İşe Yarayan Yöntem
Archive.org'dan web sitesi indirmenin üç kanıtlanmış yolu: sayfaları elle kaydetmek, CDX API'sine betik yazmak veya otomatik bir geri yükleme çalıştırmak. Her biri için gerçekçi süre tahminleri.

archive.org download website
Archive.org Web Sitesi İndirme Araçları: Dürüst Bir Karşılaştırma
HTTrack, wayback-machine-downloader betikleri ve Restorix hakkında dürüst bir archive.org web sitesi indirme karşılaştırması. Gerçek maliyetler, emek ve varlık yönetimi.

find all pages on a website
Bir Web Sitesindeki Tüm Sayfaları Bulma (Silinmiş Olanlar Dahil)
Bir web sitesindeki tüm sayfaları, kimsenin bağlantı vermediği sayfalar dahil, bulmanız mı gerekiyor? Site haritalarını, tarayıcıları, Wayback CDX API'yi ve Search Console dışa aktarımlarını karşılaştırın.

wayback download
Wayback İndirme: Her Yöntem Emeye Göre Sıralandı
Her wayback indirme yöntemi emeğe göre sıralandı: tekil sayfalar, wget betikleri, CDX API ve tüm siteyi sizin için yeniden inşa eden otomatik hizmetler.
