Archive.org İndirme Biçimleri: WARC, CDX ve Tek Dosyalar
Restorix editör ekibi tarafından · 28 Haziran 2026 · 6 dakika okuma

Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
Taramayı buldunuz, indirdiniz ve şimdi makinenizde hiçbir şeyin açamadığı.warc.gz uzantılı 900 MB'lık bir dosyaya bakıyorsunuz. Archive.org'un en az belgelenmiş kısmına hoş geldiniz: biçimler. Kütüphane ham yakalama verisi dağıtır ve ham yakalama verisi kendi araçlarınızı getirmenizi bekler.
Üç biçim, hiç çekeceğiniz neredeyse her şeyi kapsar: WARC dosyaları, JSON CDX çıktısı ve düz tek dosyalar. İşte her birinin gerçekte ne olduğu, ne zaman işinize yarayacağı ve nasıl yararlı bir şeye dönüştürebileceğiniz, eski sitenizi geri istediğinizde kullanabileceğiniz kısa yolu da dahil.
Bir Archive.org İndirmesi Gerçekte Ne İçerir?
Yine iki depolama dünyası. Öğe indirmeleri size bitmiş dosyalar verir, bir PDF PDF'dir, bir ISO ISO'dur. Wayback tarafı indirmeleri ise web yakalama verisi verir: tarama zamanında dondurulmuş HTTP yanıtları ve bunları tanımlayan dizinler. Kafa karıştırıcı biçimlerin hepsi bu ikinci dünyadan gelir; ayrıca her ikisini köprüleyen bir tek dosya kaçış kapağı vardır.
Planlama için boyutlar önemlidir. Bir tarama koleksiyonundan tek bir WARC parçası sıkıştırılmış halde yaklaşık 1 GB'dir. Orta ölçekli bir sitenin CDX listesi 50.000 satır JSON olabilir. Tek dosya ise, işte, tek bir dosyadır. Aktarımı başlatmadan önce, başlattıktan sonra değil, biçimi işe göre eşleştirin; yanlış şeyi indirdiğiniz için bir gigabaytı yeniden indirmek atlanması en iyi bir geçiş ritüelidir.
WARC: Ham Yakalama Biçimi
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
WARC, Web ARChive, ISO standardı 28500, kayıtları uç uca ekleyen bir kapsayıcıdır. Her kayıt, tek bir yakalanmış HTTP değişimidir: yanıt başlıkları ve ardından tam yük baytları, artı yakalama zamanı ve hedef URL gibi meta veriler. Kayıtlar tiplere göre gelir, response, resource, metadata, warcinfo, ve dosyalar neredeyse her zaman gzipped olarak gelir, kayıt başına bir gzip üyesi, böylece araçlar tüm arşivi açmadan konumlanabilir.
- Hiçbir şey işlenmez veya temizlenmez. Tarayıcının gördüğü şeyi bayt bayt alırsınız; 404 sayfaları ve yönlendirme zincirleri dahil.
- Tek bir WARC, bir taramadan gelen binlerce çoğu zaman alakasız URL içerir, siteniz dosyanın %2'si olabilir.
- Okumak için araç gerektirir: çıkarma için Python warcio kütüphanesi veya gezilebilir sayfalar olarak yeniden oynatmak için ReplayWeb.page ve pywb.
warcio ile çıkarma bir filtre döngüsüdür: arşivi açın, hedef URL'si alanınızın dışında olan kayıtları atlayın, yükleri orijinal yolları yansıtacak şekilde diske yazın, özdeş özetleri tekilleştirin. Elli satır Python, ya da insanların neden bunun için para ödediğini öğrenmenin uzun bir akşamı.
WARC'leri nereden alırsınız? İki yerden. Archive Team kurtarma taramaları ve Internet Archive tarama koleksiyonları onları sıradan öğe dosyaları olarak sunar, öğenin indirme kutusunda.warc.gz arayın. Ve kendi taramanızı yaptırır veya dışa aktarırsanız, geri gelen şey WARC'dir. Web arşivleme dünyasının taşıma konteyneridir: çirkin, standartlaştırılmış ve her yerde.

JSON CDX: İçerik Değil, Dizin
CDX, Wayback Machine'in kart kataloğudur. web.archive.org/cdx/search/cdx?url=example.com&output=json sorgulayın ve her satırın tek bir yakalamayı tanımladığı bir JSON dizisi alırsınız: urlkey, timestamp, original URL, mimetype, statuscode, digest ve bayt uzunluğu. Hiç sayfa içeriği yok, sadece neyin var olduğunun, yakalama yakalama kesin bir menüsü.
Her sorguda iki bayrak değerini kanıtlar: filter=statuscode:200 yönlendirmeleri ve hata sayfalarını atar, collapse=digest özdeş içeriğin yinelenen yakalamalarını kaldırır. Bir müşterinin WooCommerce mağazasında bu iki bayrak 38.000 ham satırı 4.100 gerçek, benzersiz sayfaya indirdi. O liste geri yükleme planı, ve fiyat tahmini oldu.
Bilinmeye değer sorgu hileleri: bir yol altındaki her URL'i kapsamak için matchType=prefix ekleyin ve yılları sınırlamak için from=2008&to=2012 kullanın. url=example.com/* gibi bir joker zaten tüm alan adında önek eşleşmesi anlamına gelir. Dar başlayın, büyük bir sitede filtrelenmemiş bir alan adı sorgusu megabaytlarca JSON ve donmuş bir tarayıcı sekmesi döndürür.
- Kapsam: sitenin ne kadarının hiç yakalandığı ve hangi yıllarda.
- Boşluk analizi: hiç taramayan görsel dizinlerini ve CDN sunucularını bulma.
- Toplu getirme listeleri: zaman damgalı artı URL çiftlerini indiricinize besleyin, her biri için bir id_ isteği.
- Tahminler: Restorix bir geri yükleme fiyatlandırmak için aynı CDX verisini okur, dosya sayısı, toplam boyut, kilitli fiyat, peşin.

Tek Dosyalar: Kolay Archive.org İndirmesi
Üçüncü biçim neredeyse bir biçim değil: doğrudan alınan tek bir orijinal dosya. Öğeler için bu, indirme kutusundaki dosya bağlantısıdır. Anlık görüntüler için bu, id_ hilesidir, zaman damgasından hemen sonra id_ ekleyin, örneğin web.archive.org/web/20130501000000id_/http://example.com/logo.png, ve Wayback Machine araç çubuğu veya yeniden yazılmış işaretleme olmadan dokunulmamış yükü döndürür.
Tam olarak neyin eksik olduğunu zaten bildiğinizde tek dosyalara uzanın: taramayan stil sayfası, PDF fiyat listesi, bir müşterinin sürekli sorduğu hero görseli. Proje başına bunlardan bir karalama klasörü tutarım. Yapmamanız gereken şey tüm siteyi bu şekilde kurmaktır, 4.000 manuel id_ getirme, yazılmayı bekleyen bir betiktir.
Beklemeniz gereken iki başarısızlık modu. Anlık görüntü tarafında, id_ yalnızca o tam URL yakalandıysa çalışır, URL tahmin etmek yerine önce CDX dizinini kontrol edin. Öğe tarafında, doğrudan URL kalıbı archive.org/download/{identifier}/{filename} kararlı ve betiklenebilirdir, ancak boşluk içeren dosya adları düzgün URL kodlaması gerektirir yoksa wget açıkça var olan bir dosyada 404 verir.
Hangi Archive.org İndirme Biçimine İhtiyacınız Var?
| Biçim | İçerir | En iyi kullanım | Araçlar |
|---|---|---|---|
| WARC (.warc.gz) | Toplu ham HTTP yanıtları | Tüm taramalar, çevrimdışı arşivler | warcio, pywb, ReplayWeb.page |
| JSON CDX | Yalnızca yakalama meta verisi | Kapsam, boşluk analizi, getirme listeleri | Herhangi bir HTTP istemcisi artı bir betik |
| Tek dosya / id_ | Tek bir orijinal yük | Hedeflenmiş eksik varlıklar | Tarayıcı veya wget |
| Öğe indirme | Bitmiş dosyalar (PDF, ISO, MP3) | Kitaplar, yazılım, medya | Yok, tıkla ve git |
Bir web sitesi geri yüklemesi için dürüst bağımlılık zinciri şudur: önce CDX, ikinci olarak WARC veya id_ getirmeleri, son olarak boşlukları yamamak için tek dosyalar. CDX adımını atlamak, bir gigabayt tarama verisi indirip sitenin yarısını yine kaçırmanızın yoludur. Öğe indirmeleri bu zincirin tamamen dışındadır, onlar bitmiş ürünlerdir ve ihtiyacınız olan bir kitap veya sürücü ise okumayı bırakın ve tıklamaya gidin.
İndirdiğiniz Şeyle Çalışmak
Herkesi bir kez ısıran tuzaklar. Gzipped WARC'ler çok üyelidir, naif bir gunzip çalışır, ama akışlı okuyucular ilk üyede durmamalıdır. Özetler yakalamalar arasında tekrar eder, bu yüzden dosyaları saymadan önce tekilleştirin yoksa toplamlarınız yalan söyler. 2004'ten kalma karakter kodlamaları UTF-8 değildir; kod çözmek zorunda kalana kadar baytları bayt olarak tutun. Ve yakalanan HTML'in içindeki her Wayback tarafından yeniden yazılmış URL, siz onu geri yazana kadar hâlâ web.archive.org'u işaret eder.
Çıkarmadan önce çıktı yapısını planlayın: orijinal URL yollarını yansıtın, hangi yükün hangi kayıttan geldiğini gösteren bir manifest tutun ve daha sonra ihtiyacınız olabilecek bir varyantı asla üzerine yazmayın. Restorix her geri yüklemede tam bu tür bir manifest (JSON veya SQLite) dışa aktarabilir, elle yaparsanız, bu özelliğin neden var olduğunu anlarsınız.
Veya Biçim Mücadelesini Tamamen Atlayın
Yukarıdakilerin hepsi öğrenilebilir ve hiçbiri bir işletme sahibinin hafta sonunun iyi bir kullanımı değildir. bu geri yükleme hizmeti tam bu katman için vardır: CDX verisini okur, yakalamaları çeker, tekilleştirir, bağlantıları yeniden yazar ve size çalışan bir site verir. Ücretsiz tahmin, ödemeden önce arşivlenen dosya sayısını, toplam boyutu ve kilitli fiyatı gösterir, ilk dosya ücretsiz geri yüklenir, sonrasında dosya başına ödeme, herhangi bir başarısızlıkta bakiyeye otomatik iade.
Geri yükleme seçenekleri yukarıdaki acı noktalarıyla birebir eşleşir: archive.org URL'leri yerine göreli iç bağlantılar, HTTPS dönüşümü, eski analitik ve reklamların kaldırılması, 301 yönlendirmelerinin korunması. Dağıtım, geri yükleme panelinden SSH/SFTP, FTP/FTPS veya S3'ye tek tıkla yapılır ve /webarchive-cms.php konumundaki paket CMS, rastgele oluşturulmuş parola, varsayılan olarak güvenli mod, WARC araçlarına tek satır dokunmadan canlandırılmış siteyi düzenleyebileceğiniz anlamına gelir. Biçimler arşivciler içindir. Siz sitenizi geri istiyorsunuz.
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
FAQ
WARC dosyası nedir ve nasıl açarım?
WARC, yakalanan HTTP yanıtlarının ISO standart kapsayıcısıdır, başlıklar artı tam yük baytları, genellikle gzipped. Dosyaları çıkarmak için Python warcio kütüphanesiyle açın veya ReplayWeb.page veya pywb ile gezilebilir sayfalar olarak yeniden oynatın. Çift tıklamak hiçbir şey yapmaz; yerel bir masaüstü görüntüleyicisi yoktur.
JSON CDX çıktısındaki alanlar ne anlama gelir?
Her satır tek bir yakalamadır: urlkey (kanonikleştirilmiş URL), timestamp (yakalama zamanı, yyyyMMddhhmmss), original (taramadaki haliyle URL), mimetype, statuscode, digest (içerik karması, özdeş özetler özdeş baytlar anlamına gelir) ve length (sıkıştırılmış kayıt boyutu). Yakalamaları tanımlar; kendisi sayfa içeriği içermez.
Wayback'in yeniden yazılmış HTML'i olmadan orijinal dosyayı nasıl alırım?
id_ değiştiricisini kullanın: herhangi bir anlık görüntü URL'sinde zaman damgasından hemen sonra ekleyin ve arşiv değiştirilmemiş yükü döndürür, araç çubuğu yok, yeniden yazılmış bağlantı yok. Sayfalar, görseller, CSS, yakalanan her şey için çalışır.
Bir Archive.org indirmesini tekrar çalışan bir web sitesine dönüştürebilir miyim?
Evet, çabayla: CDX aracılığıyla yakalamaları numaralandırın, WARC veya id_ getirmelerinden yükleri çıkarın, bağlantıları yeniden yazın, eksik varlıkları yamalayın, sonra dağıtın. Bir avuç sayfa için bu eğlenceli bir akşamdır. Gerçek bir site için Restorix gibi bir geri yükleme hizmeti tüm zinciri otomatikleştirir ve herhangi bir ücret alınmadan önce fiyatı gösterir.
Tipik bir sitenin Archive.org indirmesi ne kadar büyük?
Genellikle korktuğunuzdan küçük. Beş yaşında, 200 sayfalık bir broşür sitesi tüm yakalamalar boyunca çoğu zaman 200-800 MB'dir; tekilleştirildiğinde benzersiz içerik 60 MB olabilir. CDX listesi, herhangi bir şey indirmeden önce gerçek rakamları söyler, her zaman önce kapsamı belirleyin.
İlgili rehberler

download archive org
Archive.org'dan Nasıl İndirilir: Öğeler, Anlık Görüntüler ve Daha Fazlası
Archive.org içeriğinin her pratik indirme yolu, öğe dosyaları, toplu CLI çekimleri ve Wayback web anlık görüntüleri, ve işiniz için doğru olanı nasıl seçersiniz.

archive.org download website
Archive.org Web Sitesi İndirme Araçları: Dürüst Bir Karşılaştırma
HTTrack, wayback-machine-downloader betikleri ve Restorix hakkında dürüst bir archive.org web sitesi indirme karşılaştırması. Gerçek maliyetler, emek ve varlık yönetimi.

wayback download
Wayback İndirme: Her Yöntem Emeye Göre Sıralandı
Her wayback indirme yöntemi emeğe göre sıralandı: tekil sayfalar, wget betikleri, CDX API ve tüm siteyi sizin için yeniden inşa eden otomatik hizmetler.

restore website from archive.org
Archive.org'dan Web Sitesi Geri Yükleme: Kendin Yap mı, Hazır Hizmet mi?
Archive.org'dan bir web sitesini kendin mi geri yüklemelisin yoksa hazır hizmet mi almalısın? Maliyet, zaman, beceri ve risk açısından dürüst bir karşılaştırma ve bir karar çerçevesi.
