Format Unduhan Archive.org: WARC, CDX & File Tunggal
Oleh tim editorial Restorix · 28 Juni 2026 · 7 menit baca

Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Anda menemukan hasil crawl, menekan tombol unduh, dan sekarang Anda sedang menatap file 900 MB berekstensi.warc.gz yang tidak bisa dibuka oleh apa pun di komputer Anda. Selamat datang di bagian Archive.org yang paling minim dokumentasinya: format-formatnya. Perpustakaan ini memberikan data tangkapan mentah, dan data tangkapan mentah mengharuskan Anda membawa peralatan sendiri.
Tiga format mencakup hampir semua hal yang akan Anda unduh: file WARC, output JSON CDX, dan file tunggal biasa. Berikut apa sebenarnya masing-masing format itu, kapan Anda membutuhkannya, dan cara mengubahnya menjadi sesuatu yang berguna, termasuk jalan pintas saat Anda hanya ingin situs lama Anda kembali.
Apa yang Sebenarnya Dikandung Unduhan Archive.org
Dua dunia penyimpanan lagi. Unduhan item memberikan Anda file jadi, PDF adalah PDF, ISO adalah ISO. Unduhan sisi Wayback memberikan data tangkapan web: respons HTTP yang dibekukan pada waktu crawl, beserta indeks yang menjelaskannya. Format-format yang membingungkan semuanya datang dari dunia kedua, ditambah ada jalan keluar berupa file tunggal yang menjembatani keduanya.
Ukuran penting untuk perencanaan. Satu segmen WARC dari koleksi crawl berukuran sekitar 1 GB dalam kondisi terkompresi. Daftar CDX situs berukuran sedang bisa jadi 50.000 baris JSON. File tunggal ya, satu file. Cocokkan format dengan pekerjaan sebelum Anda mulai transfer, bukan sesudah, mengunduh ulang satu gigabita karena salah mengambil adalah ritual inisiasi yang sebaiknya dilewati.
WARC: Format Tangkapan Mentah
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
WARC, Web ARChive, standar ISO 28500, adalah wadah yang menggabungkan record. Setiap record adalah satu transaksi HTTP yang ditangkap: header respons diikuti dengan byte payload persisnya, ditambah metadata seperti waktu tangkapan dan URL target. Record-record hadir dalam beberapa tipe, response, resource, metadata, warcinfo, dan file hampir selalu datang dalam bentuk gzip, satu record per anggota gzip, sehingga alat bisa melakukan seek tanpa mendekompresi seluruh arsip.
- Tidak ada yang dirender atau dibersihkan. Anda mendapatkan byte per byte apa yang dilihat crawler, termasuk halaman 404 dan rantai redirect.
- Satu WARC memuat ribuan URL yang sering kali tidak berhubungan dari sebuah crawl, situs Anda mungkin hanya 2% dari file tersebut.
- Anda butuh peralatan untuk membacanya: library Python warcio untuk ekstraksi, atau ReplayWeb.page dan pywb untuk memainkannya sebagai halaman yang bisa dijelajahi.
Ekstraksi dengan warcio adalah loop penyaringan: buka arsip, lewati record yang URL targetnya di luar domain Anda, tulis payload ke disk dengan mengikuti path asli, dedupe digest yang identik. Lima puluh baris Python, atau satu malam panjang untuk memahami mengapa orang membayar untuk ini.
Dari mana sebenarnya Anda mendapatkan WARC? Dua tempat. Crawl救援 Archive Team dan koleksi crawl Internet Archive mengirimkannya sebagai file item biasa, cari.warc.gz di kotak unduh item. Dan jika Anda pernah memesan atau mengekspor crawl sendiri, WARC adalah yang akan kembali. Ini adalah kontainer pengiriman dunia pengarsipan web: jelek, terstandar, dan ada di mana-mana.

JSON CDX: Indeksnya, Bukan Kontennya
CDX adalah katalog kartu Wayback Machine. Akses web.archive.org/cdx/search/cdx?url=example.com&output=json dan Anda akan mendapatkan array JSON di mana setiap baris mendeskripsikan satu tangkapan: urlkey, timestamp, URL asli, mimetype, statuscode, digest, dan ukuran byte. Tidak ada konten halaman sama sekali, hanya menu presisi tentang apa yang ada, tangkapan demi tangkapan.
Dua flag yang selalu berguna di setiap query: filter=statuscode:200 menghilangkan halaman redirect dan error, dan collapse=digest menghapus tangkapan duplikat dari konten identik. Di toko WooCommerce seorang klien, dua flag ini memangkas 38.000 baris mentah menjadi 4.100 halaman unik yang sebenarnya. Daftar itu menjadi rencana pemulihan, dan estimasi harganya.
Trik query yang layak diketahui: tambahkan matchType=prefix untuk mencakup setiap URL di bawah sebuah path, dan gunakan from=2008&to=2012 untuk membatasi tahun. Wildcard seperti url=example.com/* sudah menyiratkan pencocokan prefix di seluruh domain. Mulai dari yang sempit, query domain tanpa filter di situs besar mengembalikan megabita JSON dan tab browser yang membeku.
- Scoping: seberapa banyak situs yang pernah ditangkap, dan di tahun berapa.
- Analisis gap: menemukan direktori gambar dan host CDN yang tidak pernah di-crawl.
- Daftar fetch batch: berikan pasangan timestamp dan URL ke downloader Anda, satu permintaan id_ masing-masing.
- Estimasi: Restorix membaca data CDX yang sama ini untuk menentukan harga pemulihan, jumlah file, total ukuran, harga terkunci, di muka.

File Tunggal: Unduhan Archive.org yang Mudah
Format ketiga ini hampir bukan format: satu file asli, diambil langsung. Untuk item, itulah link file di kotak unduh. Untuk snapshot, itulah trik id_, sisipkan id_ setelah timestamp, seperti web.archive.org/web/20130501000000id_/http://example.com/logo.png, dan Wayback Machine mengembalikan payload yang tidak tersentuh tanpa toolbar dan tanpa markup yang ditulis ulang.
Gunakan file tunggal saat Anda sudah tahu persis apa yang hilang: stylesheet yang tidak ter-crawl, daftar harga PDF, gambar utama yang terus ditanyakan klien. Saya menyimpan folder coret-coretan berisi file-file ini per proyek. Yang tidak boleh Anda lakukan adalah membangun seluruh situs dengan cara ini, 4.000 fetch id_ manual adalah script yang meminta untuk ditulis.
Dua mode kegagalan yang bisa diantisipasi. Di sisi snapshot, id_ hanya berfungsi jika URL tersebut benar-benar ditangkap, periksa indeks CDX dulu alih-alih menebak URL. Di sisi item, pola URL langsung archive.org/download/{identifier}/{filename} stabil dan bisa di-script, tetapi nama file dengan spasi memerlukan URL encoding yang benar atau wget akan 404 pada file yang jelas ada.
Format Unduhan Archive.org Mana yang Anda Butuhkan?
| Format | Isi | Cocok untuk | Peralatan |
|---|---|---|---|
| WARC (.warc.gz) | Respons HTTP mentah dalam jumlah besar | Seluruh crawl, arsip offline | warcio, pywb, ReplayWeb.page |
| JSON CDX | Metadata tangkapan saja | Scoping, analisis gap, daftar fetch | Klien HTTP apa pun plus script |
| File tunggal / id_ | Satu payload asli | Aset hilang yang ditargetkan | Browser atau wget |
| Unduhan item | File jadi (PDF, ISO, MP3) | Buku, perangkat lunak, media | Tidak ada, klik dan jadi |
Rantai ketergantungan yang jujur untuk pemulihan situs web adalah CDX dulu, fetch WARC atau id_ kedua, file tunggal untuk menambal lubang terakhir. Melewatkan langkah CDX adalah cara Anda mengunduh satu gigabita data crawl dan tetap kehilangan separuh situs. Unduhan item berada di luar rantai ini sepenuhnya, itu adalah barang jadi, dan jika yang Anda butuhkan adalah buku atau driver, berhenti membaca dan langsung klik.
Bekerja dengan Apa yang Anda Unduh
Jebakan yang menyerang semua orang suatu saat. WARC yang digzip bersifat multi-member, gunzip naif bisa dipakai, tetapi pembaca streaming tidak boleh berhenti di anggota pertama. Digest berulang di lintas tangkapan, jadi dedupe sebelum menghitung file atau total Anda akan berbohong. Encoding karakter dari tahun 2004 bukanlah UTF-8; biarkan byte sebagai byte sampai Anda benar-benar harus mendekode. Dan setiap URL yang ditulis ulang Wayback di dalam HTML yang ditangkap masih menunjuk ke web.archive.org sampai Anda menulis ulangnya kembali.
Rencanakan struktur output sebelum mengekstrak: tiru path URL asli, simpan manifes payload mana yang berasal dari record mana, dan jangan pernah menimpa varian yang mungkin Anda butuhkan nanti. Restorix dapat mengekspor manifes persis seperti ini (JSON atau SQLite) di setiap pemulihan, melakukannya secara manual, Anda akan memahami mengapa fitur itu ada.
Atau Lewati Seluruh Pergulatan Format Ini
Semua hal di atas bisa dipelajari, dan tidak ada yang merupakan penggunaan akhir pekan yang baik bagi pemilik bisnis. layanan pemulihan website ini ada untuk lapisan ini: ia membaca data CDX, mengambil tangkapan, melakukan dedupe, menulis ulang link, dan menyerahkan situs yang berfungsi. Estimasi gratis menunjukkan jumlah file yang diarsipkan, total ukuran, dan harga terkunci sebelum Anda membayar, file pertama dipulihkan gratis, bayar per file setelahnya, pengembalian dana otomatis ke saldo jika ada yang gagal.
Opsi pemulihan memetakan satu-satu ke titik-titik masalah di atas: link internal relatif alih-alih URL archive.org, konversi HTTPS, penghapusan analitik dan iklan lama, mempertahankan redirect 301 tetap utuh. Deploy sekali klik ke SSH/SFTP, FTP/FTPS, atau S3 dari dashboard pemulihan, dan CMS bawaan di /webarchive-cms.php, kata sandi yang dibuat secara acak, mode aman aktif secara default, berarti Anda bisa mengedit situs yang dihidupkan kembali tanpa menyentuh satu baris pun peralatan WARC. Format adalah untuk arsiparis. Anda ingin situs Anda kembali.
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
FAQ
Apa itu file WARC dan bagaimana cara membukanya?
WARC adalah wadah standar ISO berisi respons HTTP yang ditangkap, header ditambah byte payload persisnya, biasanya digzip. Buka dengan library Python warcio untuk mengekstrak file, atau mainkan sebagai halaman yang bisa dijelajahi dengan ReplayWeb.page atau pywb. Klik dua kali tidak akan melakukan apa pun; tidak ada penampil desktop bawaan.
Apa arti field dalam output JSON CDX?
Setiap baris adalah satu tangkapan: urlkey (URL yang sudah dinormalisasi), timestamp (waktu tangkapan, yyyyMMddhhmmss), original (URL sesuai crawl), mimetype, statuscode, digest (hash konten, digest identik berarti byte identik), dan length (ukuran record terkompresi). Ini mendeskripsikan tangkapan; tidak mengandung konten halaman itu sendiri.
Bagaimana cara mendapatkan file asli tanpa HTML yang ditulis ulang Wayback?
Gunakan modifier id_: sisipkan tepat setelah timestamp di URL snapshot mana pun dan arsip akan mengembalikan payload yang tidak dimodifikasi, tanpa toolbar, tanpa link yang ditulis ulang. Ini berfungsi untuk halaman, gambar, CSS, apa pun yang ditangkap.
Bisakah saya mengubah unduhan Archive.org kembali menjadi situs web yang berfungsi?
Ya, dengan usaha: enumerasi tangkapan via CDX, ekstrak payload dari WARC atau fetch id_, tulis ulang link, tambal aset yang hilang, lalu deploy. Untuk beberapa halaman itu malam yang menyenangkan. Untuk situs sungguhan, layanan pemulihan seperti Restorix mengotomasi seluruh rantai dan menunjukkan harga sebelum ada yang ditagih.
Seberapa besar unduhan Archive.org untuk situs pada umumnya?
Lebih kecil dari yang Anda takutkan, biasanya. Situs brosur 200 halaman berusia lima tahun sering kali totalnya 200-800 MB di seluruh tangkapan; setelah dedupe, konten unik mungkin hanya 60 MB. Daftar CDX memberi Anda angka sebenarnya sebelum Anda mengunduh apa pun, selalu lakukan scoping dulu.
Panduan terkait

download archive org
Cara Mengunduh dari Archive.org: Item, Snapshot, dan Lainnya
Setiap cara praktis untuk mengunduh konten Archive.org, file item, unduhan massal via CLI, dan snapshot web Wayback, serta cara memilih yang tepat untuk kebutuhan Anda.

archive.org download website
Alat Unduh Website Archive.org: Perbandingan Jujur
Perbandingan jujur alat unduh website archive.org: HTTrack, skrip wayback-machine-downloader, dan Restorix. Biaya, usaha, dan penanganan aset yang sebenarnya.

wayback download
Download Wayback: Setiap Metode Diurutkan Berdasarkan Tingkat Usaha
Setiap metode download Wayback diurutkan berdasarkan tingkat usaha: halaman tunggal, skrip wget, CDX API, dan layanan otomatis yang membangun ulang seluruh situs untuk Anda.

restore website from archive.org
Memulihkan Situs Web dari Archive.org: DIY atau Jasa Langsung?
Haruskah Anda memulihkan situs web dari Archive.org sendiri atau membayar jasa langsung? Perbandingan jujur mengenai biaya, waktu, keahlian, dan risiko, serta kerangka pengambilan keputusan.
