Cara Mengunduh dari Archive.org: Item, Snapshot, dan Lainnya
Oleh tim editorial Restorix · 28 April 2026 · 7 menit baca

Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Frasa 'mengunduh Archive.org' mencakup dua tugas yang sama sekali berbeda, dan mencampuradukkannya adalah alasan orang menghabiskan waktu sia-sia. Tugas pertama: mengambil file dari sebuah item, buku, driver, rekaman konser. Tugas kedua: mengekstrak situs web dari Wayback Machine. Yang pertama punya tombol unduh. Yang kedua sama sekali tidak.
Saya melakukan keduanya setiap minggu, untuk pemulihan klien dan riset. Berikut adalah setiap metode yang masih berfungsi, dengan kelebihan dan kekurangannya yang jujur: mana yang satu klik, mana yang baris perintah, dan mana yang jebakan berkedok tombol unduh.
Dua Cara Mengunduh dari Archive.org
Archive.org menyimpan konten sebagai item, paket file mandiri dengan metadata, seperti folder berlabel di rak. Wayback Machine menyimpan tangkapan, salinan bercap waktu dari URL individu, yang ditampilkan dengan tautan yang ditulis ulang. Item dibuat untuk diunduh. Tangkapan dibuat untuk dilihat di browser.
Semua yang bisa Anda lakukan berawal dari pembagian tersebut. Unduhan item didukung secara resmi: tombol, torrent, CLI, API metadata. 'Unduhan' snapshot sebenarnya adalah rekonstruksi, Anda bertanya ke API CDX apa yang ada, mengambil byte asli setiap URL, lalu memperbaiki tautannya. Perkakas yang berbeda, mode kegagalan yang berbeda, alokasi waktu yang berbeda.
Tidak yakin di dunia mana Anda berada? Lihat URL-nya. archive.org/details/sesuatu adalah item, bisa diunduh. web.archive.org/web/2012/http://example.com adalah snapshot, bisa dilihat. Arsip yang sama, dua skema alamat, dua aturan main.
Mengunduh Item Archive.org dengan Cara Sederhana
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Buka halaman item apa pun dan lihat kotak unduhan di sebelah kanan. Anda mendapatkan file individual, biasanya tautan torrent, dan terkadang pintasan ZIP atau teks lengkap. Untuk satu PDF atau satu ISO, klik filenya. Selesai. Ini adalah satu-satunya bagian dari pengunduhan Archive.org yang berfungsi sesuai harapan orang.
- Klik 'SHOW ALL' untuk melihat semua file dalam item, termasuk log dan format turunan yang disembunyikan oleh kotak.
- URL langsung dapat diprediksi: archive.org/download/{identifier}/{filename}, sempurna untuk skrip dan wget.
- Opsi torrent seringkali mengalahkan HTTP untuk item berukuran multi-gigabyte, dan dapat melanjutkan unduhan dengan baik setelah koneksi terputus.
- Turunan adalah versi yang dihasilkan, teks OCR, MP4 yang lebih kecil. Unggahan asli ditandai demikian; ambil itu jika akurasi penting.
Satu trik lagi untuk pembuat skrip: tambahkan /metadata/{identifier} ke archive.org dan Anda akan mendapatkan daftar JSON dari setiap file, ukurannya, checksum, dan formatnya. JSON tersebut persis seperti yang dikonsumsi oleh alat baris perintah di balik layar.

Unduhan Massal dengan Internet Archive CLI
Untuk lebih dari segelintir item, pasang alat baris perintah resmi, paket Python internetarchive, yang menyediakan perintah ia. Alat ini menangani autentikasi, pelanjutan, dan percobaan ulang, dan ini adalah perbedaan antara menggunakan skrip dengan menghabiskan akhir pekan untuk mengklik.
- Pasang: pip install internetarchive, lalu jalankan ia configure sekali dengan akun Anda.
- Satu item: ia download {identifier} mencerminkan seluruh item ke folder lokal.
- Pilih yang spesifik: ia download {identifier} --glob='*.pdf', tidak ada lagi kejutan berukuran 40 GB.
- Seluruh pencarian: ia search 'collection:archiveteam AND year:2013' --itemlist > list.txt, lalu lakukan loop ia download pada file tersebut.
Batas kecepatan ada. CLI mencoba lagi dengan sopan dengan sendirinya; loop wget mentah Anda terhadap archive.org tidak akan melakukannya, dan terus memukul akan membuat Anda dibatasi atau diblokir. Jadilah yang sopan, arsip ini adalah nirlaba, bukan CDN.
Cara Mengunduh Snapshot Web Archive.org
Sekarang bagian yang sulit. Tangkapan Wayback bukan item, jadi tidak ada kotak unduhan. Anda memiliki empat rute realistis, berurutan berdasarkan usaha:
- Satu halaman, sekarang: buka snapshot dan gunakan fungsi simpan browser Anda. Bagus untuk satu halaman; salinan yang disimpan masih mengarahkan asetnya ke web.archive.org.
- Byte asli dari satu file: sisipkan id_ setelah cap waktu di URL snapshot, web.archive.org/web/20120501000000id_/http://example.com/style.css, dan Anda mendapatkan payload yang tidak dimodifikasi. Ideal untuk gambar, CSS, dan PDF individual.
- Penarikan ter-skrip: kueri API CDX untuk setiap URL yang ditangkap di bawah suatu jalur, lalu minta masing-masing dengan pengubah id_. Ini berfungsi, tetapi sekarang Anda merawat scraper, melakukan deduplikasi digest, dan menulis ulang tautan sendiri.
- Alat pengunduh dan layanan pemulihan: alat komunitas seperti gem wayback-machine-downloader mengotomatiskan loop CDX-plus-fetch; layanan pemulihan seperti Restorix melakukan itu plus pembersihan dan penyebaran ulang.
Perhatikan polanya: saat Anda menginginkan lebih dari satu atau dua halaman, Anda sedang menulis atau menjalankan perkakas. Tidak perlu malu dengan itu, hanya saja alokasikan waktu untuk itu dengan jujur.
Satu peringatan tentang trik id_, karena terlalu dilebih-lebihkan: trik ini memberi Anda byte asli dari satu respons itu, tetapi tidak memperbaiki apa pun. Halaman yang ditarik dengan id_ masih berisi URL absolut apa pun yang digunakan situs pada tahun 2012, masih merujuk aset yang tidak pernah diambil oleh crawler, dan masih mengasumsikan domain yang mungkin tidak lagi Anda miliki. Byte asli adalah bahan awal, bukan situs yang jadi.

Item vs. Snapshot Web: Kapan Menggunakan Masing-masing
| Anda ingin | Gunakan | Metode |
|---|---|---|
| Buku, lagu, driver, ISO | Item | Tombol unduh, torrent, atau ia download |
| Versi lama dari satu halaman | Snapshot | Simpan browser atau URL id_ |
| Satu gambar atau file CSS yang hilang | Snapshot | URL id_ langsung ke wget |
| Seluruh situs web yang mati | Set snapshot | API CDX ditambah perkakas, atau layanan pemulihan |
| Layanan yang sudah mati (era GeoCities) | Item plus snapshot | WARCs Archive Team, disilang-cek dengan CDX |
Baris terakhir itu mengejutkan orang: ketika Archive Team menyelamatkan host yang sekarat, hasilnya mendarat di arsip item sebagai file WARC raksasa. Situs web yang sama bisa menjadi unduhan item dan juga serangkaian snapshot. Periksa sisi itemnya terlebih dahulu, crawl yang sudah dikemas sebelumnya lebih baik daripada seribu pengambilan individual, dan panduan format kami menjelaskan apa yang harus dilakukan dengan WARC tersebut.
Kesalahan Unduhan yang Menghabiskan Waktu
- wget rekursif terhadap web.archive.org. Setiap tautan ditulis ulang untuk tetap berada di domainnya, sehingga crawler Anda dengan senang hati mengunduh antarmuka Wayback Machine itu sendiri sampai kiamat.
- Mengunduh seluruh item hanya untuk satu file. Klik 'SHOW ALL' membutuhkan sepuluh detik; ZIP 40 GB menghabiskan malam Anda.
- Mempercayai snapshot sebagai seluruh situs. Tangkapan dilakukan per-URL dan bersifat oportunistik, gambar yang dilayani dari subdomain CDN seringkali hilang sepenuhnya.
- Mengabaikan kode status dalam output CDX. Pengalihan dan 404 juga diarsipkan; saring ke statuscode:200 dan ciutkan digest, atau Anda akan memulihkan stub pengalihan sebagai halaman.
- Melewatkan checksum. Item mengirimkan file md5 dan sha1, verifikasi unduhan besar sebelum Anda membangun di atasnya.
- Mengasumsikan satu tanggal snapshot sudah cukup. Beranda 2011 dengan gambar 2009 itu normal; situs di-crawl secara terpisah-pisah, jadi bersiaplah untuk mencampur tanggal tangkapan untuk mendapatkan gambaran utuh.
Anda Punya Filenya. Selanjutnya Apa?
Unduhan item masuk langsung ke pustaka media atau toolchain Anda, bagian itu sudah selesai. Penarikan snapshot adalah tempat pekerjaan nyata dimulai: URL yang ditulis ulang, aset yang hilang, formulir kontak yang mati, campuran HTTP dan HTTPS. Mengubah folder berisi tangkapan tahun 2011 menjadi situs yang benar-benar bisa dimuat adalah pekerjaan pembangunan ulang, bukan pekerjaan unduhan.
Ini adalah titik di mana saya berhenti menulis skrip manual dan mulai mengarahkan orang ke Restorix. Estimasi gratis membaca arsip untuk Anda, jumlah file yang tepat, total ukuran, harga terkunci, sebelum Anda mengeluarkan uang sepeser pun. File pertama dipulihkan gratis, bayar per file setelahnya, isi ulang sekali bayar, tanpa langganan. Jika pemulihan atau penyebaran gagal, pengembalian dana masuk ke saldo Anda secara otomatis, tanpa perlu tiket dukungan.
Opsi pemulihan mencakup bagian rumit yang biasanya Anda skripkan: hapus analitik dan iklan, buat tautan relatif, paksa HTTPS, kanonikalisasi www, pertahankan pengalihan. Penyebaran satu klik mendorong hasilnya ke SSH/SFTP, FTP, atau S3, dan CMS file tunggal yang dibundel di /webarchive-cms.php memungkinkan Anda memperbaiki konten di tempatnya, tutorial memandu Anda melalui satu pekerjaan penuh. Unduhan mengakhiri pencarian; mereka tidak mengakhiri pekerjaan.
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
FAQ
Bisakah saya mengunduh seluruh situs web dari Archive.org?
Tidak dengan satu tombol. Situs web berada di sisi Wayback sebagai tangkapan per-URL, jadi mengunduh situs berarti menghitung URL melalui API CDX dan mengambil masing-masingnya, lalu memperbaiki tautan. Untuk apa pun lebih dari beberapa halaman, gunakan alat pengunduh atau layanan pemulihan, kami membandingkan opsinya di [mengunduh seluruh situs web dari Archive.org](/id/download-entire-website-from-archive-org).
Apakah mengunduh dari Archive.org legal?
Item domain publik dan Creative Commons jelas tidak masalah. Item berhak cipta tetap menjadi keputusan pemegang hak, mengunduh untuk penelitian pribadi umumnya ditoleransi, menerbitkan ulang tidak. Membangun kembali situs lama Anda dari tangkapannya adalah kasus sah klasik.
Apa perbedaan antara ia download dan torrent?
Byte yang sama, transportasi berbeda. Torrent unggul untuk item raksasa dan koneksi tidak stabil; CLI unggul untuk pembuatan skrip, pemfilteran --glob, dan pekerjaan batch di banyak identifier. Untuk satu item 200 MB, tombol unduh biasa mengalahkan keduanya.
Mengapa unduhan snapshot saya berisi URL web.archive.org di mana-mana?
Wayback Machine menulis ulang tautan agar halaman dirender di dalam playernya. Ambil dengan pengubah id_ untuk mendapatkan byte asli, atau jalankan pemulihan yang menulis ulang tautan kembali, opsi tautan-relatif Restorix ada tepat untuk pembersihan ini.
Bagaimana cara mengunduh seluruh koleksi, bukan satu item?
Buat daftar item dengan ia search 'collection:name' --itemlist, lalu jalankan ia download per identifier, dengan filter --glob untuk menyimpan hanya jenis file yang Anda inginkan. Bersiaplah membutuhkan waktu lama, koleksi besar bisa mencapai terabyte, jadi periksa statistik ukuran koleksi sebelum memulai.
Panduan terkait

archive org download
Format Unduhan Archive.org: WARC, CDX & File Tunggal
Apa yang sebenarnya dikandung setiap format unduhan Archive.org, tangkapan WARC, indeks JSON CDX, dan file asli tunggal, dan apa yang harus dilakukan dengan masing-masing.

download a website from archive org
Cara Mengunduh Situs Web dari Archive.org: 3 Metode yang Terbukti Berhasil
Tiga metode teruji untuk mengunduh situs web dari archive.org: menyimpan halaman secara manual, membuat skrip CDX API, atau menggunakan layanan pemulihan otomatis. Estimasi waktu realistis untuk setiap metode.

download entire website from archive org
Unduh Seluruh Situs Web dari Archive.org, Bukan Hanya Halaman Utama
Untuk mengunduh seluruh situs web dari archive.org, Anda membutuhkan setiap halaman, gambar, dan stylesheet. Aset tersembunyi di balik timestamp yang berbeda, berikut alasannya, beserta checklist lengkap.

wayback machine downloader
Alat Pengunduh Wayback Machine: Apa yang Benar-Benar Berfungsi
Tinjauan jujur tentang alat pengunduh Wayback Machine: skrip open-source, keterbatasan sebenarnya, dan opsi jadi-langsung-pakai yang mengembalikan situs Anda ke online.
