Download Wayback: Setiap Metode Diurutkan Berdasarkan Tingkat Usaha
Oleh tim editorial Restorix · 3 Mei 2026 · 7 menit baca

Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Situsnya hilang. Hosting-nya dihapus, backup-nya cuma arsip kosong, dan satu-satunya salinan yang tersisa di dunia ada di dalam Wayback Machine. Sekarang Anda butuh cara download Wayback yang benar-benar berfungsi, dan ada empat cara untuk melakukannya. Mulai dari trik browser dua menit hingga layanan yang menyelesaikan semuanya untuk Anda, dan jarak usaha di antaranya sangat besar. Berikut setiap metode, diurutkan berdasarkan berapa jam biaya yang Anda keluarkan, lengkap dengan mode kegagalan yang tidak pernah disebutkan di halaman penjualan.
Apa yang sebenarnya Anda dapatkan dari download Wayback
Wayback Machine tidak menyimpan situs Anda. Ia menyimpan respons: satu URL, satu crawl, satu momen waktu. Homepage Anda mungkin punya 10.000 tangkapan sementara kebijakan privasi hanya punya dua, dari 2014 dan 2019. Download Wayback berarti mengambil respons yang tersimpan satu URL pada satu waktu dan menyatukannya menjadi sesuatu yang menyerupai aslinya.
Dua konsekuensi menyusul. Pertama, apa pun yang tidak pernah dilihat crawler hilang selamanya: tidak ada database, tidak ada source PHP, tidak ada panel admin, tidak ada apa pun di balik login. Kedua, setiap file yang Anda tarik membeku pada waktu crawl yang tidak Anda pilih. Campurkan stylesheet 2016 dengan homepage 2021 dan situsnya terlihat seperti potongan teks acak, karena itulah persis yang Anda rakit.
Tampilan kalender di halaman snapshot membuat ini terlihat. Lingkaran biru menandai crawl, dan jarak antaranya bisa mencapai bertahun-tahun pada halaman yang tidak populer. Jadi sebelum memilih metode sama sekali, pilih tanggal target: tahun ketika situs terlihat seperti yang Anda inginkan. Setiap keputusan setelah itu, capture mana yang diambil, aset mana yang dipercaya, menjadi lebih mudah.

Metode 1: Simpan satu halaman di browser
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Buka snapshot, tekan Ctrl+S, pilih Web page, complete. Selesai. Untuk satu halaman, ini adalah cara download Wayback tercepat yang ada. Untuk apa pun lebih dari sekitar sepuluh halaman, ini menjadi bentuk penyiksaan diri, jadi tahu kapan harus berhenti. Jika browser merusak sesuatu, buka developer tools, temukan URL aset di tab network, dan simpan file-file tersebut secara individual.
- Gunakan trik id_: sisipkan id_ setelah timestamp di URL snapshot untuk mendapatkan HTML asli persis seperti yang ditangkap, tanpa toolbar Wayback dan tautan yang ditulis ulang.
- Halaman yang disimpan melakukan hotlink asetnya kembali ke web.archive.org. Buka file secara offline dan setengah gambar hilang kecuali Anda juga menyimpannya secara eksplisit.
- Periksa tanggal capture di tampilan kalender sebelum menyimpan. Mengambil tahun yang salah adalah kesalahan pemula paling umum, dan arsip jarang memperingatkan Anda.
Metode 2: Skrip download Wayback dengan wget
Langkah klasik adalah wget dalam mode mirror yang diarahkan ke URL arsip: wget --mirror --page-requisites --convert-links https://web.archive.org/web/2019/https://example.com. wget mengikuti tautan yang ditulis ulang oleh Wayback, yang membuat Anda tetap berada di dalam arsip, dan --page-requisites menarik CSS, JavaScript, dan gambar yang dibutuhkan setiap halaman.
Untuk situs brosur 40 halaman, ini bisa selesai dalam satu malam. Sisihkan malam itu untuk mengawasinya. archive.org membatasi klien yang agresif, jadi tambahkan --wait=2 antar permintaan dan bersiap untuk menjalankan ulang perintah beberapa kali ketika macet. Regex --reject yang menjaga wget tetap dekat dengan timestamp target Anda akan mencegahnya menyimpang ke dua puluh tahun tangkapan.
Apa yang Anda dapatkan pada akhirnya adalah direktori HTML yang masih membawa toolbar Wayback, timestamp di dalam setiap URL aset, dan lubang diam-diam di mana pun crawler melewatkan file. Mengubah tumpukan itu menjadi situs yang dapat di-deploy adalah proyek kedua, dan ini adalah bagian yang orang lupa untuk dijadwalkan.
Metode 3: Skrip terhadap CDX API
Ketika crawling buta tidak cukup, langsung ke sumbernya. CDX API mengembalikan daftar yang dapat dibaca mesin dari setiap capture untuk URL atau domain: web.archive.org/cdx/search/cdx?url=example.com/*&output=json&filter=statuscode:200&collapse=urlkey. Permintaan tunggal itu sudah lebih berguna daripada satu jam wget, karena memberi tahu Anda apa yang ada sebelum Anda mengunduh apa pun.
Loopnya sederhana dalam Python atau Node: baca daftar, ambil setiap capture dengan sufiks id_, simpan ke disk, tidur dengan sopan antar permintaan. Kekuatannya ada pada filter. Batasi berdasarkan tahun atau tipe MIME, dan gunakan collapse=digest untuk menghapus capture duplikat sehingga Anda mengambil setiap file unik sekali, bukan empat puluh kali.
Ini adalah metode yang saya gunakan untuk pekerjaan forensik, seperti menarik setiap PDF yang pernah diterbitkan sebuah perusahaan atau membangun ulang satu direktori per tanggal tertentu. Ini juga proyek pemrograman yang sesungguhnya: skrip yang cermat untuk situs skala menengah adalah akhir pekan penuh untuk menulis, menguji, dan menjalankan ulang setelah koneksi terputus pukul 2 pagi.

Metode 4: Layanan pemulihan otomatis
Opsi keempat adalah melewatkan pekerjaan manual sepenuhnya. Layanan yang dirancang untuk pekerjaan ini meng-query arsip, mengunduh setiap file yang ditangkap, menghapus chrome Wayback, memperbaiki tautan internal, dan menyerahkan situs yang berfungsi alih-alih folder berisi fragmen.
Restorix adalah layanan yang saya tunjuk untuk klien. Estimasi gratis saja sudah sepadan dengan klik: sebelum Anda membayar apa pun, layanan ini menampilkan jumlah file arsip yang tepat, total ukuran, dan harga terkunci. Pemulihan dibayar per file dengan file pertama gratis, dan jika pemulihan atau deploy gagal, pengembalian dana masuk ke saldo Anda secara otomatis. Tanpa tiket, tanpa berdebat dengan dukungan.
Dibandingkan dengan rute DIY, pertukarannya blak-blakan: biaya tetap kecil sebagai ganti akhir pekan Anda, pusing karena rate-limit, dan skrip pembersihan Anda. Pada tiga pekerjaan terakhir yang saya perkirakan, biayanya lebih rendah dari apa yang dua jam tagihan akan rugikan klien.
Kesalahan yang merusak download Wayback
- Mengabaikan query string. /page.php?id=12 dan /page.php?id=13 adalah capture berbeda dari halaman berbeda. Lewati dan setengah dari blog WordPress atau forum phpBB hilang.
- Mencampur timestamp secara buta. Homepage 2018 yang dirender dengan CSS 2013 terlihat seperti fotokopi rusak. Pilih tanggal target dan tetap dalam beberapa bulan darinya.
- Lupa host lain. Gambar di cdn.example.com atau assets.example.net adalah capture terpisah di bawah prefiks URL terpisah, dan query khusus situs tidak pernah melihatnya.
- Mempercayai cakupan lama. Arsip menghormati pengecualian robots.txt selama bertahun-tahun, jadi seluruh bagian dari beberapa situs tidak pernah ditangkap sama sekali.
- Menganggap capture terbaru adalah yang terbaik. Lebih baru tidak selalu lebih baik. Situs yang ditangkap setelah diretas, diparkir, atau dialihkan bernilai lebih rendah daripada snapshot sehat dari dua tahun sebelumnya.
- Menyimpan HTML yang sudah ditulis ulang. Tanpa sufiks id_ Anda menanam toolbar Wayback dan tautan archive.org ke setiap halaman, dan seseorang harus menghapusnya nanti.
Memilih metode yang tepat untuk situs Anda
| Metode | Usaha manual | Biaya | Cocok untuk | Gagal ketika |
|---|---|---|---|---|
| Simpan browser | Menit per halaman | Gratis | 1-10 halaman | Anda butuh 200 halaman |
| Skrip wget | Satu malam | Gratis | Situs statis kecil | Aset hilang, throttling |
| Skrip CDX API | Akhir pekan atau lebih | Gratis | Penarikan terfilter yang presisi | Anda tidak menulis kode |
| Layanan otomatis | Menit total | Biaya tetap kecil | Mengembalikan situs online | Anda menikmati penderitaan |
Skenario realistis: situs marketing 300 halaman milik klien mati tanpa backup. Metode satu memakan 300 simpan manual, sebut saja sepuluh jam. Metode dua memakan satu malam plus sehari pembersihan. Metode tiga memakan akhir pekan jika Anda sudah bisa coding. Metode empat memakan biaya tetap yang sudah Anda ketahui sebelum mulai, dan situsnya kembali dalam keadaan bersih, tautan diperbaiki, dan siap di-deploy. Hitungan per jamnya tidak rumit.
Aturan saya setelah bertahun-tahun melakukan pekerjaan pemulihan: jika situs perlu hidup kembali, langsung ke metode empat, karena itulah persis yang dirancang Restorix. Jika Anda butuh satu halaman untuk bukti atau nostalgia, metode satu. Dua metode tengah untuk orang yang ingin perjalanannya, bukan tujuannya.
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
FAQ
Apakah download Wayback legal?
Mengunduh halaman yang diarsipkan secara publik untuk memulihkan situs Anda sendiri atau untuk referensi pribadi adalah praktik umum dan umumnya berisiko rendah. Menerbitkan ulang konten orang lain secara massal adalah tempat masalah hak cipta dimulai. Jika situs itu milik Anda, Anda berada di posisi yang aman.
Bisakah saya mengunduh seluruh situs web dari Wayback Machine secara gratis?
Ya, dengan tenaga Anda sendiri. Skrip wget dan CDX tidak membutuhkan biaya apa pun selain waktu, dan biaya tersembunyinya adalah pembersihan: penulisan ulang tautan Wayback, aset yang hilang, navigasi rusak. Layanan berbayar ada justru karena pembersihan adalah titik di mana unduhan gratis macet.
Apa arti id_ dalam URL Wayback?
Menambahkan id_ setelah timestamp memberi tahu arsip untuk menyajikan file asli persis seperti yang ditangkap, tanpa toolbar dan tanpa menulis ulang tautan untuk mengarah kembali ke web.archive.org. Untuk unduhan serius, ini wajib.
Mengapa gambar hilang dari unduhan saya?
Crawler menangkap HTML tetapi tidak setiap aset. Gambar yang dimuat lazy, gambar background CSS, dan apa pun di balik JavaScript adalah korban biasa. Coba timestamp yang berdekatan; crawl berbeda dari halaman yang sama terkadang memiliki file tersebut.
Mengapa skrip saya terus mendapatkan error 429 dari archive.org?
Itu adalah rate limiting. Arsip membatasi klien yang mengambil terlalu cepat. Turunkan ke satu atau dua permintaan bersamaan, tambahkan jeda satu hingga dua detik antar pengambilan, dan lanjutkan alih-alih memulai ulang. Skrip yang sopan selesai; yang agresif diblokir.
Sampai kapan download Wayback bisa menjangkau?
Crawl publik arsip dimulai pada 1996. Cakupan sebelum sekitar 2005 tipis untuk situs kecil, dan banyak URL dari era itu bertahan hanya sebagai HTML telanjang tanpa gambar atau stylesheet.
Panduan terkait

wayback machine downloader
Alat Pengunduh Wayback Machine: Apa yang Benar-Benar Berfungsi
Tinjauan jujur tentang alat pengunduh Wayback Machine: skrip open-source, keterbatasan sebenarnya, dan opsi jadi-langsung-pakai yang mengembalikan situs Anda ke online.

wayback machine download site
Unduh Seluruh Situs dari Wayback Machine
Cara mengunduh seluruh situs dari Wayback Machine: jebakan perayapan, halaman dengan query string, aset yang hilang, dan kapan pemulihan otomatis lebih unggul daripada skrip manual.

download entire website from archive org
Unduh Seluruh Situs Web dari Archive.org, Bukan Hanya Halaman Utama
Untuk mengunduh seluruh situs web dari archive.org, Anda membutuhkan setiap halaman, gambar, dan stylesheet. Aset tersembunyi di balik timestamp yang berbeda, berikut alasannya, beserta checklist lengkap.

wayback machine restore
Pemulihan Wayback Machine: 4 Jebakan dan Cara Menghindarinya
Pemulihan Wayback Machine bisa gagal tanpa disadari: halaman parkir, rantai pengalihan, gambar hilang, stempel waktu campuran. Cara mengenali setiap jebakan dan menghindarinya.
