Alat Pengunduh Wayback Machine: Apa yang Benar-Benar Berfungsi
Oleh tim editorial Restorix · 9 Mei 2026 · 7 menit baca

Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Cari pengunduh wayback machine dan Anda akan menemukan segelintir alat yang sama yang sudah dipakai semua orang selama satu dekade, plus kuburan repositori GitHub yang terbengkalai. Beberapa alat ini benar-benar berfungsi. Semuanya memiliki batas yang sama. Ini adalah tinjauan yang saya harap seseorang berikan kepada saya sebelum pekerjaan restorasi pertama saya: apa yang sebenarnya dilakukan skrip open-source, di mana mereka berhenti, dan apa yang harus dipakai sebagai gantinya ketika situs harus kembali online.
Apa yang sebenarnya dilakukan pengunduh Wayback Machine
Setiap pengunduh wayback machine adalah mesin yang sama di balik tampilannya. Alat ini meminta CDX API untuk daftar tangkapan (captures), mengulang daftar itu, dan menyimpan setiap file dari URL berstempel waktunya. Yang lebih baik menambahkan filter tanggal dan jenis file plus logika percobaan ulang (retry) untuk saat archive.org mulai membatasi permintaan Anda. Tidak ada yang terhubung ke cadangan rahasia situs Anda. Mereka mengikis arsip publik yang sama yang bisa Anda buka di peramban sekarang juga.
Perbedaan itu lebih penting daripada daftar fitur apa pun. Pengunduh mewarisi setiap celah di arsip: halaman yang tidak pernah di-crawl, gambar yang tidak pernah ditangkap, direktori yang diblokir oleh file robots.txt yang salah konfigurasi di 2015. Alat hanya bisa mengambil yang memang ada.
Angkanya juga membesar dengan cepat. Situs sederhana 200 halaman, begitu Anda menghitung gambar, stylesheet, dan skrip, dengan mudah menjadi 2.000 file. Pada satu permintaan sopan per detik, itu berarti lebih dari setengah jam pengambilan murni, sebelum percobaan ulang, sebelum throttling, sebelum file yang mengembalikan 404 karena arsip kehilangannya bertahun-tahun lalu.
Opsi open-source
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Tiga nama muncul di setiap utas forum, dan dengan alasan yang bagus:
- wayback-machine-downloader, sebuah gem Ruby. Yang paling terkenal dari kelompok ini. Satu perintah, wayback_machine_downloader http://example.com --from 2015 --to 2019, dan direktori ./websites akan terisi dengan setiap tangkapan yang cocok. Termasuk flag concurrency dan filter berdasarkan ekstensi file.
- waybackpack, alat Python. Mengunduh tangkapan yang diorganisir berdasarkan stempel waktu, yang membuatnya bagus untuk mengambil satu snapshot spesifik dari sebuah halaman dan kurang ditujukan untuk cermin seluruh situs.
- HTTrack diarahkan ke URL snapshot. Bukan benar-benar alat arsip. Ia mengikuti link yang ditulis ulang yang disisipkan Wayback ke halaman dan menyeret turun seluruh pohon tangkapan. Mentah, kadang efektif di situs kecil, dan sama sekali bingung dengan query string.
Ketiganya gratis. Ketiganya dikelola dengan kecepatan hobi. Dan ketiganya memberikan Anda tumpukan file. Apa yang terjadi setelah itu adalah masalah Anda, dan kalimat itu mencakup sekitar delapan puluh persen dari yang berikut. Sebelum memasang salah satunya, baca masalah terbuka di repo. Sepuluh menit di sana memberi tahu Anda lebih banyak daripada pos perbandingan mana pun.

Apa yang diharapkan dari skrip pengunduh Wayback Machine gratis
Tetapkan ekspektasi sebelum menjalankan apa pun. Sesi pertama yang umum dengan pengunduh wayback machine gratis berjalan seperti ini: tiga puluh menit berkutat dengan instalasi Ruby atau Python Anda, sepuluh menit progres yang menjanjikan, lalu archive.org mulai menjawab dengan kesalahan 429 dan semuanya melambat menjadi merangkak. Situs 5.000 file pada tingkat permintaan sopan adalah pekerjaan semalam, dan pekerjaan semalam gagal secara diam-diam pukul 3 pagi.
Pelaksanaan pertama yang realistis
- Pasang runtime dan alatnya. Debug konflik versi yang tidak ada yang sebutkan di README.
- Jalankan tes kecil terhadap satu direktori situs untuk mengonfirmasi format output.
- Luncurkan pelaksanaan penuh dan saksikan seratus file pertama tiba.
- Kena batas kecepatan, turunkan concurrency, mulai ulang, dan berharap logika resume berfungsi.
- Buka folder output dan temukan sampah yang Anda unduh bersama emasnya.
Output selalu perlu triase. Kecuali Anda menyaring dengan baik, Anda mendapatkan setiap tangkapan dari setiap URL: sampah parameter pelacakan, tampilan cetak, halaman kesalahan yang tetap mengembalikan status 200. Dan kecuali alat mengambil varian id_, byte asli yang tidak dimodifikasi, setiap file HTML tiba dengan link yang ditulis ulang dan toolbar Wayback masih tertanam.
Satu kejutan lagi adalah organisasi. Sebagian besar skrip membuang semuanya ke jalur berstempel waktu yang mencerminkan arsip, bukan struktur direktori asli Anda. Membangun kembali pohon folder yang sebenarnya, dan mengganti nama file kembali ke apa yang disebut server, adalah pekerjaan manual yang tidak ada yang menganggarkan.
Batas yang akan Anda temui
- Tidak ada logika restorasi. Pengunduh mengambil file. Ia tidak menghapus toolbar Wayback, memperbaiki tautan internal, memilih host kanonik, atau mengonversi apa pun ke HTTPS.
- Tidak ada kecerdasan deduplikasi. Gambar yang sama yang disimpan dalam enam stempel waktu menjadi enam file kecuali Anda menggabungkan berdasarkan digest konten sendiri.
- Batas kecepatan. Terlalu kencang dan archive.org akan membatasi Anda atau memblokir Anda sepenuhnya untuk sementara waktu. Pelaksanaan ulang adalah bagian normal dari alur kerja, bukan tanda Anda melakukan sesuatu yang salah.
- Pembusukan dependensi. Skrip yang dikunci ke versi Ruby atau Python lama rusak di sistem modern. Periksa tanggal commit terakhir di repo sebelum memasang apa pun.
- Tanpa dukungan. Ketika alat rusak, pelacak isu adalah meja dukungan, dan balasan terakhir mungkin dari dua tahun lalu.
- Tanpa garis finish. Ketika skrip keluar, Anda memiliki folder. Mengubah folder itu menjadi situs web yang di-hosting dan berfungsi adalah proyek kedua dengan ukuran serupa.

Alternatif jadi-langsung-pakai
Alternatif untuk mengasuh skrip adalah layanan yang memperlakukan pengunduhan sebagai langkah satu dari restorasi, bukan keseluruhan pekerjaan. Restorix dimulai dengan estimasi gratis: jumlah file arsip yang tepat, ukuran total, dan harga terkunci sebelum Anda membayar satu sen pun. Dari situ, layanan ini mengunduh semuanya, membersihkannya, dan dapat men-deploy langsung ke hosting Anda melalui SSH, FTP, atau S3.
Detailnya dibuat untuk pekerjaan spesifik ini. Anda membayar per file yang direstorasi dengan file pertama gratis. Jika restorasi atau deploy gagal, pengembalian dana masuk ke saldo Anda secara otomatis, tanpa tiket dukungan yang diperlukan. Opsi restorasi menghapus analitik dan iklan, menulis ulang tautan ke jalur relatif, dan memaksakan HTTPS. Deploy mencakup CMS satu file kecil dengan kata sandi admin yang dihasilkannya sendiri, sehingga situs yang direstorasi tetap dapat diedit. Tidak ada langganan di mana pun: Anda mengisi ulang saldo dan menghabiskannya.
Kapan pengunduh Wayback Machine adalah alat yang salah
Skrip pengunduh adalah alat yang tepat untuk arsip offline, dataset penelitian, dan menyelamatkan folder PDF lama. Ini adalah alat yang salah ketika:
- Situs harus kembali online dan terlihat benar saat melakukannya
- Orang yang melakukan pekerjaan tidak akan pernah membuka terminal
- Arsip menyimpan puluhan ribu URL, setengahnya sampah query string
- Ada tenggat waktu: peluncuran ulang, permintaan hukum, klien yang mendesak Anda
Untuk kasus-kasus itu, skrip tidak lebih murah daripada layanan. Skrip hanya menyembunyikan tagihan dalam jam Anda. Estimasi Restorix setidaknya memberi tahu Anda harga yang sebenarnya di muka, sebelum Anda menyisihkan satu akhir pekan untuk mengetahuinya dengan cara yang sulit. Tidak ada yang membuat skrip itu buruk. Skrip itu menjadi alat dengan deskripsi pekerjaan, dan deskripsi pekerjaan berakhir di folder.
Cara memilih
| Situasi Anda | Alat yang tepat | Alasan |
|---|---|---|
| Butuh satu snapshot untuk referensi | Peramban plus trik URL id_ | Dua menit, tanpa instalasi |
| Situs kecil, nyaman dengan CLI | gem wayback-machine-downloader | Gratis, terbukti, filter bagus |
| File spesifik dalam skala besar | CDX API plus skrip Anda sendiri | Kontrol penuh atas penyaringan |
| Situs harus hidup lagi | Restorix | Unduh, bersihkan, dan deploy dalam satu pekerjaan |
Pilih berdasarkan tujuan, bukan berdasarkan unduhan. Jika folder file adalah tujuannya, alat gratis layak dipertahankan dan akan selalu begitu. Jika situs web itu sendiri adalah tujuannya, lewati tahap folder sepenuhnya dan langsung menuju hal yang membangunnya kembali.
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
FAQ
Apakah ada pengunduh Wayback Machine resmi?
Tidak. Internet Archive menjalankan Wayback Machine dan menyediakan CDX API, tetapi tidak menyediakan pengunduh massal resmi. Setiap alat di ranah ini adalah pihak ketiga dan dibangun di endpoint publik yang sama yang bisa Anda kueri sendiri.
Apakah gem wayback-machine-downloader Ruby aman?
Ini adalah proyek open-source yang sudah lama berjalan dan aman dalam pengertian biasa: baca kodenya, pasang dari repositori kanonik, dan bersikap skeptis terhadap paket tiruan dengan nama serupa. Risiko praktis yang lebih besar adalah fork yang sudah usang yang gagal secara diam-diam di tengah jalan pada situs besar.
Mengapa unduhan saya macet di tengah jalan?
Hampir selalu karena pembatasan kecepatan (rate limiting). archive.org menjawab klien yang terlalu agresif dengan kesalahan 429. Turunkan concurrency, tambahkan jeda antar permintaan, dan lanjutkan. Sebagian besar alat dapat melanjutkan dari tempat berhenti, sehingga macet hanya memakan waktu, bukan progres.
Bisakah pengunduh mengambil halaman yang dilindungi kata sandi atau yang dihapus?
Tidak untuk kata sandi: crawler tidak pernah melewati login, jadi tidak ada yang bisa diunduh. Ya untuk halaman yang dihapus: penghapusan dari web hidup adalah tepat apa yang dilindungi arsip, selama crawl terjadi sebelum penghapusan.
Apakah aplikasi pengunduh berbayar lebih baik daripada skrip gratis?
Kadang-kadang itu hanya skrip gratis dengan antarmuka yang ditambahkan. Nilai berdasarkan output, bukan harga: apakah Anda mendapatkan file id_ asli, deduplikasi yang masuk akal, dan tautan yang bersih, atau folder HTML yang ditulis ulang? Layanan restorasi melewati pertanyaan itu sepenuhnya dengan memberikan Anda situs yang jadi alih-alih file.
Bagaimana cara mengubah file yang diunduh kembali menjadi situs web yang berfungsi?
Hapus penulisan ulang Wayback, buat tautan internal menjadi relatif, pilih host kanonik, lalu deploy dan uji. Atau biarkan layanan restorasi melakukan keempatnya untuk Anda, yang merupakan alasan seluruh keberadaan layanan tersebut.
Panduan terkait

wayback download
Download Wayback: Setiap Metode Diurutkan Berdasarkan Tingkat Usaha
Setiap metode download Wayback diurutkan berdasarkan tingkat usaha: halaman tunggal, skrip wget, CDX API, dan layanan otomatis yang membangun ulang seluruh situs untuk Anda.

wayback machine download site
Unduh Seluruh Situs dari Wayback Machine
Cara mengunduh seluruh situs dari Wayback Machine: jebakan perayapan, halaman dengan query string, aset yang hilang, dan kapan pemulihan otomatis lebih unggul daripada skrip manual.

restore website from wayback machine
Cara Memulihkan Website dari Wayback Machine: Panduan Lengkap
Pulihkan website dari Wayback Machine secara menyeluruh: pilih snapshot yang tepat, atur opsi pemulihan, lalu terapkan situs yang berfungsi dengan CMS dalam waktu kurang dari satu jam.
