Alat Unduh Website Archive.org: Perbandingan Jujur
Oleh tim editorial Restorix · 7 Juli 2026 · 6 menit baca

Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Ada tiga cara masuk akal untuk mengeluarkan sebuah situs dari Wayback Machine, dan saya sudah memakai ketiganya di proyek nyata: HTTrack, gem Ruby wayback-machine-downloader beserta keluarganya yang berbasis skrip, dan Restorix, layanan yang saya arahkan ke klien saat situs harus kembali berfungsi, bukan sekadar menjadi tumpukan file.
Tak satu pun yang 'terbaik'. Masing-masing memecahkan masalah berbeda dengan harga berbeda, dan harganya lebih banyak dibayar dalam jam daripada dolar. Berikut apa yang sebenarnya dilakukan masing-masing, di mana mereka jatuh, dan siapa yang sebaiknya memilih yang mana. Bukan peringkat ala afiliasi, hanya apa yang sudah saya lihat berhasil dan gagal.
Apa yang harus benar dari sebuah alat unduh website archive.org
Menilai alat-alat ini dari kecepatan unduh melewatkan intinya. Bagian sulit dari pekerjaan unduh website archive.org tidak glamor, dan di situlah alat-alat diam-diam berbeda:
- Menemukan setiap file. Indeks arsip adalah satu-satunya sumber yang lengkap, mengikuti tautan dari halaman utama melewatkan setiap halaman yang tak terhubung.
- Mencocokkan aset lintas timestamp. Halaman tahun 2014 mungkin memerlukan logo dari satu-satunya tangkapan yang tersisa di tahun 2012.
- Mendapatkan byte asli. Kalau dilakukan sembrono, Anda menyimpan markup toolbar Wayback yang melekat di setiap file HTML.
- Menulis ulang tautan internal agar salinan bisa dijelajahi tanpa bergantung pada server archive.org.
- Bertahan dari throttling. Archive.org membatasi laju klien yang terburu-buru, dan percobaan ulang harus sopan serta sabar.
Ingatlah kelima hal itu. Kelimanya menjelaskan setiap baris di tabel perbandingan di bawah, dan sebagian besar ulasan buruk yang diterima alat-alat ini bisa ditelusuri ke salah satunya.
HTTrack: gratis, klasik, dan masih bisa diandalkan
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
HTTrack adalah yang veteran: browser offline gratis dan open-source yang sudah mirroring situs sejak tahun 1990-an. Arahkan ke URL Wayback Machine dan ia akan mengikuti tautan, menyimpan apa pun yang ditemukannya ke disk. Ada GUI Windows, harganya pas, dan untuk mirror cepat situs kecil ia memang benar-benar berfungsi.
Kalau dipakai untuk archive.org, kekurangannya menumpuk. HTTrack tidak tahu apa-apa soal indeks arsip, ia hanya menemukan halaman yang bisa dicapai dengan mengikuti tautan dari URL awal Anda, jadi halaman yang tak terhubung tertinggal. Ia mengambil tangkapan apa pun yang diarahkan wayback, mencampur timestamp tanpa memberi tahu Anda. Dan aturan filter-nya butuh pengaturan serius: kalau salah menyetelnya, mirror blog tahun 2013 Anda akan tersesat ke web aktif dari sebuah tautan, dan Anda malah mengunduh situs yang sekarang. Tanya saja bagaimana saya tahu.
Benchmark yang realistis: mirroring blog WordPress 40 halaman tahun 2012 melalui Wayback Machine memakan sekitar 40 menit penyiapan dan crawl tanpa pengawasan selama dua jam, dan saya masih harus menghabiskan satu jam lagi membersihkan sisa-sisa web aktif dari folder. Itulah bentuk jujur dari pekerjaan HTTrack, murah, mostly otomatis, dan tidak pernah benar-benar selesai saat crawl berakhir.
- Biaya: gratis.
- Usaha: satu atau dua jam untuk mempelajari sintaks filter; mirror kemudian berjalan tanpa pengawasan.
- Cocok untuk: mirror cepat situs kecil yang tautannya lengkap ketika fidelitas sempurna bukan tujuannya.
- Waspadai: tersesat ke web aktif, tercampurnya timestamp tangkapan, dan URL wayback yang ikut masuk ke file Anda setelah ditulis ulang.

wayback-machine-downloader dan jalur skrip
wayback-machine-downloader adalah gem Ruby yang mengkueri indeks CDX arsip, lalu mengunduh setiap file yang tercantum untuk domain Anda, opsional dalam rentang tanggal tertentu. Karena ia membaca indeks alih-alih mengikuti tautan, ia menemukan halaman-halaman yang tak pernah dilihat HTTrack. Beberapa skrip Python yang bertebaran di GitHub melakukan pekerjaan yang sama dengan flag dan tingkat ketelitian yang berbeda.
Trade-off-nya adalah trade-off open-source yang biasa. Anda butuh Ruby atau Python yang terpasang dan keberanian untuk membaca README. Proyek-proyek di niche ini bisa diam bertahun-tahun, jadi periksa issue tracker sebelum menggadaikan deadline pada salah satunya. Dan saat crawl selesai, pekerjaan perakitan jadi tanggung jawab Anda: tautan internal masih menunjuk ke domain asli, timestamp tangkapan perlu dicek kewarasannya, dan semua pembersihan, menghapus tag analytics lama, memperbaiki canonical URL, mengubah ke HTTPS, adalah Sabtu siang Anda.
- Biaya: gratis, plus waktu Anda.
- Usaha: setengah hari jika Anda nyaman dengan terminal; crawl-nya sendiri kemudian berjalan sendiri.
- Cocok untuk: developer dan arsiparis yang ingin kontrol penuh atas setiap byte dan senang memilikinya.
- Waspadai: crawl yang di-throttle tanpa logika retry, penulisan ulang tautan yang jadi pekerjaan rumah, dan celah pemeliharaan di repo.
Dua kebiasaan membuat jalur skrip bisa dijalankan dengan baik. Simpan respons CDX yang Anda mulai, ia berfungsi ganda sebagai manifest saat seseorang bertanya apa yang seharusnya ada di folder. Dan sajikan hasilnya secara lokal sebelum menyatakan selesai: lima menit mengklik-klik salinan di localhost menemukan aset yang hilang lebih cepat daripada log file mana pun.
Restorix: opsi unduh website archive.org yang serba beres
Restorix berada di ujung spektrum yang berbayar dan serba beres, dan dibangun khusus untuk pemulihan archive.org, bukan scraping umum. Anda memasukkan domain dan mendapat estimasi instan gratis: jumlah file arsip persis, total ukuran, dan harga yang terkunci. Anda memilih rentang tanggal dan opsi Anda, tautan internal relatif, penghapusan analytics dan iklan, konversi HTTPS, minifikasi JS/CSS, kanonikalisasi www atau non-www, dan layanan menangani enumerasi indeks, pencocokan aset lintas timestamp, throttling, dan penulisan ulang tautan.
Hasilnya diunduh sebagai salinan yang bersih dan bisa dijelajahi, atau langsung di-deploy ke hosting Anda melalui SSH/SFTP, FTP/FTPS, atau S3, dengan CMS satu file kecil yang disertakan untuk mengedit halaman yang sudah dipulihkan sesudahnya. Anda membayar per file yang dipulihkan, file pertama gratis, dan pemulihan yang gagal akan di-refund otomatis ke saldo Anda. Tidak ada langganan, top-up dilakukan satu kali, lewat kartu atau kripto. Ini bukan jalur penghobi, dan memang tidak berusaha menjadi begitu.

Alat unduh website Archive.org, berdampingan
| HTTrack | Skrip (gem / Python) | Restorix | |
|---|---|---|---|
| Harga | Gratis | Gratis | Bayar per file, file pertama gratis |
| Menemukan halaman tak terhubung | Tidak, hanya mengikuti tautan | Ya, membaca indeks CDX | Ya, membaca indeks CDX |
| Pencocokan aset lintas timestamp | Tidak | Sebagian | Ya |
| Byte asli tanpa markup toolbar | Tidak | Ya, dengan flag yang tepat | Ya |
| Tautan internal ditulis ulang | Sebagian | Anda menulis ulangnya sendiri | Ya, tautan relatif opsional |
| Deploy ke hosting Anda | Tidak | Tidak | Ya, SSH, FTP, S3 |
| Usaha tipikal dari Anda | Berjam-jam menyetel filter | Setengah hari plus perakitan | Sekitar 15 menit |
| Cocok untuk | Mirror kecil yang cepat | Developer yang ingin kontrol | Mengembalikan situs ke online |
Baca baris usaha dua kali. Setiap alat di daftar ini pada akhirnya bisa menghasilkan folder file yang sama, yang sebenarnya Anda pilih adalah siapa yang mengerjakan 20% pekerjaan yang merepotkan itu: Anda, atau sesuatu yang lain.
Satu baris lagi yang tak muat di tabel: risiko. Dengan alat gratis, pekerjaan yang gagal menghabiskan satu malam Anda. Dengan layanan berbayar, perhatikan ketentuan kegagalannya, refund otomatis ke saldo, harga yang terkunci sebelum Anda mulai, dan estimasi gratis membuat risiko finansial dari pemulihan yang gagal hampir nol.
Mana yang sebaiknya Anda pilih?
Panduan jujur. Jika Anda butuh satu situs kecil di-mirror untuk referensi dan menikmati alat gratis, HTTrack akan menyediakannya di disk Anda malam ini. Jika Anda menulis kode, ingin file mentahnya, dan punya satu weekend untuk dihabiskan, jalur gem benar-benar bagus dan benar-benar gratis. Jika situsnya adalah aset bisnis, toko WooCommerce klien, forum dengan sepuluh tahun postingan, karya hidup Anda sendiri, bayar biaya per file dan habiskan malam Anda untuk hal lain. Tutorial menunjukkan alur pemulihan lengkap sebelum Anda menggelontorkan satu sen pun, dan estimasi gratis membuat Anda bisa melihat harga persisnya sebelum memutuskan apa pun.
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
FAQ
Apakah ada fitur unduh website archive.org resmi?
Tidak. Wayback Machine dibuat untuk menjelajahi tangkapan individual, dan archive.org tidak menawarkan ekspor seluruh situs. Setiap metode massal, HTTrack, skrip downloader, layanan pemulihan, adalah alat pihak ketiga yang membaca tangkapan publik dan indeks publik yang sama.
Apakah HTTrack atau wayback-machine-downloader lebih baik untuk archive.org?
Pekerjaan berbeda. HTTrack meng-crawl tautan dan cocok untuk mirror kecil yang sederhana. wayback-machine-downloader membaca indeks arsip, jadi ia menemukan halaman tak terhubung dan menangani rentang tanggal dengan benar. Untuk apa pun yang lebih besar dari beberapa lusin halaman, pendekatan berbasis indeks menang.
Berapa biaya untuk memulihkan situs dengan Restorix?
Anda membayar biaya flat kecil per file yang dipulihkan, dengan file pertama gratis dan harga yang terkunci di waktu estimasi, jadi Anda melihat total persis untuk situs spesifik Anda sebelum membayar apa pun. Top-up dilakukan satu kali, lewat kartu atau kripto, dan ada kode promo. Tidak ada yang berulang.
Bisakah alat-alat ini mengembalikan situs ke hosting saya, atau hanya mengunduh file?
HTTrack dan skrip berhenti di file di disk Anda; unggah, perbaikan tautan, dan konfigurasi hosting jadi tanggung jawab Anda. Restorix bisa men-deploy salinan yang dipulihkan langsung ke server SSH/SFTP, shared hosting FTP/FTPS, atau S3, dan menyertakan CMS sederhana untuk mengedit halaman sesudahnya.
Apakah saya perlu mengetahui semua URL lama sebelum mengunduh?
Tidak. Alat berbasis indeks menghitung setiap URL yang tertangkap dari API CDX, jadi Anda hanya butuh domainnya. Crawler berbasis tautan seperti HTTrack hanya butuh URL awal, tapi mereka akan melewatkan apa pun yang tidak ditautkan dari tempat yang bisa dijangkau crawl mereka.
Panduan terkait

wayback machine downloader
Alat Pengunduh Wayback Machine: Apa yang Benar-Benar Berfungsi
Tinjauan jujur tentang alat pengunduh Wayback Machine: skrip open-source, keterbatasan sebenarnya, dan opsi jadi-langsung-pakai yang mengembalikan situs Anda ke online.

web downloader
Perbandingan Alat Unduh Web: Apa yang Disimpan dan yang Rusak
Cara kerja pengunduh web, apa yang HTTrack, wget, SiteSucker, dan simpan browser benar-benar pertahankan, apa yang masing-masing rusak, dan kapan pemulihan adalah pilihan yang lebih baik.

download a website from archive org
Cara Mengunduh Situs Web dari Archive.org: 3 Metode yang Terbukti Berhasil
Tiga metode teruji untuk mengunduh situs web dari archive.org: menyimpan halaman secara manual, membuat skrip CDX API, atau menggunakan layanan pemulihan otomatis. Estimasi waktu realistis untuk setiap metode.
