Perbandingan Alat Unduh Web: Apa yang Disimpan dan yang Rusak
Oleh tim editorial Restorix · 17 Mei 2026 · 7 menit baca

Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Sebuah perusahaan hosting menghilang dari klien selama akhir pekan. Tidak ada cadangan, tentu saja. Situs masih menjawab Senin pagi, nyaris, dan hal pertama yang saya lakukan adalah mengarahkan pengunduh web ke sana dan menarik setiap halaman yang dapat dijangkau sebelum lampu mati untuk selamanya. Itu gunanya alat-alat ini: mengambil apa yang masih bisa diberikan server, dengan cepat, sebelum berhenti memberikan.
Pengunduh web bukan sihir, meskipun, dan empat alat yang orang benar-benar gunakan, HTTrack, SiteSucker, wget, dan tombol simpan browser, sangat berbeda dalam apa yang mereka pertahankan. Berikut adalah apa yang masing-masing simpan, apa yang masing-masing diam-diam rusak, dan cara memilih di antara keduanya.
Apa yang sebenarnya disimpan oleh pengunduh web
Setiap pengunduh web bekerja dengan cara yang sama di balik layar. Ini meminta URL, mengurai HTML yang kembali, menemukan aset yang ditautkan dan tautan internal, mengunduh tersebut, menulis ulang tautan agar berfungsi dari disk Anda, dan terus berlanjut sampai antrian kosong. Penjelajah web dengan tombol simpan.
Apa yang mendarat di drive Anda:
- Halaman HTML, biasanya diganti nama agar dapat dibuka secara lokal tanpa server
- CSS, JavaScript, dan font yang dirujuk oleh halaman-halaman tersebut
- Gambar, video, PDF, dan apa pun lainnya yang ditautkan langsung oleh halaman
- Struktur folder yang mencerminkan tata letak URL asli
Yang tidak masuk: apa pun yang dibuat server secara dinamis. Pengunduh menerima HTML yang dirender sama seperti pengunjung anonim mana pun. PHP, database, panel admin, riwayat pesanan, tidak ada yang melewati kabel, jadi tidak ada yang sampai ke rumah. Situs WordPress yang diunduh adalah patung dari situs, bukan situs itu sendiri.
Dua detail cakupan menentukan apa yang Anda dapatkan. Pertama, penemuan: penjelajah hanya menemukan URL yang ditautkan dari halaman yang sudah dimilikinya, ditambah sitemap jika Anda memberikannya, halaman yatim piatu tanpa tautan masuk tetap tidak terlihat. Kedua, kesopanan: sebagian besar alat menghormati robots.txt secara default, dan meskipun HTTrack memungkinkan Anda mengesampingkan itu, Anda hanya boleh melakukannya di situs yang Anda miliki.
HTTrack dan SiteSucker: opsi GUI
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
HTTrack (WinHTTrack di Windows) adalah pionir kategori ini: gratis, open source, dan sudah ada sejak 1998. Tempel URL, pilih folder proyek, dan itu mencerminkan situs. Nilai nyata ada di opsi, batas kedalaman crawl, filter tipe file, batas bandwidth, dan aturan pemindaian yang menyertakan atau mengecualikan pola URL. Saya mencerminkan portofolio fotografer 400 halaman dengannya dalam waktu sekitar dua puluh menit, termasuk gambar.
Pengaturan yang sebenarnya saya ubah dari default:
- Kedalaman pencerminan maksimum: biarkan tidak terbatas untuk situs kecil, batasi 3 atau 4 untuk yang besar
- Aturan pemindaian: tambahkan pola inklusi untuk domain target agar crawl tidak berjalan keluar jalur
- Kontrol aliran: dua hingga empat koneksi dan batas bandwidth untuk apa pun yang bukan server Anda sendiri
- Jenis MIME: kecualikan video pada pass pertama, satu folder webinar yang terlupakan bisa berukuran 40 GB
Kekurangannya: antarmuka terlihat sudah tua, rilis bermakna terakhir bertahun-tahun yang lalu, dan buta terhadap JavaScript. Jika halaman membangun kontennya di browser, HTTrack menyimpan kerangka kosong.
SiteSucker adalah jawaban Mac, beberapa dolar di App Store. Tempel URL, tekan mulai, dan mengunduh di latar belakang dengan default yang masuk akal, jeda dan lanjutkan termasuk. Lebih sedikit tombol daripada HTTrack dan sama-sama buta terhadap JavaScript, tapi untuk cerminan cepat yang bersih di macOS, ini adalah opsi paling tidak menyakitkan.
wget untuk orang yang suka terminal
wget adalah opsi yang bisa di-skrip, terinstal di hampir setiap kotak Linux dan satu brew install jauh di Mac. Resep cerminan lengkap klasik:
wget --mirror --convert-links --adjust-extension --page-requisites --no-parent https://example.com
Apa yang dibeli setiap flag:
- --mirror mengaktifkan rekursi dan timestamp, jadi runs ulang hanya mengambil yang berubah
- --convert-links menulis ulang tautan setelah unduhan agar halaman berfungsi offline
- --adjust-extension menyimpan halaman yang dihasilkan server sebagai file.html yang tepat
- --page-requisites mengambil CSS, JS, dan gambar yang dibutuhkan setiap halaman untuk dirender
- --no-parent menjaga crawl di bawah jalur awal alih-alih memakan seluruh domain
Penambahan yang worth knowing: --wait=1 --random-wait menjaga kesopanan di server kecil, -c melanjutkan cerminan yang terputus tanpa mengambil ulang file yang sudah selesai, dan --load-cookies dengan file cookie yangdiekspor dapat mengambil halaman di balik login Anda sendiri. Dan jangan bingung wget dengan curl, curl mengambil satu URL dengan indah, wget mencerminkan seluruh situs. Orang terus-terusan mencampuraduk它们.

Simpan browser: opsi bawaan
Ctrl+S, Webpage Complete, pengunduh yang sudah Anda miliki. Menyimpan satu halaman ditambah folder aset. Untuk receipt, artikel, atau halaman kontak yang Anda butuhkan sekarang, itu cukup baik. Bahkan punya satu superkraft sejati: browser menyimpan halaman setelah JavaScript berjalan, jadi halaman berat React yang memberi wget kerangka kosong datang through sepenuhnya dirender.
Batasannya cepat terlihat. Gambar background CSS dan rantai @import sering hilang, tautan menunjuk kembali ke situs langsung alih-alih satu sama lain, dan tidak ada rekursi, situs 300 halaman berarti 300 penyimpanan manual. Satu trik samping yang worth knowing: ekstensi SingleFile menginline setiap aset ke dalam satu file HTML mandiri, setelah JavaScript berjalan. Untuk mengarsipkan halaman JS-berat individu secara individual, itu mengalahkan Ctrl+S biasa dengan bersih. Simpan sebagai PDF adalah beast berbeda: ia menangkap penampilan, bukan halaman, dan tidak ada yang berfungsi di dalamnya.
Sesi pengunduh web, dari awal hingga akhir
Cerminan pertama situs yang tidak familiar berjalan lebih baik dengan rutinitas. Saya:
- Periksa robots.txt dan syarat situs sebelum crawl, dan gunakan flag wait di server kecil terlepas.
- Pilih cakupan: seluruh domain atau satu bagian. Aturan no-parent atau aturan pemindaian HTTrack menjaga crawl blog dari menelan toko di sebelah.
- Jalankan cerminan dan pantau log. 403 berulang berarti deteksi bot; banjir halaman kalender atau tag berarti cakupan Anda bocor.
- Periksa sepuluh halaman acak secara offline, termasuk satu dengan formulir kontak dan satu galeri berat. Rusak sekarang berarti rusak selamanya.
- Bandingkan jumlah file lokal terhadap sitemap situs. Celah besar berarti konten yang dirender JavaScript atau aturan cakupan memakan halaman.
Apa yang selalu dipecahkan oleh setiap pengunduh web
Pilih alat apa pun di atas dan hal yang sama akan hancur, karena masalahnya ada di medium, bukan perangkat lunak:
| Yang Rusak | Mengapa Itu Terjadi | Kerusakan |
|---|---|---|
| Pencarian, formulir, login | Kode sisi server sudah hilang | Fitur mati saat muncul |
| Konten yang dirender JavaScript | Crawler melihat HTML pra-JS | Seluruh bagian hilang |
| URL yang dibangun dalam skrip atau gaya inline | Penulis ulang tautan tidak dapat mengurai mereka | Gambar dan tautan rusak |
| Halaman query-string (?p=123) | Nama file rusak atau dideduplikasi | Halaman hilang secara diam-diam |
| Video streaming (HLS/DASH) | URL segmen kedaluwarsa di tengah pengunduhan | Klip yang tidak pernah diputar |
Perhatikan juga aset lintas domain. Sebagian besar crawler tetap pada host awal secara default, jadi gambar yang served dari subdomain CDN atau font dari host eksternal dilewati kecuali Anda melebar cakupan, dan kemudian halaman yang disimpan datang pulang penuh dengan referensi rusak. Ada juga residu SEO: tag kanonik, URL Open Graph, dan tautan internal absolut masih menunjuk ke domain lama. Harmless dalam arsip pribadi, masalah nyata jika cerminan kembali online.
Situs yang Diunduh adalah patung: terlihat persis benar, dan tidak ada yang bergerak di dalam.

Ketika pengunduh web adalah alat yang salah
Kasus yang jelas: situs sudah offline. Pengunduh butuh server langsung yang menjawab permintaan, dan domain yang expired atau host yang mati memberinya tidak ada yang di-crawl. Salinan yang bertahan duduk di Wayback Machine sebagai gantinya, dan mengarahkan wget ke web.archive.org adalah penderitaan: permintaan dibatasi, URL ditulis ulang arsip, toolbar disuntikkan ke setiap halaman, dan snapshot tersebar di seluruh tahun.
Itu pekerjaannya Restorix ada untuk. Ini memulihkan situs dari snapshot arsip dengan pemilihan rentang tanggal, menghilangkan kekacauan arsip dan analitik lama, dan menunjukkan jumlah file arsip yang tepat, ukuran total, dan harga terkunci sebelum Anda membayar apa pun.
Kasus salah alat kedua: Anda ingin kontennya, bukan pikselnya, artikel ke spreadsheet, produk ke database. Itu ekstraksi, bukan pengunduhan. Dan ketiga: jika situs membutuhkan fitur berbasis database-nya kembali, toko, forum, cerminan statis memberi Anda tampilan, bukan mesin. Anda membutuhkan pemulihan plus backend baru.
Dari file ke situs langsung lagi
Folder cerminan bukan situs web. Mengembalikan online berarti hosting di suatu tempat, memperbaiki tautan absolut, menghapus skrip pelacakan mati, dan menyelesaikan HTTPS. Dapat dilakukan dengan tangan, atau lewati pipa: Restorix men-deploy situs yang Dipulihkan langsung ke SSH/SFTP, FTP/FTPS, atau S3, dengan CMS ringan disertakan sehingga situs dapat diedit lagi, bukan hanya dilihat. Either way, uji hasilnya di ponsel sebelum menyebutnya selesai.
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
FAQ
Apakah legal mengunduh situs web dengan pengunduh web?
Mengunduh halaman yang diberikan server kepada publik secara umum tidak masalah, byte tersebut diberikan kepada siapa saja yang meminta. Apa yang Anda lakukan selanjutnya yang penting. Menerbitkan ulang konten milik orang lain secara keseluruhan adalah masalah hak cipta, dan membombardir server kecil dengan kecepatan penuh dapat melanggar syarat penggunaannya. Unduh situs Anda sendiri, dapatkan izin untuk pekerjaan klien, dan jaga batas kecepatan untuk yang lain.
Bisakah pengunduh web mengambil halaman di balik login?
Untuk akun Anda sendiri, ya. wget melakukannya dengan --load-cookies dan file cookie yangdiekspor; HTTrack memiliki trik proxy catch-URL yang menangkap sesi Anda. Expect gesekan, sesi berakhir dan token CSRF merusak crawl di tengah proses, jadi babysit prosesnya. Dan jangan pernah memberikan cookie Anda ke alat online.
Mengapa situs yang Diunduh saya terlihat rusak saat saya membukanya?
Hampir selalu satu dari tiga penyebab: tautan absolut masih menunjuk ke domain langsung, aset dimuat oleh JavaScript yang tidak pernah dilihat crawler, atau halaman query-string disimpan dengan nama yang rusak. Buka konsol browser pada salinan lokal dan baca 404s, mereka daftar persis apa yang dilewatkan alat.
Bisakah saya menjalankan wget atau HTTrack terhadap Wayback Machine?
Secara teknis ya, secara praktis menyedihkan. Anda akan mengenai batas kecepatan, URL yang ditulis ulang arsip, markup toolbar dipanggang ke setiap halaman, dan file diambil dari snapshot bertahun-tahun terpisah. Restorer yang dibuat untuk tujuan menangani semua itu untuk Anda, itulah seluruh alasan Restorix ada.
Apa pengunduh web terbaik untuk situs penuh?
HTTrack jika Anda ingin GUI di Windows atau Linux, SiteSucker di Mac, wget jika Anda script. Untuk situs yang sudah offline, tidak ada yang bisa membantu, tidak ada yang live untuk di-crawl, jadi pulihkan dari snapshot arsip sebagai gantinya.
Panduan terkait

wayback machine downloader
Alat Pengunduh Wayback Machine: Apa yang Benar-Benar Berfungsi
Tinjauan jujur tentang alat pengunduh Wayback Machine: skrip open-source, keterbatasan sebenarnya, dan opsi jadi-langsung-pakai yang mengembalikan situs Anda ke online.

download entire website from archive org
Unduh Seluruh Situs Web dari Archive.org, Bukan Hanya Halaman Utama
Untuk mengunduh seluruh situs web dari archive.org, Anda membutuhkan setiap halaman, gambar, dan stylesheet. Aset tersembunyi di balik timestamp yang berbeda, berikut alasannya, beserta checklist lengkap.

online website extractor
Alat Ekstraktor Situs Web Online: Kegunaan, Batasan, dan Keamanan
Apa yang diambil oleh ekstraktor situs web online dari sebuah halaman: teks, gambar, tautan, data terstruktur. Perbandingan alat online dengan alat lokal, dan cara tetap aman.

restoration websites
Situs Restorasi: Apa Arti Sebenarnya Restorasi Situs Web
Situs restorasi membangun ulang situs yang hilang dari arsip web. Bagaimana restorasi berbeda dari pencadangan dan desain ulang, serta alur kerja dari cuplikan ke situs aktif.
