Unduh Seluruh Situs Web dari Archive.org, Bukan Hanya Halaman Utama
Oleh tim editorial Restorix · 15 Juli 2026 · 7 menit baca

Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Siapa pun bisa menyimpan halaman utama. Halaman utama adalah bagian yang mudah, justru 4.000 file di baliknya yang membedakan 'saya mengambil salinannya' dengan 'saya benar-benar memiliki situsnya'. Ketika seseorang meminta saya mengunduh seluruh situs web dari archive.org, halaman utamanya biasanya sudah ada di desktop mereka, tetapi stylesheet-nya tidak.
Artikel ini membahas kata 'seluruh'. Apa yang sebenarnya termasuk dalam salinan lengkap, mengapa arsip menyebarkan aset Anda ke berbagai timestamp selama bertahun-tahun, dan checklist yang bisa Anda jalankan di akhir untuk membuktikan Anda mendapatkan semuanya, alih-alih sekadar berharap.
Apa arti 'seluruh' saat mengunduh seluruh situs web dari archive.org
Salinan lengkap memiliki empat lapisan, dan kebanyakan orang berhenti setelah lapisan pertama. HTML untuk setiap halaman yang pernah ada. Aset yang dirujuk setiap halaman: gambar, stylesheet, JavaScript, font, PDF, video. Tautan internal yang ditulis ulang agar salinannya bisa dijelajahi sendiri, tanpa bergantung pada server archive.org. Dan manifes dari apa yang ditangkap, sehingga celah-celahnya terdokumentasi, bukan ditemukan nanti oleh klien.
- Halaman: setiap URL yang pernah dilihat crawler, bukan hanya yang ada di menu utama. Situs lama menyembunyikan seluruh bagian di balik tautan footer yang terlupakan.
- Aset: gambar, CSS, JS, font, dan file unduhan, di sebagian besar situs, jumlahnya bisa lima kali lipat dari jumlah halaman.
- Tautan: ditulis ulang ke path relatif, atau salinan Anda hanya berfungsi selama archive.org masih aktif.
- Manifes: daftar per file dari apa yang Anda miliki, mengubah 'saya rasa saya mendapatkan semuanya' menjadi sesuatu yang bisa diverifikasi.
Jumlah file mengejutkan orang. Situs bisnis sederhana dengan 50 halaman biasanya berjumlah 400-800 file. Forum phpBB tahun 2009 dengan avatar dan lampiran pengguna bisa mencapai puluhan ribu. Rencanakan berdasarkan jumlah file, bukan jumlah halaman.
Ada juga perbedaan antara salinan yang bisa dijelajahi dan salinan yang bisa di-deploy ulang. Salinan yang bisa dijelajahi hanya butuh file dan tautan yang berfungsi. Salinan yang ingin Anda pasang kembali di hosting membutuhkan lebih banyak lagi: URL kanonik yang konsisten (pilih www atau non-www), referensi yang siap HTTPS, dan beban mati seperti skrip analitik berusia satu dekade yang perlu dihapus. Putuskan mana dari keduanya yang Anda bangun sebelum mulai, karena retrofit salah satunya memakan waktu.
Mengapa aset berada di bawah timestamp yang berbeda
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Wayback Machine tidak memotret seluruh situs dalam satu sore. Crawlernya mengambil apa pun yang bisa dijangkaunya, kapan pun crawler tersebut berhasil menjangkaunya. Halaman utama Anda tahun 2014 mungkin merujuk logo yang terakhir diambil pada 2012, stylesheet yang diambil enam kali dalam lima tahun, dan hero image yang tidak pernah diambil. Ketika Anda melihat halaman itu, archive.org dengan diam-diam mengganti tangkapan terdekat yang dimilikinya untuk setiap aset. Itulah sebabnya halaman tersebut terlihat baik di browser Anda meskipun bagian-bagiannya tersebar di sepanjang satu dekade.
Ada dua konsekuensi yang mengikuti. Pertama, tidak ada satu pun 'timestamp situs' yang bisa Anda arahkan ke downloader, unduhan lengkap mengambil setiap file dari tangkapan terbaiknya sendiri. Kedua, trik tangkapan terdekat menyembunyikan celah: wayback dengan senang hati akan menyajikan gambar tahun 2016 ke halaman tahun 2014 Anda tanpa menyatakannya. Tidak berbahaya untuk penjelajahan santai, tetapi patut diketahui ketika Anda peduli apakah halaman yang dipulihkan benar-benar halaman tahun 2014.
Halaman yang diarsipkan adalah sebuah kolase. HTML, gambar, dan CSS masing-masing dibekukan pada momen yang berbeda, dan arsip merekatkannya kembali setiap kali seseorang melihat.

Alat atau skrip apa pun yang Anda gunakan membutuhkan strategi untuk ini. Strategi yang malas, mengambil semuanya pada satu timestamp, justru bagaimana Anda berakhir dengan halaman penuh ikon gambar rusak, karena setengah aset tidak memiliki tangkapan pada minggu itu. Strategi yang tepat adalah per file: ambil setiap aset dari tangkapan terdekat terbaiknya dalam rentang tanggal Anda.
Cara mengunduh seluruh situs web dari archive.org: mulai dengan inventaris
Sebelum mengambil satu file pun, daftarkan apa yang sebenarnya dipegang arsip. CDX API memberi Anda buku besar lengkap untuk sebuah domain: setiap URL yang ditangkap beserta timestamp, MIME type, dan status HTTP-nya. Filter ke statuscode 200, ciutkan digest konten duplikat, dan Anda memiliki daftar belanja yang realistis, bukan tebakan.
Baca inventaris sebelum mengunduh dan Anda akan mengetahui hal-hal yang tidak nyaman sejak awal. Pada pekerjaan forum phpBB itu, daftar CDX menunjukkan 11.000 URL yang ditangkap, dan sekitar 3.000 di antaranya adalah GIF avatar yang sama yang disimpan dengan query string berbeda. Menyingkirkan duplikat mengubah pekerjaan yang menakutkan menjadi pekerjaan biasa. Daftar yang sama juga mengungkap halaman-halaman yang tidak pernah ditangkap sama sekali, yang tidak ada metode unduhan apa pun di bumi ini yang bisa menghidupkannya kembali. Lebih baik mengetahuinya di hari pertama.
Kelompokkan yang tersisa berdasarkan MIME type dan bentuk pekerjaan itu muncul: berapa banyak halaman HTML, berapa banyak gambar, berapa banyak JavaScript, apakah ada PDF atau video yang perlu dikhawatirkan. Pengelompokan itu mendorong urutan unduhan dan pemeriksaan kelengkapan akhir Anda.
Checklist untuk mengunduh seluruh situs web dari archive.org tanpa celah
- Tarik inventaris CDX untuk domain tersebut, difilter ke tangkapan HTTP 200, mencakup rentang tanggal penuh Anda.
- Ciutkan digest konten duplikat agar file identik diunduh sekali, bukan ratusan kali.
- Kelompokkan daftar berdasarkan MIME type: halaman HTML dulu, lalu CSS, JS, gambar, font, dokumen, media.
- Unduh setiap file dari tangkapan terbaiknya sendiri, menggunakan modifier id_ untuk mendapatkan byte asli tanpa markup yang disuntikkan wayback.
- Tulis ulang tautan internal ke path relatif agar salinannya berfungsi di host mana pun, termasuk laptop Anda.
- Sajikan folder secara lokal dan klik melewatinya. Tautan rusak, gambar hilang, dan font 404 muncul dalam hitungan menit.
- Bandingkan jumlah file akhir dengan inventaris dan catat apa yang hilang dan mengapa.

Langkah terakhir itulah yang dilewati semua orang, dan itulah perbedaan antara cadangan dan tumpukan file. Manifes mengubah 'saya rasa saya mendapatkan semuanya' menjadi daftar yang bisa diaudit. Restorix mengintegrasikan ini: estimasi gratis melaporkan jumlah file arsip yang tepat dan total ukuran sebelum Anda mulai, dan pemulihan bisa mengekspor manifes JSON atau SQLite dari setiap file yang dibawanya kembali, sehingga kelengkapan adalah angka, bukan perasaan.
Celah yang akan Anda temui juga
- Halaman yang tidak pernah ditemukan crawler. Jika tidak ada yang menautkan ke sebuah halaman di web publik, wayback kemungkinan tidak pernah melihatnya.
- Pengecualian robots.txt. Crawl yang lebih lama melewatkan path yang dilarang seluruhnya, dan beberapa situs sengaja memblokir pengarsipan.
- Konten yang dirender oleh JavaScript. Secara historis, crawler menyimpan shell HTML, bukan apa pun yang dibangun skrip setelahnya.
- Login, keranjang, dan hasil pencarian. Apa pun di balik permintaan POST atau sesi adalah tembok yang tidak bisa dilewati crawler.
- Noise URL. ID sesi dan parameter pelacakan menggelembungkan inventaris dengan ribuan 'halaman' duplikat yang menyusut menjadi beberapa halaman asli.
Tidak satu pun dari ini adalah kegagalan metode Anda, ini adalah lubang di arsip itu sendiri. Nilai inventaris adalah menunjukkan lubang-lubang itu kepada Anda sebelum menjanjikan siapa pun pemulihan lengkap.
Ketika Anda memang menemukan lubang, dokumentasikan. Catatan satu halaman yang mencantumkan dua belas halaman yang tidak pernah ditangkap, video yang hanya ada sebagai thumbnail, dan bagian forum yang diblokir oleh robots.txt mengubah kejutan yang canggung menjadi ekspektasi yang terkelola. Klien memaafkan file yang hilang. Mereka tidak memaafkan menemukannya sendiri.
Apa nilai salinan lengkap
Jika situs tersebut adalah toko klien atau forum komunitas dengan satu dekade postingan, unduhan setengah jadi adalah masalah yang menyamar sebagai cadangan. Entah anggarkan waktu untuk menjalankan checklist sendiri, atau serahkan crawling, pencocokan timestamp, penulisan ulang tautan, dan pembuatan manifes ke alat yang dibangun khusus untuk pekerjaan ini. Estimasi tidak dikenakan biaya, dan alternatifnya adalah menemukan 300 gambar yang hilang setelah situs tayang.
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
FAQ
Bisakah saya mengunduh seluruh situs web dari archive.org dalam satu klik?
Archive.org sendiri tidak menawarkan ekspor seluruh situs, ini dibangun untuk penjelajahan tangkapan tunggal. Hasil satu klik datang dari alat yang menghitung indeks arsip dan mengambil setiap file: skrip seperti wayback-machine-downloader, atau layanan pemulihan seperti Restorix yang juga menangani aset, penulisan ulang tautan, dan manifes.
Mengapa gambar hilang setelah saya mengunduh seluruh situs web dari archive.org?
Biasanya salah satu dari dua alasan. Gambar tidak pernah di-crawl, jadi tidak ada salinan yang ada di mana pun, atau alat Anda mengambil halaman dari satu timestamp sementara satu-satunya tangkapan gambar yang tersisa berada di timestamp lain. Pencocokan aset lintas timestamp memperbaiki kasus kedua; tidak ada yang memperbaiki kasus pertama.
Apakah Wayback Machine mengarsipkan setiap halaman situs web?
Tidak. Ini mengarsipkan apa yang bisa dijangkau crawlernya: halaman yang ditautkan dari suatu tempat, diizinkan oleh robots.txt, dirender tanpa login atau JavaScript berat. Thread forum yang dalam, halaman pencarian faceted, dan area admin secara rutin absen. Inventaris CDX menunjukkan dengan tepat apa yang ada sebelum Anda mulai.
Berapa banyak file yang biasanya terlibat dalam unduhan situs web lengkap?
Lebih dari yang orang harapkan. Situs bisnis sederhana 50 halaman sering kali berjumlah 400-800 file setelah Anda menghitung gambar, stylesheet, skrip, dan font. Forum dan toko mencapai puluhan ribu. Jumlah file, bukan jumlah halaman, yang mendorong waktu dan biaya unduhan.
Apakah PDF, video, dan unduhan lainnya termasuk dalam arsip?
Sering kali, ya. Arsip menyimpan dokumen dan media yang bisa dijangkaunya, dan indeks CDX mencantumkannya berdasarkan MIME type bersama halaman. Video besar adalah pengecualian, video di-crawl secara tidak konsisten, jadi verifikasi di inventaris daripada mengasumsikannya selamat.
Panduan terkait

download a website from archive org
Cara Mengunduh Situs Web dari Archive.org: 3 Metode yang Terbukti Berhasil
Tiga metode teruji untuk mengunduh situs web dari archive.org: menyimpan halaman secara manual, membuat skrip CDX API, atau menggunakan layanan pemulihan otomatis. Estimasi waktu realistis untuk setiap metode.

archive.org download website
Alat Unduh Website Archive.org: Perbandingan Jujur
Perbandingan jujur alat unduh website archive.org: HTTrack, skrip wayback-machine-downloader, dan Restorix. Biaya, usaha, dan penanganan aset yang sebenarnya.

find all pages on a website
Cara Menemukan Semua Halaman di Sebuah Situs Web (Termasuk yang Sudah Dihapus)
Perlu menemukan semua halaman di sebuah situs web, termasuk yang tidak ditautkan siapa pun? Bandingkan sitemap, crawler, Wayback CDX API, dan ekspor Search Console.

wayback download
Download Wayback: Setiap Metode Diurutkan Berdasarkan Tingkat Usaha
Setiap metode download Wayback diurutkan berdasarkan tingkat usaha: halaman tunggal, skrip wget, CDX API, dan layanan otomatis yang membangun ulang seluruh situs untuk Anda.
