Cara Menemukan Semua Halaman di Sebuah Situs Web (Termasuk yang Sudah Dihapus)
Oleh tim editorial Restorix · 25 Mei 2026 · 7 menit baca

Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Berapa banyak halaman yang dimiliki situs kami? Kedengarannya seperti pertanyaan yang punya basis data di baliknya. Jarang sekali begitu. Tahun lalu seorang klien bersikeras situsnya punya sekitar 400 halaman. Sitemap menyebutkan 1.900. Sebuah crawler menemukan 3.400. Indeks Wayback Machine mencantumkan 11.000 URL yang pernah dilayani situs tersebut, setengahnya sudah lama dihapus. Empat sumber, empat jawaban, dan keempatnya benar tentang hal yang berbeda.
Berikut empat metode yang saya gunakan untuk menemukan semua halaman di sebuah situs web, apa yang sebenarnya dicakup masing-masing, dan cara menggabungkannya menjadi satu daftar rapi yang bisa Anda tindaklanjuti.
Mengapa sulit menemukan semua halaman di sebuah situs web
Tidak ada daftar induk kecuali CMS kebetulan menyimpannya, dan bahkan kalau ada, CMS hanya tahu tentang dirinya sendiri. Situs-situs nyata mengakumulasi halaman yang luput dari inventaris mana pun: halaman yatim yang tidak ditautkan menu mana pun, bagian yang tertinggal dari migrasi lama, unggahan yang dirujuk sekali dalam kampanye email, URL faceted yang dibuat secara dinamis, seluruh subdomain yang didirikan seseorang pada 2016 lalu dilupakan.
Setiap metode penemuan melihat potongan berbeda dari kekacauan itu. Sitemap adalah laporan mandiri CMS. Crawler memetakan grafik tautan. Indeks CDX Wayback Machine mengingat sejarah. Search Console melaporkan apa yang sebenarnya disajikan Google ke pengguna. Tak ada yang lengkap; bersama-sama hasilnya mendekati.
Tentukan dulu untuk apa daftar itu sebelum membuatnya. Inventaris migrasi, audit SEO, dan pemulihan situs mati membutuhkan bahan mentah yang sama tapi pembersihan yang berbeda.
Sitemap: cara tercepat menemukan semua halaman di sebuah situs web
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Mulai dari /sitemap.xml. Kalau muncul 404, periksa robots.txt untuk direktif Sitemap:, banyak situs menyimpan file itu di jalur yang tidak biasa. WordPress core sudah menyajikan /wp-sitemap.xml sejak versi 5.5; Yoast dan Rank Math menghasilkan /sitemap_index.xml, yang bercabang menjadi sitemap anak per tipe posting. Ambil indeksnya, lalu setiap anaknya.
Protokolnya membatasi setiap file sitemap hingga 50.000 URL dan 50 MB tanpa kompresi, jadi situs besar selalu memakai indeks, jangan berhenti di file pertama yang Anda temukan.
Sekarang catatan pentingnya, karena sitemap berbohong lewat omisi. Sitemap hanya mencantumkan apa yang diketahui CMS: tidak ada unggahan media yatim, tidak ada halaman yang dihapus bertahun-tahun lalu, tidak ada bagian warisan yang berjalan di luar CMS, tidak ada yang dihasilkan skrip kustom di /old-tools/. Dan pada sitemap yang dibuat manual atau kedaluwarsa, bahkan daftar yang sudah dikenal pun fiktif. Periksa silang tanggal lastmod dengan halaman yang baru saja Anda perbarui; kalau tidak cocok, jangan percaya apa pun.

Rayapi situs seperti yang Googlebot lakukan
Crawler memulai dari beranda dan mengikuti setiap tautan yang bisa dilihatnya, sama seperti yang dilakukan mesin pencari. Screaming Frog adalah standar industri dan gratis hingga 500 URL; Sitebulb lebih ramah untuk audit; untuk kendali penuh, skrip Python kecil dengan requests dan BeautifulSoup, atau wget dalam mode spider, tidak butuh biaya.
Crawling menemukan apa yang dilewatkan sitemap: arsip paginasi yang tidak ditambahkan siapa pun ke sitemap, halaman tag dan kategori, tautan rusak yang menunjuk ke halaman yang masih ada, rantai redirect yang membakar crawl budget.
Titik butanya adalah cerminan dari titik buta sitemap. Kalau tidak ada yang menautkan ke sebuah halaman, crawler tidak akan pernah menemukannya. Menu yang dirender JavaScript butuh peramban headless atau crawling berhenti di beranda. Dan navigasi faceted, filter, kalender, urutan sortir, bisa menggembungkan toko berisi 500 halaman menjadi jebakan crawl 500.000 URL; pasang aturan pengecualian sebelum Anda menekan mulai, bukan sesudah. Pada situs yang bukan milik Anda, jaga concurrency tetap rendah dan hormati robots.txt.
Wayback CDX API: temukan semua halaman di sebuah situs web, masa lalu dan sekarang
Ini adalah metode yang hampir tidak dipakai siapa pun dan yang paling banyak menemukan. Server CDX Internet Archive akan mencantumkan setiap URL yang pernah ditangkapnya untuk sebuah host, termasuk halaman yang dihapus satu dekade lalu, yang tidak bisa dilihat metode aktif mana pun.
Satu perintah curl mendapatkan inventaris lengkap:
curl "https://web.archive.org/cdx/search/cdx?url=example.com/*&output=text&fl=timestamp,original,statuscode&filter=statuscode:200&collapse=urlkey&from=2010&to=2020"
Parameter yang penting: collapse=urlkey melakukan deduplikasi tangkapan berulang untuk URL yang sama; filter=statuscode:200 membuang 404 dan redirect; matchType=domain memperluas jangkauan ke subdomain; from dan to membatasi rentang tahun. Untuk situs mati, jendela tanggal itulah tempat emasnya.
Harapkan volume besar. Forum atau toko yang sudah lama berjalan bisa mengembalikan jutaan baris, dan derau query string, ID sesi, parameter pelacakan, menggelembungkan daftar. API-nya gratis tetapi terbatas kecepatannya, jadi bersabarlah dengan domain besar dan pecah tarikan besar menjadi potongan tahunan.

Kalau Anda ingin jawabannya tanpa repot, Restorix menjalankan indeks yang sama untuk estimasi gratisnya, tempelkan domain dan ia melaporkan jumlah file arsip yang tepat dan total ukuran dalam hitungan detik, tanpa perlu kueri.
Google Search Console: temukan semua halaman yang ditunjukkan situs web Anda ke Google
Untuk situs yang Anda miliki, Search Console menambahkan satu set data yang tidak dimiliki siapa pun: apa yang sebenarnya diindeks dan disajikan Google. Verifikasi kepemilikan, lalu kerjakan dua laporan.
- Laporan Performa, tab Halaman: setiap URL yang memperoleh tayangan, bisa diekspor. UI web membatasi ekspor hingga 1.000 baris; Search Analytics API mem-paging jauh melampaui itu, dan ekspor massal ke BigQuery menyediakan set data lengkap setiap hari.
- Pengindeksan, laporan Halaman: diindeks versus crawled-currently-not-indexed, dengan contoh URL, gambaran cepat tentang seberapa banyak dari situs yang bahkan dianggap perlu disimpan Google.
Nilai uniknya adalah data tayangan: halaman yang dijangkau pengguna nyata, termasuk halaman yatim yang tidak ditautkan apa pun. Kalau halaman landing yang terlupakan masih menyedot tiga puluh klik per bulan, halaman itu masuk daftar pertahankan. Bing Webmaster Tools menawarkan laporan serupa kalau lalu lintas Bing penting bagi Anda.
Gabungkan, deduplikasi, dan bersihkan daftar
Empat sumber, empat format, penggabunganlah tempat nilainya muncul. Tuang semuanya ke satu CSV, lalu normalkan sebelum deduplikasi, atau halaman yang sama akan muncul enam kali dalam enam penyamaran.
Penyamaran itu bukan hipotetis. Satu halaman produk nyata bisa muncul sebagai https://www.example.com/page/?utm_source=newsletter, http://example.com/page, example.com/page/#comments, example.com/page?fbclid=abc123, www.example.com/page/index.html, dan EXAMPLE.com/page, enam baris, satu dokumen. Huruf besar-kecil, protokol, www, parameter, fragmen, dan nama file bawaan semuanya harus diciutkan menjadi satu bentuk kanonik sebelum proses deduplikasi berarti. Lewati langkah ini dan inventaris 11.000 URL Anda sebenarnya cuma 6.000 URL yang berdandan.
- Ubah hostname menjadi huruf kecil; hapus fragmen (#bagian) seluruhnya.
- Buang parameter pelacakan: utm_*, fbclid, gclid, ref. Urutkan parameter kueri yang tersisa.
- Pilih satu konvensi garis miring di akhir dan tegakkan.
- Ciptutkan varian protokol dan www ke bentuk kanonik Anda.
Setelah deduplikasi, klasifikasikan setiap URL: live 200, melakukan redirect, 404 sekarang tapi diarsipkan, atau hilang sepenuhnya. Kelompok ketiga, dihapus tapi ada di data CDX, adalah kelompok yang dilupakan dan disesalkan saat migrasi. Skrip Python dua puluh baris menangani semua ini untuk kebanyakan situs; spreadsheet cukup sampai beberapa ribu URL.
Perbandingan singkat empat sumber:
| Sumber | Melihat halaman yang dihapus? | Butuh akses situs? | Apa yang sebenarnya dicakupnya |
|---|---|---|---|
| sitemap.xml | Tidak | Tidak | Halaman yang diakui CMS, saat ini |
| Crawler | Tidak | Tidak | Segala yang dapat dicapai lewat tautan |
| Wayback CDX API | Ya | Tidak | Setiap URL yang pernah ditangkap arsip |
| Search Console | Tidak | Ya | URL yang diindeks atau disajikan Google |
Anda menemukan setiap halaman, lalu apa
Untuk migrasi, daftar itu menjadi peta redirect Anda: setiap URL dengan tayangan di Search Console atau tangkapan di data CDX mendapatkan 301 ke padanan modern terdekatnya. Untuk audit SEO, kolom crawl dan index mengungkap bagian tipis dan jebakan crawl. Keduanya beberapa sore kerja yang serius.
Kalau daftar itu untuk situs mati yang ingin Anda hidupkan kembali, lewati pembangunan ulang manual. Restorix memulihkan semuanya dari Wayback Machine: estimasi gratis menunjukkan jumlah dan ukuran file yang tepat dengan harga terkunci, Anda membayar per file yang dipulihkan dengan file pertama gratis, dan opsi pembersihan menghapus analitik lama, mengubah tautan menjadi relatif, dan memperkecil aset. Hasilnya diterapkan ke hosting Anda dalam satu klik, atau diekspor sebagai XML, CSV, atau JSON dengan manifes file lengkap kalau Anda ingin bahan mentahnya saja. Bagaimanapun juga, kerja enumerasi yang baru Anda lakukan memberi tahu Anda persis apa yang seharusnya dikandung sebuah pemulihan yang baik.
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
FAQ
Apakah sitemap mencantumkan setiap halaman di sebuah situs web?
Tidak. Sitemap hanya mencantumkan apa yang diterbitkan CMS: tidak ada halaman yatim, tidak ada unggahan, tidak ada yang dihapus, dan tidak ada yang berada di luar CMS. Anggap itu sebagai laporan mandiri situs, bukan sensus.
Bagaimana cara menemukan halaman yatim yang tidak ditautkan oleh tautan internal mana pun?
Gabungkan tiga sumber: data tayangan Search Console, indeks Wayback CDX, dan log server kalau Anda memilikinya. Halaman yatim yang pernah mendapat lalu lintas atau tangkapan akan muncul di setidaknya salah satu dari ketiganya.
Bisakah saya menemukan halaman yang dihapus bertahun-tahun lalu?
Bisa, itu yang diberikan Wayback CDX API: setiap URL yang pernah ditangkap Internet Archive, termasuk halaman yang dihapus satu dekade lalu. Metode aktif seperti sitemap dan crawler sama sekali tidak bisa melihat konten yang dihapus.
Apakah merayapi situs web orang lain itu legal?
Merayapi halaman publik pada laju yang sopan umumnya diterima, dan pengadilan di beberapa yurisdiksi menganggap scraping data publik sebagai hal yang sah, tetapi hormati robots.txt, hargai ketentuan situs, jaga laju permintaan tetap rendah, dan ingat bahwa menerbitkan ulang konten berhak cipta adalah pertanyaan terpisah dari sekadar membacanya.
Mengapa crawl saya menemukan lebih banyak halaman daripada yang diindeks Google?
Bisa di-crawl dan diindeks adalah hal yang berbeda. Google menolak mengindeks halaman yang dianggapnya tipis, duplikatif, atau bernilai rendah, dan navigasi faceted bisa menggelembungkan crawl Anda dengan URL nyaris duplikat. Laporan pengindeksan Search Console menunjukkan kubu mana yang dimasuki setiap halaman.
Apa cara tercepat untuk mendapatkan inventaris halaman yang lengkap?
Ambil sitemap-nya, lalu tarik indeks CDX dengan collapse=urlkey, gabungkan kedua daftar, dan deduplikasi. Untuk kebanyakan situs itu pekerjaan di bawah satu jam dan mencakup masa kini serta seluruh masa lalu yang diarsipkan.
Panduan terkait

wayback machine downloader
Alat Pengunduh Wayback Machine: Apa yang Benar-Benar Berfungsi
Tinjauan jujur tentang alat pengunduh Wayback Machine: skrip open-source, keterbatasan sebenarnya, dan opsi jadi-langsung-pakai yang mengembalikan situs Anda ke online.

download entire website from archive org
Unduh Seluruh Situs Web dari Archive.org, Bukan Hanya Halaman Utama
Untuk mengunduh seluruh situs web dari archive.org, Anda membutuhkan setiap halaman, gambar, dan stylesheet. Aset tersembunyi di balik timestamp yang berbeda, berikut alasannya, beserta checklist lengkap.

find website history
Temukan Riwayat Situs Web: Buktikan Apa yang Dikatakan Situs dan Kapan
Temukan riwayat situs web yang dapat diandalkan: cuplikan arsip, stempel waktu, dan sumber pendukung untuk sengketa, jurnalisme, dan investigasi OSINT.

restore deleted site
Memulihkan Situs yang Dihapus: Yang Harus Dilakukan dalam 48 Jam Pertama
Hosting Anda menghapus situs Anda? Ikuti rencana triase 48 jam ini, lalu pulihkan situs yang dihapus dari arsip web langkah demi langkah.
