Situs Archive.org: Pencarian Lanjutan, Filter & Koleksi
Oleh tim editorial Restorix · 26 April 2026 · 7 menit baca

Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Kebanyakan orang mengunjungi situs Archive.org hanya sekali. Mereka menempelkan URL yang mati ke Wayback Machine, mengambil tangkapan layar, lalu pergi. Itu adalah pemborosan alat yang serius. Di balik login yang sama terdapat perpustakaan digital lengkap, puluhan juta item, dengan mesin pencari, sintaks kueri, dan filternya sendiri yang nyaris tak pernah digunakan orang.
Saya sudah menarik situs klien, perangkat lunak yang sudah mati, dan manual pindaian dari Archive.org selama bertahun-tahun. Perbedaan antara menemukan sesuatu dalam dua menit dan menyerah setelah dua puluh menit jarang disebabkan oleh keberuntungan. Hal itu bergantung pada pengetahuan tentang kotak pencarian mana yang harus digunakan dan filter mana yang harus diklik. Inilah alur kerja yang benar-benar saya ikuti.
Apa yang Sebenarnya Diindeks oleh Situs Archive.org
Kebingungan dimulai di sini. Archive.org menjalankan dua sistem berbeda yang berbagi logo. Arsip item, yang Anda cari dari halaman depan, menyimpan objek yang diunggah dan di-crawl: buku, konser, perangkat lunak, video, acara radio. Setiap item memiliki metadata, daftar file, dan ulasan. Wayback Machine, di web.archive.org, menyimpan tangkapan halaman web yang diindeks berdasarkan URL. Lebih dari 900 miliar di antaranya.
Mengapa ini penting untuk situs web lama? Karena situs yang sudah mati bisa muncul di kedua tempat tersebut dengan cara yang berbeda. Sisi Wayback memiliki halamannya. Sisi item mungkin menyimpan crawl penyelamatan Archive Team dari seluruh layanan tempat situs Anda berada, GeoCities, FortuneCity, MobileMe, yang dikemas sebagai file WARC yang dapat diunduh. Jika Anda hanya menggunakan satu pintu, Anda akan melewatkan pintu lainnya.
- Teks: buku pindaian, manual, majalah, dapat dicari dalam teks penuh
- Perangkat lunak: mulai dari CD shareware hingga peramban lama dan Flash projectors
- Audio dan video: konser langsung, arsip radio, news reels, iklan
- Item web: koleksi crawl dan hasil ambil Archive Team, disimpan sebagai file WARC
- Gambar dan data: kumpulan foto, peta pindaian, dataset penelitian
Pencarian Lanjutan di Situs Archive.org
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Kotak di halaman depan cukup untuk bootleg Beatles. Untuk pencarian yang lebih spesifik, buka halaman pencarian lanjutan, archive.org/advancedsearch.php, atau tulis kueri sendiri. Sintaksnya mirip Lucene dan ketat: nama bidang menggunakan huruf kecil, rentang menggunakan tanda kurung siku, dan operator boolean harus menggunakan huruf besar. Salah satu ini dan Anda akan diam-diam mendapatkan hasil yang tidak relevan.
Kueri untuk menemukan perangkat lunak terkait Joomla yang ditambahkan antara tahun 2005 dan 2010 terlihat seperti ini: title:(joomla) AND mediatype:software AND date:[2005-01-01 TO 2010-12-31]. Tempelkan ke dalam kotak pencarian dan itu langsung berfungsi. Tidak diperlukan formulir.
- identifier:, slug URL persis item; pencarian tercepat yang ada
- collection:, batasi ke satu koleksi, mis. collection:archiveteam
- creator: dan title:, samar tapi berguna dengan tanda kutip di sekitar frasa
- date:[YYYY-MM-DD TO YYYY-MM-DD], rentang tanggal penambahan, bukan publikasi asli
- mediatype:, teks, perangkat lunak, audio, film, gambar, web, data
- NOT, AND, OR dan tanda kurung, gabungkan dengan bebas, tetapi gunakan huruf besar
Satu hal yang perlu diperhatikan: date: memfilter saat item masuk ke arsip, bukan saat konten dibuat. Manual tahun 2003 yang diunggah pada 2019 akan cocok dengan tahun 2019.

Filter yang Melakukan Pekerjaan Berat
Setelah hasil dimuat, bilah sisi kiri adalah tempat untuk menghemat waktu. Anda dapat memfilter berdasarkan mediatype, tahun, koleksi, kreator, dan bahasa, serta mengurutkan berdasarkan relevansi, jumlah tampilan (sepanjang masa atau mingguan), tanggal ditambahkan, atau judul. Sebagian besar pencarian gagal bukan karena materinya tidak ada, melainkan karena berada di halaman sembilan di balik dua ratus episode podcast. Filter memperbaikinya.
- Filter mediatype terlebih dahulu. Mencari CMS yang sudah tidak beroperasi di semua item akan menenggelamkan Anda dalam audio.
- Urutkan berdasarkan tampilan mingguan saat Anda menginginkan materi yang terawat, banyaknya penonton adalah sinyal kualitas yang cukup baik.
- Susun filter koleksi dan tahun untuk merekonstruksi tampilan salah satu sudut web pada, misalnya, tahun 2008.
| Filter | Penggunaan terbaik |
|---|---|
| Mediatype | Menghilangkan 90% kebisingan dengan satu klik |
| Tahun | Membangun ulang linimasa seputar masa pakai situs |
| Koleksi | Tetap berada dalam crawl tepercaya atau proyek penyelamatan |
| Kreator / pengunggah | Mengikuti satu set lengkap dari seorang arsiparis |
| Tampilan mingguan | Menemukan item yang masih aktif digunakan orang |
Koleksi yang Perlu Diketahui untuk Situs Web Lama
Koleksi adalah rak yang dikurasi, dan segelintir di antaranya sangat berharga bagi siapa pun yang mengejar situs web lama:
- archiveteam, hasil ambil yang panik dan penuh cinta dari layanan yang sekarat: GeoCities, FortuneCity, Posterous, MobileMe. Sering kali crawl WARC lengkap dari seluruh platform hosting.
- geocities dan mirror-nya, penyelamatan Yahoo! GeoCities, pemulihan satu halaman web pribadi terbesar yang pernah dilakukan.
- widecrawl dan koleksi crawl lainnya, crawl massal Internet Archive, berguna saat tampilan per-URL Wayback memiliki celah.
- koleksi perpustakaan perangkat lunak, peramban lama, Flash, Shockwave, Java applets. Anda memerlukan ini untuk menjalankan apa yang disajikan situs lama.
- perpustakaan perangkat lunak cd-rom, disk shareware penuh dengan pembuat situs akurat era, penghitung, dan skrip buku tamu.
Mulailah dari halaman koleksi, bukan kotak pencarian. Pengelola biasanya mendokumentasikan apa yang ada di dalamnya, bagaimana cara di-crawl, dan apa arti tata letak file, konteks yang menyelamatkan Anda dari menebak-nebak pada pukul 2 pagi.

Situs Archive.org vs. Wayback Machine: Pintu Mana yang Harus Digunakan
| Pencarian item Archive.org | Wayback Machine | |
|---|---|---|
| Anda mencari | Item berdasarkan metadata | URL berdasarkan alamat |
| Anda mendapatkan | File yang dapat diunduh | Tangkapan yang dirender |
| Paling cocok untuk | Perangkat lunak, media, crawl massal | Halaman dari situs tertentu |
| Kelemahan | Tidak ada rendering halaman | Tidak ada unduhan seluruh situs resmi |
Aturan praktis: jika Anda dapat menyebutkan URL-nya, mulailah di Wayback Machine. Jika Anda hanya bisa mendeskripsikan barangnya, tema phpBB yang digunakan semua orang pada tahun 2007, pencarian item adalah pemenangnya. Untuk pemulihan penuh, Anda biasanya akan menggunakan keduanya: crawl dan data CDX dari sisi item, tangkapan halaman dari sisi Wayback.
Alur Kerja Nyata: Berburu Forum Klien yang Sudah Mati
Kasus konkret. Forum phpBB milik klien dari tahun 2009 menghilang saat host ditutup pada tahun 2014. Domain tersebut diparkir selama bertahun-tahun; mereka ingin kontennya kembali. Berikut adalah urutan langkah yang berhasil:
- Kueri Wayback CDX pada domain untuk memetakan URL mana yang ditangkap dan kapan, sekitar 1.400 tangkapan, sebagian besar dari tahun 2010 hingga 2012.
- Pencarian item untuk nama domain dan situs di dalam collection:archiveteam, kali ini tidak ada hasil, tetapi ini hanya pemeriksaan tiga puluh detik.
- Pemeriksaan koleksi pada host lama, host itu sendiri sebagian telah diambil oleh Archive Team, yang mengisi beberapa celah templat dan gambar.
- Pencarian yang difilter tahun pada perangkat lunak forum untuk mengambil paket phpBB yang sesuai era sebagai referensi.
Total waktu: sekitar empat puluh menit, sebagian besar untuk membaca output CDX. Mencari adalah bagian yang mudah setelah Anda mengetahui pintunya. Perhatikan apa yang tidak terjadi: tidak ada menebak cache Google, tidak ada memohon ke kotak masuk dukungan host lama, belum membayar siapa pun. Arsip memberi tahu kami persis apa yang bertahan, 1.400 tangkapan, celah yang diketahui pada tahun 2013, dan crawl penyelamatan parsial untuk menambalnya. Data CDX yang sama itulah yang dibaca oleh estimasi Restorix untuk menghitung file dan menentukan harga pemulihan, di sinilah kisah ini berlanjut di bawah.
Ketika Situs Archive.org Tidak Cukup
Semua hal di atas menemukan materi. Itu tidak memberikan Anda situs web yang berfungsi. Tangkapan Wayback hadir dengan URL yang ditulis ulang, gambar yang hilang, formulir yang mati, dan tautan absolut yang mengarah ke domain yang tidak lagi Anda kendalikan. Membangun ulang situs dari tangkapan mentah secara manual memakan waktu berhari-hari penuh skrip sed dan penyesalan.
Celah itulah yang dibangun untuk diatasi oleh Restorix. Tempelkan URL-nya, dan estimasi gratis akan menunjukkan jumlah file arsip yang tepat, total ukuran, dan harga terkunci sebelum Anda membayar apa pun. Pemulihan dapat menghapus analitik dan iklan, mengonversi tautan menjadi relatif, memaksa HTTPS, dan meneruskan langsung ke VPS, hosting FTP, atau S3 Anda, dengan CMS satu file yang disertakan sehingga Anda dapat mengedit konten yang dihidupkan kembali.
Gunakan situs Archive.org untuk mencari: verifikasi apa yang ada, kapan, dan berapa banyak yang bertahan. Kemudian biarkan perkakas melakukan rekonstruksi. Waktu Anda lebih berharga daripada akhir pekan penuh untuk mengurai WARC.
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
FAQ
Apakah situs Archive.org gratis digunakan?
Ya. Mencari, streaming, dan mengunduh item publik tidak dikenai biaya, dan tidak diperlukan akun untuk menjelajah. Akun gratis menambahkan favorit, unggahan, dan daftar. Meminjam buku modern tertentu memerlukan akun, tetapi semua yang dibahas dalam panduan ini bersifat terbuka.
Apa perbedaan antara situs Archive.org dan Wayback Machine?
Archive.org adalah perpustakaan digital induk: item seperti buku, perangkat lunak, audio, dan koleksi crawl, yang dapat dicari berdasarkan metadata. Wayback Machine adalah salah satu layanan di dalamnya, menyimpan lebih dari 900 miliar tangkapan halaman web yang diindeks berdasarkan URL. Situs web lama bisa muncul di keduanya, sebagai tangkapan Wayback dan sebagai item crawl massal.
Bisakah saya melakukan pencarian teks penuh pada halaman web lama di Archive.org?
Tidak. Wayback Machine mengindeks berdasarkan URL, bukan teks halaman, Anda memerlukan alamatnya, bukan kata kunci. Pencarian teks penuh hanya berfungsi di dalam item teks seperti buku pindaian. Untuk halaman, temukan URL-nya terlebih dahulu (tautan lama, mesin pencari, wildcard CDX), lalu cari.
Bagaimana cara mengunduh sesuatu yang saya temukan di situs Archive.org?
Setiap halaman item memiliki kotak unduhan yang mencantumkan file individual, ditambah opsi torrent dan item lengkap. Untuk situs web yang ditangkap oleh Wayback Machine tidak ada tombol unduh, hal itu memerlukan CDX API, alat pengunduh, atau layanan pemulihan seperti Restorix. Panduan kami tentang [mengunduh dari Archive.org](/id/download-archive-org) menjelaskan setiap metode.
Mengapa saya tidak dapat menemukan situs lama tertentu sama sekali?
Tiga alasan umum: robots.txt situs memblokir crawler, situs tidak pernah ditautkan ke tempat yang diikuti crawler, atau semuanya berada di balik login atau Flash dan JavaScript yang berat. Periksa CDX API untuk domain telanjang sebelum menyerah, tangkapan terkadang tersembunyi di balik subdomain aneh atau varian www yang Anda lupakan.
Panduan terkait

wayback machine archive org
Wayback Machine di Archive.org: Panduan Praktis Situs
Tur praktis Wayback Machine di Archive.org: di mana ia berada, cara kerja kotak pencarian dan kalender yang sebenarnya, dan cara keluar dengan file nyata.

archiveorg
Archiveorg: Menjelajahi Perpustakaan Gratis Terbesar di Internet
Archiveorg lebih dari sekadar Wayback Machine: buku gratis, musik live, berita TV, perangkat lunak yang bisa dimainkan, dan lebih dari 900 miliar halaman web. Panduan lengkap, plus pemulihan file.

download archive org
Cara Mengunduh dari Archive.org: Item, Snapshot, dan Lainnya
Setiap cara praktis untuk mengunduh konten Archive.org, file item, unduhan massal via CLI, dan snapshot web Wayback, serta cara memilih yang tepat untuk kebutuhan Anda.

archive org download
Format Unduhan Archive.org: WARC, CDX & File Tunggal
Apa yang sebenarnya dikandung setiap format unduhan Archive.org, tangkapan WARC, indeks JSON CDX, dan file asli tunggal, dan apa yang harus dilakukan dengan masing-masing.
