Sejarah Situs Internet: Tersimpan, Hilang, dan Alasannya
Oleh tim editorial Restorix · 29 Mei 2026 · 7 menit baca

Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Pada April 2009, Yahoo mengumumkan penutupan GeoCities. Tiga puluh delapan juta halaman pengguna, file MIDI, rambu konstruksi animasi, situs penggemar untuk segala hal mulai dari The X-Files hingga ikan tropis, dijadwalkan untuk dihapus pada bulan Oktober. Sekelompok relawan bernama Archive Team menghabiskan waktu enam bulan mengunduh sebanyak mungkin yang diizinkan oleh bandwidth mereka dan merilis hasilnya sebagai torrent. Sebagian kecil web awal bertahan karena orang asing memutuskan untuk menyimpannya. Sebagian besar web awal tidak seberuntung itu.
Ini adalah tinjauan tentang apa yang benar-benar dilestarikan dari beberapa dekade pertama dunia maya, apa yang hilang secara permanen, serta alasan teknis dan sosial di balik keduanya. Jika Anda mencoba memulihkan satu situs lama tertentu, lewati ke bagian terakhir, bagian itu untuk Anda.
Sejarah situs internet lebih muda dari yang Anda kira
Web mulai dibuka untuk umum pada Agustus 1991, ketika Tim Berners-Lee mengumumkan proyek World Wide Web dari CERN dan mengarahkan orang ke info.cern.ch. Tidak ada yang mengarsipkannya. Tidak ada alat untuk mengarsipkan, web crawler berskala besar masih bertahun-tahun lagi, dan ide sengaja melestarikan situs web dianggap sebagian besar orang sebagai penimbunan.
Internet Archive didirikan pada Mei 1996 oleh Brewster Kahle, dengan data crawl yang mengalir dari Alexa Internet. Wayback Machine sendiri dibuka untuk umum pada Oktober 2001, sudah menyimpan 10 miliar halaman. Saat ini ia menyimpan lebih dari 900 miliar halaman. Mengesankan, tetapi celahnya penting. Dari 1991 hingga 1996 tidak ada pengarsipan sistematis sama sekali. Ketika CERN memulihkan situs web pertama di alamat aslinya pada 2013, salinan tertua yang bisa ditemukan siapa pun berasal dari November 1992. Aslinya tahun 1991, yang bisa dibilang halaman terpenting dalam sejarah web, hanya bertahan dalam tangkapan layar dan rekonstruksi.
Semua hal dari celah lima tahun itu bertahan secara tidak sengaja: kaset cadangan sysadmin, CD-ROM yang dibundel dengan majalah, cermin FTP yang dilupakan orang untuk dihapus.
Siapa menyimpan apa: arsiparis, relawan, dan perpustakaan
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Empat kelompok melakukan penyimpanan, masing-masing dengan motif dan cakupan yang berbeda.
- Internet Archive menjalankan crawl terus-menerus dan menerima kiriman publik Save Page Now. Ini adalah memori default web dan tempat pertama untuk diperiksa.
- Archive Team adalah kolektif penyelamat relawan yang bergerak ketika sebuah layanan mengumumkan penutupan. GeoCities pada 2009, Google+ dan Yahoo Groups pada 2019, mereka mengambil apa yang mereka bisa dan merilisnya sebagai torrent.
- Perpustakaan nasional mengarsipkan secara selektif. UK Web Archive telah beroperasi di bawah ketentuan serah simpan legal sejak 2013; arsip PANDORA Australia telah mengkurasi situs-situs Australia penting sejak 1996.
- Common Crawl telah menerbitkan kumpulan data crawl terbuka yang masif sejak 2008, sangat berharga bagi peneliti, tetapi tidak ada antarmuka kalender yang ramah untuk penjelajahan santai.
Layak disebutkan secara terpisah: archive.today, yang berjalan sejak 2012, mengambil tangkapan sesuai permintaan dan sering kali menyimpan halaman yang dilewatkan oleh Internet Archive, terutama yang diblokir dari crawl IA.

Apa yang disimpan oleh sejarah situs internet: statis, publik, populer
Perhatikan apa yang paling bertahan dan sebuah pola akan terlihat jelas. Arsip cenderung menyimpan apa pun yang dapat dijangkau oleh crawler dengan murah dan sering.
- Halaman HTML statis dengan tautan biasa, makanan asli crawler.
- Gambar dan file yang ditautkan langsung dari halaman yang ditangkap, setidaknya ketika ukuran file masih masuk akal.
- Halaman dengan banyak tautan masuk, karena crawler mengikuti tautan dan halaman populer di-crawl ulang terus-menerus.
- Situs yang robots.txt-nya mengizinkan crawling, satu Disallow: / menyembunyikan semuanya.
- Teks jenis apa pun. Terkompresi dengan baik dan disajikan kembali dengan cepat.
Halaman beranda pribadi buatan tangan tahun 1998, latar belakang ungu, penghitung pengunjung, halaman tautan, biasanya dapat diambil sepenuhnya, termasuk GIF. Sebuah toko online tahun 2008 dengan jejak budaya sepuluh kali lipat sering kali tidak. Popularitas dan kesederhanaan mengalahkan yang lain.
Apa yang hilang selamanya, dan alasannya
Kerugian terkumpul dalam beberapa kelompok yang dapat diprediksi, dan yang terbesar adalah file teks biasa. Hingga perubahan kebijakan pada 2017, Internet Archive menghormati pengecualian robots.txt dan menerapkannya secara retroaktif, satu editan file bisa menyembunyikan tangkapan yang ada selama bertahun-tahun dari tampilan publik. Domain dijual, pemilik baru memasang file robots yang ketat, dan satu dekade sejarah menghilang dalam semalam. Situs tak terhitung jumlahnya menghilang dari arsip dengan cara ini sementara datanya secara teknis masih ada.
Apa pun yang berada di balik login tidak pernah di-crawl: forum pribadi, jejaring sosial awal, komunitas khusus anggota. Redesain Friendster tahun 2011 menghapus profil selama bertahun-tahun dalam satu deployment. Halaman dinamis berbasis database paling tidak di-crawl secara konsisten, crawler menangani tautan GET, bukan formulir POST, sehingga hasil pencarian, keranjang belanja, dan daftar yang difilter secara efektif tidak pernah ada sejauh menyangkut arsip.

Media berat juga bernasib buruk. Audio dan video streaming dari era RealPlayer, applet Java, dan apa pun yang disajikan melalui protokol aneh dilewati atau ditangkap dalam keadaan rusak. Flash adalah kasus tepi yang terkenal: file.swf sering disimpan tetapi tidak bisa diputar selama bertahun-tahun, sampai emulator Ruffle membuat banyak di antaranya berjalan lagi pada 2020. Bagian Flash yang tidak ditangkap siapa pun benar-benar hilang.
Angkanya suram bahkan untuk web terbaru. Pew Research menemukan pada 2024 bahwa 38 persen halaman yang ada pada 2013 tidak lagi dapat diakses. Sebuah studi Harvard tentang link rot menemukan sekitar setengah dari URL yang dikutip dalam pendapat Mahkamah Agung AS sudah mati. Pelestarian adalah pengecualian. Pembusukan adalah default.
Mengapa situs dinamis merusak pengarsipan
Crawler mengambil URL. Itulah seluruh triknya. Forum phpBB tahun 2005 atau toko osCommerce bukan kumpulan URL, ini adalah database yang mengenakan URL sebagai kostum, menghasilkan halaman sesuai permintaan dari query string seperti viewtopic.php?t=4821&start=40. Ruang URL secara efektif tak terbatas, sehingga crawler hanya mencontohnya. Mereka menangkap halaman indeks dan utas apa pun yang tertaut dengan baik bulan itu, dan melewatkan sisanya.
Sesi dan cookie membuatnya lebih buruk: URL yang sama mengembalikan konten berbeda per pengunjung, sehingga tangkapan mungkin menyimpan stub yang keluar-log atau pengalihan. Dan ada sudut pandang ekonomi yang blak-blakan, teks murah untuk diambil dan disimpan, media tidak. Crawl yang dibatasi melewatkan file besar untuk menekan biaya, itulah sebabnya begitu banyak halaman arsip dimuat sebagai teks dengan lubang abu-abu di tempat gambar dulu berada.
Hasilnya: arsip biasanya hanya menyimpan kerangka situs, halaman beranda, artikel statis, beberapa utas yang tertaut dengan baik, tetapi bukan organisme hidupnya. Kotak pencarian, daftar anggota, alur checkout: hal-hal itu tidak pernah bisa ditangkap dalam arti yang berarti.
Cara menjelajahi sejarah situs internet sendiri
Untuk situs tertentu, alurnya singkat:
- Masukkan domain di web.archive.org. Sparkline di atas kalender menunjukkan kepadatan tangkapan per tahun, tahun yang sibuk berarti cakupan yang menyeluruh.
- Buka tangkapan terlama terlebih dahulu, lalu maju ke depan. Tangkapan awal mengungkap struktur asli dan pola URL lama.
- Mencari URL tertentu? Kueri indeks CDX atau tempel alamat langsung ke bilah Wayback, panduan saya tentang menemukan setiap halaman yang pernah dimiliki situs mencakup trik API.
- Periksa silang archive.today untuk apa pun yang dilewatkan oleh Internet Archive.
- Untuk materi pra-1996, carilah cermin yang dijalankan operator, koleksi universitas, dan proyek nostalgia alih-alih arsip formal.
Jika Anda menginginkan gambaran besar alih-alih satu halaman, panduan kami tentang cara mencari riwayat situs web dan menelusuri riset riwayat situs web mencakup kalender, koleksi, dan arsip alternatif secara rinci.
Ketika sekadar menjelajah masa lalu tidak cukup
Wayback Machine adalah ruang baca, bukan tombol pemulihan. Saat Anda butuh situs yang benar-benar kembali, file, gambar, tautan internal yang berfungsi di domain Anda sendiri, penyimpanan manual akan berantakan setelah sekitar selusin halaman. Klik kanan, simpan sebagai, perbaiki jalur, ulangi: itu memakan waktu satu sore per bagian, dan hasilnya adalah folder berisi fragmen.
Layanan pemulihan ini hadir tepat untuk tugas tersebut. Tempelkan domain dan estimasi gratis akan menunjukkan jumlah file arsip yang tepat, total ukuran, dan harga terkunci sebelum Anda membayar apa pun. Anda membayar per file yang dipulihkan, file pertama gratis, dan pemulihan dapat difilter berdasarkan rentang tanggal serta dibersihkan, analitik dan iklan lama dihapus, tautan dibuat relatif, HTTPS diterapkan. Situs yang dibangun ulang di-deploy ke hosting Anda sendiri dalam satu klik, atau diekspor sebagai data terstruktur. Tutorial menunjukkan alur lengkapnya.
Sejarah situs internet tidak merata, tetapi apa yang bertahan biasanya dapat dipulihkan jika Anda menggunakan alat yang tepat untuk pekerjaan tersebut.
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
FAQ
Sedalam apa sejarah situs internet tersimpan di Wayback Machine?
Tangkapan dimulai pada 1996, ketika Internet Archive mulai melakukan crawling. Web itu sendiri dimulai pada 1991, sehingga lima tahun pertama hanya ada di cadangan pribadi dan rekonstruksi, situs web pertama CERN yang dipulihkan, misalnya, berasal dari salinan November 1992.
Apakah semua hal dari internet awal diarsipkan di suatu tempat?
Tidak. Halaman yang diblokir oleh robots.txt, konten di balik login, media berat, dan halaman yang dihasilkan secara dinamis jarang ditangkap. Jika Wayback Machine maupun archive.today tidak memiliki suatu halaman, kemungkinan besar halaman itu hanya bertahan di tangan pribadi, jika sama sekali masih ada.
Mengapa halaman lama menunjukkan 'tidak ada di arsip' padahal situsnya sudah pasti tua?
Biasanya karena salah satu dari empat alasan: robots.txt memblokir crawler, halaman tidak memiliki tautan masuk untuk diikuti crawler, halaman dihasilkan secara dinamis, atau tangkapan domain disembunyikan setelah perubahan kepemilikan. Usia saja tidak pernah menjamin cakupan.
Apa yang terjadi pada semua situs GeoCities?
Yahoo menghapusnya pada Oktober 2009. Archive Team menyelamatkan sebagian besar dan merilisnya sebagai torrent berukuran sekitar 900 GB, dan cermin seperti Reocities tetap membuat sebagiannya dapat dijelajahi. Banyak halaman GeoCities juga ada di Wayback Machine, tetapi cadangan resmi yang lengkap tidak pernah dipublikasikan.
Bisakah pemilik situs menghapus situs mereka dari arsip web?
Internet Archive menghormati permintaan penghapusan dari pemilik situs, dan perubahan robots.txt secara historis menyembunyikan tangkapan secara retroaktif hingga perubahan kebijakan pada 2017. Penjualan domain telah menghapus akses publik ke arsip dengan cara ini. Namun, menghapus situs dari server Anda tidak menghapus tangkapan yang ada dengan sendirinya.
Apakah menghapus situs web saya akan menghapusnya dari Wayback Machine?
Tidak otomatis. Tangkapan yang sudah diambil tetap tersedia kecuali pemilik domain mengajukan permintaan pengecualian. Jika Anda ingin sesuatu hilang dari arsip, Anda harus memintanya, sekadar mengambil situs itu offline meninggalkan riwayatnya tetap di tempat.
Panduan terkait

website history
Riwayat Situs Web: Snapshot, WHOIS, DNS, dan Alat untuk Masing-Masing
Riwayat situs web bisa berarti snapshot arsip, catatan WHOIS, perubahan DNS, atau peringkat lama. Pelajari alat mana yang menjawab pertanyaan mana, dan cara membangun kembali situs yang hilang.

search website history
Cara Mencari Riwayat Situs Web Sebelum Membeli Domain
Cari riwayat situs web sebelum membeli domain: rekam jejak lama, pergantian kepemilikan, bawaan spam, dan jebakan merek dagang, alur kerja due-diligence selama 30 menit.

historical web
Web Sejarah sebagai Sumber Daya Riset: Apa yang Bertahan
Bagaimana akademisi, jurnalis, dan pengacara menggunakan web sejarah: di mana rekaman tersimpan, bagaimana menilai kualitas preservasi, dan kapan sebuah tangkapan dianggap sebagai bukti.

wayback machine
Wayback Machine: Panduan Lengkap Menelusuri Sejarah Web
Wayback Machine mengarsipkan lebih dari 900 miliar halaman web. Pelajari cara kerja crawl, snapshot, kalender, dan sintaks pencarian, serta cara memulihkan situs yang hilang.
