Ang Kasaysayan ng mga Site sa Internet: Naitala, Nawala, at Bakit
Ni ang koponan sa editoryal ng Restorix · Mayo 29, 2026 · 9 min na pagbabasa

Ibalik ang iyong website mula sa Wayback Machine
Libreng estimate sa ilang segundo — magbabayad ka lang kapag kinumpirma. Awtomatikong na-re-refund ang mga nabigong restore.
Noong Abril 2009, inanunsyo ng Yahoo na isasara nito ang GeoCities. Tatlumpu't walong milyong pahina ng mga gumagamit, MIDI files, animated na palatandaan ng konstruksiyon, mga fan shrine para sa lahat mula The X-Files hanggang sa tropikal na isda, nakatakdang burahin noong Oktubre. Isang grupo ng mga boluntaryo na tinawag na Archive Team ang gumastos ng anim na buwan nag-download ng hangga't kaya ng kanilang bandwidth at inilabas ang nilikom bilang torrent. Isang bahagi ng maagang web ay naligtas dahil nagdesisyon ang mga estranghero na dapat itong maligtas. Karamihan ng maagang web ay hindi ganoong swerte.
Ito ay isang pagtingin sa kung ano talaga ang naitala mula sa unang dekada online, kung ano ang nawala nang permanente, at ang teknikal at panlipunang dahilan sa likod ng dalawa. Kung sinusubukan mong mabawi ang isang partikular na lumang site, tumalon na sa huling seksyon, iyon ay para sa iyo.
Mas bata ang kasaysayan ng mga site sa internet kaysa sa inaakala mo
Naging pampubliko ang web noong Agosto 1991, nang ipahayag ni Tim Berners-Lee ang World Wide Web project mula sa CERN at itinuro ang mga tao sa info.cern.ch. Walang nag-archive nito. Wala ring magagamit sa pag-archive, ang mga malakihang web crawler ay taon-taon pa ang layo, at ang ideya ng sadyang pagpreserba ng mga website ay itinuring ng karamihan bilang paghoard.
Itinatag ang Internet Archive noong Mayo 1996 ni Brewster Kahle, na may crawl data na papasok mula sa Alexa Internet. Ang Wayback Machine mismo ay nagbukas sa publiko noong Oktubre 2001, na may 10 bilyong pahina na. Ngayon ay may hawak na itong mahigit 900 bilyon. Kahanga-hanga, ngunit mahalaga ang puwang. Mula 1991 hanggang 1996 walang sistematikong pag-archive. Nang ibalik ng CERN ang unang website sa orihinal nitong address noong 2013, ang pinakalumang kopya na matatagpuan ng sinuman ay mula pa noong Nobyembre 1992. Ang orihinal na 1991, na marahil ang pinakamahalagang pahina sa kasaysayan ng web, ay nabubuhay lamang sa mga screenshot at muling pagtatayo.
Lahat mula sa limang taong puwang na iyon ay naligtas nang aksidente: backup tape ng isang sysadmin, CD-ROM na kasama ng isang magazine, FTP mirror na nakalimutan ng sinuman na burahin.
Sino ang nag-save ng ano: mga archivist, boluntaryo, at aklatan
Ibalik ang iyong website mula sa Wayback Machine
Libreng estimate sa ilang segundo — magbabayad ka lang kapag kinumpirma. Awtomatikong na-re-refund ang mga nabigong restore.
Apat na grupo ang gumawa ng pag-save, bawat isa ay may iba't ibang motibo at saklaw.
- Ang Internet Archive ay gumagawa ng tuluy-tuloy na crawl at tumatanggap ng pampublikong Save Page Now na mga submission. Ito ang default na memorya ng web at ang unang lugar na dapat suriin.
- Ang Archive Team ay isang grupong boluntaryo na nagmo-mobilize kapag may serbisyong nag-anunsyo ng pagsasara. GeoCities noong 2009, Google+ at Yahoo Groups noong 2019, kinukuha nila ang kaya at inilalabas bilang torrent.
- Ang mga pambansang aklatan ay nakaka-archive nang selektibo. Ang UK Web Archive ay umiiral sa ilalim ng legal deposit mula noong 2013; ang PANDORA archive ng Australia ay nag-curate ng mga kapansin-pansing Australian site mula pa noong 1996.
- Ang Common Crawl ay naglathala ng malalaking open crawl dataset mula noong 2008, napakahalaga para sa mga mananaliksik, ngunit walang friendly na calendar interface para sa casual na pag-browse.
Karapat-dapat sa hiwalay na banggit: ang archive.today, na tumatakbo mula noong 2012, ay gumagawa ng on-demand snapshot at madalas ay may hawak na mga pahina na hindi nakuha ng Internet Archive, lalo na ang mga naka-block sa IA crawl.

Ano ang naitala ng kasaysayan ng mga site sa internet: static, pampubliko, popular
Tingnan kung ano ang pinakamahusay na naligtas at lalabas ang isang pattern. Ang mga archive ay nakabias sa kung ano ang abot-kaya at madalas na maabot ng isang crawler.
- Mga static HTML page na may plain link, ang natural na diyeta ng crawler.
- Mga imahe at file na direktang naka-link mula sa nakuhaang pahina, kahit papaano kapag sensible ang laki ng file.
- Mga pahina na may maraming inbound link, dahil sinusundan ng mga crawler ang mga link at ang mga popular na pahina ay paulit-ulit na nire-crawl.
- Mga site na pinayagan ng robots.txt na ma-crawl, isang Disallow: / ay itinago ang lahat.
- Text ng anumang uri. Maganda itong na-compress at mabilis na isinasauli.
Isang hand-coded na personal homepage noong 1998, lila ang background, may visitor counter, may links page, ay karaniwang mababawi nang buo, GIFs kasama. Isang online store noong 2008 na sampung beses mas malaki ang cultural footprint ay madalas na hindi. Ang pagiging popular at pagiging simple ay tinalo ang lahat.
Ano ang nawala nang tuluyan, at bakit
Ang mga pagkawala ay nagkukumpol sa ilang predictable na bucket, at ang pinakamalaki ay isang plain text file. Hanggang sa pagbabago ng patakaran noong 2017, sinusunod ng Internet Archive ang mga robots.txt exclusion at inilapat ang mga ito nang retroaktibo, isang edit sa file ay maitatago ang taon-taon ng mga umiiral na capture mula sa pampublikong view. Ibinebenta ang mga domain, maglalagay ang bagong may-ari ng restrictibong robots file, at isang dekada ng kasaysayan ay mapapalimot sa isang gabi. Hindi mabilang na site ang nawala sa archive sa ganitong paraan habang ang data ay teknikal na umiiral pa rin.
Anumang nasa likod ng login ay hindi kailanman na-crawl: mga pribadong forum, maagang social network, members-only na komunidad. Ang 2011 redesign ng Friendster ay nagpurga ng taon-taon ng profile sa isang deploy. Ang mga dynamic at database-driven na pahina ay hindi nai-crawl nang consistent, humahawak ang mga crawler ng GET link, hindi POST form, kaya ang mga search result, shopping cart, at filtered listing ay epektibong hindi kailanman umiral hangga't ang mga archive ang pinag-uusapan.

Ang mabibigat na media ay hindi rin nangyaring maayos. Streaming audio at video mula sa panahon ng RealPlayer, Java applet, at anumang naka-serve sa kakaibang protocol ay nilaktawan o nakuha na sira. Ang Flash ang sikat na edge case: ang mga.swf file ay madalas na naitala ngunit nanatiling hindi mapatugtog sa loob ng mga taon, hanggang ginawang tumakbo muli ng Ruffle emulator ang marami sa kanila noong 2020. Ang mga Flash piece na walang nakuha ay simple nang nawala.
Mapanglaw ang mga numero kahit para sa kamakailang web. Natuklasan ng Pew Research noong 2024 na 38 porsyento ng mga pahinang umiral noong 2013 ay hindi na ma-access. Isang pag-aaral ng Harvard tungkol sa link rot ay nakatagpo na halos kalahati ng mga URL na binanggit sa mga opinyon ng U.S. Supreme Court ay patay na. Ang pagpreserba ay eksepsyon. Ang pagkabulok ang default.
Bakit sumira ang pag-archive ng mga dynamic site
Kumukuha ang crawler ng URL. Iyon ang buong trick. Isang phpBB forum noong 2005 o osCommerce shop ay hindi koleksyon ng URL, ito ay database na nakasuot ng URL, na gumagawa ng pahina on demand mula sa query string tulad ng viewtopic.php?t=4821&start=40. Ang URL space ay epektibong walang katapusan, kaya minu-muestra ito ng mga crawler. Nahuhuli nila ang mga index page at anumang thread na maganda ang link ngayong buwan, at namimiss ang iba.
Ang session at cookie ay nagpapabigat pa: ang parehong URL ay nagbabalik ng iba't ibang content kada bisita, kaya ang isang capture ay maaaring mag-imbak ng logged-out stub o redirect. At may malinaw na anggulong ekonomiko, ang text ay mura kunin at itago, ang media ay hindi. Ang mga throttle na crawl ay nilaktawan ang malalaking file para mapanatiling mababa ang gastos, kaya kung bakit maraming naka-archive na pahina ay naglo-load bilang text na may gray hole kung saan dating may imahe.
Ang resulta: ang mga archive ay karaniwang may hawak na kalansay ng site, home page, static na artikulo, ilang magandang naka-link na thread, ngunit hindi ang buhay na organismo. Ang search box, ang member list, ang checkout flow: ang mga ito ay hindi kailanman na-capture sa anumang makahulugang paraan.
Paano tuklasin ang kasaysayan ng mga site sa internet sa sarili mo
Para sa isang partikular na site, maikli lang ang workflow:
- Ilagay ang domain sa web.archive.org. Ang sparkline sa itaas ng calendar ay nagpapakita ng capture density kada taon, abala na taon ay nangangahulugang masusing saklaw.
- Buksan muna ang pinakalumang capture, pagkatay ay maglakad pasulong. Ang mga maagang capture ay nagbubunyag ng orihinal na estruktura at lumang URL pattern.
- Naghahanap ng partikular na URL? I-query ang CDX index o i-paste ang address direkta sa Wayback bar, ang aking gabay sa paghahanap ng bawat pahina na mayroon ang isang site ay sumasaklaw sa mga trick ng API.
- I-cross-check ang archive.today para sa anumang hindi nakuha ng Internet Archive.
- Para sa pre-1996 na materyal, maghanap ng operator-run na mirror, koleksyon ng unibersidad, at nostalgia project sa halip na pormal na archive.
Kung gusto mo ang malaking larawan sa halip na isang pahina, ang aming walkthrough kung paano maghanap ng kasaysayan ng website at maghukay sa kasaysayan ng website na pananaliksik ay sumasaklaw sa calendar, koleksyon, at alternatibong archive nang detalyado.
Kapag ang pag-browse sa nakaraan ay hindi sapat
Ang Wayback Machine ay reading room, hindi restore button. Ang araw na kailanganin mong ibalik ang aktwal na site, ang mga file, ang mga imahe, internal link na gumagana sa sarili mong domain, ang manual na pag-save ay sumisira pagkatapos ng humigit-kumulang dosenang pahina. Right-click, save-as, ayusin ang path, ulitin: iyon ay isang hapon kada seksyon, at ang resulta ay folder ng mga fragment.
Umiiral ang serbisyong ito para sa eksaktong trabahong iyon. I-paste ang domain at ipapakita ng libreng estimate ang eksaktong bilang ng naka-archive na file, kabuuang laki, at nakatakdang presyo bago ka magbayad ng anuman. Nagbabayad ka kada nare-restore na file, ang unang file ay libre, at ang mga restore ay maaaring i-filter ayon sa date range at linisin, ang lumang analytics at ad ay tinatanggal, ang link ay ginawang relative, ang HTTPS ay ipinapatupad. Ang muling itinayong site ay nagde-deploy sa sarili mong hosting sa isang click, o nag-e-export bilang structured data. Ipinapakita ng tutorial ang buong daloy.
Pira-piraso ang kasaysayan ng mga site sa internet, ngunit kung ano ang naligtas ay karaniwang mababawi kung gagamit ka ng tamang tool para sa trabaho.
Ibalik ang iyong website mula sa Wayback Machine
Libreng estimate sa ilang segundo — magbabayad ka lang kapag kinumpirma. Awtomatikong na-re-refund ang mga nabigong restore.
FAQ
Hanggang saan nakakarating ang kasaysayan ng mga site sa internet sa Wayback Machine?
Nagsimula ang capture noong 1996, nang magsimulang mag-crawl ang Internet Archive. Ang web mismo ay nagsimula noong 1991, kaya ang unang limang taon ay umiiral lamang sa mga pribadong backup at muling pagtatayo, ang nire-store na unang website ng CERN, halimbawa, ay mula sa kopyang Nobyembre 1992.
Naka-archive ba ang lahat mula sa maagang internet kahit saan?
Hindi. Ang mga pahinang naka-block ng robots.txt, content sa likod ng login, mabibigat na media, at dynamically generated na pahina ay bihirang na-capture. Kung wala sa Wayback Machine o archive.today ang isang pahina, malamang na umiiral ito lamang sa pribadong kamay, kung mayroon man.
Bakit nagpapakita ng 'not in archive' ang isang lumang pahina kung tiyak na luma ang site?
Karaniwan ay isa sa apat na dahilan: naka-block ang crawler ng robots.txt, walang inbound link ang pahina para sundan ng crawler, ito ay dynamically generated, o ang capture ng domain ay itinago matapos ang pagbabago ng may-ari. Ang edad lamang ay hindi kailanman naggiyera ng saklaw.
Anong nangyari sa lahat ng GeoCities site?
Binura ito ng Yahoo noong Oktubre 2009. Iniligtas ng Archive Team ang isang malaking bahagi at inilabas bilang torrent na humigit-kumulang 900 GB, at ang mga mirror tulad ng Reocities ay nagpapanatili ng bahaging maa-browse. Maraming GeoCities page ay umiiral din sa Wayback Machine, ngunit ang isang buong opisyal na backup ay hindi kailanman inilabas sa publiko.
Maaari bang burahin ng may-ari ng site ang kanyang site mula sa mga web archive?
Sinusunod ng Internet Archive ang mga kahilingan ng pag-alis mula sa may-ari ng site, at ang mga pagbabago sa robots.txt ay historikal na nagtago ng capture nang retroaktibo hanggang sa pagbabago ng patakaran noong 2017. Ang pagbebenta ng domain ay nagpurga ng pampublikong access sa archive sa ganitong paraan. Ang pagbura ng site mula sa iyong server, gayunpaman, ay hindi nag-aalis ng umiiral na capture sa sarili nito.
Burahin ba ng pagtanggal sa aking website ito mula sa Wayback Machine?
Hindi awtomatiko. Ang mga capture na nakuha na ay mananatiling available maliban kung maghain ang may-ari ng domain ng exclusion request. Kung gusto mong mawala ang isang bagay sa archive, kailangan mong humiling, ang simpleng pag-offline ng site ay nag-iiwan ng kasaysayan sa pwesto.
Mga kaugnay na gabay

website history
Kasaysayan ng Website: Mga Snapshot, WHOIS, DNS, at ang mga Tool para sa Bawat Isa
Ang kasaysayan ng website ay maaaring tumukoy sa mga naka-archive na snapshot, mga talaan ng WHOIS, mga pagbabago sa DNS, o lumang mga ranggo. Alamin kung aling tool ang sumasagot sa aling tanong, at kung paano muling itayo ang isang nawalang site.

search website history
Paano Suriin ang Kasaysayan ng Website Bago Bumili ng Domain
Suriin ang kasaysayan ng website bago bumili ng domain: mga lumang snapshot, pagpapalit ng pag-aari, spam baggage, at trademark traps, isang 30-minutong due-diligence workflow.

historical web
Ang Makasaysayang Web bilang Yaman ng Pananaliksik: Ano ang Tumatagal
Paano ginagamit ng mga akademiko, mamamahayag, at abogado ang makasaysayang web: kung saan nakatago ang mga rekord, paano huhusgahan ang kalidad ng pagpapanatili, at kailan itinuturing na ebidensya ang isang capture.

wayback machine
Wayback Machine: Ang Kumpletong Gabay sa Pag-browse sa Kasaysayan ng Web
Mahigit 900 bilyong web page ang ini-archive ng Wayback Machine. Alamin kung paano gumagana ang mga crawl, snapshot, kalendaryo, at search syntax, at kung paano ibalik ang nawawalang site.
