Archive.org Website: Advanced Search, Mga Filter at Koleksyon
Ni ang koponan sa editoryal ng Restorix · Abril 26, 2026 · 8 min na pagbabasa

Ibalik ang iyong website mula sa Wayback Machine
Libreng estimate sa ilang segundo — magbabayad ka lang kapag kinumpirma. Awtomatikong na-re-refund ang mga nabigong restore.
Karamihan sa mga tao ay bumibisita lang nang isang beses sa Archive.org website. I-paste nila ang patay na URL sa Wayback Machine, kumuha ng screenshot, at aalis na. Ito ay isang pag-aaksaya ng isang seryosong tool. Sa likod ng parehong login ay nakatago ang isang buong digital library, daan-daang milyong item, na may sariling search engine, query syntax, at mga filter na halos walang gumagamit.
Maraming taon na akong kumukuha ng mga client site, patay na software, at na-scan na mga manual mula sa Archive.org. Ang pagkakaiba sa paghahanap ng isang bagay sa loob ng dalawang minuto at pagsuko pagkatapos ng dalawampu ay bihirang dahil sa swerte. Ito ay dahil sa pag-alam kung aling search box ang gagamitin at aling filter ang i-click. Ito ang workflow na talagang sinusunod ko.
Ano ang Talagang Ini-index ng Archive.org Website
Nagsisimula ang kalituhan dito. Ang Archive.org ay nagpapatakbo ng dalawang magkaibang sistema na nagbabahagi ng logo. Ang item archive, ang hinahanap mo mula sa front page, ay naglalaman ng mga na-upload at na-crawl na bagay: mga libro, konsyerto, software, video, mga radio show. Bawat item ay may metadata, file list, at mga review. Ang Wayback Machine, sa web.archive.org, ay naglalaman ng mga snapshot ng web page na na-index ayon sa URL. Higit sa 900 bilyon sa kanila.
Bakit mahalaga ito para sa mga lumang website? Dahil ang isang patay na site ay maaaring lumabas sa parehong lugar, nang magkaiba. Ang Wayback side ay may mga page. Ang item side ay maaaring maglaman ng isang Archive Team rescue crawl ng buong serbisyo kung saan nakatira ang iyong site, GeoCities, FortuneCity, MobileMe, na naka-package bilang mga downloadable na WARC file. Kung gumagamit ka lang ng isang pinto, napalalampas mo ang isa pa.
- Mga Teksto: mga na-scan na libro, manual, magasin, ganap na mahahanap sa buong teksto
- Software: lahat mula sa shareware CDs hanggang sa mga lumang browser at Flash projector
- Audio at video: mga live na konsyerto, archive ng radyo, news reel, komersyal
- Mga web item: mga koleksyon ng crawl at mga kuha ng Archive Team, na nakaimbak bilang mga WARC file
- Mga larawan at data: mga photo set, scan ng mapa, dataset ng pananaliksik
Advanced na Paghahanap sa Archive.org Website
Ibalik ang iyong website mula sa Wayback Machine
Libreng estimate sa ilang segundo — magbabayad ka lang kapag kinumpirma. Awtomatikong na-re-refund ang mga nabigong restore.
Ang box sa front page ay okay na para sa mga Beatles bootleg. Para sa anumang tumpak, pumunta sa advanced search page, archive.org/advancedsearch.php, o isulat mo mismo ang query. Ang syntax ay Lucene-like at mahigpit: lowercase ang mga pangalan ng field, ginagamit ang square brackets para sa mga range, at ang mga boolean operator ay dapat uppercase. Kapag mali ang isa sa mga iyon, tahimik kang makakakuha ng mga basura na resulta.
Isang query na nakakahanap ng Joomla-related na software na idinagdag sa pagitan ng 2005 at 2010 ay ganito ang hitsura: title:(joomla) AND mediatype:software AND date:[2005-01-01 TO 2010-12-31]. I-paste ito sa search box at gagana lang. Hindi kailangan ng form.
- identifier:, ang eksaktong URL slug ng item; ang pinakamabilis na paghahanap doon
- collection:, limitahan sa isang koleksyon, hal. collection:archiveteam
- creator: at title:, fuzzy ngunit kapaki-pakinabang kapag may mga quote sa paligid ng mga parirala
- date:[YYYY-MM-DD TO YYYY-MM-DD], range ng petsa ng pagdaragdag, hindi ang orihinal na petsa ng publikasyon
- mediatype:, texts, software, audio, movies, image, web, data
- NOT, AND, OR at mga parenthesis, pagsamahin nang malaya, ngunit i-uppercase ang mga ito
Isang gotcha: ang date: ay nagfi-filter kung kailan pumasok ang item sa archive, hindi kung kailan ginawa ang nilalaman. Ang isang manual noong 2003 na na-upload noong 2019 ay tumutugma sa 2019.

Mga Filter na Nagpapatakbo ng Mabibigat na Gawain
Kapag nag-load na ang mga resulta, nasa kaliwang sidebar ang tipid sa oras. Maaari kang mag-filter ayon sa mediatype, taon, koleksyon, creator, at wika, at mag-sort ayon sa relevance, views (all-time o weekly), petsa ng pagdaragdag, o title. Karamihan sa mga paghahanap ay nabibigo hindi dahil wala ang materyal, kundi dahil nasa page nine ito sa likod ng dalawang daang podcast episode. Inaayos iyan ng mga filter.
- I-filter muna ang mediatype. Ang paghahanap ng isang defunct na CMS sa lahat ng bagay ay maglulubog sa iyo sa audio.
- Mag-sort ayon sa weekly views kung gusto mo ng materyal na pinananatili, ang crowd ay disenteng quality signal.
- Mag-stack ng collection at year filter para muling buuin ang hitsura ng isang sulok ng web noong, sabihin nating, 2008.
| Filter | Pinakamainam na gamit |
|---|---|
| Mediatype | Pagputol ng 90% ng ingay sa isang click |
| Taon | Pagbuo ng timeline sa paligid ng lifespan ng isang site |
| Koleksyon | Panatilihing nasa loob ng isang pinagkakatiwalaang crawl o rescue project |
| Creator / uploader | Pagsunod sa kumpletong set ng isang archivist |
| Weekly views | Pagtukoy sa mga item na aktibong ginagamit pa rin ng mga tao |
Mga Koleksyon na Karapat-dapat Malaman para sa mga Lumang Website
Ang mga koleksyon ay mga curated na shelf, at iilan sa kanila ay ginto para sa sinumang humahabol ng mga lumang website:
- archiveteam, mga panic, mapagmahal na kuha ng mga namamatay na serbisyo: GeoCities, FortuneCity, Posterous, MobileMe. Mga karaniwang kumpletong WARC crawl ng buong hosting platform.
- geocities at mga mirror nito, ang Yahoo! GeoCities rescue, ang pinakamalaking solong recovery ng mga personal na web page na kailanman naisagawa.
- widecrawl at iba pang mga koleksyon ng crawl, bulk na Internet Archive crawls, kapaki-pakinabang kapag may mga gap ang Wayback per-URL view.
- mga koleksyon ng software library, mga lumang browser, Flash, Shockwave, Java applet. Kailangan mo ang mga ito para talagang patakbuhin ang inihain ng mga lumang site.
- cd-rom software library, mga shareware disc na puno ng mga site builder, counter, at guestbook script na akma sa panahon.
Magsimula mula sa collection page, hindi sa search box. Karaniwang ini-document ng mga maintainer kung ano ang nasa loob, kung paano ito na-crawl, at kung ano ang ibig sabihin ng file layout, konteksto na nag-aakalva sa iyo mula sa paghuhula ng 2 a.m.

Archive.org Website vs. Wayback Machine: Aling Pinto ang Gagawin
| Paghanap ng item sa Archive.org | Wayback Machine | |
|---|---|---|
| Hanapin mo | Mga item ayon sa metadata | Mga URL ayon sa address |
| Makakakuha ka | Mga downloadable na file | Mga nai-render na snapshot |
| Pinakamainam para sa | Software, media, bulk na crawl | Mga page ng isang partikular na site |
| Kahinaan | Walang page rendering | Walang opisyal na full-site download |
Rule of thumb: kung maaari mong pangalanan ang URL, magsimula sa Wayback Machine. Kung mailalarawan mo lang ang bagay, ang phpBB theme na ginamit ng lahat noong 2007, panalo ang item search. Para sa isang buong restore, karaniwang nagtatapos kang gumagamit ng pareho: mga crawl at CDX data mula sa item side, mga snapshot ng page mula sa Wayback side.
Isang Tunay na Workflow: Paghahanap sa Patay na Forum ng Isang Kliyente
Konkreto na kaso. Ang 2009 phpBB forum ng isang kliyente ay nawala nang bumagsak ang host noong 2014. Ang domain ay nanatiling naka-park nang mahabang panahon; gustong ibalik ng kliyente ang nilalaman. Ito ang sequence na gumana:
- Wayback CDX query sa domain para i-map kung anong mga URL ang nakuha at kailan, mga 1,400 na capture, karamihan mula 2010 hanggang 2012.
- Item search para sa domain at pangalan ng site sa loob ng collection:archiveteam, walang nahanap na pagkakataong ito, ngunit ito ay thirty-second na check.
- Collection check sa lumang host, ang host mismo ay bahagyang nakuha ng Archive Team, na pumuno sa ilang template at image gap.
- Year-filtered na paghahanap sa software ng forum para kumuha ng era-correct na phpBB package para sa reference.
Kabuuang oras: mga apatnapung minuto, karamihan ay nagbabasa ng CDX output. Ang paghahanap ay ang madaling bahagi kapag alam mo na ang mga pinto. Pansinin kung ano ang hindi nangyari: walang paghuhula sa Google cache, walang pagmamakaawa sa support inbox ng lumang host, walang pagbabayad sa sinuman pa. Sinabi ng archive sa amin kung ano ang eksaktong nakaligtas, 1,400 na capture, isang kilalang gap noong 2013, at isang partial rescue crawl para i-patch ito. Ang parehong CDX data na iyan ay ang binabasa ng Restorix estimate para bilangin ang mga file at mag-presyo ng isang restore, kung saan nagpapatuloy ang kuwentong ito sa ibaba.
Kulang ang Archive.org Website
Ang lahat ng nasa itaas ay nakakahanap ng materyal. Hindi ka nito binibigyan ng gumaganang website. Ang mga Wayback snapshot ay may kasamang mga nirewrite na URL, nawawalang larawan, patay na form, at mga absolute link na tumuturo sa isang domain na hindi mo na kontrol. Ang pag-rebuild ng isang site mula sa mga raw capture nang manu-mano ay mga araw ng mga sed script at pagsisisi.
Ang kakulangang iyan ay eksaktong dahilan kung bakit ginawa ang Restorix. I-paste ang URL, at ipinapakita ng libreng estimate ang eksaktong bilang ng na-archive na file, kabuuang laki, at naka-lock na presyo bago ka magbayad ng kahit ano. Maaaring tanggalin ng mga restore ang analytics at ads, i-convert ang mga link sa relative, pilitin ang HTTPS, at i-deploy diretso sa iyong VPS, FTP hosting, o S3, na may kasamang single-file CMS para ma-edit mo ang binuhay na nilalaman.
Gamitin ang Archive.org website para mag-scout: i-verify kung ano ang umiral, kailan, at gaano karami ang nakaligtas. Pagkatapos hayaang gawin ng tooling ang reconstruction. Ang iyong oras ay mas mahalaga kaysa isang weekend ng WARC parsing.
Ibalik ang iyong website mula sa Wayback Machine
Libreng estimate sa ilang segundo — magbabayad ka lang kapag kinumpirma. Awtomatikong na-re-refund ang mga nabigong restore.
FAQ
Libre ba gamitin ang Archive.org website?
Oo. Walang bayad ang paghahanap, streaming, at pag-download ng mga pampublikong item, at hindi kailangan ng account para mag-browse. Ang libreng account ay nagdadagdag ng favorites, upload, at list. Ang pagpapahiram ng ilang partikular na modernong libro ay nangangailangan ng account, ngunit ang lahat ng saklaw sa gabay na ito ay bukas.
Ano ang pagkakaiba ng Archive.org website at Wayback Machine?
Ang Archive.org ay ang parent na digital library: mga item tulad ng libro, software, audio, at mga koleksyon ng crawl, na mahahanap ayon sa metadata. Ang Wayback Machine ay isang serbisyo sa loob nito, na naglalaman ng 900+ bilyong snapshot ng web page na na-index ayon sa URL. Ang mga lumang website ay maaaring lumabas sa pareho, bilang mga Wayback snapshot at bilang mga bulk crawl item.
Maaari ba akong mag-full-text search ng mga lumang web page sa Archive.org?
Hindi. Ang Wayback Machine ay nag-i-index ayon sa URL, hindi sa teksto ng page, kailangan mo ang address, hindi mga keyword. Ang full-text search ay gumagana lang sa loob ng mga text item tulad ng mga na-scan na libro. Para sa mga page, hanapin muna ang URL (mga lumang link, search engine, CDX wildcard), pagkatapos hanapin ito.
Paano ako magda-download ng isang bagay na nakita ko sa Archive.org website?
Ang bawat item page ay may download box na nagbibigay ng listahan ng mga indibidwal na file, kasama ang mga torrent at full-item na opsyon. Para sa mga website na nakuha ng Wayback Machine ay walang download button, kailangan nito ang CDX API, isang downloader tool, o isang restore service tulad ng Restorix. Ang aming gabay sa [pag-download mula sa Archive.org](/fil/download-archive-org) ay naglalakad sa bawat paraan.
Bakit hindi ko mahanap ang isang partikular na lumang site sa lahat?
Tatlong karaniwang dahilan: ang robots.txt ng site ay humarang sa mga crawler, ang site ay hindi kailanman na-link saanman na sinunod ng isang crawler, o lahat ay nasa likod ng isang login o mabigat na Flash at JavaScript. Suriin ang CDX API para sa hubad na domain bago sumuko, kung minsan nagtatago ang mga capture sa ilalim ng mga kakaibang subdomain o www variant na nakalimutan mo.
Mga kaugnay na gabay

wayback machine archive org
Wayback Machine sa Archive.org: Praktikal na Gabay sa Site
Isang hands-on na paglilibot sa Wayback Machine sa Archive.org: kung saan ito matatagpuan, paano gumagana ang search box at calendar, at paano makakakuha ng aktwal na files.

archiveorg
Archiveorg: Sa Loob ng Pinakamalaking Libreng Aklatan ng Internet
Higit sa Wayback Machine ang Archiveorg: mga libreng libro, live na musika, balita sa TV, playable na software, at 900+ bilyong web page. Buong tour, kasama ang file recovery.

download archive org
Paano Mag-download mula sa Archive.org: Mga Item, Snapshot, at Iba Pa
Bawat praktikal na paraan para mag-download ng nilalaman mula sa Archive.org, mga file ng item, bulk CLI pulls, at Wayback web snapshots, at kung paano pumili ng tama para sa iyong trabaho.

archive org download
Mga Format ng Pag-download sa Archive.org: WARC, CDX at Mga Single File
Ano ang laman ng bawat format ng pag-download sa Archive.org, mga WARC capture, JSON CDX index, at mga orihinal na file, at kung ano ang gagawin sa bawat isa.
