I-download ang Buong Website mula sa Archive.org, Hindi Lang ang Homepage
Ni ang koponan sa editoryal ng Restorix · Hulyo 15, 2026 · 9 min na pagbabasa

Ibalik ang iyong website mula sa Wayback Machine
Libreng estimate sa ilang segundo — magbabayad ka lang kapag kinumpirma. Awtomatikong na-re-refund ang mga nabigong restore.
Kahit sino ay makakapag-save ng homepage. Ang homepage ang madaling parte, ang 4,000 na file sa likod nito ang nagpapahiwatig ng 'Iyon ay isang kopya' mula sa 'Tunay na mayroon akong site'. Kapag may nagtanong sa akin na i-download ang buong website mula sa archive.org, ang homepage ay karaniwang nasa desktop na nila, pero ang stylesheet ay wala.
Ang artikulong ito ay tungkol sa salitang 'buo'. Ano ang talagang kasama sa isang kumpletong kopya, bakit ikinakalat ng archive ang iyong mga asset sa iba't ibang taon at timestamp, at isang checklist na maaari mong gamitin sa dulo para patunayang nakuha mo ang lahat sa halip na umaasa lang.
Ano ang ibig sabihin ng 'buo' kapag nagda-download ka ng buong website mula sa archive.org
Ang isang kumpletong kopya ay may apat na layer, at karamihan ng tao ay humihinto pagkatapos ng una. Ang HTML para sa bawat pahina na umiral. Ang mga asset na tinutukoy ng bawat pahina: mga imahe, stylesheet, JavaScript, font, PDF, video. Muling isinulat ang mga internal link para ang kopya ay ma-browse nang mag-isa, nang hindi umaasa sa mga server ng archive.org. At isang manifest ng ano ang nakuha, para ang mga kakulangan ay naka-dokumento sa halip na matuklasan kalaunan ng kliyente.
- Mga pahina: bawat URL na nakita ng crawler, hindi lang ang mga nasa main menu. Ang mga lumang site ay nagtatago ng buong seksyon sa likod ng mga nakalimutang footer link.
- Mga asset: mga imahe, CSS, JS, font, at mga downloadable na file, sa karamihan ng site, mas marami ang mga ito sa mga pahina sa ratio na lima sa isa.
- Mga link: muling isinulat sa relative paths, o ang iyong kopya ay gagana lang hangga't gumagana ang archive.org.
- Isang manifest: isang listahan file-by-file ng ano ang mayroon ka, na ginagawang 'Sa tingin ko nakuha ko ang lahat' sa isang bagay na maaaring suriin.
Nagugulat ang mga tao sa bilang ng file. Ang isang karaniwang 50-pahinang business site ay karaniwang umaabot sa 400-800 na file. Ang isang 2009 phpBB forum na may user avatar at attachment ay maaaring umabot sa sampu-sampung libo. Magplano para sa bilang ng file, hindi sa bilang ng pahina.
Mayroon ding pagkakaiba sa pagitan ng isang kopya na ma-browse at isang kopya na ma-redeploy. Ang isang browsing copy ay kailangan lang ng mga file at gumaganang link. Ang isang kopya na balak mong ibalik sa hosting ay nangangailangan ng higit pa: pare-parehong canonical URL (pumili ng www o non-www), mga sangguniang handa na sa HTTPS, at alisin ang mga walang silbi tulad ng mga analytics script na dekada na ang edad. Desisyunan kung alin sa dalawa ang iyong gagawin bago ka magsimula, dahil ang pag-retrofit sa alinman ay nakakapagod.
Bakit nakatira ang mga asset sa iba't ibang timestamp
Ibalik ang iyong website mula sa Wayback Machine
Libreng estimate sa ilang segundo — magbabayad ka lang kapag kinumpirma. Awtomatikong na-re-refund ang mga nabigong restore.
Hindi kinukunan ng litrato ng Wayback Machine ang buong site sa isang hapon. Ang mga crawler nito ay kumukuha ng anumang maaabot nila, kahit kailan nila maabot. Ang iyong 2014 homepage ay maaaring tumukoy sa isang logo na huling nakuha noong 2012, isang stylesheet na nakuha ng anim na beses sa loob ng limang taon, at isang hero image na hindi kailanman nakuha. Kapag tiningnan mo ang pahinang iyon, tahimik na pinapalitan ng archive.org ang pinakamalapit na capture na hawak nito para sa bawat asset. Iyan ang dahilan kung bakit mukhang maayos ang pahina sa iyong browser kahit na ang mga parte nito ay nakakalat sa isang dekada.
May dalawang resulta na sumusunod. Una, walang iisang 'timestamp ng site' na maaari mong ituro sa downloader, ang isang kumpletong download ay kumukuha ng bawat file mula sa sarili nitong pinakamahusay na capture. Pangalawa, ang trick na pinakamalapit na capture ay nagtatago ng mga kakulangan: maglilingkod ang wayback ng isang 2016 na imahe sa iyong 2014 na pahina nang hindi binabanggit ito. Hindi nakakapinsala para sa casual na pag-browse, sulit malaman kapag mahalaga sa iyo kung ang na-restore na pahina ay talagang ang 2014.
Ang isang naka-archive na pahina ay isang collage. Ang HTML, ang mga imahe, at ang CSS ay bawat isa ay naka-freeze sa iba't ibang sandali, at muli itong dinidikit ng archive tuwing may titingin.

Ang anumang tool o script na gamit mo ay nangangailangan ng diskarte para dito. Ang tamad na diskarte, kunin ang lahat sa isang timestamp, ay eksaktong paraan para magtapos ka na may pahina na puno ng sira na icon ng imahe, dahil ang kalahati ng mga asset ay walang capture sa linggong iyon. Ang tamang diskarte ay per-file: kunin ang bawat asset mula sa sarili nitong pinakamalapit na mabuting capture sa loob ng iyong date range.
Paano mag-download ng buong website mula sa archive.org: magsimula sa inventory
Bago kumuha ng kahit isang file, ilista ang talagang hawak ng archive. Ang CDX API ay nagbibigay sa iyo ng buong ledger para sa isang domain: bawat naka-capture na URL kasama ang mga timestamp nito, MIME type, at HTTP status. I-filter sa statuscode 200, pagsamahin ang mga duplicate na content digest, at magkakaroon ka ng isang makatotohanang shopping list sa halip na isang hula.
Basahin ang inventory bago mag-download at maaalaman mo ang mga hindi kasiya-siyang bagay nang maaga. Sa trabahong phpBB forum na iyon, ang CDX listing ay nagpakita ng 11,000 na naka-capture na URL, at mga 3,000 sa kanila ay parehong avatar GIF na na-save sa ilalim ng iba't ibang query string. Ang pagsasama ng mga duplicate ay ginawang ordinaryong trabaho ang isang nakakatakot na trabaho. Ang parehong listing ay nagpapakita rin ng mga pahina na hindi kailanman naka-capture, na walang paraan ng pag-download sa mundo ang makakabalik. Mas mainam na malaman iyan sa unang araw.
Pagsamahin ang mga nakaligtas ayon sa MIME type at lalabas ang hugis ng trabaho: gaano karaming HTML page, gaano karaming imahe, gaano karaming JavaScript, kung may mga PDF o video na dapat pansinin. Ang pagsasama-sama na iyon ang nagpapatakbo sa iyong download order at sa iyong huling tseke ng pagiging kumpleto.
Checklist para mag-download ng buong website mula sa archive.org nang walang kakulangan
- Kunin ang CDX inventory para sa domain, na na-filter sa HTTP 200 captures, na sumasaklaw sa iyong buong date range.
- Pagsamahin ang mga duplicate na content digest para ang magkaparehong file ay ma-download ng isang beses sa halip na daan-daan.
- Pagsamahin ang listahan ayon sa MIME type: HTML page muna, pagkatapos ay CSS, JS, imahe, font, dokumento, media.
- I-download ang bawat file mula sa sarili nitong pinakamahusay na capture, gamit ang id_ modifier para makuha ang orihinal na bytes nang walang iniksyong markup ng wayback.
- Muling isulat ang mga internal link sa relative paths para gumana ang kopya sa anumang host, kabilang ang iyong laptop.
- I-serve ang folder nang lokal at i-click ito. Ang mga sirang link, nawawalang imahe, at font 404 ay lalabas sa loob ng ilang minuto.
- Ihambing ang huling bilang ng file laban sa inventory at isulat kung ano ang nawawala at bakit.

Ang huling hakbang na iyon ang lahat ay nilalaktawan, at iyan ang pagkakaiba sa pagitan ng backup at bungkos ng mga file. Ang isang manifest ay ginagawang 'Sa tingin ko nakuha ko ang lahat' sa isang listahan na maaari mong suriin. Restorix ay mayroon nito nang built-in: ang libreng tantya ay nag-uulat ng eksaktong bilang ng naka-archive na file at kabuuang laki bago ka magsimula, at ang restore ay maaaring mag-export ng JSON o SQLite manifest ng bawat file na ibinalik nito, kaya ang pagiging kumpleto ay isang numero, hindi isang pakiramdam.
Ang mga kakulangan na maaari mong makaharap pa rin
- Mga pahina na hindi kailanman natagpuan ng crawler. Kung walang anuman sa pampublikong web ang nag-link sa isang pahina, malamang ay hindi ito nakita ng wayback.
- Mga pagbubukod sa Robots.txt. Ang mga lumang crawl ay laktawan nang buo ang mga hindi pinapayagang path, at ang ilang site ay sinadyang harang ang pag-archive.
- Nilalamang na-render ng JavaScript. Ang mga crawler ay historical na nag-store ng HTML shell, hindi anumang ginawa ng mga script pagkatapos.
- Mga login, cart, at resulta ng paghahanap. Anumang nasa likod ng POST request o session ay isang pader na hindi makakadaan ng crawler.
- URL noise. Ang mga session ID at tracking parameter ay nagpapalaki sa inventory ng libu-libong duplicate na 'pahina' na nagde-dedupe pababa sa iilang tunay.
Walang isa sa mga ito ang pagkabigo ng iyong paraan, mga butas ang mga ito sa archive mismo. Ang halaga ng inventory ay ipinapakita nito sa iyo ang mga butas bago ka mangako ng kumpletong restore sa sinuman.
Kapag nakakita ka ng mga butas, idokumento ang mga ito. Ang isang one-page na tala na naglilista ng labindalawang pahina na hindi kailanman naka-capture, ang video na umiiral lang bilang thumbnail, at ang seksyon ng forum na hinarang ng robots.txt ay ginagawang pinamamahalaang inaasahan ang isang awkward na sorpresa. Pinapatawad ng mga kliyente ang mga nawawalang file. Hindi nila pinapatawad ang pagtuklas sa mga ito nang mag-isa.
Ano ang halaga ng isang kumpletong kopya
Kung ang site ay isang tindahan ng kliyente o isang community forum na may isang dekada ng mga post, ang isang half-download ay isang pananagutan na nagpapakita bilang backup. Mag-budget man ng mga oras para patakbuhin ang checklist sa iyong sarili, o ibigay ang pag-crawl, pagtutugma ng timestamp, muling pagsusulat ng link, at pag-manifest sa isang tool na ginawa para sa eksaktong trabahong ito. Walang bayad ang tantya, at ang alternatibo ay paghahanap ng 300 nawawalang imahe pagkatapos maging live ang site.
Ibalik ang iyong website mula sa Wayback Machine
Libreng estimate sa ilang segundo — magbabayad ka lang kapag kinumpirma. Awtomatikong na-re-refund ang mga nabigong restore.
FAQ
Maaari ko bang i-download ang buong website mula sa archive.org sa isang click?
Ang archive.org mismo ay hindi nag-aalok ng whole-site export, ito ay ginawa para sa pag-browse ng mga single capture. Ang mga resulta sa isang click ay mula sa mga tool na nag-e-enumerate ng index ng archive at kumukuha ng bawat file: mga script tulad ng wayback-machine-downloader, o mga restore service tulad ng Restorix na humahawak din ng mga asset, muling pagsusulat ng link, at manifest.
Bakit nawawala ang mga imahe pagkatapos kong i-download ang buong website mula sa archive.org?
Karaniwang isa sa dalawang dahilan. O ang imahe ay hindi kailanman na-crawl, kaya walang kopya na umiiral kahit saan, o ang iyong tool ay kinuha ang pahina mula sa isang timestamp habang ang tanging natitirang capture ng imahe ay nasa ilalim ng iba. Ang cross-timestamp asset matching ay nag-aayos sa pangalawang kaso; walang nag-aayos sa una.
Ima-archive ba ng Wayback Machine ang bawat pahina ng isang website?
Hindi. Ini-archive nito ang maaabot ng mga crawler nito: mga pahina na naka-link mula sa isang lugar, na pinapayagan ng robots.txt, na nai-render nang walang login o mabigat na JavaScript. Ang malalim na thread ng forum, mga pahina ng faceted search, at admin area ay karaniwang wala. Ang CDX inventory ay nagpapakita ng eksaktong umiiral bago ka magsimula.
Gaano karaming file ang karaniwang kasangkot sa isang kumpletong website download?
Mas marami sa inaasahan ng mga tao. Ang isang karaniwang 50-pahinang business site ay karaniwang umaabot sa 400-800 na file kapag binilang mo ang mga imahe, stylesheet, script, at font. Ang mga forum at tindahan ay umaabot sa sampu-sampung libo. Ang bilang ng file, hindi ang bilang ng pahina, ang nagpapatakbo sa oras at gastos ng pag-download.
Kasama ba sa archive ang mga PDF, video, at iba pang download?
Madalas, oo. Ang archive ay nag-i-store ng mga dokumento at media na maaabot nito, at ang CDX index ay naglilista ng mga ito ayon sa MIME type kasama ng mga pahina. Ang malalaking video ay ang pagbubukod, na-crawl ang mga ito nang hindi pantay-pantay, kaya i-verify ang mga ito sa inventory sa halip na ipalagay na nakaligtas ang mga ito.
Mga kaugnay na gabay

download a website from archive org
Paano Mag-download ng Website mula sa Archive.org: 3 Paraan na Gumagana
Tatlong napatunayang paraan para mag-download ng website mula sa archive.org: mano-manong i-save ang mga pahina, i-script ang CDX API, o patakbuhin ang awtomatikong restore. Makatotohanang pagtatantya ng oras para sa bawat isa.

archive.org download website
Mga Tool sa Pag-download ng Website mula sa Archive.org: Isang Tapat na Paghahambing
Tapat na paghahambing ng mga tool sa pag-download ng website mula sa archive.org: HTTrack, mga script na wayback-machine-downloader, at Restorix. Tunay na gastos, pagsisikap, at paghawak ng asset.

find all pages on a website
Paano Hanapin ang Lahat ng Pahina sa Isang Website (Kahit ang mga Na-delete)
Kailangan mong hanapin ang lahat ng pahina sa isang website, kasama ang mga walang nagli-link? Ikumpara ang mga sitemap, crawler, Wayback CDX API, at Search Console exports.

wayback download
Wayback Download: Bawat Paraan Niraranggo ayon sa Pagsisikap
Bawat paraan ng wayback download niraranggo ayon sa pagsisikap: iisang pahina, wget script, ang CDX API, at mga automated na serbisyo na muling binubuo ang buong site para sa iyo.
