Mga Format ng Pag-download sa Archive.org: WARC, CDX at Mga Single File
Ni ang koponan sa editoryal ng Restorix · Hunyo 28, 2026 · 9 min na pagbabasa

Ibalik ang iyong website mula sa Wayback Machine
Libreng estimate sa ilang segundo — magbabayad ka lang kapag kinumpirma. Awtomatikong na-re-refund ang mga nabigong restore.
Nahanap mo ang crawl, na-click ang download, at ngayon ay nakatitig ka sa isang 900 MB na file na nagtatapos sa.warc.gz na walang makabukas sa iyong computer. Maligayang pagdating sa pinakamahirap na dokumentadong bahagi ng Archive.org: ang mga format. Ang library ay nagbibigay ng raw capture data, at ang raw capture data ay umaasa na may dala kang sarili mong mga tool.
Tatlong format ang sumasaklaw sa halos lahat ng iyong makukuha: WARC files, JSON CDX output, at plain single files. Narito kung ano talaga ang bawat isa, kung kailan mo ito kailangan, at kung paano ito gagawing kapaki-pakinabang, kasama ang shortcut kung gusto mo lang ibalik ang iyong lumang site.
Ano Talaga ang Laman ng isang Archive.org Download
Muli, dalawang mundo ng imbakan. Ang mga pag-download ng item ay nagbibigay sa iyo ng tapos na mga file, ang PDF ay PDF, ang ISO ay ISO. Ang mga pag-download sa bahagi ng Wayback ay nagbibigay sa iyo ng web capture data: mga HTTP response na na-freeze sa oras ng crawl, kasama ang mga index na naglalarawan sa kanila. Ang mga nakakalitong format ay nagmumula sa pangalawang mundong iyon, at mayroon ding single-file escape hatch na sumasaklaw sa pareho.
Mahalaga ang laki sa pagpaplano. Ang isang segment ng WARC mula sa isang crawl collection ay humigit-kumulang 1 GB kapag naka-compress. Ang CDX listing ng isang katamtamang laki ng site ay maaaring 50,000 linya ng JSON. Ang single file ay, well, iisang file. Itugma ang format sa trabaho bago mo simulan ang paglilipat, hindi pagkatapos, ang muling pag-download ng isang gigabyte dahil mali ang iyong nakuha ay isang ritwal na dapat iwasan.
WARC: Ang Raw Capture Format
Ibalik ang iyong website mula sa Wayback Machine
Libreng estimate sa ilang segundo — magbabayad ka lang kapag kinumpirma. Awtomatikong na-re-refund ang mga nabigong restore.
WARC, Web ARChive, ISO standard 28500, ay isang lalagyan na pinagsasama-sama ang mga record. Ang bawat record ay isang na-capture na HTTP exchange: ang response headers na sinusundan ng eksaktong payload bytes, kasama ang metadata tulad ng oras ng capture at target URL. Ang mga record ay may mga uri, response, resource, metadata, warcinfo, at ang mga file ay halos palaging dumarating na naka-gzip, isang record bawat gzip member, upang ang mga tool ay makapag-seek nang hindi na-decompress ang buong archive.
- Walang nire-render o nililinis. Makukuha mo ang byte-for-byte kung ano ang nakita ng crawler, kasama ang mga 404 page at redirect chain.
- Ang isang WARC ay naglalaman ng libu-libong madalas na hindi nauugnay na URL mula sa isang crawl, ang iyong site ay maaaring 2% lamang ng file.
- Kailangan mo ng tool upang mabasa ito: ang Python warcio library para sa extraction, o ReplayWeb.page at pywb upang i-replay ito bilang mga mabibisitang page.
Ang pag-extract gamit ang warcio ay isang filter loop: buksan ang archive, laktawan ang mga record na ang target URL ay nasa labas ng iyong domain, isulat ang mga payload sa disk na sumasalamin sa orihinal na mga path, i-dedupe ang magkakahawig na digest. Limampung linya ng Python, o isang mahabang gabi ng pag-aaral kung bakit nagbabayad ang mga tao para dito.
Saan ka ba talaga makakakuha ng mga WARC? Dalawang lugar. Ang Archive Team rescue crawls at ang Internet Archive crawl collections ay nagpapadala sa kanila bilang ordinaryong item files, hanapin ang.warc.gz sa download box ng item. At kung mag-commission o mag-export ka ng sarili mong crawl, WARC ang ibabalik. Ito ang shipping container ng mundo ng web archiving: pangit, standardized, at nasa lahat ng dako.

JSON CDX: Ang Index, Hindi ang Nilalaman
Ang CDX ay ang card catalog ng Wayback Machine. I-query ang web.archive.org/cdx/search/cdx?url=example.com&output=json at makakakuha ka ng JSON array kung saan ang bawat row ay naglalarawan ng isang capture: urlkey, timestamp, original URL, mimetype, statuscode, digest, at byte length. Walang nilalaman ng page, isang tumpak na menu lamang ng kung ano ang umiiral, capture bawat capture.
Dalawang flag ang sulit na gamitin sa bawat query: ang filter=statuscode:200 ay nag-aalis ng mga redirect at error page, at ang collapse=digest ay nagtatanggal ng duplicate na capture ng magkakahawig na nilalaman. Sa isang WooCommerce store ng isang kliyente, ang dalawang flag na iyon ay nagbawas ng 38,000 raw rows sa 4,100 totoo at natatanging page. Ang listahang iyon ay naging restore plan, at ang pagtatantya ng presyo.
Mga trick sa query na dapat malaman: idagdag ang matchType=prefix upang masakop ang bawat URL sa ilalim ng isang path, at gamitin ang from=2008&to=2012 upang limitahan ang mga taon. Ang wildcard tulad ng url=example.com/* ay nagpapahiwatig na ng prefix match sa buong domain. Magsimula nang makitid, ang isang unfiltered domain query sa isang malaking site ay nagbabalik ng megabytes ng JSON at isang nagyeyelong browser tab.
- Pag-scope: gaano karami ng site ang na-capture, at sa anong mga taon.
- Gap analysis: paghahanap ng mga image directory at CDN host na hindi kailanman na-crawl.
- Batch fetch lists: ibigay ang mga timestamp-plus-URL pair sa iyong downloader, isang id_ request bawat isa.
- Mga pagtatantya: Binabasa ng Restorix ang parehong CDX data na ito upang presyuhan ang isang restore, bilang ng file, kabuuang laki, naka-lock na presyo, nang maaga.

Single Files: Ang Madaling Pag-download sa Archive.org
Ang ikatlong format ay halos hindi isang format: isang orihinal na file, direktang nakuha. Para sa mga item, iyon ang file link sa download box. Para sa mga snapshot, ito ang id_ trick, ilagay ang id_ pagkatapos ng timestamp, tulad ng web.archive.org/web/20130501000000id_/http://example.com/logo.png, at ang Wayback Machine ay nagbabalik ng untouched payload na walang toolbar at walang rewritten markup.
Kunin ang mga single file kung alam mo na kung ano ang nawawala: ang stylesheet na hindi na-crawl, ang PDF price list, ang hero image na paulit-ulit na tinatanong ng isang kliyente. Nag-iingat ako ng isang scratch folder ng mga ito bawat proyekto. Ang hindi mo dapat gawin ay bumuo ng buong site sa ganitong paraan, ang 4,000 manual id_ fetches ay isang script na naghihintay na maisulat.
Dalawang failure mode na asahan. Sa bahagi ng snapshot, ang id_ ay gagana lamang kung ang eksaktong URL na iyon ay na-capture, suriin muna ang CDX index sa halip na hulaan ang mga URL. Sa bahagi ng item, ang direct URL pattern na archive.org/download/{identifier}/{filename} ay stable at scriptable, ngunit ang mga filename na may espasyo ay nangangailangan ng tamang URL encoding o ang wget ay mag-404 sa isang file na malinaw na umiiral.
Aling Format ng Pag-download sa Archive.org ang Kailangan Mo?
| Format | Nilalaman | Pinakamainam para sa | Mga Tool |
|---|---|---|---|
| WARC (.warc.gz) | Maramihang raw HTTP response | Buong crawl, offline na archive | warcio, pywb, ReplayWeb.page |
| JSON CDX | Metadata lamang ng capture | Pag-scope, gap analysis, fetch lists | Kahit anong HTTP client at isang script |
| Single file / id_ | Isang orihinal na payload | Target na mga nawawalang asset | Browser o wget |
| Pag-download ng item | Tapos na mga file (PDF, ISO, MP3) | Mga libro, software, media | Wala, i-click at go |
Ang totoong dependency chain para sa isang website restore ay CDX muna, WARC o id_ fetches pangalawa, single files upang punan ang mga butas sa huli. Ang paglaktaw sa CDX step ay kung paano ka magda-download ng isang gigabyte ng crawl data at makaligtaan pa rin ang kalahati ng site. Ang mga pag-download ng item ay nasa labas ng chain na ito, ang mga ito ay tapos na mga produkto, at kung ang kailangan mo ay isang libro o driver, tumigil sa pagbabasa at pumunta mag-click.
Pagtatrabaho sa Iyong Na-download
Mga gotcha na minsan ay nakakagulat sa lahat. Ang mga naka-gzip na WARC ay multi-member, gumagana ang isang simpleng gunzip, ngunit ang mga streaming reader ay hindi dapat huminto sa unang member. Ang mga digest ay umuulit sa mga capture, kaya mag-dedupe bago mo bilangin ang mga file o magsisinungaling ang iyong mga kabuuan. Ang mga character encoding mula 2004 ay hindi UTF-8; panatilihin ang bytes bilang bytes hanggang kailangan mong i-decode. At ang bawat Wayback-rewritten URL sa loob ng captured HTML ay nakaturo pa rin sa web.archive.org hanggang sa i-rewrite mo ito pabalik.
Planuhin ang output structure bago mag-extract: gayahin ang orihinal na URL paths, panatilihin ang isang manifest kung aling payload ang nagmula sa aling record, at huwag kailanman i-overwrite ang variant na maaaring kailanganin mo sa ibang pagkakataon. Ang Restorix ay maaaring mag-export ng ganitong uri ng manifest (JSON o SQLite) sa bawat restore, kung gagawin mo ito nang mano-mano, mauunawaan mo kung bakit umiiral ang feature na iyon.
O Laktawan ang Paghihirap sa Format nang Buo
Ang lahat ng nasa itaas ay matututunan, at wala sa mga ito ang magandang gamit ng weekend ng isang may-ari ng negosyo. Ang Restorix ay umiiral para sa mismong layer na ito: binabasa nito ang CDX data, kinukuha ang mga capture, nagde-dedupe, nagre-rewrite ng mga link, at ibinibigay sa iyo ang isang gumaganang site. Ang libreng estimate ay nagpapakita ng archived file count, kabuuang laki, at isang naka-lock na presyo bago ka magbayad, unang file na-restore nang libre, bayad bawat file pagkatapos noon, awtomatikong refund para balanse kung may mabibigo.
Ang mga opsyon sa restore ay isa-sa-isa sa mga pain point sa itaas: relative internal links sa halip na archive.org URLs, HTTPS conversion, pag-alis ng lumang analytics at ads, pananatiling buo ng 301 redirects. Ang deploy ay isang click papunta sa SSH/SFTP, FTP/FTPS, o S3 mula sa restore dashboard, at ang bundled CMS sa /webarchive-cms.php, random na nabuong password, safe mode na naka-default, ay nangangahulugan na maaari mong i-edit ang nabuhay na site nang hindi ginagalaw ang isang linya ng WARC tooling. Ang mga format ay para sa mga archivist. Gusto mo ng site mo pabalik.
Ibalik ang iyong website mula sa Wayback Machine
Libreng estimate sa ilang segundo — magbabayad ka lang kapag kinumpirma. Awtomatikong na-re-refund ang mga nabigong restore.
FAQ
Ano ang WARC file at paano ko ito bubuksan?
Ang WARC ay isang ISO-standard na lalagyan ng mga na-capture na HTTP response, headers kasama ang eksaktong payload bytes, karaniwang naka-gzip. Buksan ito gamit ang Python warcio library upang i-extract ang mga file, o i-replay ito bilang mga mabibisitang page gamit ang ReplayWeb.page o pywb. Ang pag-double-click ay walang nagagawa; walang native desktop viewer.
Ano ang ibig sabihin ng mga field sa JSON CDX output?
Ang bawat row ay isang capture: urlkey (canonicalized URL), timestamp (oras ng capture, yyyyMMddhhmmss), original (ang URL ayon sa pagkaka-crawl), mimetype, statuscode, digest (content hash, ang magkakahawig na digest ay nangangahulugang magkakahawig na bytes), at length (compressed record size). Inilalarawan nito ang mga capture; hindi ito naglalaman ng nilalaman ng page.
Paano ko makukuha ang orihinal na file nang walang rewritten HTML ng Wayback?
Gamitin ang id_ modifier: ilagay ito pagkatapos ng timestamp sa anumang snapshot URL at ang archive ay nagbabalik ng unmodified payload, walang toolbar, walang rewritten links. Ito ay gumagana para sa mga page, images, CSS, kahit ano na na-capture.
Maaari ko bang i-convert ang isang Archive.org download pabalik sa isang gumaganang website?
Oo, may pagsisikap: ilista ang mga capture sa pamamagitan ng CDX, i-extract ang mga payload mula sa WARC o id_ fetches, i-rewrite ang mga link, ayusin ang mga nawawalang asset, pagkatapos ay i-deploy. Para sa ilang mga page, iyon ay isang masayang gabi. Para sa isang tunay na site, isang restore service tulad ng Restorix ang nag-automate ng buong chain at ipinapakita sa iyo ang presyo bago mag-charge.
Gaano kalaki ang karaniwang Archive.org download ng isang site?
Mas maliit kaysa sa iyong kinakatakutan, kadalasan. Ang isang limang-taong-gulang na 200-page brochure site ay kadalasang umaabot ng 200-800 MB sa lahat ng capture; kapag na-dedupe, ang natatanging nilalaman ay maaaring 60 MB. Ang CDX listing ay nagsasabi sa iyo ng totoong mga numero bago ka mag-download ng kahit ano, palaging mag-scope muna.
Mga kaugnay na gabay

download archive org
Paano Mag-download mula sa Archive.org: Mga Item, Snapshot, at Iba Pa
Bawat praktikal na paraan para mag-download ng nilalaman mula sa Archive.org, mga file ng item, bulk CLI pulls, at Wayback web snapshots, at kung paano pumili ng tama para sa iyong trabaho.

archive.org download website
Mga Tool sa Pag-download ng Website mula sa Archive.org: Isang Tapat na Paghahambing
Tapat na paghahambing ng mga tool sa pag-download ng website mula sa archive.org: HTTrack, mga script na wayback-machine-downloader, at Restorix. Tunay na gastos, pagsisikap, at paghawak ng asset.

wayback download
Wayback Download: Bawat Paraan Niraranggo ayon sa Pagsisikap
Bawat paraan ng wayback download niraranggo ayon sa pagsisikap: iisang pahina, wget script, ang CDX API, at mga automated na serbisyo na muling binubuo ang buong site para sa iyo.

restore website from archive.org
Ibalik ang Website mula sa Archive.org: DIY o Gawin-na-lang?
Dapat mo bang ibalik ang website mula sa Archive.org nang sarili mo o bayaran ang gawin-na-lang? Isang tapat na paghahambing ng gastos, oras, kasanayan, at panganib, kasama ang framework para sa pagpapasya.
