Ganze Website von Archive.org herunterladen, nicht nur die Startseite
Von der Restorix-Redaktion · 15. Juli 2026 · 7 Min. Lesezeit

Stellen Sie Ihre Website aus der Wayback Machine wieder her
Kostenlose Schätzung in Sekunden — Sie zahlen erst bei Bestätigung. Fehlgeschlagene Wiederherstellungen werden automatisch erstattet.
Jeder kann eine Startseite speichern. Die Startseite ist der einfache Teil – es sind die 4.000 Dateien dahinter, die unterscheiden zwischen „Ich habe eine Kopie gezogen“ und „Ich habe die Seite wirklich“. Wenn mich jemand bittet, eine gesamte Website von archive.org herunterzuladen, liegt die Startseite meist schon auf dem Desktop, das Stylesheet jedoch nicht.
Dieser Artikel dreht sich um das Wort „vollständig“. Was eine komplette Kopie tatsächlich beinhaltet, warum das Archiv Ihre Assets über Jahre verteilt auf verschiedene Zeitstempel, und eine Checkliste, die Sie am Ende durchgehen können, um zu beweisen, dass Sie alles haben, anstatt zu hoffen, dass Sie es haben.
Was „vollständig“ bedeutet, wenn Sie eine gesamte Website von archive.org herunterladen
Eine vollständige Kopie besteht aus vier Schichten, und die meisten Menschen hören nach der ersten auf. Das HTML jeder existierenden Seite. Die Assets, auf die jede Seite verweist: Bilder, Stylesheets, JavaScript, Schriftarten, PDFs, Videos. Interne Links wurden umgeschrieben, sodass die Kopie eigenständig durchsucht werden kann, ohne auf die Server von archive.org angewiesen zu sein. Und ein Manifest dessen, was erfasst wurde, sodass die Lücken dokumentiert und nicht erst später von einem Kunden entdeckt werden.
- Seiten: jede URL, die der Crawler jemals gesehen hat, nicht nur die im Hauptmenü. Alte Seiten verstecken ganze Bereiche hinter vergessenen Footer-Links.
- Assets: Bilder, CSS, JS, Schriftarten und herunterladbare Dateien – auf den meisten Seiten übersteigt ihre Anzahl die der Seiten um das Fünffache.
- Links: umgeschrieben auf relative Pfade, sonst funktioniert Ihre Kopie nur so lange wie archive.org.
- Ein Manifest: eine dateibasierte Liste dessen, was Sie haben, und macht aus „Ich glaube, ich habe alles“ etwas Überprüfbares.
Die Dateianzahl überrascht die Leute. Eine bescheidene 50-seitige Business-Website kommt routinemäßig auf 400–800 Dateien. Ein phpBB-Forum von 2009 mit Benutzer-Avataren und Anhängen kann in die Zehntausende gehen. Planen Sie nach Dateianzahl, nicht nach Seitenanzahl.
Es gibt auch einen Unterschied zwischen einer Kopie zum Durchsuchen und einer Kopie zur erneuten Bereitstellung. Eine Durchsuch-Kopie benötigt nur die Dateien und funktionierende Links. Eine Kopie, die Sie wieder auf einem Hosting ablegen wollen, benötigt mehr: konsistente kanonische URLs (www oder non-www wählen), HTTPS-fähige Referenzen und Ballast wie jahrzehntealte Analytics-Skripte, die entfernt werden. Entscheiden Sie sich vor dem Start, welches der beiden Sie erstellen, denn nachträgliches Umrüsten ist mühsam.
Warum Assets unter verschiedenen Zeitstempeln leben
Stellen Sie Ihre Website aus der Wayback Machine wieder her
Kostenlose Schätzung in Sekunden — Sie zahlen erst bei Bestätigung. Fehlgeschlagene Wiederherstellungen werden automatisch erstattet.
Die Wayback Machine fotografiert nicht eine ganze Website an einem Nachmittag. Ihre Crawler holen, was sie erreichen können, wann immer sie es erreichen. Ihre Startseite von 2014 könnte auf ein Logo verweisen, das zuletzt 2012 aufgezeichnet wurde, ein Stylesheet, das über fünf Jahre sechsmal aufgezeichnet wurde, und ein Hero-Bild, das nie aufgezeichnet wurde. Wenn Sie diese Seite anzeigen, setzt archive.org leise die nächste verfügbare Aufzeichnung für jedes Asset ein. Deshalb sieht die Seite in Ihrem Browser gut aus, obwohl ihre Teile über ein Jahrzehnt verstreut sind.
Zwei Konsequenzen ergeben sich. Erstens gibt es keinen einzigen „Zeitstempel der Seite“, auf den ein Downloader verweisen kann – ein vollständiger Download holt jede Datei aus ihrer eigenen besten Aufzeichnung. Zweitens versteckt der „nächste Aufzeichnung“-Trick Lücken: wayback serviert fröhlich ein Bild von 2016 auf Ihrer Seite von 2014, ohne es zu erwähnen. Für beiläufiges Surfen harmlos, wissenswert, wenn Ihnen wichtig ist, ob die wiederhergestellte Seite wirklich die von 2014 ist.
Eine archivierte Seite ist eine Collage. Das HTML, die Bilder und das CSS wurden jeweils zu unterschiedlichen Zeitpunkten eingefroren, und das Archiv setzt sie jedes Mal wieder zusammen, wenn jemand hinschaut.

Jedes Werkzeug oder Skript, das Sie verwenden, benötigt eine Strategie dafür. Die faule Strategie – alles zu einem Zeitstempel abzurufen – führt genau dazu, dass Sie auf einer Seite voller kaputter Bildsymbole landen, weil die Hälfte der Assets in dieser Woche einfach keine Aufzeichnung hat. Die richtige Strategie ist pro Datei: Jedes Asset von seiner eigenen nächsten guten Aufzeichnung innerhalb Ihres Datumsbereichs nehmen.
So laden Sie eine gesamte Website von archive.org herunter: Beginnen Sie mit dem Inventar
Bevor Sie eine einzelne Datei abrufen, listen Sie auf, was das Archiv tatsächlich enthält. Die CDX-API gibt Ihnen das vollständige Hauptbuch für eine Domain: jede erfasste URL mit ihren Zeitstempeln, MIME-Typ und HTTP-Status. Filtern Sie nach Statuscode 200, entfernen Sie doppelte Content-Digests, und Sie haben eine realistische Einkaufsliste anstelle einer Vermutung.
Lesen Sie das Inventar vor dem Herunterladen, und Sie erfahren die unangenehmen Dinge früh. Bei diesem phpBB-Forum-Job zeigte die CDX-Auflistung 11.000 erfasste URLs – und etwa 3.000 davon waren dasselbe Avatar-GIF, das unter verschiedenen Query-Strings gespeichert war. Das Entfernen von Duplikaten machte aus einer beängstigenden Aufgabe eine gewöhnliche. Dieselbe Auflistung zeigt auch die Seiten, die überhaupt nie erfasst wurden, die keine Download-Methode der Welt zurückzaubern kann. Besser, das am ersten Tag zu wissen.
Gruppieren Sie die Überlebenden nach MIME-Typ, und die Form der Aufgabe erscheint: Wie viele HTML-Seiten, wie viele Bilder, wie viel JavaScript, ob PDFs oder Videos zu berücksichtigen sind. Diese Gruppierung bestimmt sowohl Ihre Download-Reihenfolge als auch Ihre abschließende Vollständigkeitsprüfung.
Checkliste zum Herunterladen einer gesamten Website von archive.org ohne Lücken
- Ziehen Sie das CDX-Inventar für die Domain, gefiltert nach HTTP-200-Aufzeichnungen, unter Abdeckung Ihres vollständigen Datumsbereichs.
- Entfernen Sie doppelte Content-Digests, sodass identische Dateien einmal statt hunderte Male heruntergeladen werden.
- Gruppieren Sie die Liste nach MIME-Typ: HTML-Seiten zuerst, dann CSS, JS, Bilder, Schriftarten, Dokumente, Medien.
- Laden Sie jede Datei von ihrer eigenen besten Aufzeichnung herunter, indem Sie den id_-Modifikator verwenden, um Original-Bytes ohne waybacks eingefügtes Markup zu erhalten.
- Schreiben Sie interne Links auf relative Pfade um, sodass die Kopie auf jedem Host funktioniert, einschließlich Ihres Laptops.
- Stellen Sie den Ordner lokal bereit und klicken Sie sich hindurch. Kaputte Links, fehlende Bilder und Schriftart-404er tauchen innerhalb von Minuten auf.
- Vergleichen Sie die endgültige Dateianzahl mit dem Inventar und notieren Sie, was fehlt und warum.

Dieser letzte Schritt wird von allen übersprungen, und er ist der Unterschied zwischen einem Backup und einem Haufen Dateien. Ein Manifest verwandelt „Ich glaube, ich habe alles“ in eine überprüfbare Liste. unsere Wiederherstellungslösung hat dies integriert: Der kostenlose Kostenvoranschlag meldet die genaue archivierte Dateianzahl und Gesamtgröße, bevor Sie beginnen, und die Wiederherstellung kann ein JSON- oder SQLite-Manifest jeder wiederhergestellten Datei exportieren, sodass Vollständigkeit eine Zahl ist, kein Gefühl.
Die Lücken, auf die Sie trotzdem stoßen werden
- Seiten, die der Crawler nie gefunden hat. Wenn nichts im öffentlichen Web auf eine Seite verlinkt hat, hat wayback sie wahrscheinlich nie gesehen.
- Robots.txt-Ausschlüsse. Ältere Crawls haben nicht erlaubte Pfade komplett übersprungen, und einige Websites haben die Archivierung absichtlich blockiert.
- JavaScript-gerenderter Inhalt. Crawler haben historisch die HTML-Hülle gespeichert, nicht das, was die Skripte später erstellt haben.
- Logins, Warenkörbe und Suchergebnisse. Alles hinter einer POST-Anfrage oder einer Sitzung ist eine Mauer, die der Crawler nicht überwinden konnte.
- URL-Rauschen. Sitzungs-IDs und Tracking-Parameter blähen das Inventar mit Tausenden von doppelten „Seiten“ auf, die sich auf einige wenige echte reduzieren lassen.
Keines davon ist ein Fehler Ihrer Methode – es sind Lücken im Archiv selbst. Der Wert des Inventars ist, dass es Ihnen die Lücken zeigt, bevor Sie jemandem eine vollständige Wiederherstellung versprechen.
Wenn Sie doch Lücken finden, dokumentieren Sie sie. Eine einseitige Notiz, die die zwölf nie erfassten Seiten, das Video, das nur als Thumbnail existiert, und den durch robots.txt blockierten Forenbereich auflistet, verwandelt eine unangenehme Überraschung in eine gemanagte Erwartung. Kunden verzeihen fehlende Dateien. Sie verzeihen nicht, wenn sie sie selbst entdecken.
Was eine vollständige Kopie wert ist
Wenn es sich bei der Website um den Shop eines Kunden oder ein Community-Forum mit einem Jahrzehnt an Beiträgen handelt, ist ein halber Download eine als Backup getarnte Verbindlichkeit. Budgetieren Sie entweder die Stunden, um die Checkliste selbst durchzugehen, oder übergeben Sie das Crawlen, Timestamp-Matching, Link-Umschreiben und Manifestieren einem Tool, das genau für diese Aufgabe gebaut wurde. Der Kostenvoranschlag kostet nichts, und die Alternative ist, die fehlenden 300 Bilder zu finden, nachdem die Seite live gegangen ist.
Stellen Sie Ihre Website aus der Wayback Machine wieder her
Kostenlose Schätzung in Sekunden — Sie zahlen erst bei Bestätigung. Fehlgeschlagene Wiederherstellungen werden automatisch erstattet.
FAQ
Kann ich eine ganze Website mit einem Klick von archive.org herunterladen?
Archive.org selbst bietet keinen Export der gesamten Website – es ist für das Durchsuchen einzelner Aufnahmen konzipiert. Ergebnisse mit einem Klick kommen von Tools, die den Index des Archivs aufzählen und jede Datei abrufen: Skripte wie wayback-machine-downloader oder Wiederherstellungsdienste wie Restorix, die auch Assets, Link-Umschreibung und das Manifest übernehmen.
Warum fehlen Bilder, nachdem ich eine gesamte Website von archive.org heruntergeladen habe?
Meistens einer von zwei Gründen. Entweder wurde das Bild nie gecrawlt, sodass keine Kopie irgendwo existiert, oder Ihr Tool hat die Seite von einem Zeitstempel abgerufen, während die einzige verbliebene Bildaufnahme unter einem anderen liegt. Zeitstempelübergreifendes Asset-Matching behebt den zweiten Fall; nichts behebt den ersten.
Archiviert die Wayback Machine jede Seite einer Website?
Nein. Sie archiviert, was ihre Crawler erreichen konnten: von irgendwo verlinkte Seiten, von robots.txt erlaubt, ohne Logins oder schweres JavaScript gerendert. Tiefe Forenthreads, facettierte Suchergebnisse und Admin-Bereiche fehlen oft routinemäßig. Das CDX-Inventar zeigt genau, was existiert, bevor Sie beginnen.
Wie viele Dateien umfasst ein kompletter Website-Download normalerweise?
Mehr als die Leute erwarten. Eine bescheidene 50-seitige Business-Website summiert sich oft auf 400–800 Dateien, wenn man Bilder, Stylesheets, Skripte und Schriftarten zählt. Foren und Shops gehen in die Zehntausende. Die Dateianzahl, nicht die Seitenanzahl, treibt Download-Zeit und Kosten.
Sind PDFs, Videos und andere Downloads im Archiv enthalten?
Oft ja. Das Archiv speichert Dokumente und Medien, die es erreichen konnte, und der CDX-Index listet sie nach MIME-Typ neben Seiten auf. Große Videos sind die Ausnahme – sie wurden inkonsistent gecrawlt – überprüfen Sie sie daher im Inventar, anstatt anzunehmen, dass sie überlebt haben.
Verwandte Guides

download a website from archive org
So laden Sie eine Website von Archive.org herunter: 3 funktionierende Wege
Drei bewährte Wege, eine Website von archive.org herunterzuladen: Seiten manuell speichern, die CDX-API skripten oder eine automatisierte Wiederherstellung durchführen. Realistische Zeitangaben für jede Methode.

archive.org download website
Archive.org Tools zum Herunterladen von Websites: Ein ehrlicher Vergleich
Ein ehrlicher Vergleich von archive.org Download-Website-Tools: HTTrack, wayback-machine-downloader-Skripte und Restorix. Echte Kosten, Aufwand und Asset-Handling.

find all pages on a website
So finden Sie alle Seiten einer Website (auch gelöschte)
Müssen Sie alle Seiten einer Website finden – auch die, auf die niemand verlinkt? Vergleichen Sie Sitemaps, Crawler, die Wayback-CDX-API und Search-Console-Exporte.

wayback download
Wayback-Download: Alle Methoden nach Aufwand bewertet
Jede Wayback-Download-Methode nach Aufwand bewertet: einzelne Seiten, wget-Skripte, die CDX-API und automatisierte Dienste, die die gesamte Website für Sie wiederherstellen.
