Сравнение инструментов для скачивания сайтов: что они сохраняют, а что ломают
От редакционной команды Restorix · 17 мая 2026 г. · 7 мин чтения

Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
Хостинговая компания отключила сайт клиента за выходные. Бэкапов, конечно, не было. Сайт ещё отвечал в понедельник утром, едва-едва, и первое, что я сделал, направил скачивальщик на него и вытянул все доступные страницы, пока свет окончательно не погас. Вот для чего нужны эти инструменты: быстро забрать то, что сервер ещё готов отдать, пока он не перестал отдавать.
Скачивальщик сайтов, это не магия, хотя четыре инструмента, к которым люди реально прибегают, HTTrack, SiteSucker, wget и встроенная кнопка сохранения браузера, существенно различаются в том, что они сохраняют. Вот что каждый из них сохраняет, что каждый тихо ломает, и как выбирать между ними.
Что реально сохраняет скачивальщик сайтов
Под капотом все скачивальщики работают одинаково. Запрашивают URL, разбирают полученный HTML, находят связанные ресурсы и внутренние ссылки, скачивают их, переписывают ссылки для работы с диска, и продолжают, пока очередь не пуста. Краулер с кнопкой «Сохранить».
Что попадает на диск:
- HTML-страницы, обычно переименованные для локального открытия без сервера
- CSS, JavaScript и шрифты, на которые ссылаются эти страницы
- Изображения, видео, PDF и всё остальное, что страницы ссылают напрямую
- Структура папок, отражающая оригинальную раскладку URL
Чего не попадает: всё, что сервер генерирует на лету. Скачивальщик получает тот же отрендеренный HTML, что и любой анонимный посетитель. PHP, база данных, админ-панель, история заказов, ничего этого не передаётся по сети, а значит, ничего не попадает домой. Скачанный WordPress-сайт, это статуя сайта, а не сайт.
Два нюанса определяют, что в итоге окажется в ваших руках. Первый, обнаружение: краулер находит только URL, на которые есть ссылки со страниц, которые он уже получил, плюс карту сайта, если вы её подсунули, изолированные страницы без входящих ссылок остаются невидимыми. Второй, вежливость: большинство инструментов по умолчанию уважают robots.txt, и хотя HTTrack позволяет это переопределить, делать это стоит только на собственных сайтах.
HTTrack и SiteSucker: варианты с графическим интерфейсом
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
HTTrack (WinHTTrack на Windows), дедушка этой категории: бесплатный, с открытым исходным кодом, существует с 1998 года. Вставляете URL, выбираете папку проекта, и он зеркалирует сайт. Настоящая ценность, в настройках: ограничения глубины сканирования, фильтры типов файлов, ограничения пропускной способности и правила сканирования, включающие или исключающие URL-паттерны. Я зеркалировал 400-страничное портфолио фотографа минут за двадцать, со всеми картинками.
Настройки, которые я реально меняю относительно умолчаний:
- Максимальная глубина зеркалирования: оставьте без ограничений для маленьких сайтов, ставьте 3–4 для больших
- Правила сканирования: добавьте паттерн включения для целевого домена, чтобы краулинг не ушёл на соседние сайты
- Контроль потока: два-четыре соединения и ограничение пропускной способности на чужих серверах
- MIME-типы: исключайте видео на первых проходах, одна забытая папка с вебинаром может весить 40 ГБ
Подводные камни: интерфейс выглядит соответственно возрасту, последний значимый релиз был годы назад, и он слеп к JavaScript. Если страница строит контент в браузере, HTTrack сохраняет пустые строительные леса.
SiteSucker, это Mac-ответ, несколько долларов в App Store. Вставляете URL, нажимаете «старт», и он скачивает в фоне с разумными умолчаниями, с паузой и возобновлением. Меньше ручек управления, чем у HTTrack, и та же слепота к JavaScript, но для быстрого чистого зеркалирования на macOS это наименее болезненный вариант.
wget для тех, кто любит терминалы
wget, это скриптуемый вариант, установлен почти на каждой Linux-машине и в одном brew install на Mac. Классический рецепт полного зеркала:
wget --mirror --convert-links --adjust-extension --page-requisites --no-parent https://example.com
Что даёт каждый флаг:
- --mirror включает рекурсию и временные метки, чтобы повторные запуски забирали только изменения
- --convert-links переписывает ссылки после скачивания, чтобы страницы работали офлайн
- --adjust-extension сохраняет страницы, генерируемые сервером, как правильные.html-файлы
- --page-requisites забирает CSS, JS и картинки, нужные каждой странице для отображения
- --no-parent удерживает краулинг ниже стартового пути вместо поглощения всего домена
Полезные дополнения: --wait=1 --random-wait сохраняет вежливость на маленьких серверах, -c возобновляет прерванное зеркалирование без повторной загрузки уже завершённых файлов, а --load-cookies с экспортированным файлом куки позволяет забирать страницы за своим логином. И не путайте wget с curl, curl прекрасно загружает один URL, wget зеркалирует целые сайты. Люди постоянно их путают.

Сохранение браузера: встроенный вариант
Ctrl+S, «Веб-страница полностью», скачивальщик, который у вас уже есть. Сохраняет одну страницу плюс папку ресурсов. Для квитанции, статьи или контактной страницы, которая нужна прямо сейчас, сойдёт. У него даже есть одно настоящее супер-свойство: браузер сохраняет страницу после выполнения JavaScript, так что React-тяжёлая страница, которая даёт wget пустую оболочку, проходит полностью отрендеренной.
Лимиты проявляются быстро. CSS-фоновые картинки и цепочки @import часто пропадают, ссылки указывают обратно на живой сайт вместо друг друга, и нет рекурсии, 300-страничный сайт означает 300 ручных сохранений. Одна полезная хитрость: расширение SingleFile инлайнит все ресурсы в один самодостаточный HTML-файл, после выполнения JavaScript. Для архивирования отдельных JS-тяжёлых страниц оно чисто выигрывает у обычного Ctrl+S. Сохранение как PDF, это другое: оно фиксирует внешний вид, а не страницу, и ничего из него не работает.
Сеанс скачивания сайта от начала до конца
Первое зеркалирование незнакомого сайта проходит лучше по процедуре. Моя:
- Проверьте robots.txt и условия использования сайта перед краулингом, и ставьте флаг ожидания на маленьких серверах в любом случае.
- Определите область: весь домен или один раздел. Правило no-parent или правило сканирования HTTrack не даст краулу блога проглотить соседний магазин.
- Запустите зеркалирование и следите за логом. Повторяющиеся 403 означают обнаружение бота; поток страниц календаря или тегов означает, что область утекает.
- Проверьте десять случайных страниц офлайн, включая одну с контактной формой и одну тяжёлую галерею. Сломанное сейчас, сломанное навсегда.
- Сравните локальное количество файлов с картой сайта. Большой разрыв означает контент, отрендеренный JavaScript, или правила области, поглощающие страницы.
Что каждый скачивальщик сайтов ломает
Возьмите любой инструмент из вышеперечисленных, и одни и те же вещи развалятся, потому что проблемы живут в самой среде, а не в софте:
| Что ломается | Почему это происходит | Последствия |
|---|---|---|
| Поиск, формы, авторизация | Серверный код исчез | Функции мертвы сразу |
| Контент, отрендеренный JavaScript | Краулеры видят HTML до JS | Целые разделы отсутствуют |
| URL, встроенные в скрипты или inline-стили | Переписыватель ссылок не может их распарсить | Битые картинки и ссылки |
| Страницы с query-string (?p=123) | Искажённые или дедуплицированные имена файлов | Страницы тихо теряются |
| Стриминговое видео (HLS/DASH) | URL сегментов истекают прямо во время скачивания | Ролики, которые никогда не воспроизводятся |
Также следите за междоменными ресурсами. Большинство краулеров по умолчанию остаются на стартовом хосте, поэтому картинки с CDN-поддомена или шрифты с внешнего хоста пропускаются, пока вы не расширите область, и тогда сохранённые страницы возвращаются с кучей битых ссылок. Остаётся ещё SEO-хвост: каноничные теги, URL Open Graph и абсолютные внутренние ссылки всё ещё указывают на старый домен. Безобидно в личном архиве, реальная проблема, если зеркало снова выйдет в онлайн.
Скачанный сайт, это статуя: выглядит абсолютно правильно, а внутри ничего не двигается.

Когда скачивальщик сайтов, неправильный инструмент
Очевидный случай: сайт уже офлайн. Скачивальщику нужен живой сервер, отвечающий на запросы, а истёкший домен или мёртвый хост не дают ему ничего для краулинга. Уцелевшая копия сидит в Wayback Machine, а направлять wget на web.archive.org, мучение: ограничения скорости, переписанные архивом URL, введённый тулбар на каждой странице и снимки, разбросанные по годам.
Именно для этого существует Restorix. Он восстанавливает сайты из архивных снимков с выбором диапазона дат, убирает архивный мусор и старую аналитику и показывает точное количество архивных файлов, общий размер и фиксированную цену до оплаты.
Второй неправильный случай: вам нужен контент, а не пиксели, статьи в таблицу, товары в базу данных. Это экстракция, а не скачивание. И третий: если сайту нужны его функции, работающие на базе данных, магазин, форум, статическое зеркало даёт вам только внешний вид, а не машину. Нужно восстановление плюс свежий бэкенд.
От файлов обратно к живому сайту
Папка с зеркалом, это не веб-сайт. Вернуть его в сеть значит где-то хостить, чинить абсолютные ссылки, убирать мёртвые скрипты отслеживания и разбираться с HTTPS. Реально сделать руками, или пропустить сантехнику: Restorix разворачивает восстановленные сайты напрямую на SSH/SFTP, FTP/FTPS или S3, с лёгкой CMS, чтобы сайт снова можно было редактировать, а не только просматривать. Как бы то ни было, протестируйте результат на телефоне, прежде чем считать дело.done.
Восстановите свой сайт из Wayback Machine
Бесплатная оценка за секунды — вы платите только при подтверждении. При сбое деньги возвращаются автоматически.
FAQ
Законно ли скачивать сайт скачивальщиком?
Скачивание публично доступных страниц, которые сервер раздаёт всем подряд, обычно не вызывает проблем, эти байты отдаются любому желающему. Важно, что вы делаете дальше. Перепубликация чужого контента как есть, это проблема с авторским правом, а обработка маленького сервера на полной скорости может нарушать его условия использования. Скачивайте свои сайты, берите разрешение для клиентской работы и держите ограничения скорости включёнными для всего остального.
Может ли скачивальщик забрать страницы за логином?
Для собственных аккаунтов, да. wget делает это с --load-cookies и экспортированным файлом куки; HTTrack имеет трюк с прокси catch-URL, который захватывает вашу сессию. Ожидайте сложностей, сессии истекают, а CSRF-токены ломают краулы на полпути, так что следите за процессом. И никогда не передавайте свои куки онлайн-инструменту.
Почему скачанный сайт выглядит сломанным при открытии?
Почти всегда одна из трёх причин: абсолютные URL всё ещё указывают на живой домен, ресурсы загружаются JavaScript, который краулер не видел, или страницы с query-string сохранены под искажёнными именами. Откройте консоль браузера на локальной копии и читайте 404-е, они точно показывают, что инструмент пропустил.
Можно ли запускать wget или HTTrack против Wayback Machine?
Технически да, по факту, мучение. Вы упрётесь в ограничения скорости, URL, переписанные архивом, разметку тулбара, впечатанную в каждую страницу, и файлы, вытащенные из снимков разных лет. Специализированный инструмент восстановления справляется со всем этим за вас, в этом вся причина существования Restorix.
Какой лучший скачивальщик для полного сайта?
HTTrack, если хотите GUI на Windows или Linux, SiteSucker на Mac, wget, если пишете скрипты. Для сайта, который уже офлайн, ни один из них не поможет, загружать нечего, так что восстанавливайте из архивных снимков.
Похожие гайды

wayback machine downloader
Инструменты для скачивания из Wayback Machine: что реально работает
Честный обзор инструментов для скачивания из Wayback Machine: опенсорс-скрипты, их реальные ограничения и готовое решение, которое вернёт ваш сайт в онлайн.

download entire website from archive org
Загрузка всего сайта из Archive.org, а не только главной страницы
Чтобы загрузить весь сайт из archive.org, вам нужны все страницы, изображения и стили. Ресурсы скрываются под разными временными метками, вот почему это происходит, а также полный чек-лист.

online website extractor
Онлайн-инструменты для извлечения данных с сайтов: возможности, ограничения и безопасность
Что именно онлайн-инструмент извлекает со страницы: текст, изображения, ссылки, структурированные данные. Чем онлайн-инструменты отличаются от локальных и как не нарваться на проблемы.

restoration websites
Восстановление сайтов: что на самом деле означает восстановление веб-сайта
Сайты восстановления восстанавливают утерянные сайты из веб-архивов. Чем восстановление отличается от резервного копирования и редизайна, и как происходит процесс от снимка до работающего сайта.
