Web İndirici Araçlarının Karşılaştırılması: Neleri Korur ve Neleri Bozar
Restorix editör ekibi tarafından · 17 Mayıs 2026 · 7 dakika okuma

Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
Bir hosting şirketi bir müşteriyi bir hafta sonu boyunca tamamen kapattı. Elbette yedekleme yoktu. Site Pazartesi sabahı hâlâ zor da olsa yanıt veriyordu ve yaptığım ilk şey, ışıklar tamamen sönmeden önce her erişilebilir sayfayı çekmek için bir web indiricisini ona doğrultmaktı. Bu araçların kullanım amacı budur: bir sunucunun hâlâ size verebildiği şeyleri, durmadan önce hızlıca yakalamak.
Bir web indirici sihirli bir araç değildir, ancak insanların gerçekten kullandığı dört araç, HTTrack, SiteSucker, wget ve tarayıcının kendi kaydetme düğmesi, korudukları konusunda büyük farklılıklar gösterir. İşte her birinin ne kaydettiğini, her birinin sessizce ne bozduğunu ve bunlar arasında nasıl seçim yapılacağını anlatacağız.
Bir web indirici aslında ne kaydeder
Her web indirici motorun altında aynı şekilde çalışır. Bir URL'yi isteyir, dönen HTML'i ayrıştırır, bağlı varlıkları ve dahili bağlantıları bulur, bunları indirir, bağlantıları diskten çalışacak şekilde yeniden yazar ve kuyruk boşalana kadar devam eder. Kaydetme düğmeli bir tarayıcı.
Sürücünüze inenler:
- HTML sayfaları, genellikle sunucu olmadan yerel olarak açılacak şekilde yeniden adlandırılmış
- Bu sayfaların başvurduğu CSS, JavaScript ve yazı tipleri
- Görüntüler, videolar, PDF'ler ve sayfaların doğrudan bağlandığı diğer her şey
- Orijinal URL düzenini yansıtan bir klasör yapısı
İnmeyenler: sunucunun anlık olarak oluşturduğu her şey. İndirici, herhangi bir anonim ziyaretçinin aldığı aynı işlenmiş HTML'i alır. PHP, veritabanı, yönetici paneli, sipariş geçmişi, bunların hiçbiri ağ üzerinden geçmez, bu yüzden hiçbiri eve gelmez. İndirilmiş bir WordPress sitesi, sitenin bir heykelidir, sitenin kendisi değil.
İki kapsam detayı, elde ettiğiniz sonucu belirler. Birincisi, keşif: bir tarayıcı, yalnızca zaten sahip olduğu sayfalardan bağlantı verilen URL'leri bulur, ayrıca bir site haritası beslerseniz onu da ekler, gelen bağlantısı olmayan yetim sayfalar görünmez kalır. İkincisi, nezaket: çoğu araç varsayılan olarak robots.txt'ye saygı gösterir ve HTTrack bunu devre dışı bırakmanıza izin verse de, bunu yalnızca sahip olduğunuz sitelerde yapmalısınız.
HTTrack ve SiteSucker: Grafik Arayüz Seçenekleri
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
HTTrack (Windows'ta WinHTTrack), kategorinin atasıdır: ücretsiz, açık kaynaklı ve 1998'den beri var. Bir URL yapıştırın, bir proje klasörü seçin ve siteyi aynalayın. Gerçek değer seçeneklerdedir, tarama derinliği sınırları, dosya türü filtreleri, bant genişliği sınırları ve URL kalıplarını dahil eden veya hariç tutan tarama kuralları. 400 sayfalık bir fotoğrafçının portföyünü yaklaşık yirmi dakikada, görseller dahil aynaladım.
Varsayılanlardan gerçekten değiştirdiğim ayarlar:
- Maksimum aynalama derinliği: küçük siteler için sınırsız bırakın, büyükler için 3 veya 4 ile sınırlayın
- Tarama kuralları: hedef alan adı için bir dahil etme kalıbı ekleyin, böylece tarama site dışına çıkamaz
- Akış kontrolü: kendi sunucunuz olmayan her şey için iki ila dört bağlantı ve bir bant genişliği sınırı
- MIME türleri: ilk geçişlerde videoyu hariç tutun, unutulmuş bir seminer klasörü 40 GB olabilir
Tuzaklar: arayüz eski görünümünü koruyor, son anlamlı çıkış yıllar önceydi ve JavaScript'e karşı kör. Bir sayfa içeriğini tarayıcıda oluşturuyorsa, HTTrack boş iskeleti kaydeder.
SiteSucker, Mac için cevaptır, App Store'da birkaç dolara mal olur. Bir URL yapıştırın, başlat'a basın ve makul varsayılanlarla arka planda indirme yapar, duraklatma ve devam ettirme dahil. HTTrack'tan daha az ayar ve aynı JavaScript körlüğü, ancak macOS'ta hızlı ve temiz bir aynalama için en az acı veren seçenektir.
Terminal sevenler için wget
wget, betiklenebilir seçenektir, neredeyse her Linux kutusuna kurulu ve Mac'te bir brew install uzaklıktadır. Klasik tam aynalama tarifi:
wget --mirror --convert-links --adjust-extension --page-requisites --no-parent https://example.com
Her bayrağın size kazandırdıkları:
- --mirror özyinelemeyi ve zaman damgasını açar, böylece tekrar çalıştırmalar yalnızca değişenleri getirir
- --convert-links indirmeden sonra bağlantıları yeniden yazar, böylece sayfalar çevrimdışı çalışır
- --adjust-extension sunucu tarafından oluşturulan sayfaları düzgün.html dosyaları olarak kaydeder
- --page-requisites her sayfanın görüntülemek için ihtiyaç duyduğu CSS, JS ve görselleri yakalar
- --no-parent taramayı başlatma yolunun altında tutar, tüm alanı yemez
Değerli eklemeler: --wait=1 --random-wait küçük sunucularda nezaketinizi korur, -c kesintiye uğramış bir aynalamayı bitirilmiş dosyaları tekrar indirmeden devam ettirir ve --load-cookies ile dışa aktarılmış bir çerez dosyası, kendi girişinizin arkasındaki sayfaları çekebilir. Ve wget ile curl'u karıştırmayın, curl tek bir URL'yi mükemmel çeker, wget tüm siteleri aynalar. İnsanlar sürekli olarak bunları karıştırır.

Tarayıcı kaydı: dahili seçenek
Ctrl+S, Web Sayfası Tam, zaten sahip olduğunuz indirici. Bir sayfa ve bir varlık klasörü kaydeder. Bir makbuz, bir makale veya hemen ihtiyacınız olan bir iletişim sayfası için yeterlidir. Hatta bir gerçek süper gücü bile var: tarayıcı sayfayı JavaScript çalıştıktan sonra kaydeder, bu yüzden wget'e boş bir kabuk veren React ağırlıklı bir sayfa tam olarak işlenmiş haliyle gelir.
Sınırlar çabuk gösterir. CSS arka plan görselleri ve @import zincirleri genellikle kaybolur, bağlantılar birbirleri yerine canlı siteye işaret eder ve özyineleme yoktur, 300 sayfalık bir site 300 manuel kayıt demektir. Bilinmeye değer bir komşu numara: SingleFile eklentisi, JavaScript çalıştıktan sonra her varlığı tek bir bağımsız HTML dosyasına dahil eder. Tek tek JS ağırlıklı sayfaları arşivlemek için düz Ctrl+S'den kesinlikle daha iyidir. PDF olarak kaydetme farklı bir canavar: görünümü yakalar, sayfayı değil ve içindeki hiçbir şey çalışmaz.
Bir web indirici oturumu, baştan sona
Tanınmayan bir sitenin ilk aynalaması bir rutinle daha iyi gider. Benimki:
- Taramadan önce robots.txt'yi ve sitenin şartlarını kontrol edin, ve küçük sunucularda ne olursa olsun bir bekleme bayrağı kullanın.
- Kapsamı seçin: tüm alan adı veya tek bir bölüm. Bir no-parent kuralı veya bir HTTrack tarama kuralı, bir blog taramasının yanındaki dükkanı yutmasını önler.
- Aynalamayı çalıştırın ve günlüğü izleyin. Tekrarlayan 403'ler bot tespiti demektir; takvim veya etiket sayfaları seli kapsamınızın sızdığı anlamına gelir.
- Rastgele on sayfayı çevrimdışı olarak kontrol edin, bunlardan biri iletişim formu olan bir sayfa ve biri ağır bir galeri olsun. Şimdi bozuksa sonsuza kadar bozuktur.
- Yerel dosya sayısını sitenin site haritasıyla karşılaştırın. Büyük bir boşluk, JavaScript ile oluşturulmuş içerik veya kapsam kurallarının sayfaları yediği anlamına gelir.
Her web indiricinin bozduğu şeyler
Yukarıdaki herhangi bir aracı seçin ve aynı şeyler bozulur, çünkü sorunlar yazılımda değil ortamdadır:
| Bozulan | Neden olur | Zarar |
|---|---|---|
| Arama, formlar, girişler | Sunucu tarafı kodu gitti | Ölü doğan özellikler |
| JavaScript ile oluşturulmuş içerik | Tarayıcılar JS öncesi HTML'i görür | Bütün bölümler eksik |
| Betiklerin veya satır içi stillerin içinde oluşturulan URL'ler | Bağlantı yeniden yazıcı bunları ayrıştıramaz | Bozuk görseller ve bağlantılar |
| Sorgu dizgili sayfalar (?p=123) | Bozulmuş veya yinelenmemiş dosya adları | Sessizce kaybolan sayfalar |
| Akışlı video (HLS/DASH) | Segment URL'leri indirme sırasında sona erer | Asla oynamayan klipler |
Çapraz alan adı varlıklarına da dikkat edin. Çoğu tarayıcı varsayılan olarak başlangıç ana bilgisayarında kalır, bu yüzden bir CDN alt alan adından sunulan görseller veya harici bir ana bilgisayandan gelen yazı tipleri, kapsamı genişletmediğiniz sürece atlanır, ve sonra kaydedilen sayfalar eve bozuk referanslarla döner. Ayrıca SEO kalıntıları da vardır: kanonik etiketler, Open Graph URL'leri ve mutlak dahili bağlantılar hâlâ eski alan adına işaret eder. Kişisel bir arşivde zararsızdır, ancak aynalama tekrar çevrimiçi olursa gerçek bir sorundur.
İndirilmiş bir site bir heykeldir: tamamen doğru görünür ve içinde hiçbir şey hareket etmez.

Bir web indiricinin yanlış araç olduğu durumlar
Açık durum: site zaten çevrimdışı. Bir indiricinin isteklere yanıt veren canlı bir sunucuya ihtiyacı vardır ve süresi dolmuş bir alan adı veya ölü bir ana bilgisayar tarama için hiçbir şey vermez. Hayatta kalan kopya Wayback Machine'de oturur, ve wget'i web.archive.org'a doğrultmak bir işkence: kısıtlanmış istekler, arşiv tarafından yeniden yazılmış URL'ler, her sayfaya enjekte edilmiş bir araç çubuğu ve yıllara yayılmış anlık Görüntüler.
Bu, Restorix platformu'in var olma nedenidir. Tarih aralığı seçimiyle arşiv anlık Görüntülerinden siteleri geri yükler, arşiv kalıntılarını ve eski analizleri temizler ve herhangi bir ödeme yapmadan önce tam olarak arşivlenmiş dosya sayısını, toplam boyutu ve kilitli bir fiyatı gösterir.
İkinci yanlış araç durumu: pikselleri değil, içeriği istiyorsunuz, makaleleri bir tabloya, ürünleri bir veritabanına aktarmak. Bu indirme değil, çıkarmadır. Ve üçüncüsü: sitenin veritabanı özelliklerine geri ihtiyacı varsa, bir mağaza, bir forum, statik bir aynalama size görünüşü verir, makineyi değil. Geri yükleme ve yeni bir arka uçağa ihtiyacınız var.
Dosyalardan tekrar canlı siteye
Bir aynalama klasörü bir web sitesi değildir. Onu tekrar çevrimiçi yapmak, bir yerde barındırmak, mutlak bağlantıları düzeltmek, ölü izleme betiklerini kaldırmak ve HTTPS'yi çözmek demektir. Elle yapılabilir, veya boru hattını atlayın: Restorix, geri yüklenen siteleri doğrudan SSH/SFTP, FTP/FTPS veya S3'e dağıtır, site tekrar düzenlenebilir olsun diye hafif bir CMS dahil eder, yalnızca görüntülenebilir değil. Her iki durumda da, bitmiş demeden önce sonucu bir telefonda test edin.
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
FAQ
Bir web sitesini bir web indiricisiyle indirmek yasal mıdır?
Bir sunucunun herkese açık olarak verdiği sayfaları indirmek genellikle sorunsuzdur, bu baytlar isteyen herkese verilir. Bundan sonra ne yaptığınız önemlidir. Başkasının içeriğini toptan yeniden yayınlamak bir telif hakkı sorunudur ve küçük bir sunucuya tam hızla vurmak kullanım şartlarını ihlal edebilir. Kendi sitelerinizi indirin, müşteri çalışmaları için izin alın ve diğer her şey için hız sınırlarını açık tutun.
Bir web indiricisi girişin arkasındaki sayfaları yakalayabilir mi?
Kendi hesaplarınız için, evet. wget bunu --load-cookies ve dışa aktarılmış bir çerez dosyasıyla yapar; HTTrack, oturumunuzu yakalayan bir catch-URL proxy hilesine sahiptir. Sürtünme bekleyin, oturumlar sona erer ve CSRF belirteçleri taramaları çalıştırma sırasında bozar, bu yüzden sürece gözetmenlik yapın. Ve çerezlerinizi asla bir çevrimiçi araca vermeyin.
İndirilmiş sitemi açtığımda neden bozuk görünüyor?
Neredeyse her zaman üç nedenden biri: canlı alana hâlâ işaret eden mutlak URL'ler, tarayıcının hiç görmediği JavaScript tarafından yüklenen varlıklar veya bozulmuş adlar altında kaydedilmiş sorgu dizgili sayfalar. Yerel kopyada tarayıcı konsolunu açın ve 404 hatalarını okuyun, araçın tam olarak neyi kaçırdığını listelerler.
wget veya HTTrack'i Wayback Machine'e karşı çalıştırabilir miyim?
Teknik olarak evet, pratik olarak işkence. Hız sınırlarına, arşiv tarafından yeniden yazılmış URL'lere, her sayfaya yerleştirilmiş araç çubuğu işaretlemesine ve yıllarca ayrı anlık Görüntülerden çekilen dosyalara takılacaksınız. Amaca yönelik bir geri yükleyici tüm bunları sizin için halleder, Restorix'in var olma nedeni budur.
Tam bir site için en iyi web indiricisi hangisidir?
Windows veya Linux'ta grafik arayüz istiyorsanız HTTrack, Mac'te SiteSucker, betikliyorsanız wget. Zaten çevrimdışı olan bir site için hiçbiri yardımcı olamaz, taranacak canlı bir şey yok, bu yüzden arşiv anlık Görüntülerinden geri yükleyin.
İlgili rehberler

wayback machine downloader
Wayback Machine İndirme Araçları: Gerçekten İşe Yarayanlar
Wayback Machine indirme araçlarına dürüst bir bakış: açık kaynak betikler, gerçek sınırları ve sitenizi yeniden yayına alan hazır çözüm seçeneği.

download entire website from archive org
Archive.org'dan Sadece Anasayfayı Değil, Tüm Bir Web Sitesini İndirin
Archive.org'dan tüm bir web sitesini indirmek için her sayfaya, her görsele ve her stil dosyasına ihtiyacınız var. Varlıklar farklı zaman damgalarının altına gizlenir, nedenini ve eksiksiz bir kontrol listesini burada bulabilirsiniz.

online website extractor
Çevrimiçi Web Sitesi Çıkarma Araçları: Kullanım, Sınırlar ve Güvenlik
Çevrimiçi bir web sitesi çıkarıcısının bir sayfadan aldıkları: metin, görseller, bağlantılar, yapılandırılmış veri. Çevrimiçi araçların yerel olanlarla karşılaştırması ve nasıl güvende kalınacağı.

restoration websites
Geri Yükleme Siteleri: Web Sitesi Geri Yüklemesi Gerçekte Ne Demektir?
Geri yükleme siteleri, kaybolan siteleri web arşivlerinden yeniden inşa eder. Geri yüklemenin yedekten ve yeniden tasarımdan nasıl ayrıldığını ve anlık görüntüden yayına giden iş akışını öğrenin.
