Çevrimiçi Web Sitesi Çıkarma Araçları: Kullanım, Sınırlar ve Güvenlik
Restorix editör ekibi tarafından · 1 Haziran 2026 · 7 dakika okuma

Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
Bir müşteri bir zamanlar eski sitesindeki tüm ürün fotoğraflarını çekmemi istedi, dört yıllık katalog sayfalarına dağılmış 300 küsur görsel. Kimse HTML'i, CSS'i veya tam bir site kopyasını istemiyordu. Sadece görselleri, bir klasörde, mantıklı isimlerle. Bu bir çıkarma işidir ve çevrimiçi bir web sitesi çıkarıcısı genellikle bunu yapmanın en hızlı yoludur.
Çıkarıcılar, indiricilerin seçici kuzenleridir. Her şeyi almak yerine tek bir tür şey alırlar, metin, görseller, bağlantılar, meta veri, ve kullanılabilir bir biçimde geri verirler. İşte nelerde iyi oldukları, çevrimiçi araçların yerel yazılımlara nerede üstün geldiği ve nerede kaybettiği ve bir yabancının formuna URL yapıştırmadan önce sormaya değer güvenlik soruları.
Çevrimiçi bir web sitesi çıkarıcısı gerçekte ne yapar
Bir URL verirsiniz, sayfayı getirir, bazen etrafında sığ bir tarama yapar, HTML'i ayrıştırır ve bulduklarının filtrelenmiş bir dilimini döndürür. Kurulum yok, kod yok; her şey bir tarayıcı sekmesinde gerçekleşir. Araçtan araca değişen sunulan dilimler:
- İçerik çıkarma: gezinme, reklamlar ve kalıp metinlerden arındırılmış okunabilir makale metni
- Medya çıkarma: sayfanın referans verdiği her görsel, video veya ses dosyası, indirme için paketlenmiş
- Bağlantı çıkarma: sayfadaki her href, genellikle iç ve dış listelerine ayrılmış
- İletişim çıkarma: biçimlendirmede görünen e-posta adresleri, telefon numaraları ve sosyal medya profilleri
- Yapılandırılmış veri: JSON-LD blokları, Open Graph etiketleri, meta başlık ve açıklamaları, bazen tüm HTML tabloları CSV'ye dönüştürülmüş
Kaputun altında, iyi içerik çıkarıcıları HTML bloklarını puanlayan ve özlü olanı tutan bir okunabilirlik tarzı algoritma çalıştırır, tarayıcı okuyucu modlarının kullandığı aynı hile. İyi bir aracın temiz makale metni döndürmesinin ve kötü birinin gezinme menüsünü makaleyi dipnot olarak döndürmesinin nedeni budur.
İnsanların gerçekte onları kullandığı işler
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
Gerçek kullanımın çoğu dört işten oluşur. Birincisi, göç öncesi envanter: bir siteyi yeniden inşa etmeden önce her meta başlığı, açıklamayı ve başlığı bir elektronik tabloya çekmek, böylece hiçbir şey unutulmaz. İkincisi, kendi varlıklarınızı kurtarmak, o ürün fotoğrafı işi gibi, orijinaller kaybolmuş ama site hâlâ onları sunuyorsa. Üçüncüsü, SEO bakımı: anahtar sayfalardaki her giden bağlantıyı çıkarın ve artık park edilmiş etki alanlarına işaret edenleri bulun. Dördüncüsü, içerik denetimleri: eski bir blogdan tüm yazı başlıkları ve tarihleri, CSV'ye aktarılmış, böylece neyin saklanmaya değer olduğuna karar verebilirsiniz.
Yakın zamanda bir örnek: 2014 WordPress blogunun sahibi, barındırmayı sonlandırmadan önce her yazı başlığını, tarihini ve gövdesini bir elektronik tabloda istedi. Çıkarıcıyla yirmi dakika, bir CSV, aynı hafta barındırma iptal edildi. Bu işlerin ortak noktasına dikkat edin, tam bir site kopyasını beklemek istemeden, yapılandırılmış bir biçimde bir alt küme istiyorsunuz.
Çevrimiçi web sitesi çıkarıcı araçları ve yerel yazılım
Çevrimiçi araçlar sürtünmede kazanır. Kurulacak bir şey yok, saniyeler içinde sonuçlar ve iyi olanlar CSV veya zip doğrudan çıktı verir. Ölçek ve kontrolde kaybederler: çoğu sizi tek sayfa veya sığ bir taramayla sınırlar, işinizi diğer insanlarınki ardına sıraya koyar ve çerezler, başlıklar veya oluşturma ayarları için az seçenek sunar.
Yerel araçlar bunu tersine çevirir. Bir tarayıcı uzantısı, oturumunuza bindiği için giriş yaptığınız sayfalardan çıkarabilir. requests ve BeautifulSoup ile bir Python betiği, veya daha büyük işler için Scrapy, kimlik doğrulamayı, sayfalamayı ve yüz bin sayfayı kimse izni olmadan yönetir. wget ve HTTrack arada kalır: daha kaba ama doğru kabul kurallarıyla bir etki alanındaki her görseli memnuniyetle çekerler.
| Çevrimiçi çıkarıcı | Yerel araçlar | |
|---|---|---|
| Kurulum | Yok, URL yapıştırın | Kurulum, yapılandırma, bazen kod |
| Ölçek | Tek sayfa veya sığ tarama | Tüm siteler, zamanlanmış taramalar |
| Giriş yapılan sayfalar | Nadiren | Evet, oturumunuz veya çerezleriniz |
| JavaScript yoğun sayfalar | Bazıları oluşturur, çoğu oluşturmaz | Gerekirse başsız tarayıcı |
| En uygun | Hızlı tek seferlik çekmeler | Tekrarlanabilir, büyük işler |
Dürüst ayrımım: iş bir öğleden sonra sığıyorsa ve sayfalar herkese açıksa, çevrimiçi bir araçla başlayın. Çerez, sayfalama mantığı veya gelecek ay ikinci bir çalıştırma gerektiği an, betiği yazın.
Çevrimiçi bir web sitesi çıkarıcısına URL yapıştırmak güvenli mi?
Çoğunlukla evet, bilinmeye değer üç gerçek istisna var.
Bir: hizmet gönderdiğiniz her URL'yi görür ve günlüğe kaydeder. Herkese açık sayfalar için sorun değil. Hazırlık bağlantıları, içinde erişim belirteçleri olan önizleme URL'leri veya intranet ana bilgisayar adları için sorun, popüler bir çıkarıcının otomatik tamamlama önerilerinde iç bilet sistemi URL'leri gördüm, bu da günlük kayıtları hakkında bilmeniz gereken her şeyi söyler. İki: indirme paketi. Meşru bir çıkarıcı size görseller, metin veya CSV verir. Size yürütülebilir bir görüntüleyici veren bir araç çıkarıcı değildir, bir teslim mekanizmasıdır. Üç: benzer görünümlü siteler. Popüler araç adları için arama reklamları düzenli olarak kötü amaçlı yazılım sunmak veya yapıştırdığınız her şeyi toplamak için var olan klonlara götürür.
İşe yarayan kontrol listesi:
- Gerçek bir itibara sahip HTTPS sitelerine bağlı kalın, yapıştırmadan önce kontrol edin
- İçinde belirteç, oturum kimliği veya parola sıfırlama bağlantısı olan URL'leri asla yapıştırmayın
- Kimlik bilgilerini asla girmeyin veya çerez dosyalarını bir web aracına asla yüklemeyin
- Görseller, metin, CSV veya zip bekleyin, bir.exe alırsanız sekmeyi kapatın
Bir araç size görsellerin zip dosyası yerine bir yükleyici geri verirse, o hiçbir zaman bir çıkarıcı değildi.

Bu araçların ulaşamadığı şeyler
Her çıkarıcı, çevrimiçi veya yerel, aynı duvarlara çarpar. JavaScript ile oluşturulan tek sayfa uygulamaları, araç gerçek bir tarayıcı motoru çalıştırmadıkça boş bir kabuk döndürür. Giriş duvarları, oturumunuzdan yoksun olan her şeyi durdurur. Robots.txt engelleri kibar tarayıcıları geri çevirir. Hız sınırları ve CAPTCHA'lar kibar olmayanları keşke yapsaydım diye düşünmeye iter. Derin sayfalama, bir forum konu listesinin 47. sayfası, çoğu çevrimiçi aracın sabrını aşar.
Sonsuz kaydırma kendi başına bir anketi hak ediyor: sayfa yalnızca ilk öğe grubunu içerir ve geri kalanını kaydırdıkça getirir, bu yüzden kaydırmayı taklit etmeyen her araç listenin yalnızca bir bölümünü görür. Pazaryerleri ve sosyal medya profilleri her zamanki suçlular.
En zor duvar ise en basit olanıdır: çıkarıcılar canlı sayfaları getirir. Site gittiyse, süresi dolmuş etki alanı, ölü barındırıcı, yıllar önce silinmiş, çıkarılacak bir şey yoktur. URL bir park edilmiş sayfa döndürür ve araç boş geri gelir.
Mantıklı bir çıkarma iş akışı
- Bir araca dokunmadan önce hedefi tanımlayın: makale metni, görseller, bağlantılar veya meta veri. Her biri farklı bir çıkarıcıya işaret eder.
- Temsili bir sayfada test edin ve çıktıyı inceleyin, kodlamalar, görsel çözünürlükleri, metnin başlıklarını koruyup korumadığı.
- Çıktı biçimini kontrol edin: elektronik tablolar için CSV, medya için zip, başka bir sistemi besliyorsa JSON.
- Tüm işi kibar biçimde çalıştırın. Araç izin veriyorsa hız sınırlaması yapın, özellikle küçük sitelerde.
- Sayıları beklentilere göre doğrulayın. Üç yüz ürün kabaca üç yüz görsel seti vermelidir, 180 değil.
- Sonuçlarla birlikte kaynak URL listesini kaydedin. Altı ay sonra kimse verinin nereden geldiğini hatırlamaz.

Ücretsiz ve ücretli çevrimiçi web sitesi çıkarıcı araçlar
Çoğu çevrimiçi çıkarıcı aynı freemium modelini izler: günde bir avuç ücretsiz çıkarma, sonra bir ödeme duvarı. Ücretsiz katman tek seferlik işler için gerçekten yeterlidir, beş katalog sayfasından görselleri çekmek size yalnızca sabır maliyeti çıkarır.
İş tekrarlandığında veya büyüdüğünde ödeyin: API erişimi, birkaç seviyenin ötesinde tarama derinliği, zamanlanmış çalıştırmalar ve toplu URL listeleri bir aboneliğin gerçekte satın aldığı şeylerdir. Ödemeye değer olmayan şey, tüm sunusunun wget etrafında daha güzel bir sarmalayıcıdan ibaret olan herhangi bir araçtır. İş bu etki alanındaki her şeyi indirmekse, yerel bir araç bunu ücretsiz, sonsuza kadar yapar.
Çıkarma restorasyona dönüştüğünde
Bazen çıkarma isteği, gizlenmiş bir restorasyon isteğidir. Eski sitemdeki tüm metin ve görselleri çek, eski sitenin çevrimiçi olduğunu varsayar. Çevrimiçi olmadığında içerik hâlâ vardır, Wayback Machine içinde, ama hiçbir canlı getirme çıkarıcısı ona dokunamaz.
İşte Restorix hizmeti bu boşluğu doldurur. Ölü bir siteyi arşiv anlık görüntülerinden geri yükler ve kurtarılan makaleleri yapılandırılmış XML, CSV veya JSON olarak dışa aktarabilir, ayrıca bir JSON veya SQLite dosya bildirimi, tek bir geçişte çıkarma ve restorasyon, ödemeden önce dosya sayısı ve fiyat kilitli. Bildirim kulağa geldiğinden daha önemli: eski site haritanızla karşılaştırın ve yeniden inşa etmeden önce tam olarak neyin eksik olduğunu bilin.
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
FAQ
Çevrimiçi bir web sitesi çıkarıcısı nedir?
Yapıştırdığınız URL'lerdeki sayfalardan belirli verileri, metin, görseller, bağlantılar, iletişim bilgileri, yapılandırılmış meta veri, çıkaran web tabanlı bir araç. Tam bir site indiricisinin aksine yansıtmak yerine filtreler ve özel bir kazıyıcının aksine kurulum veya kod gerektirmez.
Çevrimiçi bir web sitesi çıkarıcısı tüm bir web sitesini indirebilir mi?
Genel olarak hayır. Çoğu çevrimiçi çıkarıcı sayfa başına çalışır veya sınırlarla sığ taramalar yürütür ve büyük işler hızla sıra sınırlarına çarpar. Tüm site kopyaları indirici bölgesidir, HTTrack veya wget, ve ölü siteler restorasyon bölgesidir.
Bir web sitesinden veri çıkarmak yasal mı?
Kendi sitenizden çıkarmak, açıkça evet. Başkalarının siteleri için: herkese açık bilgileri çekmek birçok yargı bölgesinde yasal olsa da, telif hakkıyla korunan içeriği yeniden yayınlamak değildir, kullanım koşulları otomatik erişimi yasaklayabilir ve ölçekte kişisel veri doğrudan GDPR bölgesine girer. Analiz ve kurtarma için çıkarın, yeniden yayınlama için değil.
Çıkarıcı neredeyse hiçbir şey döndürmedi, neden?
Sayfayı açın ve view-source'e basın. İçerik ham HTML'de değilse, sayfa JavaScript ile oluşturulur ve oluşturmayan herhangi bir çıkarıcı bir kabuk görür. Diğer her zamanki şüpheliler: fark etmediğiniz bir yönlendirme, bot algılamanın bir CAPTCHA sayfası sunması veya robots.txt'nin araca uzaklaşmasını söylemesi.
Artık var olmayan bir siteden içerik çıkarabilir miyim?
Canlı webden değil, çevrimdışı çevrimdışıdır. İçerik genellikle web arşivlerinde hayatta kalır ancak bu anlık görüntülerden bir geri yükleme sayfaları geri getirir; Restorix daha sonra yapılandırılmış veri gerçekte ihtiyacınız olan şeyse makaleleri XML, CSV veya JSON olarak dışa aktarabilir.
Bir çıkarıcı sitedeki PDF'lerden veya belgelerden metin çıkarabilir mi?
Çoğu, içeriklerini ayrıştırmak yerine bağlantılı dosyaları, PDF'ler, belgeler, elektronik tablolar, listeler veya paketler. İçindeki metin için önce dosyaları indirin ve yerel olarak bir PDF'den metne geçişi çalıştırın.
İlgili rehberler

web downloader
Web İndirici Araçlarının Karşılaştırılması: Neleri Korur ve Neleri Bozar
Bir web indirici nasıl çalışır, HTTrack, wget, SiteSucker ve tarayıcı kayıtları aslında neleri korur, her biri neleri bozar ve ne zaman geri yükleme daha iyi bir seçimdir.

find all pages on a website
Bir Web Sitesindeki Tüm Sayfaları Bulma (Silinmiş Olanlar Dahil)
Bir web sitesindeki tüm sayfaları, kimsenin bağlantı vermediği sayfalar dahil, bulmanız mı gerekiyor? Site haritalarını, tarayıcıları, Wayback CDX API'yi ve Search Console dışa aktarımlarını karşılaştırın.

restore website from wayback machine
Wayback Machine'dan Bir Web Sitesini Geri Yükleme: Eksiksiz Rehber
Wayback Machine'dan bir web sitesini baştan sona geri yükleyin: doğru anlık görüntüyü seçin, geri yükleme seçeneklerini belirleyin ve bir saatten kısa sürede CMS üzerinden düzenlenebilen canlı bir site yayına alın.

download archive org
Archive.org'dan Nasıl İndirilir: Öğeler, Anlık Görüntüler ve Daha Fazlası
Archive.org içeriğinin her pratik indirme yolu, öğe dosyaları, toplu CLI çekimleri ve Wayback web anlık görüntüleri, ve işiniz için doğru olanı nasıl seçersiniz.
