Web Makaleleri: Herhangi Bir Siteden Temiz Metin Nasıl Çıkarılır
Restorix editör ekibi tarafından · 7 Mayıs 2026 · 6 dakika okuma

Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
Bir müşterim bir keresinde panikle aradı: ajansları şirket sitesini yeniden tasarlamış ve blogu taşımayı unutmuştu. Kırk küsur yazı, dört yıllık arama otoritesi, hepsi gitmişti. Ajansın yedeği yoktu. Ağızlarından çıkan ilk soru doğruydu: makale metinlerini geri alabilir miyiz?
O iş, ve dağınık bir sayfadan tek bir temiz makale kaydetme gibi çok daha küçük günlük iş, farklı ölçeklerde aynı beceridir. İşte her ikisini de nasıl yaptığım: hangi araçlar gerçekten işe yarıyor, artık var olmayan sitelerden web makaleleri nasıl kurtarılır ve herhangi bir şeyi yeniden yayınlamadan önce yasal sınırlar nerede duruyor.
Çıkarma işlemi neden göründüğünden daha zor
Tipik bir haber sayfasında, makale HTML'in beşte birinden azdır. Gerisi navigasyon, kenar çubukları, çerez banner'ları, bülten pop-up'ları, ilgili yazı karuselleri ve izleme betikleridir. Tarayıcıdan kopyala-yapıştır yapmak tüm bunları beraberinde getirir, ya da daha kötüsü, iç içe div ve span'lerle oluşturulduğu için kaosa dönüşen metinler yapıştırır.
Her zamanki engeller:
- JavaScript render: indirdiğiniz HTML, betikler çalışana kadar boş bir kabuktur
- Sayfalandırma: reklam gösterimleri için bir makalenin beş URL'ye bölünmesi
- Bot karşıtı duvarlar: basit indiricileri anında engelleyen zorluklar
- Tembel yükleme: yalnızca kaydırdığınızda var olan görseller
- Kesik RSS: iki cümle ve üç noktadan sonra duran beslemeler
Seçeceğiniz yöntem ölçeğe bağlıdır: tek bir makale, tüm bir site veya ölü bir site.
Yöntem 1: tek web makaleleri için okuyucu modu
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
Tek bir sayfa için hiçbir şey inşa etmeyin. Firefox'un Okuyucu Görünümü (F9 veya adres çubuğundaki sayfa simgesi) bir sayfayı başlık, yazar adı ve gövde metnine indirger. Safari ve Edge'in kendi sürümleri vardır, Edge makaleyi sesli bile okur. Okuyucu modundan, düzenleyicinize kopyalayın veya arşiv kalitesinde bir kayıt için PDF olarak yazdırın.
- Makaleyi açın ve Okuyucu Görünümü'nü etkinleştirin
- Algılayıcı yanlış tahmin ettiyse başlığı ve yazar adını düzeltin
- Düzenleyicinize kopyalayın veya PDF olarak yazdırın
- Orijinal URL'yi ve yakalama tarihini metinle birlikte kaydedin, daha sonra kaynak göstermek isteyeceksiniz
Az bilinen bir numara: birçok site yazdırma stil sayfası sunar. Yazdırma önizlemesine basmak, okuyucu modu takıldığında bile bazen tüm makaleyi temiz bir şekilde verir, ve yazdırma iletişim kutusunda üstbilgi ve altbilgileri etkinleştirirseniz 'PDF Olarak Kaydet' kaynak URL'yi üstbilgide tutar.
Sınırlar gerçektir: her seferinde bir sayfa, üstveri (yazar, tarih, etiketler) sıklıkla kaybolur veya yanlış olur ve ücretli, sayfalandırılmış veya betik yoğun sayfalarda tamamen başarısız olur. Pocket ve Instapaper, üstüne sonra-oku katmanı ekleyerek aynı temizliği yapar, okumak için kullanışlı, toplu iş için işe yaramaz.
Yöntem 2: web makalelerinin yapılandırılmış çıkarımı
Bir düzineden fazla sayfada, elle çalışma anlamını yitirir. Yapılandırılmış çıkarma, her sayfayı, şablonun içindeki makaleyi bulmayı bilen bir kütüphaneden geçirmek anlamına gelir, okuyucu modunun kullandığı aynı numara, ancak betiklenebilir.
| Araç | Dil | En iyi olduğu yer |
|---|---|---|
| Readability.js | JavaScript | Firefox Okuyucu Görünümü'nün arkasındaki motor; JS ile render edilen sayfalar için Playwright ile eşleştirin |
| Postlight Parser | JavaScript | Site başına özel kurallarla hızlı tek seferlik çıkarma |
| trafilatura | Python | En iyi üstveri (yazar, tarih, etiketler); sizin için beslemeleri ve site haritalarını tarar |
| newspaper3k | Python | Hızlı betikler ve prototipler; kolay API, daha az bakım |
| go-readability | Go | Hızın önemli olduğu yüksek hacimli taramalar |
Herhangi bir çıkarma kodu yazmadan önce iki hile kodunu kontrol edin. İlk olarak, /wp-json/wp/v2/posts?per_page=100, eğer site WordPress kullanıyorsa, bu URL size her yazıyı temiz JSON olarak verir, kazıma gerekmez. İkincisi, sitemap.xml: sitenin URL'lerini listeler, böylece körü körüne taramak yerine makaleleri sıralayabilirsiniz. Tarama yaptığınızda, nazik olun: saniyede bir istek, gerçek bir kullanıcı aracısı dizesi, robots.txt'ye saygı gösterin, kanonik URL'ye göre tekilleştirin.

Saatleri boşa harcayan çıkarma hataları
Çıkarma işlerinde gördüğüm temizlik çalışmasının çoğunu dört hata oluşturur ve hepsini düzeltmektense kaçınmak daha ucuzdur:
- Algılanan tarihe güvenmek. Çıkarıcılar mutlulukla değiştirilme tarihini, bir yorum tarihini veya altbilgideki yılı alır. Yazar satırına veya arşiv yakalama tarihine göre doğrulayın.
- Kanonik URL'yi kaybetmek. Metinle birlikte kaydedin. Onsuz tekilleştiremez, yönlendirme ayarlayamaz veya daha sonra kaynak kanıtlayamazsınız.
- Liste sayfalarını makale olarak çıkarmak. Kategori ve etiket sayfaları bir algılayıcıya içerik gibi görünür. Toplu işi çalıştırmadan önce, sonra değil, URL desenine göre filtreleyin.
- Kodlamayı görmezden gelmek. Windows-1251'deki 2008'den bir site, UTF-8 varsayarsanız alfabe çorbasına dönüşür, yalnızca meta etiketine değil, HTTP karakter kümesi başlığına bakın.
Ölü bir siteden web makalelerini kurtarmak
Site gittiğinde, arşiv kaynağınız olur. Wayback Machine'in CDX API'si bir yol altındaki her yakalamayı listeler, example.com/blog/*, ve her yazının en son iyi anlık görüntüsünü alabilir, ardından aynı çıkarma araçlarını web.archive.org URL'lerine karşı çalıştırabilirsiniz. Çalışır, ancak yavaştır: arşiv hız sınırlar, eski yakalamalar eksik görsellere referans verir ve elli makale, başında beklemeniz gereken bir öğleden sonraya dönüşür.
Daha hızlı yol, önce siteyi düzgün bir şekilde geri yüklemektir. site kurtarma platformumuz size ücretsiz bir tahmin verir, tam arşivlenmiş dosya sayısı, toplam boyut, sabit fiyat, ardından seçtiğiniz bir tarih aralığında dosyaları geri yükler. Çoğu kişinin kaçırdığı kısım: makale metnini XML, CSV veya JSON olarak, ayrıca geri yüklenen her dosyanın JSON veya SQLite manifestosunu veren bir yapılandırılmış makale dışa aktarma seçeneği vardır. Açılış hikayemdeki 2016 blogu bu şekilde geri geldi, 412 dosya, 96 MB, yazılar başlık, slug, tarih ve gövde ile CSV'ye aktarıldı, aynı öğleden sonra WordPress'e yeniden içe aktarıldı. Eğitim tüm akışı adım adım anlatıyor.
İnsanların unuttuğu bir kaynak daha: Google önbellek bağlantılarını 2024'te kullanımdan kaldırdı, ancak archive.today genellikle Wayback Machine'in kaçırdığı sayfaları tutar, özellikle haber makaleleri, ve Bing hala bazı siteler için önbelleğe alınmış kopyalar sunar. Bir makalenin kurtarılamaz olduğunu ilan etmeden önce bakmaya değer.

Yeniden yayınlamadan önce telif hakkı kuralları
Hukuki tavsiye değil, sadece profesyonellerin gerçekten içinde çalıştığı sınırlar. Olgular ve fikirler telif hakkına tabi değildir; bunların özgün ifadesi tabidir. Kendi makaleleriniz dilediğiniz gibi kullanmanız için sizindir. Başkasının metni için:
- Bir lisans kontrol edin. Creative Commons işaretleri önemlidir: CC0 ve CC-BY yeniden yayınlamaya izin verir (CC-BY atıf gerektirir); CC-BY-NC ticari kullanımı yasaklar; işaret yoksa tüm hakları saklıdır.
- Lisans yoksa yazılı izin alın. Evet diyen bir e-posta, bir sayfa adil kullanım teorisinden üstündür.
- Adil kullanım bir mahkeme savunmasıdır, izin belgesi değil. Amacı, miktarı, niteliği ve piyasa etkisini tartar, ve tüm bir makaleyi alıntılamak neredeyse her zaman miktar testinde başarısız olur.
- Atıf ve kanonik bağlantı iyi bir görgü ve iyi SEO'dur. İhlali iyileştirmezler.
- Görseller kendi telif haklarını taşır, metinden ayrıdır. Onları yeniden barındırmak kendi iznini gerektirir.
Ajansları ısıran bir incelik: çalışanlar tarafından yapılan iş genellikle şirkete aittir, ancak yüklenici işi, sözleşme öyle demedikçe ait olmayabilir. Kendi şirketinizin blogunu kurtarıyorsanız, yeni bir marka altında yeniden yayınlamadan önce metnin gerçekte kime ait olduğunu doğrulayın.
Sizi güvende tutan bir yeniden yayınlama kontrol listesi
- Her parçaya sahip olduğunuzu veya lisansladığınızı doğrulayın, metin ve görseller ayrı ayrı
- Orijinal yazar adını ve yayın tarihini makaleyle birlikte tutun
- Eski sürüm hala bir yerde varsa kanonik bir URL belirleyin
- Eski URL'leri yeni konumlara 301 yönlendirmesi yapın
- İç bağlantıları ölü sayfalara değil, canlı sayfalara işaret edecek şekilde güncelleyin
- Tarihi sessizce yeniden yazmak yerine önemli düzenlemeleri not edin ('Temmuz 2026'da güncellendi')
Bu altı şeyi yapın ve kurtarılan bir blog şaşırtıcı derecede hızlı bir şekilde arama sıralamalarını geri kazanır, Google, orijinal URL'lerdeki sadık bir geri yüklemeyi, sıfırdan başlayan yeni bir site olarak değil, aynı sitenin geri dönüşü olarak değerlendirir.
Web sitenizi Wayback Machine’den geri yükleyin
Saniyeler içinde ücretsiz tahmin — yalnızca onaylarsanız ödersiniz. Başarısız geri yüklemeler otomatik iade edilir.
FAQ
Birinin sitesinden web makalelerini kazımak yasal mı?
Özel kullanım için, ödediğiniz bir sayfayı arşivlemek, çevrimdışı okumak için bir öğreticiyi kaydetmek, genellikle sorun olmaz. Başkasının makalelerini yeniden yayınlamak için toplu kopyalama yasal değildir: metin, indirmesi ne kadar kolay olursa olsun telif hakkına tabidir. Hizmet şartları üstüne sözleşmeye dayalı bir katman ekler. İçeriğe sahip olun veya izniniz olsun, bu test çoğu durumu çözer.
Şu anda bir web makalesini çıkarmanın en hızlı yolu nedir?
Firefox'ta açın ve F9'a basın. Okuyucu Görünümü yaklaşık bir saniyede makale dışındaki her şeyi temizler ve oradan kopyalayabilir veya PDF olarak yazdırabilirsiniz. Araç yok, kod yok.
Artık var olmayan bir siteden web makalelerini kurtarabilir miyim?
Evet, arşivlendiyse. Wayback Machine, herhangi bir trafiği olan çoğu sitenin yakalamalarını tutar; sayfaları manuel olarak alabilir, CDX API aracılığıyla betikleyebilir veya tüm siteyi geri yükleyip yapılandırılmış bir dışa aktarma kullanarak her makaleyi tek seferde CSV veya JSON olarak alabilirsiniz.
Hangi dışa aktarma biçimini seçmeliyim, XML, CSV mi yoksa JSON mu?
İçe aktarıcıya uydurun. WordPress'in yerel içe aktarıcısı XML'i yer. Elektronik tablo odaklı iş akışları ve basit betikler CSV ile en mutludur. İş hatları kuran geliştiriciler JSON ister. Şüphede kalırsanız, üçünü de alın, üretmeleri ucuzdur ve geri yüklemeyi yalnızca bir kez yaparsınız.
Okuyucu modu her sitede çalışır mı?
Hayır. Ücretli makalelerde, çok sayfalı galerilerde ve metnin yalnızca JavaScript çalıştıktan sonra var olduğu sayfalarda başarısız olur. Bunlar için başsız tarayıcı çıkarıcı kullanın veya, kendi ölü siteniz için, arşiv geri yüklemesi ve ardından yapılandırılmış dışa aktarma.
Çıkarma araçları görselleri korur mu?
Çoğu metin çıkarıcı görselleri temizler veya orijinal sunucuyla birlikte ölen hotlink URL'leri bırakır. Siteyi geri yüklemek, gerçek görüntü dosyalarını metinle birlikte korur. Her iki durumda da, görsel haklarını metin haklarından ayrı olarak ele alın, bunlar farklı telif haklarıdır.
İlgili rehberler

wayback machine downloader
Wayback Machine İndirme Araçları: Gerçekten İşe Yarayanlar
Wayback Machine indirme araçlarına dürüst bir bakış: açık kaynak betikler, gerçek sınırları ve sitenizi yeniden yayına alan hazır çözüm seçeneği.

download entire website from archive org
Archive.org'dan Sadece Anasayfayı Değil, Tüm Bir Web Sitesini İndirin
Archive.org'dan tüm bir web sitesini indirmek için her sayfaya, her görsele ve her stil dosyasına ihtiyacınız var. Varlıklar farklı zaman damgalarının altına gizlenir, nedenini ve eksiksiz bir kontrol listesini burada bulabilirsiniz.

restore old website
Eski Bir Web Sitesini Sorunlarını Geri Getirmeden Restore Etme
Eski bir web sitesi nasıl restore edilir: eski PHP, Flash ve frameset'leri yönetme, neleri koruyup neleri modernize edeceğine karar verme ve dosyaları web arşivlerinden çekme.

web cache
Web Önbelleği Nedir: Nasıl Çalışır ve Nasıl Kullanılır?
Web önbelleğinin ne olduğu, tarayıcı, CDN, arama motoru ve arşiv önbelleklerinin nasıl çalıştığı ve kaybolan bir sayfayı görmek için web önbelleğinin nasıl kullanılacağı.
