Artikel Web: Cara Mengekstrak Teks Bersih dari Situs Web Apa Pun
Oleh tim editorial Restorix · 7 Mei 2026 · 7 menit baca

Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Seorang klien pernah menelepon saya dengan panik: agensi mereka telah mendesain ulang situs perusahaan dan tidak memigrasikan blog. Sekitar empat puluh-an postingan, empat tahun ekuitas pencarian, hilang. Agensi tersebut tidak memiliki cadangan. Pertanyaan pertama yang keluar dari mulut mereka adalah pertanyaan yang tepat: bisakah kita mendapatkan teks artikel kembali?
Pekerjaan itu, dan pekerjaan sehari-hari yang jauh lebih kecil yaitu menyimpan satu artikel bersih dari halaman yang berantakan, adalah keterampilan yang sama pada skala yang berbeda. Inilah cara saya melakukan keduanya: alat mana yang benar-benar berfungsi, cara memulihkan artikel web dari situs yang sudah tidak ada, dan di mana batas hukumnya sebelum Anda menerbitkan ulang apa pun.
Mengapa ekstraksi lebih sulit dari yang terlihat
Pada halaman berita tipikal, artikelnya kurang dari seperlima HTML. Sisanya adalah navigasi, sidebar, spanduk cookie, popup newsletter, korsel posting terkait, dan skrip pelacakan. Menyalin-tempel dari browser menyeret semuanya, atau lebih buruk, menempelkan teks yang mengalir ulang menjadi kacau karena dibangun dari div dan span bersarang.
Hambatan yang biasa:
- Rendering JavaScript: HTML yang Anda unduh adalah cangkang kosong hingga skrip berjalan
- Paginasi: satu artikel dibagi di lima URL untuk impresi iklan
- Tembok anti-bot: tantangan yang langsung memblokir pengunduh sederhana
- Lazy loading: gambar yang baru ada setelah Anda menggulir
- RSS terpotong: feed yang berhenti setelah dua kalimat dan elipsis
Metode yang Anda pilih tergantung pada skala: satu artikel, satu seluruh situs, atau satu situs mati.
Metode 1: mode pembaca untuk satu artikel web
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
Untuk satu halaman, jangan buat apa pun. Tampilan Pembaca Firefox (F9, atau ikon halaman di bilah alamat) memangkas halaman menjadi judul, nama penulis, dan teks tubuh. Safari dan Edge memiliki versi mereka sendiri, Edge bahkan akan membacakan artikel dengan suara keras. Dari mode pembaca, salin ke editor Anda, atau cetak ke PDF untuk penyimpanan berkualitas arsip.
- Buka artikel dan aktifkan Tampilan Pembaca
- Perbaiki judul dan nama penulis jika detektor salah menebak
- Salin ke editor Anda, atau cetak ke PDF
- Simpan URL asli dan tanggal pengambilan di samping teks, Anda akan membutuhkan riwayat asal nanti
Trik yang kurang dikenal: banyak situs menyertakan stylesheet cetak. Menekan pratinjau cetak terkadang memberi Anda seluruh artikel bersih bahkan saat mode pembaca gagal, dan 'Simpan sebagai PDF' menyimpan URL sumber di header jika Anda mengaktifkan header dan footer di dialog cetak.
Keterbatasannya nyata: satu halaman dalam satu waktu, metadata (penulis, tanggal, tag) sering hilang atau salah, dan gagal total pada halaman berbayar, berpaginasi, atau berat skrip. Pocket dan Instapaper melakukan pembersihan yang sama dengan lapisan simpan-untuk-nanti di atasnya, berguna untuk membaca, tidak berguna untuk massal.
Metode 2: ekstraksi terstruktur artikel web
Setelah selusin halaman, kerja manual tidak masuk akal lagi. Ekstraksi terstruktur berarti menjalankan setiap halaman melalui pustaka yang tahu cara menemukan artikel di dalam boilerplate, trik yang sama dengan mode pembaca, tetapi dapat diprogram.
| Alat | Bahasa | Terbaik untuk |
|---|---|---|
| Readability.js | JavaScript | Mesin di balik Tampilan Pembaca Firefox; pasangkan dengan Playwright untuk halaman yang dirender JS |
| Postlight Parser | JavaScript | Ekstraksi satu-kali cepat dengan aturan khusus per situs |
| trafilatura | Python | Metadata terbaik (penulis, tanggal, tag); merayapi feed dan peta situs untuk Anda |
| newspaper3k | Python | Skrip dan prototipe cepat; API mudah, kurang terawat |
| go-readability | Go | Perayapan volume tinggi di mana kecepatan penting |
Sebelum Anda menulis kode ekstraksi, periksa dua trik. Pertama, /wp-json/wp/v2/posts?per_page=100, jika situs tersebut menjalankan WordPress, URL itu memberi Anda setiap postingan sebagai JSON bersih, tanpa perlu scraping. Kedua, sitemap.xml: itu mencantumkan URL situs sehingga Anda dapat mendaftar artikel alih-alih merayapi secara buta. Saat Anda merayapi, lakukan dengan sopan: satu permintaan per detik, string user-agent nyata, hormati robots.txt, deduplikasi berdasarkan URL kanonik.

Kesalahan ekstraksi yang membuang waktu berjam-jam
Empat kesalahan menjadi penyebab sebagian besar pekerjaan pembersihan yang saya lihat dalam pekerjaan ekstraksi, dan semuanya lebih murah untuk dihindari daripada diperbaiki:
- Mempercayai tanggal yang terdeteksi. Ekstraktor dengan senang hati mengambil tanggal modifikasi, tanggal komentar, atau tahun di footer. Verifikasi dengan nama penulis atau tanggal pengambilan arsip.
- Kehilangan URL kanonik. Simpan bersama teks. Tanpanya Anda tidak dapat melakukan deduplikasi, menyiapkan pengalihan, atau membuktikan riwayat asal nanti.
- Mengekstrak halaman daftar sebagai artikel. Halaman kategori dan tag terlihat seperti konten bagi detektor. Filter berdasarkan pola URL sebelum Anda menjalankan batch, bukan sesudahnya.
- Mengabaikan encoding. Situs tahun 2008 dalam Windows-1251 menjadi sup alfabet jika Anda menganggap UTF-8, periksa header charset HTTP, bukan hanya tag meta.
Memulihkan artikel web dari situs mati
Ketika situs sudah tidak ada, arsip menjadi sumber Anda. CDX API Wayback Machine mencantumkan setiap tangkapan di bawah jalur, example.com/blog/*, dan Anda dapat mengambil snapshot terbaru yang bagus dari setiap postingan, lalu menjalankan alat ekstraksi yang sama pada URL web.archive.org. Ini berfungsi, tetapi lambat: arsip membatasi kecepatan, tangkapan lama merujuk pada gambar yang hilang, dan lima puluh artikel berubah menjadi sore yang menjemukan.
Jalur yang lebih cepat adalah memulihkan situs dengan benar terlebih dahulu. Restorix memberi Anda perkiraan gratis, jumlah file yang diarsipkan tepat, ukuran total, harga tetap, lalu memulihkan file dalam rentang tanggal pilihan Anda. Bagian yang sering dilewatkan: ada opsi ekspor artikel terstruktur yang memberikan teks artikel sebagai XML, CSV, atau JSON, ditambah manifes JSON atau SQLite dari setiap file yang dipulihkan. Blog tahun 2016 dari cerita pembuka saya kembali dengan cara itu, 412 file, 96 MB, postingan diekspor ke CSV dengan judul, slug, tanggal, dan konten, diimpor ulang ke WordPress pada sore yang sama. Tutorial memandu seluruh alur.
Satu lagi sumber yang sering dilupakan orang: Google menghentikan tautan cache-nya pada tahun 2024, tetapi archive.today sering menyimpan halaman yang terlewatkan oleh Wayback Machine, terutama artikel berita, dan Bing masih menyajikan salinan cache untuk beberapa situs. Layak diperiksa sebelum Anda menyatakan artikel tidak dapat dipulihkan.

Aturan hak cipta sebelum Anda menerbitkan ulang
Bukan nasihat hukum, hanya batas yang sebenarnya menjadi pedoman para profesional. Fakta dan ide tidak dilindungi hak cipta; ekspresi spesifik dari keduanya yang dilindungi. Artikel Anda sendiri adalah milik Anda untuk digunakan sesuka Anda. Untuk teks orang lain:
- Periksa lisensi. Tanda Creative Commons penting: CC0 dan CC-BY mengizinkan penerbitan ulang (CC-BY membutuhkan atribusi); CC-BY-NC melarang penggunaan komersial; tanpa tanda berarti semua hak dilindungi.
- Dapatkan izin secara tertulis saat tidak ada lisensi. Email yang mengatakan ya lebih baik daripada halaman teori penggunaan wajar.
- Penggunaan wajar adalah pembelaan di pengadilan, bukan izin. Ini mempertimbangkan tujuan, jumlah, sifat, dan efek pasar, dan mengutip seluruh artikel gagal dalam uji jumlah hampir setiap saat.
- Atribusi dan tautan kanonik adalah sopan santun dan SEO yang baik. Mereka tidak menyembuhkan pelanggaran.
- Gambar memiliki hak cipta mereka sendiri, terpisah dari teks. Menyimpan ulang gambar membutuhkan izin tersendiri.
Satu nuansa yang sering menjebak agensi: karya yang dibuat oleh karyawan biasanya milik perusahaan, tetapi karya kontraktor mungkin tidak kecuali kontrak menyatakan demikian. Jika Anda memulihkan blog perusahaan Anda sendiri, pastikan siapa yang sebenarnya memiliki teks sebelum Anda menerbitkannya kembali di bawah merek baru.
Daftar periksa penerbitan ulang yang membuat Anda aman
- Pastikan Anda memiliki atau telah melisensikan setiap bagian, teks dan gambar secara terpisah
- Simpan nama penulis asli dan tanggal publikasi bersama artikel
- Tetapkan URL kanonik jika versi lama masih ada di mana pun
- 301-arahkan URL lama ke lokasi baru
- Perbarui tautan internal sehingga mengarah ke halaman aktif, bukan yang mati
- Catat suntingan materi ('diperbarui Juli 2026') alih-alih diam-diam menulis ulang sejarah
Lakukan enam hal ini dan blog yang dipulihkan akan mendapatkan kembali peringkat pencariannya dengan sangat cepat, Google memperlakukan restorasi setia di URL asli sebagai situs yang sama kembali, bukan situs baru yang memulai dari awal.
Pulihkan situs Anda dari Wayback Machine
Estimasi gratis dalam hitungan detik — Anda hanya membayar saat konfirmasi. Pemulihan gagal dikembalikan otomatis.
FAQ
Apakah legal untuk meng-scrape artikel web dari situs seseorang?
Untuk penggunaan pribadi, mengarsipkan halaman yang Anda bayar, menyimpan tutorial untuk bacaan offline, umumnya baik. Menyalin massal artikel orang lain untuk diterbitkan ulang tidak diperbolehkan: teks dilindungi hak cipta tidak peduli betapa mudahnya mengunduh. Ketentuan layanan menambahkan lapisan kontraktual di atasnya. Miliki konten atau dapatkan izin, uji itu menyelesaikan sebagian besar kasus.
Apa cara tercepat untuk mengekstrak satu artikel web saat ini?
Buka di Firefox dan tekan F9. Tampilan Pembaca menghilangkan semuanya kecuali artikel dalam waktu sekitar satu detik, dan dari sana Anda dapat menyalinnya atau mencetaknya ke PDF. Tanpa alat, tanpa kode.
Bisakah saya memulihkan artikel web dari situs yang sudah tidak ada?
Ya, jika itu diarsipkan. Wayback Machine menyimpan tangkapan dari sebagian besar situs yang memiliki lalu lintas; Anda dapat mengambil halaman secara manual, membuat skrip melalui CDX API, atau memulihkan seluruh situs dan menggunakan ekspor terstruktur untuk mendapatkan setiap artikel sebagai CSV atau JSON dalam satu langkah.
Format ekspor mana yang harus saya pilih, XML, CSV, atau JSON?
Sesuaikan dengan pengimpor. Pengimpor asli WordPress menggunakan XML. Alur kerja berbasis spreadsheet dan skrip sederhana paling nyaman dengan CSV. Pengembang yang membangun pipeline menginginkan JSON. Jika ragu, ambil ketiganya, murah untuk dihasilkan dan Anda hanya melakukan pemulihan sekali.
Apakah mode pembaca berfungsi di setiap situs?
Tidak. Itu gagal pada artikel berbayar, galeri multi-halaman, dan halaman di mana teks hanya ada setelah JavaScript berjalan. Untuk itu, gunakan ekstraktor headless-browser, atau, untuk situs mati Anda sendiri, pemulihan arsip diikuti dengan ekspor terstruktur.
Apakah alat ekstraksi menyimpan gambar?
Kebanyakan ekstraktor teks menghapus gambar atau meninggalkan URL hotlink yang mati bersama host asli. Memulihkan situs menyimpan file gambar aktual di samping teks. Bagaimanapun juga, perlakukan hak gambar secara terpisah dari hak teks, itu adalah hak cipta yang berbeda.
Panduan terkait

wayback machine downloader
Alat Pengunduh Wayback Machine: Apa yang Benar-Benar Berfungsi
Tinjauan jujur tentang alat pengunduh Wayback Machine: skrip open-source, keterbatasan sebenarnya, dan opsi jadi-langsung-pakai yang mengembalikan situs Anda ke online.

download entire website from archive org
Unduh Seluruh Situs Web dari Archive.org, Bukan Hanya Halaman Utama
Untuk mengunduh seluruh situs web dari archive.org, Anda membutuhkan setiap halaman, gambar, dan stylesheet. Aset tersembunyi di balik timestamp yang berbeda, berikut alasannya, beserta checklist lengkap.

restore old website
Memulihkan Situs Web Lama Tanpa Menghidupkan Kembali Masalahnya
Cara memulihkan situs web lama: menangani PHP, Flash, dan frameset kuno, memutuskan apa yang disimpan atau dimodernisasi, serta menarik file dari arsip web.

web cache
Penjelasan Web Cache: Cara Kerja Cache dan Cara Menggunakannya
Apa itu web cache, cara kerja cache browser, CDN, mesin pencari, dan arsip, serta cara menggunakan web cache untuk melihat halaman yang telah hilang.
