Artykuły webowe: Jak wyodrębnić czysty tekst z dowolnej strony
Autor: zespół redakcyjny Restorix · 7 maja 2026 · 7 min czytania

Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Klient zadzwonił do mnie pewnego razu w panice: jego agencja przeprojektowała stronę firmową i po prostu nie zmigrowała bloga. Czterdzieści kilka postów, cztery lata pozycjonowania, przepadło. Agencja nie miała kopii zapasowej. Pierwsze pytanie, które zadali, było właściwe: czy da się odzyskać tekst artykułów?
To zlecenie, oraz znacznie mniejsze, codzienne zadanie zapisania jednego czystego artykułu z zaśmieconej strony, to ta sama umiejętność w różnej skali. Oto jak podchodzę do obu: które narzędzia faktycznie działają, jak odzyskiwać artykuły ze stron, które już nie istnieją, oraz gdzie przebiegają granice prawne, zanim cokolwiek opublikujesz ponownie.
Dlaczego ekstrakcja jest trudniejsza, niż się wydaje
Na typowej stronie informacyjnej artykuł stanowi mniej niż jedną piątą kodu HTML. Reszta to nawigacja, paski boczne, banery cookies, popupy z newsletterami, karuzele powiązanych postów i skrypty śledzące. Kopiowanie-wklejanie z przeglądarki ciągnie to wszystko za sobą, albo, co gorsza, wkleja tekst, który rozpada się w chaos, bo został zbudowany z zagnieżdżonych divów i spanów.
Typowe przeszkody:
- Renderowanie JavaScript: pobrany HTML to pusta skorupa, dopóki nie uruchomią się skrypty
- Paginacja: jeden artykuł podzielony na pięć adresów URL dla zwiększenia wyświetleń reklam
- Zabezpieczenia antybotowe: mechanizmy, które na pierwszy rzut oka blokują proste narzędzia pobierające
- Leniwe ładowanie: obrazy, które istnieją dopiero po przewinięciu
- Obcinane kanały RSS: feedy, które urywają się po dwóch zdaniach i wielokropku
Wybór metody zależy od skali: jeden artykuł, cała strona czy martwa strona.
Metoda 1: tryb czytania dla pojedynczych artykułów
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
Dla jednej strony nie buduj niczego. Tryb czytania Firefoksa (F9 lub ikona strony na pasku adresu) redukuje stronę do tytułu, autora i tekstu głównego. Safari i Edge mają swoje wersje, Edge potrafi nawet odczytać artykuł na głos. Z trybu czytania skopiuj tekst do edytora albo wydrukuj do PDF, by uzyskać jakość archiwalną.
- Otwórz artykuł i włącz tryb czytania
- Popraw tytuł i autora, jeśli detektor się pomylił
- Skopiuj do edytora lub wydrukuj do PDF
- Zapisz oryginalny adres URL i datę zrzutu razem z tekstem, przyda się później jako dowód pochodzenia
Mniej znany trik: wiele stron ma arkusz stylów do druku. Otwarcie podglądu wydruku czasem daje cały artykuł w czystej postaci, nawet gdy tryb czytania sobie nie radzi, a opcja „Zapisz jako PDF" zachowuje źródłowy adres URL w nagłówku, jeśli włączysz nagłówki i stopki w oknie dialogowym drukowania.
Ograniczenia są realne: jedna strona na raz, metadane (autor, data, tagi) często utracone lub błędne, a na stronach z paywallem, paginacją lub dużą ilością skryptów zawodzi całkowicie. Pocket i Instapaper robią to samo czyszczenie z warstwą „zapisz na później", przydatne do czytania, bezużyteczne przy hurtowej pracy.
Metoda 2: strukturalna ekstrakcja artykułów
Przy kilkunastu stronach ręczna robota przestaje mieć sens. Strukturalna ekstrakcja oznacza przepuszczenie każdej strony przez bibliotekę, która potrafi znaleźć artykuł wśród szablonu, ten sam trik, którego używa tryb czytania, ale skryptowalny.
| Narzędzie | Język | Najlepsze do |
|---|---|---|
| Readability.js | JavaScript | Silnik stojący za trybem czytania Firefoksa; połącz z Playwright dla stron renderowanych przez JS |
| Postlight Parser | JavaScript | Szybka jednorazowa ekstrakcja z regułami niestandardowymi dla poszczególnych stron |
| trafilatura | Python | Najlepsze metadane (autor, data, tagi); sama przeszukuje feedy i sitemapy |
| newspaper3k | Python | Szybkie skrypty i prototypy; łatwe API, mniej utrzymywane |
| go-readability | Go | Crawle na dużą skalę, gdzie liczy się szybkość |
Zanim napiszesz jakikolwiek kod ekstrakcji, sprawdź dwa skróty. Po pierwsze, /wp-json/wp/v2/posts?per_page=100, jeśli strona działa na WordPressie, ten adres URL oddaje ci każdy post jako czysty JSON, bez scrapowania. Po drugie, sitemap.xml: zawiera listę adresów URL strony, dzięki czemu możesz wyliczyć artykuły zamiast crawlować na oślep. Gdy już crawlujesz, bądź uprzejmy: jedno żądanie na sekundę, prawdziwy user-agent, szanuj robots.txt, deduplikuj po kanonicznym adresie URL.

Błędy ekstrakcji, które marnują godziny
Cztery błędy odpowiadają za większość pracy porządkowej, którą widzę w zleceniach ekstrakcji, a wszystkie łatwiej ich uniknąć niż je naprawiać:
- Ufanie wykrytej dacie. Narzędzia ekstrakcji chętnie łapią datę modyfikacji, datę komentarza albo rok ze stopki. Weryfikuj na podstawie autora lub daty zrzutu archiwalnego.
- Utrata kanonicznego adresu URL. Zapisz go razem z tekstem. Bez niego nie zdeduplikujesz, nie ustawisz przekierowań ani nie udowodnisz później pochodzenia.
- Ekstrakcja stron-list jako artykułów. Strony kategorii i tagów wyglądają dla detektora jak treść. Filtruj po wzorcu adresu URL przed uruchomieniem paczki, a nie po.
- Ignorowanie kodowania. Strona z 2008 roku w Windows-1251 zamieni się w alfabetę, jeśli założysz UTF-8, sprawdzaj nagłówek charset HTTP, nie tylko znacznik meta.
Odzyskiwanie artykułów z martwej strony
Gdy strona zniknie, archiwum staje się twoim źródłem. API CDX Wayback Machine listuje każdy zrzut pod daną ścieżką, example.com/blog/*, i możesz pobrać najnowszy dobry snapshot każdego posta, a następnie uruchomić te same narzędzia ekstrakcji na adresach URL web.archive.org. Działa, ale jest powolne: archiwum nakłada limity, stare zrzuty odwołują się do brakujących obrazów, a pięćdziesiąt artykułów zamienia się w popołudnie pilnowania procesu.
Szybszą drogą jest najpierw właściwe przywrócenie strony. Restorix daje ci bezpłatną wycenę, dokładną liczbę zarchiwizowanych plików, łączny rozmiar, stałą cenę, a następnie przywraca pliki z wybranego przez ciebie zakresu dat. Część, którą większość ludzi pomija: istnieje opcja strukturalnego eksportu artykułów, która oddaje ci tekst artykułów w formacie XML, CSV lub JSON, plus manifest JSON lub SQLite każdego przywróconego pliku. Blog z 2016 roku z mojej historii otwierającej wrócił właśnie w ten sposób, 412 plików, 96 MB, posty wyeksportowane do CSV z tytułem, slugiem, datą i treścią, ponownie zaimportowane do WordPressa tego samego popołudnia. Tutorial przeprowadza przez cały proces.
Jeszcze jedno źródło, o którym ludzie zapominają: Google wycofał linki do pamięci podręcznej w 2024 roku, ale archive.today często przechowuje strony, które pominął Wayback Machine, zwłaszcza artykuły informacyjne, a Bing wciąż serwuje kopie pamięci podręcznej dla niektórych stron. Warto sprawdzić, zanim uznasz artykuł za nieodzyskiwalny.

Zasady praw autorskich przed ponowną publikacją
To nie jest porada prawna, tylko granice, w których faktycznie pracują profesjonaliści. Fakty i idee nie są objęte prawem autorskim; ich konkretne wyrażenie, tak. Twoje własne artykuły możesz robić, co chcesz. Dla cudzego tekstu:
- Sprawdź licencję. Oznaczenia Creative Commons mają znaczenie: CC0 i CC-BY pozwalają na ponowną publikację (CC-BY wymaga uznania autorstwa); CC-BY-NC zabrania użytku komercyjnego; brak oznaczenia oznacza wszystkie prawa zastrzeżone.
- Uzyskaj pisemną zgodę, gdy nie ma licencji. E-mail z „tak" jest wart więcej niż strona teorii o dozwolonym użytku.
- Dozwolony użytek to obrona w sądzie, a nie pozwolenie. Waży cel, ilość, charakter i wpływ na rynek, a zacytowanie całego artykułu niemal zawsze oblewa test ilościowy.
- Atrybucja i kanoniczny link to dobre maniery i dobre SEO. Nie leczą naruszenia.
- Obrazy mają własne prawa autorskie, oddzielne od tekstu. Ich rehostowanie wymaga osobnej zgody.
Jeden niuans, który dopada agencje: praca wykonana przez pracowników zwykle należy do firmy, ale praca zlecona może nie, chyba że tak stanowi umowa. Jeśli odzyskujesz bloga własnej firmy, potwierdź, kto faktycznie jest właścicielem tekstu, zanim opublikujesz go ponownie pod nową marką.
Lista kontrolna ponownej publikacji, która cię chroni
- Potwierdź, że posiadasz lub masz licencjonowany każdy element, tekst i obrazy osobno
- Zachowaj oryginalne nazwisko autora i datę publikacji razem z artykułem
- Ustaw kanoniczny adres URL, jeśli stara wersja gdzieś jeszcze istnieje
- Przekieruj stare adresy URL 301 do nowych lokalizacji
- Zaktualizuj linki wewnętrzne, aby wskazywały na żywe strony, a nie martwe
- Oznacz istotne zmiany („zaktualizowano w lipcu 2026") zamiast po cichu przepisywać historię
Zrób te sześć rzeczy, a odzyskany blog odzyska pozycje w wyszukiwarce zaskakująco szybko, Google traktuje wierne przywrócenie pod oryginalnymi adresami URL jako powrót tej samej strony, a nie start nowej.
Przywróć swoją stronę z Wayback Machine
Darmowa wycena w kilka sekund — płacisz tylko po potwierdzeniu. Nieudane przywrócenia zwracamy automatycznie.
FAQ
Czy scrapowanie artykułów z cudzej strony jest legalne?
Do użytku prywatnego, archiwizowanie strony, za którą zapłaciłeś, zapisanie tutorialu do czytania offline, ogólnie jest w porządku. Hurtowe kopiowanie cudzych artykułów w celu ponownej publikacji nie jest: tekst jest objęty prawem autorskim niezależnie od tego, jak łatwo było go pobrać. Warunki korzystania z usługi dodają na to warstwę umowną. Posiadaj treść lub miej zgodę, ten test rozstrzyga większość przypadków.
Jaki jest najszybszy sposób na wyodrębnienie jednego artykułu w tej chwili?
Otwórz go w Firefoksie i naciśnij F9. Tryb czytania usuwa wszystko oprócz artykułu w około sekundę, a potem możesz go skopiować lub wydrukować do PDF. Żadnych narzędzi, żadnego kodu.
Czy mogę odzyskać artykuły ze strony, która już nie istnieje?
Tak, jeśli został zarchiwizowany. Wayback Machine przechowuje zrzuty większości stron, które miały jakikolwiek ruch; możesz pobrać strony ręcznie, zeskryptować to przez API CDX lub przywrócić całą stronę i użyć strukturalnego eksportu, by uzyskać każdy artykuł jako CSV lub JSON w jednym przebiegu.
Który format eksportu wybrać, XML, CSV czy JSON?
Dopasuj do importera. Natywny importer WordPressa „je" XML. Przepływy oparte na arkuszach kalkulacyjnych i proste skrypty są najszczęśliwsze z CSV. Deweloperzy budujący pipeline'y chcą JSON. W razie wątpliwości weź wszystkie trzy, są tanie w generowaniu, a przywracasz tylko raz.
Czy tryb czytania działa na każdej stronie?
Nie. Zawodzi na artykułach z paywallem, wielostronicowych galeriach i stronach, gdzie tekst istnieje dopiero po uruchomieniu JavaScriptu. W takich przypadkach użyj ekstraktora z bezgłową przeglądarką albo, dla własnej martwej strony, przywracania z archiwum, po którym następuje strukturalny eksport.
Czy narzędzia ekstrakcji zachowują obrazy?
Większość ekstraktorów tekstu usuwa obrazy albo zostawia hotlinkowane adresy URL, które umierają wraz z oryginalnym hostem. Przywrócenie strony zachowuje faktyczne pliki obrazów razem z tekstem. Tak czy inaczej, traktuj prawa do obrazów osobno od praw do tekstu, to różne prawa autorskie.
Powiązane poradniki

wayback machine downloader
Narzędzia do pobierania z Wayback Machine: co naprawdę działa
Szczere spojrzenie na narzędzia do pobierania z Wayback Machine: skrypty open-source, ich realne ograniczenia i opcja typu „gotowe rozwiązanie”, która przywraca Twoją witrynę do sieci.

download entire website from archive org
Pobierz całą witrynę z archive.org, nie tylko stronę główną
Aby pobrać całą witrynę z archive.org, potrzebujesz każdej strony, obrazu i arkusza stylów. Zasoby kryją się pod różnymi znacznikami czasu, oto dlaczego, plus pełna lista kontrolna.

restore old website
Przywróć starą stronę bez wskrzeszania jej problemów
Jak przywrócić starą stronę: poradzić sobie z archaicznym PHP, Flashem i ramkami, zdecydować co zachować, a co unowocześnić, i wyciągnąć pliki z archiwów sieci.

web cache
Pamięć podręczna sieci Web: jak działa i jak z niej korzystać
Czym jest pamięć podręczna sieci Web, jak działają pamięci podręczne przeglądarek, CDN, wyszukiwarek i archiwów oraz jak użyć pamięci podręcznej, aby zobaczyć stronę, która zniknęła.
