Záchrana blogu, který zemřel v roce 2013
Každý importér tady čte exportní soubor. To funguje přesně do chvíle, kdy platforma zmizí – a pak není o jaký export žádat, kam se přihlásit ani jaký účet obnovit. Posterous skončil v roce 2013. Blog.cz je pryč. Tvůj hosting je na řadě, časem.
Pro tyhle blogy je dvacátým zdrojem importu Internet Archive.
Režim feedu: co si crawler nechal
Archiv udělal užitečnou věc, aniž to zamýšlel. Léta procházel RSS feedy blogů – znovu a znovu, každých pár týdnů, kdykoli šel crawler kolem. Každý záchyt je snímek posledních deseti nebo dvaceti příspěvků v tu chvíli. Seřaď je od nejstaršího a překryvy zrekonstruují historii, kterou nikdo neuložil.
To dělá importér: přečte index CDX pro adresu feedu, odstraní duplicity podle digestu, aby sto shodných záchytů stálo jedno stažení, vytáhne původní bajty přes koncový bod id_, aby ti do příspěvků nikdy nepřistála vlastní lišta Archivu, a překrývající se okna sloučí stejně, jako nový import slučuje cokoli jiného.
Obrázky se vracejí týmž strojem času.
Ověřeno záchranou příspěvků z blogu na Posterousu, který je třináct let mrtvý.
Režim stránek: když feed nikdy nebyl
Spousta blogů, které Archiv procházel, přišla o feed úplně. Ty propadnou do režimu stránek: každá archivovaná stránka příspěvku, nejnovější záchyt každé.
Těžké je to, že archivovaná stránka je jen HTML z éry bez konvencí. Takže balíčky platforem říkají, které cesty jsou příspěvky a jak značkování té platformy zapisuje titulek, datum a tělo. Blog.cz je zabudovaný – adresy /YYMM/slug, div článku, česká dlouhá data a kódování windows-1250 té doby převedené na cestě dovnitř. B2evolution také, postavený podle skutečného skinu z roku 2008, ne podle dokumentace: výchozí šablona bText, kterou skiny skoro nikdy nenahrazovaly, titulky h3.bTitle, štítky za svým lokalizovaným popiskem a dvouciferná data y/m/d čtená v pořadí, které říká zdroj šablony – což by ti žádná vykreslená stránka říct nemohla.
Bez balíčku pokryje tvar ručně POST_PATTERN. Bez obojího běh odmítne a vytiskne ukázkové archivované cesty, ze kterých jde vzor postavit, místo aby hádal.
Co nebude předstírat
To je část, na které mi záleží nejvíc, protože záchranný nástroj, který si potichu vymýšlí, je horší než žádný.
Co crawler nikdy nepotkal, zůstává ztracené, a běh to řekne. Nečitelné záchyty se počítají. Stránky, které jdou datovat jen podle toho, kdy byly zachyceny, se počítají zvlášť, ne potichu zpětně datují. A chybějící obrázek – který Archiv servíruje jako chybovou stránku HTML s veselým 200 – se chytí tím, že se nedá změřit jako obrázek, a započítá jako ztracený, místo aby se uložil jako rozbitý soubor, který ve výpisu vypadá v pořádku.
Zaneprázdněný Archiv se přečká, místo aby se četl jako blog, který nikdy nebyl.
Co dostaneš zpět
Příspěvky, s jejich daty, na trvalých adresách, s obrázky, které přežily, se štítkem původu, ve složce, kterou vlastníš. Ne screenshot, ne PDF stránky – tytéž soubory JSON, ze kterých je každý jiný příspěvek na tvém webu, upravitelné, prohledávatelné, znovu exportovatelné.
Archiv si kopii tvého blogu nechal, protože si nechává kopii všeho. Tohle ji jen přečte zpět do něčeho, co můžeš použít.

Komentáře