# Blokování webových archivů vydavateli: hrozba pro digitální dědictví v éře AI
Velké média, včetně The New York Times a The Guardian, zavádějí technické bariéry, které brání indexování jejich webů Internet Archive. Tyto opatření překračují rámec standardního souboru robots.txt a jsou zaměřena na zabránění web scrapingu pro trénink modelů AI. Nicméně takový přístup vede k ztrátě historických snímků webových stránek, které slouží jako jediný zdroj originálního obsahu.
Starší analytik EFF Joe Mullin to přirovnává k zákazu knihovnám uchovávat kopie novin. Internet Archive od 90. let 20. století zaznamenává stav novinových webů, včetně úprav a mazání článků. Blokování bere historikům, novinářům a výzkumníkům přístup k autentickým verzím publikací.
Role Internet Archive při zachovávání webové historie
Internet Archive funguje jako nekomerční digitální knihovna, která vytváří indexy a kopie webových zdrojů. Je to analogické práci vyhledávačů, kde kopírování obsahu je uznáváno jako fair use podle precedentního práva USA.
- Jediný zdroj originálů: Mnoho článků je upravováno nebo maže bez upozornění; archiv zachovává jejich původní podobu.
- Dlouhodobé uchovávání: Téměř 30 let dat používaných pro akademický výzkum a fact-checking.
- Nekomerční status: Organizace se neúčastní komerčního tréninku AI, zaměřuje se na zachování kulturního dědictví.
Vydavatelé motivují blokování žalobami proti firmám AI za neoprávněný web scraping. The New York Times již podala několik případů, v nichž požaduje odškodnění za použití obsahu k tréninku modelů.
Proč je blokování špatný přístup
Mullin zdůrazňuje: taková opatření nezastaví AI boty, ale zničí desetiletí dokumentace. Vyhledávače jsou chráněny zákonem, protože indexování vyžaduje kopírování. Stejně tak archivy by měly mít právo na cachování pro veřejné dobro.
Soudní výsledky ohledně AI scrapingu mohou zavést omezení, ale netýkají se nekomerčních knihoven. Uzavření přístupu k archivům maže kroniku, obětuje data v boji, v němž archivátoři neúčastní.
Právní aspekty indexování a archivování
V USA fair use pokrývá vytváření indexů vyhledávačů a archivů:
- Cíl a charakter: Nekomerční, vzdělávací — faktor ve prospěch fair use.
- Příroda díla: Faktický obsah médií je vhodný pro archivování.
- Rozsah: Pouze nezbytné kopie pro indexování.
- Dopad na trh: Archivy nekonkurují originálům, ale je zachovávají.
EFF argumentuje, že precedent pro Google a Bing platí i pro Internet Archive. Omezení na AI by neměla ovlivnit tyto zavedené praktiky.
Co je důležité
- Blokování archivů nezabrání scrapingu pro AI, ale zničí historické záznamy webového obsahu.
- Internet Archive je klíčový nástroj pro ověření změn v publikacích médií.
- Fair use chrání nekomerční archivování podobně jako vyhledávače.
- Vydavatelé riskují nevratnou ztrátu digitálního dědictví v boji s firmami AI.
- Doporučení EFF: oddělit přístup pro komerční AI a nekomerční knihovny.
Důsledky pro digitální dědictví
Obětování veřejně dostupných dat kvůli kontrole nad AI nazývá Mullin nevratnou chybou. Zmizení archivních kopií zkomplikuje analýzu propagandy, falešných zpráv a evoluce narativů. Vývojáři a výzkumníci AI, kteří studují historická data, čelí nedostatku autentických zdrojů.
Pro IT specialisty je to signál k přehodnocení praktik web scrapingu a archivování. Možná nové protokoly, jako robots.txt s diferenciací botů podle User-Agent, nebo decentralizované archivy na blockchainu pro odolnost.
— Editorial Team
Zatím žádné komentáře.