Retour à l'accueil

Blocage des archives face à l'IA : Menace pour le patrimoine web

Les grands éditeurs bloquent l'accès d'Internet Archive à leurs sites pour se protéger des scrapers IA. Cela entraîne la perte de copies historiques des publications. EFF plaide pour la protection de l'archivage sous le principe du fair use, similaire aux moteurs de recherche.

Archives sous attaque : Comment les éditeurs effacent l'histoire web à cause de l'IA
Advertisement 728x90

## Les Éditeurs Bloquent les Archives Web : Une Menace pour le Patrimoine Numérique à l'Ère de l'IA

Les grands médias, dont The New York Times et The Guardian, mettent en place des barrières techniques pour empêcher l'Internet Archive d'indexer leurs sites. Ces mesures vont au-delà du fichier robots.txt standard et visent à bloquer le web scraping pour l'entraînement de modèles d'IA. Mais cette approche risque de faire perdre les instantanés historiques des pages web — la seule source restante de contenu original.

L'analyste principal de l'EFF, Joe Mullin, compare cela à une interdiction faite aux bibliothèques de conserver des exemplaires de journaux. Depuis les années 1990, l'Internet Archive capture des instantanés de sites d'actualité, y compris les modifications et les articles supprimés. Ces blocages privent les historiens, les journalistes et les chercheurs de versions authentiques des publications.

Rôle de l'Internet Archive dans la Préservation de l'Histoire du Web

L'Internet Archive fonctionne comme une bibliothèque numérique à but non lucratif, construisant des index et des copies de ressources web. C'est similaire au fonctionnement des moteurs de recherche, où la copie de contenu est reconnue comme un usage loyal selon la jurisprudence américaine.

Google AdInline article slot
  • La seule source d'originaux : De nombreux articles sont modifiés ou supprimés sans préavis ; l'archive conserve leurs versions initiales.
  • Stockage à long terme : Près de 30 ans de données utilisées pour la recherche académique et la vérification des faits.
  • Statut non commercial : L'organisation ne s'engage pas dans l'entraînement d'IA commercial, se concentrant plutôt sur la préservation du patrimoine culturel.

Les éditeurs justifient ces blocages par des poursuites judiciaires contre les entreprises d'IA pour scraping non autorisé. The New York Times a déjà engagé plusieurs actions en justice, réclamant des compensations pour le contenu utilisé dans l'entraînement de modèles.

Pourquoi le Blocage est la Mauvaise Approche

Mullin insiste sur le fait que ces mesures n'empêcheront pas les bots d'IA mais effaceront des décennies de documentation. Les moteurs de recherche sont protégés légalement car l'indexation nécessite la copie de contenu. Les archives devraient conserver un droit similaire de mise en cache des pages pour le bien public.

Les décisions de justice sur le scraping d'IA pourraient imposer des limites, mais elles ne devraient pas s'appliquer aux bibliothèques non lucratives. Exclure les archives efface l'historique, sacrifiant des données dans un combat dont les archivistes ne font même pas partie.

Google AdInline article slot

Aspects Légaux de l'Indexation et de l'Archivage

Aux États-Unis, l'usage loyal couvre la création d'index de recherche et d'archives :

  • But et caractère : Non commercial et éducatif — cela favorise fortement l'usage loyal.
  • Nature de l'œuvre : Le contenu médiatique factuel se prête bien à l'archivage.
  • Quantité : Seules les copies nécessaires à l'indexation.
  • Effet sur le marché : Les archives ne concurrencent pas les originaux ; elles les préservent.

L'EFF argue que les précédents pour Google et Bing s'appliquent à l'Internet Archive. Les restrictions sur l'IA ne devraient pas toucher ces pratiques établies.

Points Clés

  • Bloquer les archives n'empêche pas le scraping d'IA mais détruit les historiques de contenu web.
  • L'Internet Archive est un outil vital pour vérifier les changements dans les publications médiatiques.
  • L'usage loyal protège l'archivage non commercial, tout comme les moteurs de recherche.
  • Les éditeurs risquent de perdre définitivement le patrimoine numérique dans leur bataille contre les entreprises d'IA.
  • Recommandation de l'EFF : Différencier l'accès pour l'IA commerciale versus les bibliothèques non lucratives.

Implications pour le Patrimoine Numérique

Sacrifier les données publiques pour contrôler l'IA est une erreur irréversible, selon Mullin. Perdre les copies d'archives rendra plus difficile l'analyse de la propagande, des fake news et de l'évolution des récits. Les développeurs d'IA et les chercheurs étudiant les données historiques feront face à une pénurie de sources authentiques.

Google AdInline article slot

Pour les professionnels de l'IT, c'est un appel au réveil pour repenser les pratiques de web scraping et d'archivage. Attendez-vous à de nouveaux protocoles comme des règles robots.txt qui différencient les bots par User-Agent, ou des archives décentralisées sur blockchain pour une meilleure résilience.

— Editorial Team

Advertisement 728x90

Lire ensuite