홈으로 돌아가기

AI로부터 아카이브 차단: 웹 유산에 대한 위협

주요 출판사들이 AI 스크래퍼로부터 보호하기 위해 Internet Archive의 사이트 접근을 차단합니다. 이는 출판물의 역사적 사본 손실로 이어집니다. EFF는 검색 엔진과 유사하게 공정 사용 원칙 하에 아카이빙 보호를 주장합니다.

공격받는 아카이브: 출판사들이 AI 때문에 웹 역사를 지우는 방법
Advertisement 728x90

# 출판사들의 웹 아카이브 차단: AI 시대 디지털 유산에 대한 위협

뉴욕타임스와 가디언을 포함한 대형 미디어 매체들이 인터넷 아카이브가 자사 사이트를 색인화하는 것을 막기 위해 기술적 장벽을 세우고 있습니다. 이는 표준 robots.txt 파일을 넘어선 조치로, AI 모델 훈련을 위한 웹 스크래핑을 방지하는 것을 목표로 합니다. 하지만 이런 접근 방식은 웹 페이지의 역사적 스냅샷을 잃게 할 위험이 있습니다—이는 원본 콘텐츠의 유일한 남은 원천입니다.

EFF 선임 분석가 조 멀린은 이를 신문 사본을 보관하는 도서관을 금지하는 것에 비유합니다. 1990년대부터 인터넷 아카이브는 뉴스 사이트의 스냅샷을 캡처해 왔으며, 수정본과 삭제된 기사도 포함합니다. 이러한 차단은 역사가, 기자, 연구자들이 출판물의 진본 버전에 접근하는 길을 차단합니다.

웹 역사 보존에서 인터넷 아카이브의 역할

인터넷 아카이브는 비영리 디지털 도서관으로 운영되며, 웹 자원의 색인과 사본을 구축합니다. 이는 검색 엔진이 콘텐츠를 복사하는 것이 미국 판례에서 공정 이용으로 인정되는 방식과 매우 유사합니다.

Google AdInline article slot
  • 원본의 유일한 원천: 많은 기사가 통보 없이 수정되거나 삭제됩니다; 아카이브는 초기 버전을 보존합니다.
  • 장기 보관: 학술 연구와 팩트체킹에 사용되는 거의 30년 분량의 데이터.
  • 비영리 성격: 해당 조직은 상업적 AI 훈련에 참여하지 않고 문화 유산 보존에 집중합니다.

출판사들은 AI 기업에 대한 무단 스크래핑 소송을 이유로 이러한 차단을 정당화하고 있습니다. 뉴욕타임스는 이미 모델 훈련에 사용된 콘텐츠에 대한 배상금을 요구하며 여러 소송을 제기했습니다.

차단이 잘못된 접근인 이유

멀린은 이러한 조치가 AI 봇을 막지 못할 뿐만 아니라 수십 년의 기록을 지워버릴 것이라고 강조합니다. 검색 엔진은 색인화에 콘텐츠 복사가 필요하기 때문에 법적으로 보호받습니다. 아카이브도 공공 이익을 위한 페이지 캐싱 권리를 유지해야 합니다.

AI 스크래핑에 대한 법원 판결은 제한을 부과할 수 있지만, 비영리 도서관에는 적용되지 않아야 합니다. 아카이브를 차단하는 것은 역사적 기록을 지우는 것으로, 아카이비스트들이 관여하지 않는 싸움에서 데이터를 희생시키는 일입니다.

Google AdInline article slot

색인화와 아카이빙의 법적 측면

미국에서 공정 이용은 검색 색인과 아카이브 생성을 포괄합니다:

  • 목적과 성격: 비영리적이고 교육적—공정 이용에 강력히 유리합니다.
  • 작품의 성격: 사실 중심 미디어 콘텐츠는 아카이빙에 적합합니다.
  • : 색인화에 필요한 사본만.
  • 시장 영향: 아카이브는 원본과 경쟁하지 않고 오히려 보존합니다.

EFF는 구글과 빙에 대한 선례가 인터넷 아카이브에도 적용된다고 주장합니다. AI에 대한 제한은 이러한 확립된 관행을 건드려서는 안 됩니다.

주요 요점

  • 아카이브 차단은 AI 스크래핑을 막지 못할 뿐만 아니라 웹 콘텐츠의 역사적 기록을 파괴합니다.
  • 인터넷 아카이브는 미디어 출판물 변경 사항을 검증하는 필수 도구입니다.
  • 공정 이용은 검색 엔진처럼 비영리 아카이빙을 보호합니다.
  • 출판사들은 AI 기업과의 싸움에서 디지털 유산을 영구적으로 잃을 위험이 있습니다.
  • EFF 권고: 상업적 AI와 비영리 도서관의 접근을 구분하세요.

디지털 유산에 대한 함의

멀린은 AI를 통제하기 위해 공공 데이터를 희생하는 것은 되돌릴 수 없는 실수라고 말합니다. 아카이브 사본을 잃으면 선전, 가짜 뉴스, 서사 변화 분석이 더 어려워집니다. 역사적 데이터를 연구하는 AI 개발자와 연구자들은 진본 원천 부족에 직면할 것입니다.

Google AdInline article slot

IT 전문가들에게 이는 웹 스크래핑과 아카이빙 관행을 재고하라는 경종입니다. User-Agent로 봇을 구분하는 robots.txt 규칙 같은 새로운 프로토콜이나 블록체인 기반 분산 아카이브로 더 나은 회복력을 기대할 수 있습니다.

— Editorial Team

Advertisement 728x90

다음 읽기