옥스퍼드대(University of Oxford)가 보들리안 도서관(Bodleian Library)의 역사 자료를 오픈AI(OpenAI)의 AI 모델 학습에 활용하도록 허용했다. 가디언(The Guardian)은 내부 문서와 대학 측 설명을 토대로 9월 26일 이같이 보도했다.
보들리안 자료 12만5000건 공유
옥스퍼드대는 2025년 3월 오픈AI와 협력한다고 발표하면서, 도서관 자료를 디지털화해 학생과 연구자가 더 쉽게 이용하도록 하겠다고 밝혔다. 당시 발표에는 디지털화한 자료가 오픈AI 모델 학습에 쓰인다는 내용이 명시되지 않았다. 다만 대학 대변인은 디지털화가 협력의 주된 목적이었지만, 학습 자료에도 기여한다는 점을 공개해왔다고 설명했다.
대학 내부 문서에는 보들리안 도서관 자료가 “오픈AI 학습 세트를 채우는 데” 쓰였다고 기록됐다. 2025년 6월까지 공유된 자료에는 19~20세기에 유럽·미국 대학에서 작성된 박사학위 논문 등에서 스캔한 이미지 12만5000장이 포함됐다. 16세기 노래 가사와 악보를 담은 희귀 브로드사이드 발라드 1만점도 스캔됐다. 18세기 아일랜드 정부 문서와 소설가 마리아 에지워스의 편지, 도로시 호지킨의 페니실린 연구 노트도 디지털화 방안으로 논의됐다.
도서관 협력과 데이터 확보 경쟁
회의록에는 보들리안 도서관 운영위원회 관계자 등을 포함한 교직원들이 오픈AI와 협력할 때 대학의 평판에 미칠 위험을 우려했다는 내용이 담겼다. 에너지 소비가 큰 기술과 협력하는 일이 대학의 환경 공약에 미칠 영향도 논의됐다. 가디언은 웹사이트에 AI 생성물이 늘어 모델 학습에 쓸 만한 자료가 줄자, 개발사들이 대학의 책과 역사 자료로 눈을 돌리고 있다고 전했다.
중고 서점에서는 18세기 아프리카 농기구 안내서나 1950년대 자동차 운전자들의 전기처럼 온라인에서 찾기 어려운 책의 주문이 잇따랐다. 서점 주인들은 이런 책이 차세대 AI 모델에 새로운 학습 자료를 제공할 수 있다고 추측했다. 오픈AI는 보스턴 공공도서관과 캘리포니아공대, 매사추세츠공대(MIT), 미시간대 등 미국 연구도서관과도 ‘넥스트젠AI’ 프로젝트를 진행하고 있으며, 옥스퍼드대는 이 프로젝트에 참여한 유일한 영국 대학이다.
옥스퍼드대 측은 디지털화 규모가 제한적이고 저작권이 만료된 자료만 다루며, 오픈AI가 자료를 독점적으로 이용하지 않는다고 밝혔다. 스캔본의 권리는 보들리안 도서관에 남고, 도서관은 몇 달 안에 자료를 온라인에 공개할 계획이다. 오픈AI와의 계약으로 도서관의 2300만점 소장품을 대규모로 디지털화할 가능성이 제기됐으며, ‘애스크 더 보드’ 챗봇 구상은 회의록에서 논의됐다. 대학 측은 이번 협력으로 자료 접근성이 넓어질 것이라고 설명했다. 보들리안 자료는 스캔 뒤 폐기되지 않는다. 오픈AI의 경쟁사 앤트로픽(Anthropic)은 책을 사들여 제본을 잘라 스캔한 뒤 폐기하는 방식에 수천만달러를 썼지만, 희귀 고서와 골동본은 사거나 파기하지 않는다고 밝혔다.