생성형 AI, 저작권·라이선스 무시한 학습으로 개방성 훼손한다

생성형 AI가 저작권과 라이선스를 고려하지 않은 채 온라인 자료를 학습하면서 소프트웨어 개방성과 지식 공유의 기반을 무너뜨리고 있다는 지적이 나왔다. 해외 기술 블로그에 게재된 논평은 9월 20일 생성형 AI가 40년에 걸쳐 형성된 소프트웨어 저작권과 개방성의 균형을 흔들고 있다고 주장했다.

생성형 AI가 오픈소스 생태계에 미치는 영향

논평은 대규모언어모델(LLM)이 인터넷에서 찾은 자료를 저작권이나 라이선스와 관계없이 흡수하고 있으며, 그 결과로 만들어진 파생물이 원작자의 라이선스를 따를지는 불분명하다고 지적했다. 오픈소스 소프트웨어에 적용돼 온 GPL, MPL, CC-SA 같은 라이선스는 원작물을 활용한 파생 저작물에도 일정한 권리와 의무를 이어가도록 설계됐지만, AI 학습과 생성 과정에서는 이런 조건이 제대로 반영되지 않는다는 것이다.

이 같은 문제는 소프트웨어 개방성의 역사와 맞물려 있다. 논평은 과거 매거진에 실린 BASIC 프로그램을 직접 입력하거나, 공개된 사례를 바탕으로 REXX를 익혀 게임을 만들었던 경험을 예로 들었다. 당시에는 소프트웨어에 저작권을 적용할 수 있는지를 둘러싼 논의가 진행 중이었고, 셰어웨어와 프리웨어를 거쳐 자유로운 사용과 소스 공개를 중시하는 흐름이 발전했다. 이후 인터넷과 클라우드 서비스는 앞선 세대의 자유 소프트웨어를 토대로 성장했으며, 이런 개방성이 없었다면 온라인 서비스의 비용과 집중도는 지금보다 훨씬 높았을 것이라고 설명했다.

논평은 AI가 공개된 코드를 공유의 선물이 아니라 작성자에게 돌아오는 책임과 위험으로 바꾸고 있다고 주장했다. 코드를 공개하면 AI가 오류와 취약점을 손쉽게 찾아 악용할 수 있지만, 비공개로 유지하면 같은 결함을 외부에서 발견하기 어려워진다. 깃허브(GitHub)에 코드를 올릴 경우에는 AI 봇이나 경험이 부족한 이용자가 만든 풀 리퀘스트가 대량으로 유입돼, 개발자가 유용하지 않은 제안을 걸러내는 데 시간을 빼앗길 수 있다는 우려도 제기됐다.

지식 공유 위축과 디지털 생태계의 변화

공개된 코드를 이용하는 사람도 위험을 떠안게 된다. AI가 만든 코드에 품질이 낮은 코드가 섞이거나 악성 라이브러리가 포함될 수 있고, 제3자에게 데이터를 전송하는 기능이 들어갈 가능성도 있다. 다른 사람의 작업물을 허가 없이 가져온 결과물이 포함됐다면 이를 사용하는 사람까지 법적·윤리적 문제에 연루될 수 있다는 설명이다. 기존 라이선스와 계약은 완벽하지 않더라도 법원에서 집행될 수 있어 창작자가 자신의 결과물에 일정한 통제력을 행사하게 했지만, AI가 방대한 자료를 흡수하는 과정에서는 그 통제력이 약해진다고 봤다.

논평은 생성형 AI의 환경 부담, 사이버보안 문제, 허위정보 확산에 대한 논의에 비해 개방성의 훼손은 충분히 다뤄지지 않았다고 지적했다. 지난 35년간 소프트웨어와 지식의 공유가 온라인 생활의 토대를 만들었지만, 지금과 같은 흐름이 이어지면 개발자·기술자·예술가가 자신의 작업을 공개할 유인이 줄어들 수 있다는 주장이다. 다만 글에는 특정 기업이나 서비스에 대한 대응 계획, 가격, 출시 일정 또는 법적 조치가 제시되지는 않았다. 작성자는 창작자와 개발자 등이 함께 새로운 디지털 르네상스를 마련하지 않으면 개방적 인터넷이 위축되고, 지식 공유가 소수의 부와 권력을 키우는 수단으로 변질될 수 있다고 경고했다.

RELATED ARTICLES