오픈AI도 시작한 텍스트 워터마크… 단어 10% 바꾸면 지워진다

클로드·제미나이 이어 챗GPT도 도입, 동의어 교체에 17%로 붕괴하는 신뢰도, 소수 연구 기관에만 열린 판정소

AI 생성 콘텐츠의 워터마크와 원본 텍스트를 돋보기로 살펴보며 출처·무결성·디지털 서명을 표시한 인포그래픽.

이 게시물은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

핵심 요약
1
EU 자동 적용:오픈AI는 챗GPT와 코덱스의 EU 사용자에게 텍스트 워터마크를 순차적으로 자동 적용하고, 전 세계 API 고객에게는 기본값이 꺼진 선택 기능으로 제공한다.
2
단어 선택 신호:텍스트그레인은 비밀 키를 이용해 생성 과정의 토큰 선택 확률에 신호를 남기며, 눈에 보이는 문자나 별도 토큰을 삽입하지 않는다.
3
편집에 취약한 탐지:400토큰 영어 응답에서 단어의 10%를 동의어로 바꾸자 탐지율은 약 92%에서 66%로, 25%를 바꾸자 17%로 떨어졌다.
4
제한된 검증 권한:API 고객은 워터마크를 켤 수 있지만 텍스트 탐지 도구는 심사를 통과한 학술·연구 기관에만 제공돼 생성한 글을 직접 검사할 수 없다.
5
작성자 증명 한계:워터마크 미검출은 인간 작성의 증거가 아니며, 검출되더라도 특정 작성자나 저작권·법적 책임을 증명하지 못한다.
기사 목차 펼치기 / 접기

오픈AI(OpenAI)가 텍스트 워터마크를 전격 도입한다. 유럽연합(EU)의 챗GPT(ChatGPT)와 코덱스(Codex)에는 순차적으로 자동 적용하고, 전 세계 API 고객에게는 직접 켤 수 있는 선택권을 부여한다.

표식을 새겨 넣는 범위와 그 표식을 검사할 권한은 완전히 다르다.

오픈AI는 10월 5일 공식 발표를 통해 자체 텍스트 워터마킹 기술인 ‘텍스트그레인(textGrain)’의 단계적 도입 계획을 공개했다. 문장 생성 과정에서 단어 선택 확률에 감지 가능한 미세 신호를 남기고, 이를 전용 탐지기로 식별해내는 메커니즘이다. 글을 읽는 일반 독자의 눈에는 어떤 표식도 보이지 않는다.

클로드와 제미나이는 이미 다른 길을 택했다

빅테크 기업들의 텍스트 워터마크 대응은 적용 범위와 방식에서 확연히 엇갈린다. 앤트로픽(Anthropic)은 8월 14일 발표에서 클로드(Claude)에 구글 딥마인드(Google DeepMind)의 신스ID-텍스트(SynthID-Text) 계열 워터마크를 도입한다고 밝혔다. 같은 EU 규제에 대응하면서도 앤트로픽은 지역별 분할 적용 기술이 불안정하다는 이유를 들어 전 세계 지원 모델에 일괄 적용하는 노선을 택했다.

실제 클로드 공식 모델 문서를 보면 클로드 페이블 5.1(Claude 페이블 5(Fable 5).1)과 미토스 5.1(Mythos 5.1)의 출력 텍스트에 워터마크가 찍힌다. 클로드 지원 안내 문서에는 클로드 오푸스 5.5(Claude 오푸스(Opus) 5.5)와 클로드 소넷 5.5(Claude 소넷(Sonnet) 5.5)도 대상에 포함돼 있다. 반면 클로드 오푸스 4.7 등 구형 모델에는 워터마크가 빠져 있다. 앤트로픽은 8월 2일 이후 EU에 출시한 신규 모델부터 적용을 시작해 이전 모델로 소급 적용하는 과정을 밟고 있다. 아마존(Amazon) 베드록(Bedrock)에서는 클로드 페이블 5·클로드 오푸스 4.8·클로드 소넷 5에 대해 10월 12일까지 배포를 완료한다는 단서도 덧붙였다. ‘전 세계 적용’이라 하더라도 모델과 클라우드 플랫폼마다 실제 적용 시점에는 시차가 존재한다.

구글(Google)의 제미나이(Gemini)는 앞서 2024년 5월 14일 발표를 통해 대화형 앱과 웹에서 생성한 텍스트에 신스ID를 적용한다고 밝힌 바 있다. 구글 딥마인드의 제품 안내에도 텍스트 지원이 명시돼 있다. 하지만 일반에 공개된 신스ID 디텍터(SynthID Detector) 검증 도구의 대상은 여전히 이미지·영상·오디오에 집중돼 있어 텍스트 검증과는 거리가 있다.

xAI의 그록(Grok)은 또 다른 양상이다. 공식 FAQ에 따르면 그록이 생성한 이미지와 영상에는 워터마크가 강제 적용되며 사용자가 끌 수 없다. 그러나 텍스트 출력의 경우 공식 기술 문서나 개발자 안내 어디에서도 워터마크 적용 모델이나 기본값, 탐지 방식을 명시하지 않고 있다. 텍스트 워터마크와 C2PA 메타데이터를 분리 안내하는 클로드처럼, 업계 전반에서 텍스트 출처 검증은 미디어 파일 검증보다 훨씬 조심스럽게 다뤄진다.

보이지 않는 표식을 새긴다는 선언과 누구나 검사할 수 있다는 말은 다르다.

빅4 AI 텍스트 워터마크 정책 및 검증 권한 비교
각 사 공식 기술 문서 종합
오픈AI · 텍스트그레인
이원화 선택 적용
EU 자동 / API 선택
EU 챗GPT·코덱스 순차 적용 및 API 콘솔 선택 옵션 제공. 검증 도구는 승인된 학술·연구 기관에만 제한 개방됨.
앤트로픽 · 신스ID-텍스트 계열
글로벌 일괄 적용
지원 모델 전 세계 배포
페이블 5.1 등 지원 모델에 전 세계 일괄 적용. 탐지 API는 규제기관·언론·연구기관 대상 비공개 프리뷰 운영 중임.
구글 · 신스ID
서비스 내재화
웹·앱 텍스트 생성 적용
제미나이 생성 텍스트에 내장. 그러나 일반 대중에게 열린 공개 검증 도구는 이미지·영상·오디오에 집중돼 있음.
xAI · 그록
미디어 중심 적용
텍스트 정책 미공개
이미지·영상 워터마크는 강제 적용되나 텍스트 워터마크 규격 및 탐지 도구는 공식 자료에서 확인되지 않음.
[핵심 시사점] 워터마크 삽입은 EU AI Act 규제 대응을 계기로 플랫폼마다 점차 확대되고 있으나, 이를 사후 검증하고 판정하는 도구는 여전히 소수 기관에만 닫혀 있는 극단적 비대칭 구조임.

EU의 기본 적용과 전 세계 API의 선택 적용

오픈AI API 고객은 10월 5일부터 일부 모델에 한해 텍스트 워터마킹 기능을 활성화할 수 있다. 지원 지역은 전 세계이지만 기본 설정값은 ‘꺼짐(Off)’이다. 한국 기업이 구축한 API 연동 서비스 역시 선택적 활성화 대상에 포함된다. 다만 이는 한국의 일반 이용자가 웹이나 앱에서 쓰는 챗GPT에 워터마크가 자동으로 붙는다는 뜻과는 전혀 다른 이야기다.

반면 챗GPT와 코덱스 일반 사용자 서비스는 앞으로 수주에 걸쳐 EU 관할 사용자를 대상으로 자동 도입된다. 무료와 유료를 포함한 모든 요금제가 적용 대상이다. 오픈AI는 마이크로소프트 애저(Azure) 등 클라우드 파트너를 통한 모델 출력에도 수주 내로 워터마킹 지원을 추진할 방침이다.

이러한 이원화의 직접적인 배경은 EU의 강력한 인공지능 규제 체계다. EU 집행위 실천 규범에 따르면 자발적 규범 참여와 별개로 ‘EU AI Act(인공지능법)’ 제50조의 투명성 요건은 법적 강제 의무다. 해당 법조문은 AI 제공자가 기계 판독 가능한 식별 표식을 삽입하는 기술적 의무와, 서비스를 운영하는 주체가 최종 이용자에게 AI 제작물임을 밝히는 고지 의무를 분리해 규정한다.

워터마크를 새기는 기술과 독자에게 알리는 절차는 같은 개념이 아니다.

어느 모델에서 켜고, 콘솔에서 어떻게 설정하나

오픈AI 고객센터 도움말에 따르면 현재 지원되는 모델 목록은 조직과 프로젝트 설정 관리 화면에서 실시간으로 확인할 수 있다. 오픈AI는 앞으로 수주에 걸쳐 구형 모델까지 지원 대상을 점차 확장할 계획이다. 출시 초기에는 특정 지원 모델 목록을 고정하기보다 관리 콘솔을 통해 점진적으로 풀어나가는 방식을 택했다.

기능 활성화는 API 관리 콘솔에서 직접 수행한다. 조직 전체 단위 설정은 ‘조직 설정(Organization settings)’ 내 ‘데이터 관리(Data controls)’ 메뉴의 ‘텍스트 출처(Text provenance)’ 항목에서 제어한다. 프로젝트별 개별 설정은 ‘프로젝트 설정(Project Settings)’의 ‘텍스트 출처’ 메뉴를 거친다. 관리자가 ‘텍스트 워터마크 허용(Allow text watermarking)’을 켜고 적용 대상 모델을 선택한 뒤 저장(Save)하면 즉시 반영된다. 지원 모델의 토큰 생성 메커니즘 자체에 신호가 각인되므로 응답 텍스트마다 별도의 메타데이터 문구를 수동으로 덧붙일 필요는 없다.

개발자 관점에서 주목할 점은 설정 방식의 단일성이다. 현재 공개된 조작 체계는 전적으로 웹 관리 콘솔 설정에 묶여 있다. API 호출 시 개별 페이로드에 watermark: true 같은 매개변수를 동적으로 전달하거나, 코드를 통해 설정을 전환하는 엔드포인트는 제공되지 않는다. 프로젝트 단위의 일괄 온·오프 정책으로만 통제된다.

숨겨진 문자 대신 단어 선택에 남기는 신호

텍스트그레인은 어떤 방식으로 글에 흔적을 남길까. 오픈AI의 공식 기술보고서에 따르면 이 기술은 비밀 키(Secret Key)와 앞선 문맥에서 생성된 의사난수를 기반으로 단어(토큰) 선택 확률을 정밀하게 제어한다. 동일한 의미를 전달할 수 있는 여러 단어 후보가 경합할 때, 비밀 키가 지정한 특정 방향으로 미세하게 선택을 유도하는 구조다. 단어 하나를 콕 집어 표시하는 단순한 낙인이 아니다.

텍스트그레인은 토큰들을 여러 묶음(Bin)으로 나눈 뒤 묶음 간 선택 확률을 조정한다. 이때 묶음 내부에서는 원래 모델이 지닌 토큰별 상대 확률을 그대로 유지하며, 워터마킹으로 인해 감소하는 무작위성에 엄격한 상한선(엔트로피 보정)을 둔다. 탐지를 쉽게 만들겠다고 특정 단어 선택을 지나치게 강제하면 문장의 다양성과 창의성이 급격히 훼손되기 때문이다. 텍스트그레인은 신호의 검출 강도와 문장의 자연스러움 사이에서 아슬아슬한 균형을 유지하도록 설계됐다.

탐지기는 동일한 비밀 키와 토큰화 설정을 통해 텍스트 내에 숨은 확률적 편향 신호를 역추적해 복원한다. 이때 글을 생성할 당시 모델의 내부 가중치나 전체 확률 분포까지 알 필요는 없다. 중요한 점은 본문에 제로 너비 공백(Zero-width space)이나 특수문자, 추가 토큰이 단 하나도 삽입되지 않는다는 사실이다.

메모장에 붙여 넣거나 특수문자를 검색해서 찾아낼 수 있는 표식이 아니다.

구글의 공개 기술 역시 유사한 키-설정 구조를 활용한다. 구글 신스ID 텍스트는 알고리즘 자체를 오픈소스로 공개했지만, 개별 서비스의 워터마크 비밀 설정값은 비공개로 보관하도록 권고한다. 알고리즘 코드가 세상에 공개돼 있다고 해서 일반인이 상용 서비스의 출력물을 마음대로 검증할 수 있는 것은 아니다. 오픈AI 역시 텍스트그레인의 향후 오픈소스 공개를 예고했으나 구체적인 공개 일정이나 저장소는 아직 밝히지 않았다. 한편 오픈AI는 ‘아스트라(Astra)’ 벤치마크 테스트 결과 워터마크 삽입 전후로 모델의 지적 추론 성능 저하는 관측되지 않았다고 덧붙였다.

그러면 AI가 쓴 글을 가려내는 만능 열쇠인가

오픈AI 자체 평가 보고서가 워터마크의 결정적 한계를 가장 먼저 고백한다. 오탐(위양성, 사람 글을 AI 글로 오판) 비율을 1%로 억제한 조건에서 심리학 등 주제의 200토큰(약 150단어) 텍스트는 약 80%, 400토큰(약 300단어) 텍스트는 약 95%의 탐지율을 기록했다. 글이 일정 길이 이상 확보돼야 신호가 누적된다는 뜻이다.

“단어를 10%만 동의어로 교체해도 탐지율은 92%에서 66%로 떨어지고, 25%를 바꾸면 17%로 붕괴한다. 워터마크는 글에 새길 수 있지만, 사람의 손길이나 편집을 견디는 절대 방패는 아니다.”

더 치명적인 것은 가벼운 편집에 대한 취약성이다. 400토큰 분량의 영어 응답을 대상으로 진행한 편집 평가에서, 전체 단어의 불과 10%를 동의어로 교체하자 탐지율은 약 92%에서 66%로 곤두박질쳤다. 교체 비율을 25%로 올리자 탐지율은 17%로 사실상 붕괴했다. 문장의 기본 구조를 그대로 둔 채 몇몇 표현만 손질해도 워터마크 신호가 지워진다는 의미다.

한국어 문장이나 번역 환경에서는 성능 저하가 더 심각해질 수 있다. 구글 역시 신스ID의 검출 신뢰도가 문장을 대대적으로 재작성하거나 다른 언어로 번역할 경우 급격히 떨어진다고 경고한다. 백과사전식 사실 서술처럼 단어 선택의 여지가 좁은 문장에서도 신호 강도는 약해진다. 글의 길이, 사용 언어, 어휘의 다양성, 그리고 수정 정도에 따라 탐지율은 천차만별로 널뛴다.

작업 유형에 따른 편차도 뚜렷하다. 앤트로픽의 설명에 따르면 엄격한 논리만 요구되는 소스코드 본문에는 워터마크를 새기지 못하며, 선택 여지가 있는 코드 주석에 한해 신호가 들어간다. 사람이 초안을 쓴 뒤 AI로 문법만 가볍게 다듬었다면 바뀐 단어가 너무 적어 워터마크가 검출되지 않는다. 반대로 AI가 외국어 문서를 통째로 번역했다면 모델이 직접 단어를 골랐으므로 워터마크가 강하게 남는다. 사후 검출 결과만으로는 글의 진짜 저자가 누구인지 단정하기 어렵다.

검사 도구는 아직 누구나 쓰는 서비스가 아니다

워터마크 기술의 가장 큰 현실적 맹점은 검증 권한의 비대칭성이다.

표식을 찍는 공장은 열렸지만 진위를 판정하는 감정소의 문은 굳게 닫혀 있다.

오픈AI의 탐지기 신청 양식은 출처 검증과 탐지 신뢰도를 연구하는 공인된 학술·연구 기관만을 대상 자격으로 명시한다. 신청 기관은 조직명, 공식 웹사이트, 연구 목적을 상세히 소명해야 하며 심사를 통과해야만 접근 권한을 얻는다. 신청한다고 해서 누구에게나 열리는 개방형 도구가 아니다.

일반 개발자에게 열린 공식 콘텐츠 출처 API 가이드 역시 입력 대상이 이미지와 오디오 파일에 한정돼 있다. 텍스트 검증 기능은 일반 API 키로는 호출조차 불가능하다. API 콘솔에서 워터마킹 기능을 활성화한 기업 고객이라 할지라도, 자신이 생성한 글의 워터마크를 스스로 검사할 도구는 주어지지 않는다.

앤트로픽의 클로드 탐지 API 역시 비공개 프리뷰 상태다. 앤트로픽은 규제기관, 언론사, 팩트체커, 연구자, 교육기관 등 제한된 파트너 조직만을 대상으로 순차 접근을 허용하고 있다. 결국 워터마크가 찍힌 텍스트는 인터넷 세상으로 흘러나가지만, 그 텍스트를 손에 쥔 독자나 기업, 학교는 출처를 독자적으로 확인할 방법이 없는 셈이다.

작성자를 증명하지 못하는 표시의 본질

공식 기술 문서들은 워터마크의 법적·윤리적 한계를 분명히 못 박는다. 오픈AI 공개 검증 가이드는 ‘워터마크 미검출’이 곧 ‘인간 작성의 증거’가 아니라고 명시한다. 구형 모델의 출력이거나 지원되지 않는 플랫폼에서 나왔을 수도 있고, 가벼운 재작성 과정에서 신호가 희석됐을 가능성도 배제할 수 없기 때문이다.

반대로 워터마크가 검출됐다 하더라도 그것이 특정 프롬프트나 계정, 개별 제작자를 식별해 주지는 못한다. 앤트로픽 역시 워터마크 신호만으로는 클로드가 순수 창작한 것인지, 사람의 원고를 대폭 교정한 것인지 구분할 수 없다고 설명한다. 오픈AI 도움말 또한 워터마크가 저작권 소유권이나 법률상 책임, 내용의 사실적 정확성을 일체 담보하지 않는다고 강조한다.

EU 집행위원회는 공익 목적의 AI 생성·수정 텍스트를 고지할 때 기술적 워터마크 유무보다 ‘사람의 최종 검토와 편집 책임’을 훨씬 중요한 법적 잣대로 제시한다. 워터마크 검출 여부가 곧바로 법 위반이나 표절의 절대적 판정 기준이 될 수는 없다.

워터마크는 단지 확률적 흔적일 뿐 작성자의 책임을 대신할 수 없다.

자주 묻는 질문 (FAQ)
Q. 한국에서 일반 챗GPT를 쓰면 텍스트그레인이 자동으로 붙나?
A.붙지 않는다. 출시 초기 자동 기본 적용 대상은 EU 관할 사용자의 챗GPT와 코덱스다. 한국의 일반 이용자에게는 전 세계 기본값으로 자동 적용되지 않는다. 다만 한국 기업이라도 API를 활용하는 고객은 콘솔 설정에서 지원 모델의 워터마킹을 직접 켤 수 있다.
Q. API 콘솔에서 워터마킹을 켜면 내가 만든 글을 직접 검사해볼 수 있나?
A.직접 검사할 수 없다. 워터마크 삽입 기능과 사후 탐지 권한은 완전히 분리돼 있다. 오픈AI의 텍스트 탐지 도구는 심사를 통과한 공인 학술·연구 기관에만 비공개로 제공된다. 일반 개발자용 공개 출처 API는 이미지와 오디오 파일만 지원한다.
Q. 탐지기에서 워터마크가 발견되지 않으면 사람이 쓴 글이라고 확신할 수 있나?
A.확신할 수 없다. 워터마크 미검출이 인간 작성을 증명하지는 못한다. 워터마크가 지원되지 않는 모델이나 이전 버전의 출력일 수 있고, 단어의 10~25%만 동의어로 교체하거나 번역·재작성을 거치면 탐지율이 17~66% 수준으로 급락하기 때문이다.

RELATED ARTICLES

RECOMMENDED STORIES