AI 슬롭 논문 해부…교열 전문가 3명도 ‘슬롭이냐’엔 갈렸다

문제 구간 일치율 80%와 일치도 0의 역설, AI 채점관의 한계, 원산지와 품질의 괴리

나무 책상 위에 AI 연구 논문과 손글씨 메모, 그래프가 표시된 노트북, 펜 두 자루가 놓여 있다.
핵심 요약
1
슬롭의 평가 기준:연구진은 슬롭을 작성 주체가 아닌 글의 품질 문제로 보고, 정보 효용·정보 품질·문체 품질의 3개 영역에서 7개 평가 항목을 도출했다.
2
결함 식별과 판정:교열자 3명이 지목한 결함 문단은 65~80% 겹쳤지만, 최종 슬롭 판정의 평가자 간 카파 지수는 -0.15~0.29에 그쳤다.
3
글의 용도별 결함:슬롭 판정에는 관련성·정보 밀도·어조가 큰 영향을 미쳤으며, 긴 뉴스 기사에서는 장황함과 문맥이, 짧은 검색 답변에서는 사실성이 중요했다.
4
AI 채점의 한계:GPT-5 등 세 모델은 전체 글의 3~8%만 슬롭으로 판정했고, 사람이 슬롭으로 본 글을 포착한 비율도 8~12%에 그쳤다.
5
원산지와 품질의 차이:AI 작성 여부를 추정하는 탐지율은 슬롭 비율을 뜻하지 않으며, 이번 연구의 슬롭 판정 평균 34%도 웹 전체가 아닌 실험 표본에 한정된다.

교열 경력 15~30년의 베테랑 전문가 3명이 같은 글을 읽고 문제 구간을 짚어낸 일치율은 최대 80%에 달했다. 하지만 “그렇다면 이 글이 AI 슬롭(AI slop)인가”라는 단 하나의 질문 앞에서는 완전히 엇갈렸다. 한 사람이 슬롭이라고 본 글을 다른 전문가는 정상적인 글로 판정했고, GPT-5를 비롯한 최신 대형언어모델(LLM) 채점관들은 사람과의 일치도가 사실상 ‘동전 던지기(카파 0)’ 수준에 그쳤다. 저품질 AI 생성물을 뜻하는 슬롭의 실체를 과학적으로 측정하려던 첫 대규모 연구가 마주한 역설적 결과다.

미국 노스이스턴대(Northeastern University)의 샨탈 샤이브(Chantal Shaib) 등 연구진 4명이 발표한 「텍스트 속 AI ‘슬롭’ 측정」 논문은 이러한 품질 판정의 구조적 난제를 정면으로 파고들었다. 스토니브룩대(Stony Brook University)와 메타(Meta) AI 연구진이 공동 참여한 이 연구는 2025년 9월 23일 아카이브(arXiv)에 초판이 공개된 뒤 2026년 1월 24일 개정판이 나왔다. 학술지 동료 심사(피어리뷰)를 앞둔 프리프린트 단계이지만, AI 콘텐츠의 품질 측정을 체계화한 선구적 시도로 주목받고 있다.

슬롭은 생성형 AI로 무분별하게 대량 생산한 조악한 저품질 콘텐츠를 가리키는 신조어다. 미국 사전 출판사 메리엄웹스터(Merriam-Webster)는 이 단어를 2025년 올해의 단어로 선정하기도 했다. 인터넷 웹페이지의 몇 %를 AI가 작성했는지를 다룬 통계는 잇따라 발표됐지만, 그중 실질적인 슬롭이 얼마인지를 과학적으로 검증한 연구는 전무했다. 공장에서 대량 생산한 빵이 모두 맛없지 않고 동네 빵집 빵이 모두 맛있지 않듯, 작성 주체와 글의 완성도는 전혀 다른 차원의 문제이기 때문이다.

“텍스트는 AI가 만들지 않았어도 ‘슬롭’으로 읽힐 수 있으며, AI가 만든 텍스트가 모두 ‘슬롭’으로 읽히는 것도 아니다.”
— 샤이브 연구진 논문 서두 중

3대 영역 7개 항목… ‘슬롭’의 다차원적 정의 체계

연구진의 첫 작업은 슬롭의 개념을 학술적으로 정립하는 것이었다. 연구진은 전문가 19명을 섭외해 슬롭의 정의와 세부 특징을 조사했다. 참여 인원은 자연어처리(NLP) 6명, 전문 작가·글쓰기 전문가 5명, 머신러닝 3명, 공학 및 언어학 각 2명, 철학 1명으로 구성됐다. 이들 중 생성형 AI 콘텐츠를 뜻하는 슬롭이라는 단어를 사전에 인지하고 있던 전문가는 11명(58%)이었다.

연구진은 전문가 응답에서 핵심 키워드를 추출해 더 이상 새로운 속성이 등장하지 않을 때까지 범주를 확장하는 사회과학 질적 내용분석을 적용했다. 중복 요소를 통합한 결과 3대 상위 영역 아래 7개 최종 평가 항목과 11개 세부 지표가 도출됐다. 전문가들이 가장 결정적인 결함으로 꼽은 항목은 관련성(9명)이었으며, 사실성과 반복적 표현(각 7명)이 뒤를 이었다.

상위 영역최종 항목평가 기준자동 측정 지표
정보 효용정보 밀도글 길이에 비해 담긴 실질적 내용이 빈약한가존재 (서프라이절)
정보 효용관련성독자의 질문이나 과제 목적에 부합하는가측정 도구 없음
정보 품질사실성왜곡되거나 환각으로 지어낸 거짓 정보가 있는가측정 도구 없음
정보 품질편향필수적인 관점이 누락되거나 특정 방향으로 치우쳤는가존재 (주관어 사전)
문체 품질구조동일 어구의 기계적 반복, 상투적인 문장 패턴존재 (텍스트 압축률 등)
문체 품질일관성문단 간 논리적 맥락이 자연스럽게 이어지는가측정 도구 없음
문체 품질어조부자연스러운 번역투, 장황한 수사, 과도한 한자어나 먹물투일부 지표 (어휘 수·가독성)

측정하기 까다로운 주관적인 ‘글맛’을 정보 밀도, 사실성, 논리성, 어조 등 세부 성분으로 정밀 분해해 수치화한 시도다. 특히 편향 항목에서 전문가들이 지목한 문제는 정치적 편파성보다 ‘비판적 시각이 있어야 할 자리에 알맹이 없는 나열만 존재하는 상태’였다. 영화 평론을 표방하면서 제작비와 출연진 명단만 줄글로 나열할 뿐 정작 영화의 만듦새에 대한 통찰은 전혀 담기지 않은 껍데기 글이 대표적이다.

생각이 빠진 자리를 메운 장황함, 그것이 슬롭의 실체다.

15~30년 차 베테랑 교열자 3명의 실측 평가

실제 평가 대상은 두 가지 데이터셋으로 구성됐다. 첫 번째는 제나 러셀(Jenna Russell) 등이 진행한 2025년 AI 글 판별 연구가 공개한 뉴스 기사 150편이다. AP통신, 뉴욕타임스, 월스트리트저널 등 미국 주요 매체 8곳의 기사 헤드라인을 GPT-4o, 클로드(Claude), o1-pro 등 최상위 모델에 입력해 작성하도록 했다. 각 기사는 인간 기자의 원문과 AI 생성본이 짝을 이루며, AI 특유의 어투를 지우도록 재지시한 이른바 ‘휴머나이즈(Humanized)’ 판본도 포함됐다. 두 번째는 마이크로소프트(Microsoft) 빙(Bing)의 검색 질의 데이터셋(MS MARCO)에서 추출한 질문 100개에 대해 다양한 AI 모델이 생성한 답변 묶음이다.

연구진은 전문 프리랜서 플랫폼 업워크(Upwork)를 통해 전문 교열자 5명을 시급 35~45달러(약 4만8000~6만1000원)에 섭외해 사전 시험 평가를 진행했다. 평균 871단어인 기사 한 편을 정독하고 표기하는 데 10~15분, 55단어 안팎의 검색 답변 하나에는 4~7분이 소요됐다. 교열자들은 시험 라운드를 거치며 상호 조율을 마쳤으며, 이견이 발생한 부분도 결함 문장 위치보다는 세부 항목의 명칭 선택에 국한됐다.

이들 중 본 작업을 전담한 3명은 전원 북미 출신 원어민으로, 전문 교열자 및 작가 경력이 15~30년에 달하는 베테랑이었다. 세 사람은 기사 213편과 답변 123개를 분담하여 평가했으며, 이 중 기사 45편과 답변 10개는 3명이 동시에 교차 평가하여 일치도를 엄밀히 측정했다.

평가 절차의 순서가 핵심이었다. 교열자는 글을 끝까지 정독한 뒤 먼저 ‘이 글이 슬롭인가’에 예·아니오로 답했다. 그다음 문제가 되는 구간에 줄을 긋고 7개 항목 중 해당하는 사유를 표기했다. 슬롭이 아니라고 답한 정상적인 글에도 문제 구간 줄은 그을 수 있도록 했다. 세부 감점 요인을 따지기 전에 글 전체가 주는 총점과 인상을 먼저 확정 짓는 방식이다.

빨간펜을 들기 전, 독자로서 느낀 첫인상을 먼저 확정했다.

문제 구간 일치율 80% vs 슬롭 판정 충돌… 카파 지수의 역설

줄을 그은 결함 위치는 상당 부분 일치했다. 기사를 문단 단위로 분석했을 때 한 교열자가 결함으로 지목한 구간이 다른 교열자의 구간과 겹친 비율은 최대 80%(0.65~0.80)에 달했다. 연구진은 이를 보통에서 높은 수준의 상호 일치로 평가했다. 하지만 “이 글이 슬롭인가”라는 최종 판정 앞에서는 결과가 극단적으로 엇갈렸다. 우연히 맞아떨어질 확률을 배제하고 일치도를 정밀 측정하는 코언의 카파(Cohen’s kappa) 지수를 계산하자 세 쌍의 수치는 각각 -0.15, 0.29, 0.06에 그쳤다. 동일한 반칙 장면을 똑같이 지목하고도 정작 퇴장 여부를 두고는 세 심판이 제각기 다른 판정을 내린 격이다.

연구진은 통계적 왜곡을 보정하기 위해 단서를 덧붙였다. 교열 전문가들이 슬롭으로 판정한 기사는 전체의 평균 34%로 소수였으며, 특정 답변의 빈도가 낮을 경우 코언의 카파는 실제 일치도보다 낮게 측정되는 경향이 있다. 이러한 왜곡을 보정하는 궤트의 AC1(Gwet’s AC1) 기법으로 재산출하자 세 쌍의 일치도는 0.12~0.42로 완만하게 상승했다. 개별 텍스트에 대한 총괄적 평가는 주관적 선호가 개입될 수밖에 없음을 보여주는 대목이다.

세부 평가 항목별로 살펴보면 이러한 시각 차이가 더 뚜렷해진다. 객관적 검증이 가능한 사실성(AC1 0.76), 편향(0.67), 문장 구조(0.51)는 연구진의 신뢰 기준선인 0.5를 훌쩍 넘겼다. 반면 정보 밀도(0.45)와 일관성(0.39), 관련성(0.22), 어조(0.20)는 기준선 아래에 머물렀다. 명백히 틀린 날짜나 데이터는 누구나 오답으로 합의하지만, 부자연스러운 문맥이나 어색한 어조는 평가자마다 기준이 제각기 달랐음을 보여준다.

교열자마다 무게를 둔 기준도 판이했다. 첫 번째 교열자는 정보 밀도, 관련성, 사실성, 편향이 판정을 좌우했다. 두 번째 교열자는 오직 정보 밀도 하나만이 통계적으로 유의미한 영향을 미쳤고, 세 번째 교열자는 통계적으로 유의한 단일 항목이 전무했다. 세 사람이 공통적으로 공유한 최소한의 마지노선은 오직 ‘장황함의 유무’ 하나뿐이었다.

결함의 위치는 같았지만, 유죄의 기준은 달랐다.

AI 슬롭 판정 구조: 인간 교열 전문가 vs AI 채점관(LLM)
실측 벤치마크
인간 교열자: 결함 구간 [고도 합의]
65~80%
• 결함 문단 겹침 비율 최대 80% 달성
• 사실성(AC1 0.76) 및 편향(0.67) 일치
• 객관적 오답 구간 식별에 높은 수렴
인간 교열자: 슬롭 여부 [기준 분산]
-0.15 ~ 0.29
• 코언 카파 지수 사실상 우연 수준
• 관련성(0.22) 및 어조(0.20) 주관성 개입
• 감점 구간 짚고도 최종 처벌 수위 충돌
AI 판정자 (GPT-5 등) [판정 무력화]
카파 0.01
• 인간과의 일치도 0 (동전 던지기)
• 슬롭 판정 비율 3~8% (인간 34%의 1/5)
• 저품질 글의 88~92%를 무사 통과시킴
핵심 시사점: 인간 전문가는 어디가 문제인지 식별하는 눈은 공유하지만 최종 슬롭 규정에서 갈렸으며, AI 모델은 지침서를 주어도 대부분의 조악한 글에 무비판적 합격 도장을 찍어 판정관 역할을 전혀 수행하지 못함.

장황함과 어조가 가른 뉴스 기사의 슬롭 판정선

결함 구간으로 줄이 많이 그어진 글일수록 슬롭으로 판정될 확률도 높았다. 표시 구간 수와 최종 슬롭 판정 간의 상관계수는 전체 0.63, 뉴스 기사 0.70, 검색 질의응답 0.51로 집계됐다.

연구진은 여러 복합 변수 중 어떤 요인이 슬롭 판정을 유발하는지 로지스틱 회귀 분석으로 규명했다. 7개 항목 모두 슬롭 확률을 유의미하게 끌어올렸으나, 가장 결정적인 영향을 미친 상위 3개 항목은 관련성, 정보 밀도, 어조였다. 흔히 대중이 AI 글의 대표적 징표로 여기는 어구 반복이나 상투적인 문장 패턴은 의외로 상위 3대 요인에 들지 못했다.

논문에는 세 교열자가 예외 없이 모두 결함으로 지목한 실제 문장 사례도 실렸다. 기후변화를 다룬 한 기사에서 AI는 미국 프린스턴대 기후학자 마이클 오펜하이머(Michael Oppenheimer)의 입을 빌려 “기후변화는 날씨에 스테로이드를 투여하는 것과 같다”(“Climate change is like adding steroids to our weather”)고 적었다. 오펜하이머 교수는 실존하는 학자이지만, 정작 그는 이러한 발언을 한 적이 없었다. 그럴듯한 비유를 위해 실존 인물의 명의를 도용한 명백한 인용 환각(Hallucination)이었다.

글의 성격과 용도에 따라서도 판정 기준이 크게 요동쳤다. 호흡이 긴 뉴스 기사에서는 일관성, 어조, 정보 밀도, 관련성, 편향 순으로 슬롭 여부가 갈렸다. 반면 짧고 명확한 해답을 요구하는 검색 답변에서는 사실성과 문장 구조가 판정을 지배했다. 신문 기사에서는 알맹이 없는 장황함이 치명타로 작용한 반면, 검색 결과에서는 매끄러운 문장보다 틀린 사실 한 줄이 먼저 탈락 기준이 됐다.

기사에서는 군더더기가, 검색에서는 거짓 한 줄이 유죄였다.

일치도 0의 충격… AI 채점관이 슬롭을 놓치는 이유

연구진은 이어 인간의 슬롭 판정을 기계가 재현할 수 있는지 다각도로 실험했다. 그러나 첫 단계부터 난관에 봉착했다. 인간의 판정을 좌우했던 5대 핵심 항목 중 관련성, 일관성, 어조 3개 항목은 신뢰할 만한 기존 자동 측정 도구가 전무했다.

사용 가능한 모든 자동 수치 지표를 결합한 선형 회귀 모델을 구축했으나, 슬롭 검출 정확도와 재현율을 나타내는 AUPRC 점수는 뉴스 기사 0.52, 검색 답변 0.55에 그쳤다. 무작위 확률(0.25~0.27)보다는 두 배가량 높지만, 실제 인간의 판정을 대신하기에는 턱없이 부족한 수치다. 글쓰기 품질 점수를 매기도록 훈련된 보상 모델 WQRM(Writing Quality Reward Model) 역시 슬롭 판정과의 상관계수가 뉴스 0.25, 검색 답변 0.15에 불과했다.

가장 충격적인 결과는 최신 대형언어모델(LLM)을 심사관으로 투입한 실험에서 나타났다. 연구진은 GPT-5, 딥시크(DeepSeek) V3, o3-mini에 인간 교열자들에게 제공된 것과 동일한 채점 지침서를 통째로 입력하고 슬롭 여부를 판정하도록 했다.

판정 주체코언 카파 (인간 일치도)슬롭 판정 비율정밀도 (Precision)재현율 (Recall)
인간 교열자 3명 평균기준치34%기준치기준치
GPT-50.018%0.380.12
딥시크 V3-0.013%0.250.08
o3-mini0.037%0.420.08

GPT-5, 딥시크 V3, o3-mini 등 세 모델 모두 사람과의 카파 일치도가 0 안팎에 불과했다. 인간 교열 전문가들은 전체 글의 약 34%에 슬롭 판정을 내렸지만, AI 모델들은 단 3~8%에만 슬롭 딱지를 붙였다. 사람이 슬롭이라고 지적한 글 중 AI가 이를 포착해 낸 비율은 고작 8~12%에 그쳤다. 인간 교열자들이 숙지한 정밀 채점 기준표를 그대로 건네받았음에도, AI 채점관들은 거의 모든 저품질 글에 무비판적으로 합격 도장을 찍으며 사실상 판정을 방기한 격이다.

슬롭을 만든 장본인에게 슬롭의 감시를 맡긴 역설이다.

세부 판정 근거에서도 괴리가 심각했다. o3-mini가 남긴 감점 사유는 오직 정보 밀도 문제에만 기형적으로 집중됐다. 인간 평가자가 가장 빈번하게 짚어낸 일관성, 어조, 편향, 관련성, 사실성 결함은 제대로 짚지 못했다. GPT-5는 결함 구간을 인간보다 길게 잡았으나(평균 58자 대 41자) 실제 인간이 그은 구간과의 겹침 비율은 미미했다. 결함 예시를 최대 5개까지 사전에 보여주는 퓨샷(Few-shot) 프롬프팅을 적용해도 성능은 유의미하게 개선되지 않았다.

연구진이 딥시크 R1을 증류한 70억 매개변수 Qwen 모델을 결함 구간 추출 전용으로 미세조정하자 정확도가 다소 상승했으나, 정밀도와 재현율의 조화평균인 F1 점수는 0.26에 머물렀다. 연구진은 초록 결론부에서 “슬롭을 식별하는 완전히 자동화되고 확장 가능한 측정 기법은 여전히 해결되지 않은 중대한 도전 과제로 남아 있다”고 규정했다.

원산지 판정과 품질의 괴리… ‘웹 35% AI’ 수치의 실체

이번 연구 결과는 최근 쏟아지는 웹상 AI 비중 조사 결과와 비교할 때 더욱 본질적인 차이를 드러낸다. 퓨리서치센터(Pew Research Center)는 8월 20일 자체 보고서에서 2026년 7월 수집한 무작위 웹페이지 1만개 중 10%에서 AI 작성 징후가 뚜렷했다고 발표했다. 챗GPT(ChatGPT) 출시 이후 생성된 최신 페이지만으로 범위를 좁히면 이 비율은 3분의 1을 상회한다.

임페리얼칼리지런던(Imperial College London)과 인터넷 아카이브(Internet Archive), 스탠퍼드대 연구진 역시 4월 14일 공개한 연구에서 2025년 중반 새로 등록된 웹사이트의 약 35%가 AI 생성이거나 AI 보조 저작물이라고 추정했다. 제1저자 요나스 돌레잘(Jonas Dolezal)의 이름을 따 ‘돌레잘 연구’로 불리는 논문이다.

연구 조사측정 대상사용 도구측정 결과
퓨리서치센터 (2026년 8월)AI 작성 징후 여부탐지 모델 Open Pangram무작위 웹페이지의 10%
돌레잘 연구 (2026년 4월)AI 생성·보조 여부탐지 모델 Pangram v3신규 웹사이트의 약 35%
샤이브 연구 (2026년 1월 개정)실질적 슬롭 여부전문 교열자 3인 정밀 판정표본의 34% (판정자 간 일치도 낮음)

두 조사가 측정한 대상은 오직 ‘글을 기계가 썼는가’라는 원산지일 뿐이다. 퓨리서치는 오픈 팽그램(Open Pangram)을, 돌레잘 연구는 팽그램 v3를 탐지 도구로 활용했다. 동일 계열의 탐지기를 사용한 만큼 두 수치를 서로 독립적인 상호 검증으로 해석해서는 안 된다. 또한 샤이브 연구의 34% 역시 웹 전체의 슬롭 비율이 아닌 실험 표본 내의 판정 평균이다. 식품에 ‘공장제 원산지 스티커’는 붙일 수 있어도 ‘맛과 영양의 보증 마크’는 붙일 수 없듯, AI 탐지율과 슬롭의 비율은 완전히 별개의 문제다.

원산지 라벨이 음식의 맛과 영양을 보증하지는 못한다.

주목할 부분은 돌레잘 연구에서도 AI 작성 텍스트의 급증이 웹 전체의 사실 정확도나 문체 다양성을 훼손한 뚜렷한 정황은 통계적으로 포착되지 않았다는 점이다. 이는 대다수 미국 성인이 AI 글로 인해 정보 품질이 저하됐다고 믿는 통념과 정면으로 배치된다. 다만 AI 생성 글의 비중이 늘어날수록 의미론적 다양성이 줄어들고 천편일률적인 긍정적 어조가 증가하는 경향성은 통계적으로 입증됐다.

취향을 넘어선 품질의 기준… 슬롭 논문이 남긴 과제

평가 결과만 놓고 보면 슬롭 판정이 순전히 개인 취향의 영역이라는 회의론으로 흐르기 쉽지만, 논문은 그러한 결론을 단호히 거부한다. 전체 판정은 엇갈렸을지라도 문제 구간으로 줄이 많이 그어진 글일수록 슬롭 판정 확률이 비례하여 치솟았고, 사실성과 편향처럼 고도의 합의에 도달한 객관적 기준도 분명히 존재했다. 맛에 대한 개인적 호불호가 갈릴지라도 소금을 과하게 들이부은 국은 누구나 짜다고 입을 모으듯, 슬롭 역시 일정 선을 넘어서는 순간 보편적인 품질 결함으로 수렴한다는 분석이다.

물론 이번 연구 자체에도 뚜렷한 한계는 존재한다. 판정자가 북미 출신 원어민 교열자 3명에 국한됐고, 대상 텍스트 역시 미국 8개 주류 언론사의 영어 기사로 제한됐다. 인간 기자의 원문과 AI 판본, 휴머나이즈 판본 간에 슬롭 판정 비율이 각각 어떻게 갈렸는지 구체적인 세부 내역도 공개되지 않았다. 인간이 작성한 원문과 AI 글 간의 슬롭 비율을 1:1로 직접 대조한 수치 또한 담기지 않았다.

데이터 기록 상의 불일치도 발견된다. 본문에서는 검색 질의응답을 라마(Llama) 4 스카우트 등 5개 모델로 생성했다고 서술했으나, 부록에는 4개 모델만을 다른 명칭으로 기재했다. 연구진은 평가 지침서와 데이터셋을 전면 공개하겠다고 공언했으나, 9월 28일 기준 공식 깃허브(GitHub) 저장소에는 ‘곧 공개'(Coming soon)라는 안내만 남아 있다.

전문가 설문 중에는 인간이 작성한 글도 슬롭이 될 수 있는지 묻는 질문이 포함됐다. 이에 대해 한 글쓰기 전문가는 퇴고 전의 미숙한 초고라면 결코 슬롭이라 부를 수 없다고 선을 그으며 가장 본질적인 통찰을 남겼다.

“독자의 시간을 낭비하는 저품질 콘텐츠를 온라인이든 오프라인이든 거리낌 없이 뻔뻔하게 내보내는 행위야말로 ‘슬롭’이라는 단어에 가장 잘 부합한다.”
— 샤이브 연구진 전문가 설문 응답 중

슬롭을 가르는 기준은 도구가 아니라 독자에 대한 예의다.

자주 묻는 질문 (FAQ)
Q. AI가 작성한 글은 모두 슬롭에 해당하는가
A.그렇지 않다. 논문은 AI가 쓰지 않은 글도 슬롭으로 읽힐 수 있고, AI가 생성한 글이 모두 슬롭으로 읽히는 것도 아니라는 점을 분명히 했다. 실제 실험 표본에서도 베테랑 교열자들이 슬롭으로 판정한 글은 평균 34% 수준에 머물렀다.
Q. 기존 AI 탐지기로 슬롭 여부를 걸러낼 수 있는가
A.걸러내기 어렵다. 기존 탐지기(Pangram 등)는 통계적 어휘 분포를 바탕으로 텍스트의 작성 주체(원산지)를 추정할 뿐, 글의 정보 효용이나 문체적 결함을 판별하지 못한다. GPT-5 등 최신 LLM을 판정자로 투입한 실험에서도 사람과의 일치도는 동전 던지기 수준인 0 안팎에 그쳤다.
Q. 이번 연구 결과가 한국어 AI 텍스트에도 동일하게 적용되는가
A.직접 적용하기에는 한계가 있다. 이번 실험은 미국 내 8개 언론사 기사와 북미 출신 원어민 교열 전문가들을 대상으로 진행됐다. 연구진은 다국어 환경으로 평가 틀이 확장되길 기대한다고 밝혔으나, 한국어 환경에서의 실측 데이터는 아직 보고되지 않았다.

RELATED ARTICLES