AI 조언을 이용할 수 있게 하자 사람들의 ‘모르겠다’는 응답이 거의 사라지고 정답률은 낮아졌다는 연구 결과가 나왔다. 5개 실험에서 참가자 3132명을 조사한 결과로, 더디코더는 9월 27일 이 연구를 보도했다.
AI 조언에 답변 보류 급감
첫 두 실험에서는 참가자가 AI에 조언을 요청할지 선택할 수 있었다. AI를 쓸 수 없는 대조군은 질문의 36%, 44%에 판단을 유보했지만, AI를 사용할 수 있는 집단에서는 그 비율이 각각 6%, 3%로 떨어졌다. 연구진은 영화 장면의 세밀한 시각 정보를 묻는 문항을 활용했다. ‘벤드 잇 라이크 베컴’에 등장하는 팀 유니폼의 색처럼 온라인 텍스트에 잘 나타나지 않는 정보가 주된 소재였다. 연구진은 이런 문항이 AI의 환각을 유발하기 쉬운 유형이라고 설명했다.
사용된 스텝 3.5 플래시(Step 3.5 Flash)는 해당 문항에 거의 항상 오답을 냈다. 다른 문항 대부분은 GPT-5.5, 클로드 4.6 소넷(Claude 4.6 Sonnet), 제미나이 3.5 플래시(Gemini 3.5 Flash)가 맞혔지만, 어려운 문제에서는 이들 모델도 틀리는 경우가 있었다. 연구진은 AI 답변이 대체로 틀렸기 때문에 이번 결과를 신뢰할 만한 도구에 판단을 맡긴 합리적 선택으로 설명하기 어렵다고 봤다. 두 번째 실험에서는 AI를 쓸 수 있을 때 정답 확신도가 100점 만점에 75.9점으로, AI가 없을 때의 29.6점보다 크게 높았다. 그러나 정답률은 27.6%에서 10%로 낮아졌다.
금전 보상도 격차 못 메워
두 번째부터 네 번째 실험까지는 정답을 맞히면 10센트를 받고 틀리면 10센트를 잃으며, ‘모르겠다’고 답하면 보상이 없는 조건을 추가했다. 보상은 참가자가 AI 조언을 요청하는 횟수를 줄이고 AI를 쓸 때 정답을 늘리는 효과가 있었지만, 판단을 유보하는 비율은 AI가 없는 대조군보다 여전히 낮았다. 세 번째 실험에서 참가자들은 가능한 6회 중 보상 조건에서는 평균 4.53회 AI에 조언을 구했고, 보상이 없을 때는 5.27회 요청했다. 연구진이 사전에 예상한 ‘보상이 판단 유보를 늘리는 효과를 AI 접근성이 약화한다’는 상호작용은 세 실험에서 통계적으로 유의하지 않았다.
네 번째 실험에서는 참가자가 요청하지 않아도 AI 답변을 자동으로 보여줬다. 검색 엔진의 AI 요약이나 글쓰기 도구의 선제적 제안처럼 이용자가 먼저 묻지 않아도 답이 제시되는 상황을 반영한 설계다. 보상이 없을 때 판단 유보 비율은 AI가 없으면 35%였지만 자동 답변이 표시되면 1%로 줄었다. 보상이 있을 때도 대조군 약 39%에서 자동 답변 조건 7%로 낮아졌다. 다만 더 큰 보상이나 평판을 걸어둔 조건에서도 같은 결과가 나올지는 확인되지 않았다.
연구진은 그럴듯하게 들리는 AI 답변을 실제로 확인하지 않고 받아들이는 경향을 ‘에피스테미아’라는 개념과 연결했다. 언어 모델은 알지 못하는 상황에서도 답을 내놓으며, 이용자가 판단을 맡기면 그 주저하지 않는 태도까지 따라갈 수 있다는 설명이다. 연구진은 AI 사용 집단이 더 많은 문제에 답하면서도 대조군보다 정답을 적게 냈고, AI 접근성이 원래 맞힐 수 있었던 일부 답을 오답으로 바꿨다고 분석했다. 다만 이번 실험은 영화 퀴즈를 중심으로 설계돼 다른 분야에서도 효과가 똑같이 나타나는지는 아직 불분명하다. 연구진은 AI 답변이 널리 보급될수록 자신의 지식 한계를 인식하고 ‘모르겠다’고 말하는 능력이 중요해질 수 있다고 지적했다.