Jev는 무엇인가…토큰을 만들지 않는 모델이 나온 이유

챗GPT를 만든 연구자가 자기회귀 생성을 버렸고, 회사는 193배 빠르다고 적었지만 독립 측정에서는 2.0~3.6배였다

소프트웨어 엔지니어링 환경에서 시스템 코드와 확률분포 데이터를 분석하는 연구진
핵심 요약
1
대화 능력 포기:Jev는 대화형 텍스트 생성을 포기하고 단일 순전파 연산으로 신속한 응답을 제공한다.
2
출력 비용 무료:Jev는 출력 토큰을 생성하지 않아 출력 비용이 전혀 발생하지 않는다.
3
확률 기반 출력:Jev는 문장 대신 정형화된 확률 분포와 선택지를 반환하여 소프트웨어 엔지니어링에 최적화된 구조를 갖춘다.
4
기술적 한계 존재:Jev는 판단 근거를 제공하지 않아 블랙박스 문제와 판단의 불확실성을 엔지니어에게 떠넘기는 한계가 있다.
5
속도와 비용 절감:Jev는 기존 LLM 대비 최대 193배 빠르고 444배 저렴하다고 주장하지만, 실제 성능은 이와 차이가 있다.

전 세계 수억 명을 매료시킨 챗GPT(ChatGPT). 그 산실인 오픈AI(OpenAI)에서 인간 피드백 기반 강화학습(RLHF)을 이끌며 인스트럭트GPT와 챗GPT, GPT-4 등 주력 모델 개발을 주도했던 핵심 연구자 디오고 알메이다(Diogo Almeida). 그런 그가 4년간 몸담았던 오픈AI를 떠나 2년의 침묵 끝에 인공지능(AI) 업계에 던진 선언은 뜻밖이었다. “챗(대화)을 버려라. 단 한 자의 문장도 쓰지 마라.”

챗GPT의 화려한 문장력에 취해 있던 겉보기 세상과 달리, 실제 프로덕션 현장의 소프트웨어 엔지니어들은 매일 소리 없는 전쟁을 치르고 있었다. 결제 승인 여부(True/False)를 묻는 단 1바이트의 판단이 필요한데도 거대 언어모델은 장황한 서두 인사말을 늘어놓기 일쑤였다. 엄격한 JSON 규격을 요구했더니 쉼표 하나를 빠뜨려 백엔드 시스템 전체를 멈춰 세우기도 했다. 문단 하나를 얻기 위해 수백 개의 텍스트 토큰을 쉼 없이 찍어내며 수 초의 응답 지연과 막대한 API 비용을 허공에 날려야 했다.

알메이다가 설립한 스타트업 타입세이프AI(TypeSafe AI)가 공식 발표 블로그를 통해 공개한 신규 모델 ‘Jev’는 이 고질적인 엔지니어링 갈증에서 출발한다. Jev는 인간과 말장난을 주고받지 않는다. 문장을 단 한 줄도 생성하지 않는 대신, 사전에 닫힌 선택지 집합 위에서 정밀한 확률과 수치만을 전송한다. 회사는 이를 ‘시스템 원 모델(System One Model)’이라 명명했다. 감탄을 자아내는 데모용 챗봇에서 벗어나, 소프트웨어 코드가 실시간으로 직접 읽고 집행하는 무결점 엔지니어링 부품으로 인공지능의 역할을 재정의하겠다는 선언이다.

초이스·스코어·노울… 문장 대신 확률분포를 반환하는 3대 출력 체계

타입세이프AI 공식 기술 문서에 따르면 Jev의 반환값은 오직 세 가지 정형 데이터 타입으로 한정된다. 복수의 후보 중 하나를 고르는 ‘초이스(Choice)’, 지정된 척도 위에서 점수를 매기는 ‘스코어(Score)’, 명제의 참·거짓 여부를 0에서 1 사이의 부동소수점 확률로 산출하는 ‘노울(Noul)’이다. 세 가지 형태 모두 선택한 결과값과 함께 정밀한 수학적 확률분포 및 신뢰도 수치를 함께 반환한다.

실제 이커머스 결제 시스템의 실시간 이상 거래 탐지(Fraud Detection) 파이프라인을 떠올려보자. 기존 LLM에 거래 데이터를 넘기면 “이 결제는 이전 거래 IP와 달라 사기일 가능성이 높습니다…”라며 불필요한 서술문을 생성하느라 1초 이상의 지연이 발생하고, 포맷 파싱 오류로 결제가 튕길 위험을 안아야 했다. 반면 Jev는 단 한 번의 호출로 세 가지 질문을 동시에 병렬 평가한다. 이상 거래 여부를 묻는 ‘노울’ 질문에는 0.94(사기 확률 94%)를, 위험도를 묻는 ‘스코어’ 질문에는 88점(1~100점 척도)을, 후속 조치를 묻는 ‘초이스’ 질문에는 ['BLOCK', 'REQUIRE_2FA', 'APPROVE']BLOCK을 91%의 신뢰도로 즉시 돌려준다. 소프트웨어 백엔드의 if 조건문이 0.1초 만에 아무런 파싱 불안 없이 즉각 집행할 수 있는 형태다.

‘노울’이라는 생소한 명칭은 베르누이 확률분포(Bernoulli Distribution)에서 착안한 개념으로, 기존 소프트웨어 프로그래밍의 단순 불리언(Boolean)과 혼동되지 않도록 고안됐다. 모델 아키텍처 사양에 따르면 ‘시스템 1’이라는 개념은 행동경제학자 대니얼 카너먼(Daniel Kahneman)의 이중 과정 이론에서 따왔다. 직관적이고 즉각적인 무의식적 판단이 시스템 1이고, 논리적으로 따져보는 심층 사고가 시스템 2다. 지난 수년간 생성형 AI 업계가 긴 생각 사슬을 거치는 시스템 2 영역에만 몰두한 나머지, 소프트웨어가 초당 수백 번씩 호출해야 하는 경량·결정적 시스템 1 자리는 완전히 비어 있었다는 진단이다.

항목 공식 기술 사양
모델 명칭 jev-1.13.0 단일 모델 (별칭: jev-latest, jev-preview)
컨텍스트 윈도우 요청당 64k 토큰 (상태값 및 최장 질문 합계 32k)
이용 가격 입력 100만토큰당 0.042달러, 출력 비용 무료 (0원)
처리 한도 (Rate Limit) 초당 25만토큰, 분당 1200회 요청
선택지 상한 최대 255개 선택지 지정 가능
입력 포맷 텍스트 전용 (단일 문자열, JSON 객체, 텍스트 배열)
상태 유지 여부 요청 간 맥락 이월 없음 (완전한 무상태 Stateless)
지원 언어 영어가 주 학습 언어 (한국어·중국어·일본어 등 다국어는 보조 지원)

출력 비용이 무료(0원)라는 점이 파격적으로 보이지만, 이는 프로모션 할인이 아니라 모델 구조상 과금할 출력 토큰 자체가 전혀 생성되지 않기 때문이다. 그리고 왜 출력 토큰이 존재하지 않는지가 바로 이 모델의 핵심 동작 원리다.

챗GPT 개발 주역이 ‘대화형 텍스트 생성’을 전면 포기한 이유

알메이다 대표는 2024년 오픈AI를 떠나 회사를 설립한 뒤, 2년간 스텔스 모드로 연구개발을 이어오다 2026년 9월 중순 시드 투자 4000만달러(약 590억원) 유치 소식과 함께 Jev를 전격 공개했다. 이번 투자는 DCVC가 주도했으며 투자 유치 후 기업가치는 2억달러로 평가받았다. 그가 던진 문제의식은 간명했다. ‘초인간적인 챗봇 모델이 왜 실제 소프트웨어 엔지니어링의 인공일반지능(AGI)으로 이어지지 못하는가’라는 회의였다. 그는 자신이 개척에 기여했던 RLHF 기법이 화려한 데모와 실무 프로덕션 사이의 간극을 벌려놓았다는 기술적 부채 의식을 솔직하게 털어놓았다.

알메이다 대표는 팟캐스트 레이턴트 스페이스(Latent Space) 인터뷰에서 챗GPT의 폭발적 성공 자체가 업계의 기술적 시야를 좁혔다고 지적했다. 자기회귀(Autoregressive) 방식으로 대화 텍스트 생성에 맞춰 미세조정한 LLM 외에 다른 모든 아키텍처 대안이 사장됐다는 것이다. 그 과정에서 모델의 고질적 환각(Hallucination)과 사용자 아첨 현상(Sycophancy), 그리고 모델이 제시하는 신뢰도가 실제 정확도와 어긋나는 확률 왜곡 문제가 고착화됐다. 긴 문장을 쉼 없이 이어가는 동안 치명적인 오류를 회피하려다 보니 모델이 극도로 보수적인 성향으로 변하고, 그 보수성이 내부 확률분포 전체를 오염시킨다는 설명이다.

소프트웨어 아키텍처 관점에서 마주한 현실적인 한계는 더욱 뼈아팠다. 알메이다 대표는 테크크런치(TechCrunch) 인터뷰에서 프로덕션 엔지니어링의 답답함을 직설적으로 털어놓았다.

“우리는 병 속에 번개를 담았다. 그런데 쓸모가 없다. 컴퓨터가 다루는 언어와 대화형 LLM이 쏟아내는 언어가 전혀 다르기 때문이다.”

소프트웨어 자동화 파이프라인에서 순차적 텍스트 생성은 자연스러운 인간 대화에는 적합할지 몰라도 기계 간 통신에는 치명적인 병목이 된다. 소프트웨어가 시스템에 요구하는 것은 장황한 설명 문단이 아니다. 명확한 참·거짓 불리언, 정밀한 수치, 확정적인 카테고리 분류 데이터다.

타입세이프AI가 지향하는 포지션은 인간의 대화 파트너가 아니라 소프트웨어의 ‘결정적 부품’이다. 알메이다 대표는 미래의 인공지능이 인간 동료보다 고속 데이터베이스에 가까워질 것이라고 내다보았으며, 회사의 슬로건 역시 ‘신이 아니라 프로덕션을 위해(Not for gods, for production)’로 정했다. 모델 규모를 무작정 키우고 장황한 추론을 유도하는 대신, 텍스트 대화 능력을 과감히 포기하고 극단적인 속도와 원가 절감을 선택한 전략이다.

학습 데이터 구축 철학도 이 원칙을 철저히 따른다. 타입세이프AI는 스스로를 모델 연구소가 아닌 데이터 연구소(Data Lab)로 규정하고, 학습 데이터를 전량 합성 데이터(Synthetic Data)로 생성했다. 이용자의 사전 동의가 있더라도 실제 사용자 데이터는 일절 학습에 사용하지 않는다는 방침이다. 현실 세계의 원시 데이터에는 수많은 편향과 노이즈가 누적돼 있어 현재의 상태에 모델을 과적합(Overfitting)시킬 뿐이라는 이유에서다.

시장 반응은 즉각 나타났다. 알메이다 대표는 출시 첫 주에 일일 처리량이 1조토큰을 돌파했고 공식 디스코드 커뮤니티 가입자가 10만명을 넘어섰다고 주장했다. 외부에서 실질적으로 확인되는 변화는 개발 도구 생태계다. AI 에이전트 워크플로 통합 프레임워크인 랭체인(LangChain)의 공식 연동 패키지(langchain-typesafe) 출시가 대표적이다. 랭체인은 Jev를 백엔드로 삼아 복잡한 모델 라우팅과 위험한 도구 호출(Tool Call)을 사전에 차단하는 전용 미들웨어 2종을 함께 공개했다.

출력 토큰 없는 단일 순전파… OMR 마킹과 논술 답안의 결정적 차이

Jev와 전통적인 자기회귀 LLM의 동작 차이는 ‘수능 시험의 OMR 카드 마킹’과 ‘1000자 논술 답안 작성’의 차이에 비유할 수 있다. 일반 LLM은 객관식 질문 하나를 던져도 책상 앞에 앉아 펜을 쥐고 원고지 위에 단어를 하나씩 써 내려가는 수험생과 같다. 다음에 올 최적의 단어를 전체 어휘 사전(수만~수십만 개)에서 확률적으로 찾아내며 문장이 끝날 때까지 순전파 연산을 수백 번 반복 실행한다. 중간에 쉼표나 괄호 하나라도 삐끗하면 채점 시스템(JSON 파서)이 답안지 전체를 찢어버린다. 반면 Jev는 답안지에 미리 인쇄된 최대 255개 보기 위에 컴퓨터용 사인펜으로 단 0.1초 만에 점 하나를 찍고(단일 순전파), 그 보기를 선택한 수학적 확신도(확률분포)를 기계 판독기에 즉각 전송하는 방식이다.

이러한 아키텍처 덕분에 Jev의 신경망 연산은 단 한 번의 순전파(Single Forward Pass)만으로 완결된다. 기존 LLM의 응답 지연 시간은 대부분 출력 텍스트 길이에 정비례한다. 토큰 하나를 찍어낼 때마다 거대한 신경망 전체를 처음부터 끝까지 다시 통과시켜야 하기 때문이다. 복잡한 생각 사슬(Chain of Thought)을 켜면 이 순전파 반복 횟수가 수천 회까지 폭증한다. 반면 Jev는 출력 루프 자체가 원천 배제돼 있어, 시스템 응답 지연을 결정하는 요인이 오직 입력 프롬프트의 길이 하나로 축소된다.

신경망의 계산 결과는 질문 형태에 맞춰 사전에 부착된 과제별 전용 출력 헤드(Task-specific Heads)로 곧바로 전달된다. ‘초이스 헤드’는 선택지별 확률분포를, ‘스코어 헤드’는 척도 수치를, ‘노울 헤드’는 0과 1 사이의 부동소수점을 직접 산출한다. 이는 마치 한 권의 책(입력 데이터)을 한 번 정독해 머릿속에 기억(Hidden States)해 둔 상태에서, 세 명의 전문 심판(출력 헤드)이 동시에 각자의 신호등을 켜는 원리와 같다. 여러 개의 질문을 동시에 던져도 문맥을 세 번 다시 읽지 않으므로 연산 비용이 추가로 들지 않는다.

학습 방식에서도 독자적인 방법론이 적용됐다. 타입세이프AI는 ‘정밀 보정된 결정을 위한 강화학습'(RLCD, Reinforcement Learning for Calibrated Decisions) 기법을 도입했다고 밝혔다. 모델이 최적화하려는 목표는 단순한 정답률 향상이 아니라, 모델이 제시하는 확률값 자체의 신뢰도다. 예컨대 모델이 70%의 확신도로 내놓은 답변들을 모았을 때 실제로 약 70%가 정답이어야 한다는 캘리브레이션(Calibration) 일치율을 보상 함수로 설계했다. 인간 평가자의 주관적 선호도를 맞추는 RLHF나 수학 문제처럼 검증 가능한 절대적 정답을 겨냥하는 RLVR과 차별화되는 지점이다.

다만 Jev는 주어진 입력 상태값(State) 밖의 정보는 전혀 알지 못한다. 이전 요청의 대화 맥락을 기억하지 않는 완전한 무상태(Stateless) 구조이며, 외부 지식 베이스를 참조하거나 입력 범위를 벗어난 추론을 수행하지 못한다. 맥락을 길게 제공할수록 성능이 개선되는 일반 LLM과 달리, Jev는 관련 없는 배경 정보가 입력될 경우 오히려 판단 정확도가 급격히 하락하는 특성을 보인다. 내부 신경망의 구체적인 레이어 층수, 파라미터 규모, 손실 함수와 보상 수식은 대외비로 묶여 있다. 알메이다 대표는 Jev를 여러 전문 모델들을 유기적으로 결합한 ‘프랑켄슈타인의 피조물’에 빗댔다. 인공지능 연구자 세바스찬 라시카(Sebastian Raschka)는 Jev가 양방향 인코더(Encoder) 계열 신경망을 기반으로 구축됐을 것이라는 가설을 제시했으나, 이 역시 공개된 기술 지표에 근거한 추론에 그친다.

소형 LLM과의 결정적 분기점… 텍스트 서술형 보고 vs 직접 확률 반환

Jev와 기존 소형 언어모델(SLM)의 차이는 실패 패턴과 확률 데이터의 생성 메커니즘에서 극명하게 갈린다. JSON 포맷 파싱 실패, 스키마 붕괴, 불필요한 서두 인사말 같은 전통적 형식 오류는 원천 제거되는 대신, 닫힌 선택지 내부에서 오답을 선택하는 본질적 판단 오류가 남는다. 회사가 홍보하는 ‘환각 제로’는 정해진 스키마를 벗어난 텍스트 생성이 없다는 뜻이지, 모델이 항상 정답만 내놓는다는 보증이 아니다. 확률의 출처 또한 완전히 다르다. 일반 LLM에 확신도를 0과 1 사이로 묻는다면 모델이 생성해낸 텍스트 토큰, 즉 모델이 자신의 상태를 언어로 자기 보고(Self-reporting)한 수치에 불과하다. 반면 Jev는 신경망 출력 헤드가 직접 계산한 정밀 확률분포를 전달한다.

아키텍처 비교: 범용 자기회귀 LLM vs Jev 시스템 1
범용 자기회귀 LLM 시스템 2 지향
  • 생성 방식:토큰 단위 순차 자기회귀 생성 (수백 회 순전파 반복)
  • 결과 포맷:자연어 텍스트 문단 (JSON 파싱 실패 위험 상존)
  • 지연 요인:출력 토큰 길이에 비례해 지연 시간 급증
  • 과금 체계:입력 토큰 및 출력 토큰 양방향 종량 과금
  • 설명 가능:판단 근거를 자연어 문장으로 서술 가능
  • 오류 양상:텍스트 환각, JSON 형식 붕괴, 아첨 현상
타입세이프 Jev 시스템 1 부품
  • 생성 방식:단일 순전파(Single Forward Pass) 즉시 종결
  • 결과 포맷:구조화된 선택값 및 캘리브레이션 확률분포
  • 지연 요인:출력 토큰 없음, 오직 입력 길이에만 종속
  • 과금 체계:입력 토큰만 과금, 출력 토큰 전면 무료 (0원)
  • 설명 가능:수치 및 확률만 반환 (추론 근거 미공개)
  • 오류 양상:닫힌 스키마 내 오답 선택, 미학습 데이터 과대확신
💡 핵심 요약: Jev는 대화 능력을 포기한 대신 단일 순전파 연산으로 지연 시간을 입력 길이에만 한정시켰음. 파싱 실패가 원천 차단되나 설명 근거가 남지 않는 트레이드오프가 존재함.

이러한 아키텍처적 특성으로 인해 Jev는 최종 값과 확률만을 반환할 뿐, 어떠한 판단 근거나 추론 과정도 외부에 드러내지 않는다. 설명 가능성이 필수적인 분야에서 Jev를 곧바로 적용하기 어려운 이유다.

‘193배 속도’의 진실… 벤치마크 조건과 실측 데이터 격차

타입세이프AI는 공식 발표 블로그를 통해 Jev가 기존 LLM 대비 최대 193.6배 빠르고 444.6배 저렴하다고 발표했다. 다만 해당 수치가 ‘실제 환경에서 얻을 수 있는 이론상 최상단 이득’이라는 전제 조건을 스스로 달았다.

가장 주목해야 할 대목은 속도 수치 옆에 명시된 정확도다. 자체 평가 대시보드에서 Jev의 평균 정확도는 67.8%로 기록돼 있다. 그러나 이 수치는 절대적인 정답률이 아니다. 평가 라벨을 GPT-6 아스트라(Astra)와 클로드 페이블 5.1(Claude Fable 5.1)의 고사양 추론 모드 응답 평균값으로 생성했기 때문이다. 즉, 67.8%라는 숫자는 프런티어 최상위 모델들의 판단과 얼마나 일치했는가를 나타내는 ‘상대적 일치율’이다. 동일한 대시보드에서 기존 최상위 비교군의 일치율은 74.1%였다.

비용 절감 폭 역시 회사 자체 자료 내에서 엇갈린다. 1000건의 워크플로 실행을 기준으로 Jev의 비용은 0.39달러, GPT-5.6 루나는 3.31달러, 클로드 하이쿠 4.5는 19.49달러로 집계돼 실제 절감 배율은 8.5배에서 50배 수준에 머물렀다. 홈페이지에 게시된 홍보 수치와 자릿수 단위의 괴리가 존재하지만, 회사는 산출 기준을 명쾌하게 해명하지 못했다. 타입세이프AI는 9월 20일 공식 플레이그라운드 오픈 당시 비용 절감 상한 표기를 기존 400배에서 440배로 상향 조정했으나, 구체적인 방법론 변경 설명은 내놓지 않았다.

제3자 엔지니어링 진영의 독립 실측 결과는 상업적 마케팅 수치와 더욱 큰 격차를 보인다. 기술 분석 블로그 AY오토메이트(AY Automate)의 독립 실측 리포트에 따르면, 뱅킹77(Banking77) 고객 의도 분류 및 프롬프트 주입 공격(Prompt Injection) 탐지 벤치마크 791건을 샘플링하고 온도(Temperature)를 0으로 고정해 측정한 실측 데이터는 다음과 같다.

비교 모델 8분류 정확도 77분류 정확도 주입 공격 탐지 지연시간 중앙값
Jev 1.13 (TypeSafe) 83.8% 78.8% 87% 0.33초
GPT-5.4 나노 90% 78.4% 80.8% 1.15초
제미나이 3.5 플래시 라이트 77.5% 78.4% 86.8% 0.67초
클로드 하이쿠 4.5 78.8% 76.2% 89% 1.02초
GPT-5.6 테라 89.4% 84% 86.8% 1.17초

실제 측정 결과 Jev의 응답 속도는 동급 소형 모델 대비 2.0배에서 3.6배 빠른 수준이었으며, 호출 비용은 4.7배에서 7.5배 저렴했다. 마케팅에서 강조된 극단적인 격차에는 미치지 못했으며, 77개 다중 의도 분류 작업에서는 GPT-5.6 테라에 통계적으로 유의미하게 뒤처졌다.

자체 벤치마크의 신뢰성 논란도 제기된다. 타입세이프AI가 플레이그라운드와 함께 공개한 자체 벤치마크 ‘JevBench’는 결정형 AI 모델 전용 최초의 벤치마크를 표방하며 Jev가 75.3점으로 1위를 차지했다고 발표했다. 그러나 평가에 사용된 구체적인 과제 세부 구성과 테스트 데이터셋, 채점 알고리즘은 대외적으로 공개되지 않았다. 개발 주체가 직접 설계한 비공개 평가표에서 자사 모델이 최고점을 기록했다는 발표는 객관적 검증 결과라기보다 마케팅 선언에 가깝다는 지적이다.

테크크런치가 전한 얼리어답터 기업들의 실무 도입 사례에서도 체감 수치의 편차가 두드러진다. 웹 인프라 플랫폼 버셀(Vercel)의 프라닛 샤르마 엔지니어는 악성 코드 안전 분류기를 오픈AI 모델에서 Jev로 교체한 후 시스템 처리 속도가 5배에서 18배 빨라졌다고 밝혔다. 이메일 라우팅 솔루션 기업 브라이오AI(Bryo AI)의 니킬 무돌카르 최고기술책임자는 구글 제미나이 대비 인프라 비용을 10배에서 20배 절감했다고 전했다. 다만 두 사례 모두 구체적인 테스트 조건과 비교 대조군 모델 사양은 공개되지 않았다.

블랙박스와 과대확신… 실전 프로덕션 도입을 가로막는 4대 한계

Jev를 향한 가장 날카로운 기술적 비판은 판단의 불확실성을 엔지니어에게 떠넘긴다는 점이다. 파이썬 웹 프레임워크 플라스크(Flask)와 에러 트래킹 솔루션 센트리(Sentry) 창시자이자 에어렌딜(Arendil) 최고기술책임자(CTO)인 아르민 로나허(Armin Ronacher)는 이 구조적 맹점을 직격했다.

“Jev는 환각 문제를 해결한 것이 아니다. 환각의 판단과 분별 책임을 고스란히 최종 사용자에게 떠넘긴 것에 불과하다.”

모델이 연속적인 확률값만을 돌려주기 때문에, 어느 임계값(Threshold)을 기준으로 참과 거짓, 승인과 거절을 판정할지는 전적으로 시스템을 구축하는 개발팀이 결정해야 한다. 예컨대 대출 승인 시스템에서 모델이 신용도 확률 0.72를 반환했을 때, 승인 기준선을 0.70으로 둘지 0.75로 둘지에 따라 대규모 부실 대출이 발생하거나 우량 고객이 대거 이탈할 수 있다. 최적의 임계값을 설정하려면 사전에 정답 라벨이 정밀하게 부착된 수만 건의 검증 데이터셋이 필수적이지만, 대다수 기업 환경에는 이러한 고품질 라벨링 데이터 자체가 부족하다.

더욱 심각한 문제는 모델이 반환하는 확률 수치 자체의 불안정성이다. AI 엔지니어링 연구기관 베리(BERI)의 심층 평가 보고서에 따르면, 학습 분포에서 벗어난(OOD) 입력 900건을 대상으로 한 실험에서 기대 캘리브레이션 오차(ECE)는 0.107을 기록해 측정 잡음 하한(0.024)의 4.4배에 달했다. 오류의 방향성도 질문 형태마다 왜곡됐다. ‘노울’ 질문에서는 모델이 실제보다 지나치게 낮은 확신도를 보인 반면, ‘초이스’와 ‘스코어’ 질문에서는 극단적인 과대확신(Overconfidence) 편향을 드러냈다. 심지어 객관적으로 정답을 알 수 없도록 고의로 설계된 질문에 대해서도 44.7%의 비율로 단정적 답을 냈으며, 이때 부여된 평균 확신도는 0.74에 달했다.

판단 근거를 설명하지 못하는 ‘블랙박스’ 문제도 치명적이다. 오픈소스 개발자 사이먼 윌리슨(Simon Willison)은 기업의 채용 서류 심사 파이프라인을 특정해 경고했다. 지원자의 이력서를 입력했을 때 Jev가 돌려주는 결과는 오직 hire_score: 0.68 같은 부동소수점 숫자 하나뿐이다. 만약 학습 데이터의 잠재적 편향으로 인해 특정 성별이나 연령, 인종이 부당하게 감점되었더라도, 텍스트 추론 근거가 전혀 존재하지 않기 때문에 법적 차별이나 편향을 사후에 감사(Audit)하거나 규명할 통로가 100% 차단된다.

기술적 독창성을 둘러싼 회의론도 이어진다. 데이터 사이언스 전문 매체 KD너기츠(KDnuggets)는 텍스트 분류와 의도 탐지, 제로샷 분류는 머신러닝의 오랜 연구 분야이며, Jev의 실질적 차별점은 새로운 알고리즘이라기보다 인프라 아키텍처의 패키징과 서빙 제품화에 있다고 평가했다. 포브스(Forbes) 칼럼니스트 랜스 엘리엇(Lance Eliot) 역시 상업적 과열을 경계하며 “타입세이프AI는 내부 신경망이 어떻게 작동하는지에 관한 핵심 세부 정보를 공개하지 않은 전형적인 블랙박스이며, RLCD라는 용어 역시 스타트업이 마케팅을 위해 고안한 조어일 뿐 학계에서 표준화된 기법이 아니다”라고 짚었다. 아울러 공식 기술 문서에 명시된 대로 한국어를 비롯한 비영어권 언어의 성능 열세도 글로벌 실무 도입의 높은 장벽으로 꼽힌다.

‘신이 아닌 프로덕션을 위해’… 판단 통제권이 코드로 이전된 의미

Jev가 바꾼 것은 인공지능의 지능 수준이 아니라 시스템 작업의 형태다. 출력 공간을 사전에 닫고 단 한 번의 순전파로 연산을 끝내는 구조가 극단적인 저지연과 저비용을 만들어냈지만, 동시에 설명 가능성과 범용적 유연성을 대가로 지불했다. 이는 인공지능 에이전트 아키텍처에서 판단의 주도권이 불확실한 거대 모델에서 엔지니어의 코드로 다시 이전됐음을 의미한다. 알메이다 대표가 레이턴트 스페이스 인터뷰에서 남긴 발언은 이 같은 전략적 선택의 본질을 명확히 대변한다.

“머신러닝에서 가장 뼈아픈 교훈은 가장 중요한 부분이 머신러닝이 아니라는 점이다. 당신이 얻는 것은 오직 당신이 최적화한 대상 그 자체뿐이다.”

대화 능력을 포기하고 결정의 속도를 챙긴 Jev의 실험은 AI 업계에 중요한 질문을 던진다. 모든 인공지능이 인간처럼 장황하게 말할 필요는 없다. 기계에게 필요한 것은 때로 웅변이 아니라, 침묵 속에서 즉시 떨어지는 정확한 숫자 하나다. 다만 타입세이프AI가 내세운 화려한 마케팅 수치 이면에 도사린 블랙박스 위험과 미학습 데이터 과대확신이라는 기술적 함정을 명확히 꿰뚫어 보는 것이 소프트웨어 아키텍트들에게 남겨진 숙제다.

자주 묻는 질문 (FAQ)
Q. Jev가 기존 대규모 언어모델(LLM)과 가장 크게 다른 점은 무엇인가?
A.텍스트 문장을 생성하지 않는다는 점이다. 사전에 정의된 최대 255개 선택지 집합을 대상으로 단 한 번의 순전파 연산만 수행해 확률분포를 반환한다. 출력 토큰이라는 개념 자체가 없어 처리 지연이 입력 프롬프트 길이에만 좌우되며, 출력 토큰 과금도 전혀 발생하지 않는다.
Q. 회사가 내세우는 ‘환각 제로’ 주장은 사실인가?
A.정해진 스키마 밖으로 엉뚱한 텍스트를 생성하지 않는다는 의미일 뿐 오답이 없다는 뜻이 아니다. 닫힌 선택지 내부에서 틀린 값을 고르는 분류 오류는 상존하며, 미학습 데이터(OOD) 평가에서는 답을 알 수 없는 질문에도 44.7%의 비율로 평균 0.74의 높은 확신도를 부여하며 오답을 내는 과대확신 현상이 확인됐다.
Q. Jev가 기존 모델보다 193배 빠르다는 주장은 객관적으로 검증됐는가?
A.회사 자체 워크플로에서 도출된 이론상 최상단 수치일 뿐 독립 검증 수치가 아니다. 제3자 엔지니어링 진영이 791건의 실측 데이터셋으로 벤치마크를 수행한 결과, 실제 응답 속도는 동급 소형 모델 대비 2.0배에서 3.6배, 비용 절감은 4.7배에서 7.5배 수준으로 나타났다.

RELATED ARTICLES