미국 인공지능(AI) 스타트업 타입세이프AI(TypeSafe AI)가 판단 전용 모델 Jev를 선보인 지 불과 일주일 만에, 오픈소스 플랫폼 허깅페이스 모델 목록에는 이름에 ‘jev’를 단 저장소가 77개나 쏟아졌다. 문장을 작문하는 거대언어모델(LLM) 대신 ‘예·아니오’나 객관식 분기만을 고속으로 처리하는 판단 모델 시장이 열리자마자, 전 세계 개발자들이 저마다의 오픈소스 복제판을 직접 찍어내기 시작한 것이다.
복제판이 들불처럼 번진 배경에는 두 가지 요인이 맞물려 있다. Jev는 언어모델의 마지막 출력 확률(로짓)만 읽어내는 구조여서 기술적으로 따라 만들기 어렵지 않았고, 공식 서비스가 채워주지 못하는 설치형·특화형 수요가 시장 곳곳에 도사리고 있었기 때문이다. 하지만 벤치마크 실측 결과, 복잡한 추론과 심층 지식 영역에서는 여전히 원본 모델의 벽이 높았다.
에이전트에게 필요한 건 보고서보다 판단
AI 에이전트가 언어모델을 호출하는 이유는 대부분 문장을 지어내기 위해서가 아니다. 접수된 고객 문의를 환불팀으로 넘길지, 실패한 API 호출을 재시도할지, 지금 실행하려는 터미널 명령이 시스템에 치명적인지를 즉각 판정해야 하기 때문이다. 이때 필요한 답변은 ‘예’와 ‘아니오’, 혹은 서너 개 보기 중 하나에 불과하다.
지금까지는 이런 단순 분기조차 챗GPT(ChatGPT) 같은 대규모 언어모델에 물어왔다. 예와 아니오만 물었는데 장황한 보고서가 돌아오는 격이었다. 오픈소스 판단 모델 SemIf 프로젝트 개발자는 이 방식의 비효율을 꼬집었다.
“에이전트의 판단은 대부분 단순하다. 챗 모델도 답할 수 있지만, 소프트웨어가 곧바로 if 문으로 되돌릴 문장을 작문하느라 귀중한 시간과 연산 자원을 낭비한다.”
— 오픈소스 판단 모델 SemIf 개발자
이 같은 구조적 낭비는 실측 데이터로도 증명된다. 엔비디아(Nvidia) 지포스 RTX 3090 GPU 1장에서 40억 파라미터(4B) 모델로 21개 판단 작업을 처리한 SemIf 벤치마크 실측에 따르면, 결과를 JSON 문장으로 생성할 때는 5.33초가 걸렸지만 선택지 확률을 곧바로 읽어내는 데는 1.02초밖에 걸리지 않았다. 무려 5.21배의 속도 차이다. 복잡한 워크플로우를 수행하는 AI 에이전트가 작업 하나를 끝낼 때마다 이런 if 분기를 수십 번씩 호출한다는 점을 감안하면, 지연시간 차이는 시스템 전체의 병목으로 직결된다.
Jev는 판단을 상품으로 팔았다
타입세이프AI는 바로 이 틈새를 정조준해 지난 9월 15일 Jev의 공식 출시를 알렸다. 문장을 생성하지 않고, 정해진 보기 중 하나를 고르거나 점수를 매긴 뒤 확률값을 붙여 돌려주는 방식이다. 보고서 쓰는 컨설턴트 대신 합격·불합격 도장만 찍는 전문 검수원을 배치한 구조다. 공식 요금표에 따르면 가격은 입력 100만토큰당 0.042달러(약 60원)이며, 토큰을 생성하지 않으므로 출력 요금은 완전 무료다.
확률이 정량적 수치로 떨어진다는 점이 핵심이다. 개발자는 ‘확신도 0.95 이상이면 자동 처리, 그 미만이면 사람 검토자에게 전달’과 같은 업무 규칙을 코드에 직관적으로 설계할 수 있다. 모델이 내놓는 확률의 신뢰성이 높을수록 사람 손을 거치지 않는 무인 자동화 비율이 급증한다. 실제로 노키아 연구진의 실험에 따르면 기성 LLM의 보기 점수를 보정 없이 그대로 썼을 때 오류율 5% 이내에서 자동으로 넘길 수 있는 요청은 7.7%에 그쳤지만, 확률 보정을 거치자 자동화 비율이 52%로 폭증했다. 글로벌 클라우드 플랫폼 버셀(Vercel)의 엔지니어 역시 사내 안전 분류기를 오픈AI 모델에서 Jev로 전환한 뒤 처리 속도가 5~18배 빨라졌다고 테크크런치 인터뷰에서 전했다.
시장의 반응도 즉각적이었다. 오픈소스 프레임워크 랭체인(LangChain)이 Jev 전용 공식 통합 패키지를 배포했고, AI 라우팅 플랫폼 오픈라우터 서비스 목록에도 18일 Jev가 등재됐다. 수요가 폭발하자 타입세이프는 출시 일주일도 채 되지 않아 대기자 명단을 전면 해제하고 일반 공개로 전환했다.
일주일 사이 쏟아진 복제판
복제판은 Jev 공개 이틀 뒤인 17일부터 허깅페이스에 등장하기 시작했다. 허깅페이스 공개 저장소를 전수 집계한 결과, 9월 22일까지 이름에 ‘jev’를 명시한 모델 저장소만 77개, 이를 등록한 개발자 계정은 50개에 달했다. 20일부터는 하루에 22~23개씩 새로운 파생 저장소가 늘어나는 폭발적인 증가세를 보였다. Laya나 Kev처럼 Jev라는 단어를 쓰지 않은 독자 명칭 모델까지 합산하면 실제 파생 모델 수는 이를 훌쩍 뛰어넘는다.
엄밀히 말해 이들은 원본 모델의 소스코드를 가져와 수정한 포크(fork) 프로젝트가 아니다. 타입세이프가 Jev의 가중치나 학습 코드를 일체 공개하지 않아 가져올 소스가 없었기 때문이다. 대신 개발자들은 Jev의 외부 인터페이스와 동작 메커니즘을 관찰해 밑바닥부터 새로 구현하는 방식을 택했다. 실제로 Kev, Decider, Bespoke Nimble 등 주요 프로젝트 개발진은 Jev의 출력 데이터를 인공 학습에 일체 사용하지 않았다고 공식 명시했다.
글로벌 오픈소스 진영에서 급부상한 주요 복제판 8종의 스펙과 구동 방식은 아래 표와 같이 정리된다.
| 모델 | 개발 주체 | 공개일 | 기반 모델·규모 | 동작 메커니즘 | Jev API 호환 | 실행 환경 및 실측 |
|---|---|---|---|---|---|---|
| Laya | 컨바이 이노베이션스(Convai Innovations) | 9월 18일 | ModernBERT-large, 4억2100만 파라미터 | 소형 인코더에 전용 분류 헤드를 부착해 1회 연산으로 즉시 판정 | 호환 서버(laya-serve) | T4 GPU 기준 32.8ms(제작사 실측) |
| Kev | 재러드 파머(Jared Palmer) | 9월 18일 | Qwen3.5 0.8B~9B, Qwen3.8 27B | 로라(LoRA)와 포인터 헤드로 다중 질문을 한 번에 일괄 처리 | 타입세이프 공식 SDK 무수정 100% 연동 | 애플 실리콘(MLX), 엔비디아·AMD GPU |
| Decider | Mapika | 9월 16일 | Qwen3.5 0.8B~35B, 젬마(Gemma) 4 12B·31B | 출력 위치의 보기 글자 로짓을 한 번에 판독 (최대 255개 선택지) | /v1/systemone 전용 호환 서버 제공 | GPU, 맥, CPU(2B 경량판 1.3GB 구동) |
| Bespoke Nimble | 베스포크랩스(Bespoke Labs) | 9월 18일 | Qwen3.5-9B | 정답 토큰 위치에만 로라 미세조정 (학습 데이터 2676건 투입) | 자체 API 규격 | 맥, 엔비디아 GPU |
| Tev1-4B | 투게더AI(Together AI) | 9월 23일 | Qwen3.5-4B | 로라 학습을 거쳐 보기 단일 토큰 출력 | 미지원 | 투게더AI 전용 클라우드 |
| SemIf | 개인 개발자(theoleecj) | 9월 중순 | Qwen3.5-4B 원본 (별도 추가 학습 없음) | 보기 알파벳의 로짓을 가감 없이 그대로 추출 | 호환 레이어 개발 중 | RTX 3090, 로컬 웹브라우저(WebGPU) |
| AnyJev | 노키아 응용연구소 | 9월 23일 | Qwen3 1.7B~32B 원본 (별도 추가 학습 없음) | 보기 순서를 치환해 위치 편향을 제거하고 확률을 보정 | 미공개 | vLLM 추론 서버 |
| Cygnet | 블록브레인(Blockbrain) | 9월 하순 | 젬마 4 12B 원본 (별도 추가 학습 없음) | 보기 로짓 추출 및 보정 알고리즘 적용 | 미공개 | 전용 엔터프라이즈 서버 |
만든 주체는 글로벌 통신 장비 기업 노키아나 AI 클라우드 유니콘 투게더AI 같은 거대 조직부터 주말 동안 깃허브에 코드를 올린 개인 개발자까지 폭넓게 포진했다. 이들의 공통분모는 Jev의 인터페이스 규격, 즉 시스템 상태값과 평가 질의를 전달하면 보기별 확률 벡터를 즉시 반환하는 아키텍처를 철저히 구현했다는 점이다.
Jev는 왜 쉽게 따라 만들 수 있었나
기술의 원리부터 완전히 새로운 것은 아니었다. 거대언어모델은 근본적으로 다음에 올 단어(토큰) 후보마다 정량적 점수를 매기는데, 이 수치를 수학적으로 ‘로짓(logit)’이라고 부른다. 객관식 보기에 A·B·C 라벨을 부여하고 모델이 첫 글자를 내뱉으려는 위치에서 세 알파벳의 로짓 확률만 낚아채면, 긴 문장을 한 글자도 생성하지 않고 순식간에 판단값을 도출할 수 있다. 객관식 시험지를 풀기 전, 학생의 연필 끝이 어느 번호 위에서 멈칫거리는지 확률로 들여다보는 원리와 같다.
실제로 Laya를 개발한 컨바이 이노베이션스 창업자는 동일한 아키텍처를 다룬 선행 연구 논문을 2025년 3월 이미 아카이브(arXiv)에 공개했다고 밝혔다. 그는 개발자 블로그 기고를 통해 타입세이프가 기술 백서나 오픈 가중치, 공개 데이터셋도 전혀 제공하지 않은 채 독점 서비스로 포장했다고 지적하며 Laya의 소스코드를 전면 공개했다. 전 세계 개발자들이 Jev를 모방하며 취한 경로는 크게 세 갈래로 나뉜다.
| 구현 방식 | 동작 원리 및 특성 | 대표 모델 |
|---|---|---|
| 전용 인코더 결합 | 문장 임베딩에 특화된 소형 모델(BERT 계열)에 분류 장치를 직접 결합. 처리 속도가 가장 빠르지만 모델이 사전에 학습한 배경 지식 풀이 협소함 | Laya |
| LLM 기반 미세조정 | 기성 LLM 본체는 동결하고 선택지 판독용 파라미터(LoRA)만 덧대어 학습. 풍부한 언어 이해력에 정확한 로짓 보정 능력을 결합 | Kev, Decider, Bespoke Nimble, Tev1 |
| 무학습 로짓 직독 | 추가 학습 없이 오픈소스 LLM의 마지막 레이어 로짓을 그대로 추출한 뒤 순서 편향 보정만 적용. 모델 본체의 지능을 온전히 활용 | SemIf, AnyJev, Cygnet |
가장 파격적인 결과를 낸 곳은 세 번째 유형인 무학습 판독 진영이다. 판단 모델 성능 평가를 전문 집계하는 JevBench 라이브 보드에서 9월 29일 기준 1위는 73.7점을 기록한 Cygnet이었다. 반면 원본인 Jev 1.13.0은 72.1점으로 3위로 밀려났다. 오픈소스 JevBench 저장소에 따르면 Cygnet은 구글의 오픈 모델 젬마 4 12B를 추가 파인튜닝 없이 원형 그대로 얹고 판독 알고리즘만 장착한 모델이다. 단 한 푼의 학습 비용도 들이지 않은 기성 모델이 상용 독점 모델의 종합 점수를 넘어선 것이다.
인터페이스 규격 또한 사전에 열려 있었다. 타입세이프는 Jev 출시 엿새 전인 9월 9일 패키지 관리자를 통해 공식 파이썬 SDK 배포를 단행했다. 이어 공개 당일에는 동일한 질문 형식을 오픈AI나 앤트로픽 모델로 우회 호출할 수 있는 오픈소스 도구를 MIT 라이선스로 배포했다. Jev와 기성 LLM의 성능을 벤치마크하도록 돕겠다는 의도였지만, 결과적으로 외부 개발자들에게 완벽한 규격 청사진을 쥐여준 셈이 됐다. 실제로 Kev는 자사 서버가 타입세이프 SDK와 코드 수정 없이 100% 연동되며, 확신도 계산 로직 역시 이 공식 어댑터 코드에서 추출했다고 밝혔다.
비공개였던 내부 아키텍처 역시 빠르게 베일을 벗었다. 시스템 엔지니어 아처 흄(Archer Hume)은 Jev API를 1만회 이상 질의하고 192종의 오픈 토크나이저와 대조 분석한 역공학 리포트를 공개했고, Kev 개발진은 이 분석을 설계 토대로 삼았다. 제작 단가 역시 파격적으로 저렴했다. Kev-4B 개발 문서에 따르면 H100 GPU에서 로라 미세조정을 1회 완주하는 비용은 약 1달러(약 1500원)에 불과했으며, 자율 코딩 에이전트 데빈(Devin)을 투입해 순식간에 코드를 완성했다. Decider 프로젝트 이력은 공개 사흘 만에 열 번째 패치를 내놓았고, 투게더AI 공식 기술 블로그는 클라우드에서 단돈 17달러(약 2만5000원)로 자체 판단 모델을 만드는 튜토리얼을 공개했다. Nimble 프로젝트 문서는 단 하루 만에 제작했기에 다소 거친 구석이 있을 수 있다고 명시했을 만큼 진입 장벽이 낮았다.
내 방식대로 쓰고 싶은 사람들
개발자들이 오픈소스를 만든 동기는 단순히 비용을 아끼기 위함이 아니었다. Jev의 이용 요금은 이미 극단적으로 저렴해서, 중소 규모 워크로드에서는 오히려 자체 인프라를 띄우는 편이 비용이 더 든다. 예컨대 Kev 배포 가이드에 명시된 대로 L40S GPU 서버를 임차하면 시간당 1.95달러(약 2900원)가 소요되는데, 이 금액이면 공식 Jev API로 4640만토큰을 처리할 수 있다. 한 달에 1억토큰을 소화하는 기업이라도 Jev API 청구액은 4.2달러(약 6200원)에 불과하다. GPU를 24시간 내내 빈틈없이 풀가동하지 않는 한 클라우드 임차 비용이 상용 API 요금을 훌쩍 웃도는 구조다.
개발 진영이 갈망한 것은 완벽한 시스템 통제권이었다. 상용 Jev 서비스는 모든 기업 고객에게 획일화된 단일 모델만을 강제한다. 고객사 데이터셋을 활용한 추가 미세조정(파인튜닝)이나 어댑터 부착을 원천 불허하며, 입력 형식 역시 순수 텍스트로만 제한된다. 다국어 지원에 있어서도 영어가 아닌 언어에서는 정확도가 떨어진다. 규제 준수나 보안 정책상 사내 폐쇄망에 모델을 구축해야 하는 기업에게도 중앙화된 클라우드 API는 치명적인 걸림돌이었다. 식당의 단일 메뉴가 입맛에 맞지 않자, 요리사들이 각자의 주방에서 레시피를 입맛대로 개조하기 시작한 형국이다.
오픈소스 파생판은 이 빈틈을 정밀하게 파고들었다. Decider 2B 경량판(1.3GB)은 고가의 GPU 없이 일반 서버 CPU 8스레드 환경에서도 요청당 0.12~0.31초 만에 판정을 마친다. SemIf 브라우저 실행판은 WebGPU 가속을 통해 클라우드 서버와의 통신 없이 이용자의 로컬 웹브라우저 메모리 안에서 단독 구동된다. 77개 저장소를 전수 분류하면, 독자적 기반 모델을 채택한 범용 복제판이 41개로 절반 이상을 차지했다. 이어 맥 스튜디오(MLX)나 온디바이스(GGUF) 환경에 맞춘 최적화 저장소가 18개, 법률·의료 등 도메인 특화 모델이 12개, 멀티모달 비전 지원이 5개, 일본어·태국어 등 비영어권 특화 모델이 4개로 뒤를 이었다. 실제로 일본 개발자의 브라우저 자동화 실측기에 따르면, Laya를 브라우저 클릭 특화 데이터로 재학습시키자 웹 UI 요소를 정확히 짚어내는 판정 성공률이 기존 10%에서 66%로 6배 이상 수직 상승했다.
그러면 Jev는 따라잡혔나
단순 종합 점수만 보면 오픈소스가 독점 상용 모델을 추월한 것처럼 보이지만, 벤치마크 항목을 정밀 분해하면 이야기가 달라진다. JevBench 평가는 지능, 확률 보정 신뢰도, 추론 속도, 비용 등 네 가지 축에 동일한 가중치를 부여해 합산한다. 오픈 모델은 자체 인프라에서 구동되므로 속도와 비용 부문에서 만점에 가까운 점수를 쓸어 담을 수 있다. 이에 대해 JevBench 분석 리포트는 앞선 버전 비교에서 Jev 1.13.0이 복제판(decider-4b v2)을 상대로 순수 추론 지능(53.1대 49.4)과 확률 보정 신뢰도에서 앞선 반면, 복제판은 인프라 기반의 속도와 비용 점수 덕분에 격차를 좁혔다고 명시했다.
도메인 지식과 복합 추론으로 들어가면 격차는 한층 뚜렷해진다. 70개 모델을 43개 테스트셋으로 검증한 Decision Index 벤치마크에 따르면 Jev는 57.91점으로 오픈소스 1위(57.44점)를 근소하게 앞섰다. 그러나 세부 과목을 뜯어보면, 단순 언어 판별이나 툴 호출 영역에서는 두 진영의 점수 차가 0.01에 불과했던 반면 심층 지식을 묻는 고난도 문제에서는 Jev가 0.69, 오픈 복제판 1위(decider-35b)가 0.51로 큰 격차를 드러냈다.
오픈소스 개발진 스스로 측정한 자체 검증 데이터 역시 동일한 현실을 증언한다. Nimble 자체 평가 결과에 따르면 324건의 난제 테스트에서 Nimble의 정답률은 90.1%로 Jev의 93.2%를 넘지 못했다. SemIf 자체 검증 데이터에서도 타입세이프 표준 평가셋 기준 점수가 0.845에 머물러 Jev(0.883)에 미치지 못했다. Kev 개발진 보고서 역시 공식 평가 문항에서 Kev가 원본 Jev보다 뒤처져 있음을 인정했다. 겉모습과 API 규격을 베끼는 일은 단 하루 만에 가능했지만, 난해한 예외 상황과 복합 지식 추론에서 오답을 내지 않는 고밀도 지능까지 단숨에 따라잡을 수는 없었다는 방증이다.
판단은 부품이 됐다
이번 복제 열풍이 남긴 가장 결정적인 유산은 ‘판단 계층의 인터페이스 표준화’다. Kev, Decider, SemIf 등 주요 프로젝트가 Jev와 동일한 ‘/v1/systemone’ 엔드포인트와 입출력 JSON 규격을 전면 채택하면서, 소프트웨어 엔지니어는 소스코드 단 한 줄만 수정하면 타입세이프의 상용 클라우드와 로컬 오픈소스를 손쉽게 오갈 수 있게 됐다. 특정 독점 기업에 종속되지 않는 대체 경로가 열린 것이다.
판단 모델의 껍데기가 누구나 갈아 끼울 수 있는 범용 규격 부품으로 전락하면서, 원조인 타입세이프에 남은 실질적 해자는 독점적인 고품질 학습 데이터로 압축된다. 디오고 알메이다(Diogo Almeida) 타입세이프 최고경영자(CEO)가 소크라틱 인터뷰에서 자사를 ‘모델 개발사’가 아닌 ‘정제 데이터 연구소’로 규정한 이유도 여기에 있다. 타입세이프는 봇물 터지듯 쏟아진 오픈소스 파생판에 대해 공식 침묵을 유지하고 있지만, 인터페이스는 공유재가 되고 지능의 밀도만이 생존을 가르는 본격적인 데이터 경쟁이 막을 올렸다.