클라우드플레어, AI 에이전트용 판단 모델 두 종 출시

클라우드플레어(Cloudflare)가 AI 에이전트용 판단 모델 ‘클레프(Clef)’와 ‘클레프 플래시(Clef-flash)’를 출시했다. IT 전문 매체 더디코더는 10월 3일 두 모델이 경쟁 모델보다 빠르며, 고객이 자체 업무에 맞게 조정할 수 있는 강화학습 서비스도 함께 선보였다고 보도했다.

43개 벤치마크서 속도 비교

클라우드플레어에 따르면 두 모델은 43개 벤치마크에서 관련 판단 모델보다 빠른 결과를 냈다. 중앙값 기준 응답 지연 시간은 클레프 플래시가 약 39밀리초, 클레프가 약 209밀리초였다. 타입세이프AI(TypeSafe AI)의 경쟁 모델 제브(Jev)는 524밀리초를 조금 넘겼다. 클라우드플레어는 두 모델을 자사 인프라에서 운영하며, 엣지 데이터센터와 가까운 점도 처리 속도에 도움이 된다고 설명했다.

판단 모델은 긴 문장으로 답하는 대신 분류 결과와 확률을 간략히 내놓는다. 고객 지원 메시지의 긴급도를 평가하고 담당 팀을 지정하면, 후속 프로그램이 문의를 배정하거나 상위 단계로 넘기고 필요할 경우 사람에게 전달할 수 있다. 클라우드플레어 위협 인텔리전스팀은 웹사이트 분류에 클레프를 시험하고 있다. 한 사례에서 도메인이 패션 웹사이트일 확률은 95%, 온라인 상점일 확률은 85%로 나왔고, 피싱 사이트일 확률은 1% 미만이었다. 사이트를 불러오고 화면을 렌더링한 뒤 분류하기까지 2.2초가 걸렸다. 같은 작업에 회사의 가장 빠른 범용 언어 모델은 4.7초가 걸렸고 분류 항목 두 개만 반환했다.

언어 모델과 분류기 사이 겨냥

클라우드플레어는 클레프가 대형 언어 모델과 기존 분류기 사이의 영역을 겨냥한다고 밝혔다. 언어 모델은 추론과 도구 호출이 가능하지만 결과가 일정하지 않고 느릴 수 있으며, 기존 분류기는 빠른 대신 새 범주마다 다시 학습해야 한다는 설명이다. 클라우드플레어에 따르면 클레프는 이미지도 처리하며, 문맥 창은 6만4000토큰으로 제브의 두 배다. 회사 자체 벤치마크의 제브 의사결정 지수에서도 클레프가 앞섰다고 주장했다.

클레프는 큐웬3.8-27B(Qwen3.8-27B), 클레프 플래시는 더 작은 큐웬3.5-9B(Qwen3.5-9B)를 기반으로 한다. 클라우드플레어는 학습 과정에서 기반 모델 자체는 바꾸지 않고, 자체 합성 데이터로 추가 구성 요소를 학습시켜 선택지와 확률을 산출한다고 설명했다. 타입세이프AI가 제브 학습에 활용한 강화학습 기반 보정 의사결정(RLCD) 방식의 자체 변형도 적용했다. 이 방식은 한 번의 호출로 입력에 관한 여러 질문에 답하게 해, 제시하는 확률이 실제 정답률에 가까워지도록 훈련한다.

클라우드플레어는 에이전트의 판단 과정에서 사람이 항상 개입할 필요는 없도록 하는 것이 목표라고 밝혔다. 에이전트가 맥락을 모으고 판단한 뒤 작업을 수행하거나, 필요한 경우 사람에게 넘길 수 있다는 설명이다. 회사는 클레프를 내부적으로 악용 신고 검토와 지원 요청 분류, 유용한 봇과 유해한 봇 구분에 활용할 계획이며, 위협 인텔리전스팀은 이미 웹사이트 분류를 시험 중이다. 두 모델은 워커스 AI(Workers AI)에서 운영되고 허깅페이스(Hugging Face)에 아파치-2.0(Apache-2.0) 라이선스로 공개됐다.

함께 발표한 강화학습 서비스는 고객이 각자 업무에 맞춰 클레프를 조정할 수 있도록 지원한다. 초기에는 고객과 함께 일하는 엔지니어팀이 파인튜닝을 맡고, 이후 고객이 직접 이용하는 플랫폼을 제공할 예정이다. 고객은 AI 게이트웨이(AI Gateway)에 요청을 기록해 데이터셋을 만들고, 강화학습용 샌드박스 컨테이너에서 요청 결과를 평가한 뒤 트레이너 구성 요소를 통해 조정한 모델을 워커스 AI에 배포할 수 있다. 더디코더는 클레프가 타입세이프AI의 제브와 같은 판단 모델 시장을 겨냥했다고 전했다. 오픈AI(OpenAI)도 GPT-6 기반 루나(Luna)를 활용한 디시전스 API를 내놨지만, 제브가 미리 정한 답변 선택지 안에서만 응답한다는 점이 오류를 막아 주는 것은 아니다.

RELATED ARTICLES