이터레이트AI, AI 에이전트 세션 최대 6배 늘리는 추론 엔진 출시

이터레이트AI(Iterate.ai)가 GPU 한 장에서 실행할 수 있는 AI 에이전트 세션을 최대 6배 늘리는 추론 엔진 ‘라이프보트(Lifeboat)’를 출시했다. IT 전문 매체 실리콘앵글은 10월 5일 이터레이트AI가 이런 성능을 내세웠다고 보도했다.

GPU 한 장에서 2048개 세션 처리

라이프보트는 대규모 언어모델 추론에 기밀 컴퓨팅 기능을 결합한 엔진이다. 이터레이트AI는 자체 시험에서 엔비디아(Nvidia) RTX PRO 6000 블랙웰 GPU 한 장에 큐웬(Qwen) 30B-A3B 모델을 올려 동시 세션 2048개를 처리했고, 모든 요청이 완료됐다고 밝혔다. 최적화를 끈 같은 엔진은 절반 수준의 세션만 처리했다. 토큰 처리량도 최적화 적용 시 초당 8714토큰으로, 미적용 상태의 4965토큰보다 높았다.

에이전트는 한 작업을 수행하면서 모델을 여러 차례 호출하고, 호출이 이어질수록 문맥 정보도 쌓는다. 이 정보는 키-값 캐시에 저장되기 때문에 에이전트가 늘면 메모리 부담이 커진다. 회사는 일반 추론 엔진에서 긴 문맥 요청 4~5개가 동시에 돌아가면 처리가 정체될 수 있다고 설명했다. 라이프보트는 세션별 GPU 자원을 배분하는 공정 스케줄링과 실행 허용량 제어를 적용해, 문서 처리 작업이 대화형 요청의 자원을 독차지하지 않도록 한다. 키-값 캐시 최적화로 실효 용량도 두 배로 늘리되 모델 가중치는 전 정밀도로 유지한다는 게 회사 설명이다.

메모리 부담 줄이고 데이터 보호

메모리 압박을 시험한 조건에서는 세션 128개가 각각 1만8000토큰 요청을 보냈다. 이때 라이프보트의 첫 토큰 생성 시간은 99백분위 기준 1.5초였고, 최적화를 적용하지 않은 엔진은 189초가 걸렸다. 혼합 전문가 모델에서는 각 에이전트가 필요로 하는 전문가만 불러오도록 설계했다. 모든 세션은 별도 보안 캡슐에서 실행되며, 입력 필터링과 토큰 사용량 제한, 샌드박스 실행 기능이 적용된다.

기밀 컴퓨팅 에디션은 하드웨어 검증을 통과하기 전에는 요청을 처리하지 않는다. 검증 대상에는 어드밴스드 마이크로 디바이시스(AMD)와 인텔(Intel) 프로세서의 신뢰 실행 기능, 엔비디아 H100·B200·GB300 등 지원 GPU의 기밀 컴퓨팅 모드가 포함된다. 모델 가중치는 신뢰 실행 환경 안에 봉인돼 사용 중에도 암호화 상태를 유지한다. 클라우드의 기밀 가상머신이나 고객 소유 하드웨어에서 모두 구동할 수 있다.

이터레이트AI 공동창업자 겸 최고기술책임자 브라이언 사티아나탄은 은행·보험사·의료기관이 GPU 비용을 두 배로 늘리지 않고 자체 데이터로 에이전트를 운영하려 한다고 말했다. 공동창업자 겸 최고경영자 존 노드마크는 기업이 GPU를 추가 구매하기 전에 기존 장비의 활용도를 확인해야 한다고 강조했다. 회사는 GPU 한 장당 동시 세션을 두 배로 늘리면 데이터센터나 네오클라우드가 랙과 전력을 추가하지 않고도 처리 용량을 확보할 수 있다고 주장했다.

라이프보트는 현재 일반 제공 중이며, 회사는 얼리액세스 기간에 며칠 만에 다운로드 수천 건을 기록했다고 밝혔다. 비상업·평가용 개발자 라이선스는 단일 노드에서 추론 서버 최대 2대까지 무료로 쓸 수 있다. 전문 지원을 포함한 스탠더드 라이선스는 월 49.99달러이며, 하드웨어 검증 기능이 들어간 기밀 컴퓨팅 에디션은 월 499.99달러다. 두 유료 상품은 신용카드 없이 7일간 무료로 이용할 수 있다.

RELATED ARTICLES