바스트(Vast) 공동창업자 겸 최고기술책임자(CTO) 알론 호레브(Alon Horev)는 AI 에이전트의 긴 작업 세션에서 생기는 메모리 부담을 저장장치로 분산해 줄일 수 있다고 말했다. IT 전문 매체 실리콘앵글은 호레브가 ‘풀리 커넥티드 2026’ 행사 인터뷰에서 에이전트 메모리와 추론 과정의 병목을 설명했다고 7일 보도했다.
GPU 메모리부터 페타바이트 저장장치까지
호레브는 에이전트 메모리가 한 번의 대화에서 쓰는 정보에 그치지 않는다고 설명했다. 과거 대화와 상호작용을 저장해 다음 세션에서 참고하는 장기 기억도 필요하다는 것이다. 그는 에이전트가 오래 실행될수록 대화 맥락을 계속 보존하고 필요할 때 불러와야 해 메모리 용량뿐 아니라 데이터 이동 부담도 커진다고 말했다.
추론 과정에서는 각 세션의 키값(KV) 캐시가 그래픽처리장치(GPU) 메모리를 차지한다. 호레브에 따르면 토큰 50만개 규모의 세션 하나가 GPU 메모리의 10분의 1에서 20분의 1가량을 사용할 수 있다. 에이전트가 코드를 컴파일하거나 소프트웨어를 시험하는 동안에는 대규모언어모델(LLM)과의 대화가 잠시 멈출 수 있는데, 세션 정보를 저장장치로 옮겨두면 작업을 재개할 때 앞선 내용을 다시 계산하는 부담을 피할 수 있다는 설명이다.
바스트의 계층형 구성은 GPU 메모리를 먼저 쓰고, 이어 같은 서버의 중앙처리장치(CPU) 메모리, 페타바이트 규모의 KV 캐시를 보관할 수 있는 영구 저장장치를 활용하는 방식이다. 엔비디아(Nvidia)의 다이너모(Dynamo) 소프트웨어가 이 과정을 조율한다. 호레브는 바쁜 GPU에서 여유 있는 GPU로 세션을 옮길 수 있고, KV 캐시도 네트워크를 통해 전달하거나 바스트 저장장치에서 읽어올 수 있다고 설명했다. 여러 서버에 걸쳐 GPU·CPU 메모리와 저장장치를 함께 쓰면 세션 배치 선택지가 늘고 작업을 더 효율적으로 조정할 수 있다는 것이다.
기업 에이전트의 기록·보안 부담
호레브는 기업이 수천 개의 에이전트를 도입해 민감한 데이터를 다루고 고객을 대신해 행동할 경우, 에이전트의 활동을 기록하고 정해진 기간 보관해야 한다고 말했다. 따라서 에이전트 메모리는 추론 성능을 위한 자원인 동시에 관리·감독을 위한 기록 자산이라는 설명이다. 바스트는 민감한 작업을 위한 기밀 컴퓨팅 서비스도 출시했다.
에이전트가 나눈 대화에는 파인튜닝(fine-tuning)이나 학습에 활용하거나 특정 목적에 맞춘 모델을 만드는 데 쓸 수 있는 정보가 담길 수 있다고 호레브는 말했다. 인터뷰에서는 KV 캐시를 저장장치로 옮기는 방안과 데이터 이동이 다음 병목이 될 가능성도 다뤄졌다. 기사에는 계층형 저장장치의 구체적인 제품 사양이나 가격, 추가 출시 일정은 제시되지 않았다.