에어일엘엠, 단일 4GB GPU로 70B급 AirLLM 실행 주장

깃허브(github.com)에 올라온 오픈소스 프로젝트 ‘에어일엘엠(AirLLM)’이 양자화·증류·가지치기 없이 70B급 대규모 언어모델을 단일 4GB GPU에서 실행할 수 있다고 소개했다. 프로젝트는 희소(MoE) 모델이 토큰이 라우팅하는 ‘전문가(expert)’만 스트리밍해 한 번에 전체 레이어를 올리지 않아 추론 시 필요한 VRAM이 모델 전체 크기보다 레이어 크기에 좌우된다고 설명했다. 또 8GB GPU에서 405B급 ‘라마(Llama) 3.1’ 구동, 12GB 안팎에서 딥시크(DeepSeek) V3(671B), 4GB 미만에서 키미(Kimi) K3(2.8T) 구동 예도 제시했다. 키미(K3) 지원 기록에는 단일 RTX 6000 Ada 1대에서 전체 엔드투엔드로 VRAM 3.72GB가 측정됐다고 적었다.

원문 보기 (github.com)

RELATED ARTICLES