드워프스타 4(DwarfStar 4·DS4)가 매개변수 2840억개 규모의 딥시크 V4 플래시(DeepSeek V4 Flash) 등 대형 오픈 웨이트 모델을 고메모리 컴퓨터에서 구동하는 추론 엔진으로 공개됐다. DS4 프로젝트는 10월 3일 공식 홈페이지에서 지원 모델과 성능 자료, 설치 방법을 소개했다.
DS4가 지원하는 모델과 하드웨어
DS4는 C로 작성된 추론 엔진으로, 고메모리 맥과 CUDA·ROCm 환경에서 실행하도록 설계됐다. 지원 모델은 딥시크 V4와 V4.1 플래시, GLM 5.x, 큐웬(Qwen) 3.8 플래시 넥스트다. 텍스트와 비전 모델을 지원하며, 모델 파일은 프로젝트에 맞춘 GGUF 형식을 사용한다. 홈페이지는 범용 GGUF 실행기가 아니라 일부 모델 계열을 대상으로 레이아웃을 검증한 엔진이라고 설명했다.
핵심 기법은 비대칭 2비트 양자화다. 모델의 전문가 혼합(MoE) 구조에서 선택적으로 호출되는 전문가 부분을 압축하고, 공유 경로 등 중요한 부분은 정밀도를 유지해 메모리 사용량을 줄이는 방식이다. 장문의 입력을 처리할 때는 KV 캐시의 긴 프리픽스를 SSD에 저장하고 프롬프트 해시를 기준으로 불러올 수 있어, 재시작 뒤 전체 입력을 다시 처리하는 부담을 줄이도록 했다. 명령줄 인터페이스와 로컬 HTTP API 서버, 지속형 에이전트가 하나의 모델 상태와 캐시를 공유한다.
로컬 코딩 에이전트 연결도 지원
DS4 서버는 오픈AI(OpenAI) 및 앤트로픽(Anthropic) 방식의 API를 지원한다. 이에 따라 코덱스(Codex), 클로드 코드(Claude Code), 오픈코드(OpenCode) 같은 코딩 에이전트에서 로컬 서버 주소를 지정해 사용할 수 있다고 프로젝트는 안내했다. 모델 추론을 자체 장비에서 실행하고 편집기나 API 클라이언트와 연결하는 구성이다. 다만 페이지는 고객사 도입 사례나 경쟁 제품과의 비교 자료를 제시하지 않았다.
하드웨어 안내에 따르면 128GB 메모리 환경에서는 딥시크 V4 플래시 Q2가 기본 구동 경로이며, GLM 5.3 Q2와 큐웬 Q4도 실행할 수 있다. 딥시크 V4.1 Q2는 SSD 스트리밍 방식으로 구동한다. 공개된 기준 성능표에서 M5 맥스 128GB는 2048토큰 문맥의 프리필 790.2토큰/초, 생성 39.4토큰/초를 기록했다. 문맥 길이가 6만5536토큰일 때는 프리필 398.5토큰/초, 생성 27.6토큰/초다.
DGX 스파크 128GB의 성능표는 2048토큰 문맥에서 프리필 825.8토큰/초, 생성 18.1토큰/초로 제시됐다. 6만5536토큰 문맥에서는 각각 823토큰/초와 13.8토큰/초다. 프로젝트는 프리필과 생성 속도를 구분해 참고하라고 안내했다. 설치는 저장소를 내려받아 모델을 받고 하드웨어에 맞게 빌드한 뒤 CLI나 서버를 실행하는 순서다. 홈페이지에는 가격이나 별도 출시 일정은 제시되지 않았다.