샤오미, 최고 성능 공개 AI 모델 출시했지만 클로드 활용 의혹

샤오미가 공개 제공 인공지능(AI) 모델 가운데 가장 높은 성능을 기록한 MiMo-V2.6 제품군을 출시했다. IT 전문 매체 더디코더는 9월 22일 샤오미의 신제품이 저렴한 비용과 대규모 강화학습을 앞세웠지만 앤트로픽의 클로드를 활용했다는 의혹도 받고 있다고 보도했다.

MiMo-V2.6, 성능·비용 모두 앞세워

샤오미의 상위 모델 MiMo-V2.6-Pro는 분석업체 아티피셜 애널리시스(Artificial Analysis)의 인텔리전스 지수(Intelligence Index)에서 46점을 기록했다. 이는 공개 제공 모델 중 가장 높은 점수로, 키미 K3(Kimi K3)와 큐웬(Qwen) 등 경쟁 모델을 앞선 결과다. 입력 토큰 100만개당 0.435달러, 출력 토큰 100만개당 0.87달러로 책정돼 비슷한 성능의 모델보다 이용 비용도 낮다.

아티피셜 애널리시스의 계산에 따르면 단일 테스트 작업 비용은 약 0.13달러다. MiMo-V2.6-Pro는 1조200억개 파라미터를 갖춘 전문가 혼합형 모델이며, 요청 한 건을 처리할 때 실제로 활성화되는 파라미터는 420억개다. 함께 출시된 소형 모델 MiMo-V2.6-Flash는 효율성에 초점을 맞췄다. 샤오미는 성능 향상의 배경으로 시행착오와 보상에 따라 모델을 학습시키는 강화학습 규모를 확대했다고 설명했다.

강화학습은 학습 단계마다 사용하는 데이터량, 과제 환경의 다양성, 해답을 평가하는 데 투입하는 연산량을 늘리는 세 축으로 확장됐다. 샤오미에 따르면 학습에는 6일이 채 걸리지 않았고, 비용은 프로 모델 약 262만달러, 플래시 모델 약 85만달러였다. 코딩 평가인 딥SWE(DeepSWE)에서 프로 모델 점수는 58.4점에서 72.6점으로, 플래시는 48.8점에서 65.7점으로 상승했다. 대규모 학습의 안정성을 위해 모델의 내부 분포 메커니즘을 고정하고, 보상만 속이는 이른바 보상 해킹을 막는 보호 장치도 적용했다.

개방 전략과 클로드 데이터 활용 의혹

샤오미는 출력 속도를 최대 20배 높인 Pro-UltraSpeed 버전과 함께 강화학습 도구도 공개했다. 기술 보고서와 전체 학습 프레임워크, 추가 학습에 사용할 수 있는 소형 모델, 소프트웨어 개발·사이버보안·사무 업무·웹 디자인용 과제 약 7000개와 자동 채점기를 제공한다. 음악 작곡용 과제도 약 1000개 포함됐다. 일부 코드는 직원들의 실제 깃허브(GitHub) 풀 리퀘스트와 이용자 질의에서 나왔고, 사이버보안 과제에는 실제 소프트웨어 취약점 모음인 OSS-Fuzz가 활용됐다.

다만 앤트로픽(Anthropic)은 앞서 발표한 위협 인텔리전스 보고서에서 샤오미를 클로드 능력의 불법 증류에 관여한 중국 연구소 7곳 중 하나로 지목했다. 앤트로픽은 2025년 12월부터 2026년 8월까지 알리바바(Alibaba), 문샷AI(Moonshot), 딥시크(DeepSeek), 지푸(Zhipu), 샤오미, 미니맥스, 센스타임과 연계된 활동에서 약 1억9000만건의 대화가 자사 모델의 능력을 빼내는 데 사용됐다고 주장했다. 샤오미와 관련된 사례에서는 2026년 3∼4월 20일 동안 40만건이 넘는 교환이 오픈클로(OpenClaw)와 오픈코드를 거쳐 클로드로 전달됐다고 설명했다. 보고서는 샤오미가 MiMo 모델의 이용자 대화와 코딩 세션을 미래 모델 학습 데이터로 활용하려 했다고 주장했지만, 내부 증류에 사용된 초기 학습 데이터와 교사 모델의 출처에 대해서는 구체적인 자료를 거의 제시하지 않았다.

RELATED ARTICLES