Xiaomi MiMo 1T 모델 1000tps 주장, LocalLLaMA가 본 진짜 쟁점
LocalLLaMA의 관심은 속도 숫자보다 FP4, DFlash speculative decoding, commodity GPU 조합이 실제로 어디까지 재현될 수 있느냐에 모였다.
원문: Xiaomi is now serving MiMo V2.5 at 1000-3000tps using DFlash & Persistent kernel. DFLash model is out, open-source release promised coming soon 원문 보기 →
Xiaomi MiMo-V2.5-Pro-UltraSpeed가 1T parameter 모델에서 1000 tokens/s 이상을 냈다는 주장이 LocalLLaMA에서 빠르게 공유됐다. 표면의 숫자는 화려하지만, 커뮤니티가 파고든 부분은 “빠르다”보다 “어떤 조건에서, 어떤 구조로 가능했나”에 가깝다.
Xiaomi 글은 TileRT와의 model-system codesign을 강조한다. 회사는 전용 하드웨어 대신 단일 표준 8-GPU commodity node에서 1000+ tokens/s를 달성했다고 설명한다. 핵심 재료는 MoE expert에 선택적으로 적용한 FP4 quantization, 그리고 block-level masked parallel prediction을 쓰는 DFlash speculative decoding이다.
FP4는 1T 규모 모델의 메모리 대역폭 병목을 줄이기 위한 선택이다. Xiaomi는 모든 부분을 낮은 정밀도로 밀어 넣지 않고, MoE expert처럼 양자화 내성이 큰 부분을 중심으로 줄였다고 설명한다. DFlash는 작은 draft model이 토큰을 순차적으로 맞히는 방식의 speculative decoding 한계를 줄이려는 접근으로 소개된다.
LocalLLaMA의 자연스러운 질문은 재현성이다. API는 6월 9일부터 6월 23일까지 신청 기반 시험 접근으로 운영되고, 고속 inference 자원이 제한돼 있다. Reddit 게시물도 DFlash 모델 공개와 향후 open-source release 약속을 함께 언급했다. 실제 평가가 가능하려면 코드, 커널, 모델 가중치, 측정 조건이 함께 열려야 한다.
그래도 이 흐름은 중요하다. local LLM 커뮤니티가 관심을 두는 병목은 모델 크기만이 아니라 latency, throughput, long-context 비용이다. 1T 모델을 실시간 루프에 넣을 수 있다는 주장이 검증된다면, agent와 coding workflow의 설계도 달라질 수 있다.
원문: Xiaomi MiMo blog. Reddit 토론: r/LocalLLaMA.
관련 기사
Qwen 3.6 27B + MTP로 로컬 추론 속도 2.5배 향상, 48GB에서 262k 컨텍스트
llama.cpp의 새 MTP 지원 PR을 활용해 Qwen 3.6 27B의 추론 속도를 2.5배 높이는 방법이 공유됐다. 48GB 메모리에서 262,000 토큰 컨텍스트로 로컬 에이전틱 코딩이 가능해졌다.
vLLM speculative decoding, AMD GPU서 최대 2.87배…길게 예측한다고 빠를까
초안 토큰을 많이 뽑는 것보다 실제 작업에서 얼마나 받아들여지는지가 속도를 갈랐다. vLLM이 AMD MI300X·MI355X에서 다섯 방식을 비교한 결과 최대 2.87배를 기록했지만, 모델·업무·제안 길이에 따라 기준선 아래로 내려간 조합도 있었다.
Qwen3.8-27B, 27B 로컬 모델의 성능보다 먼저 나온 질문 ‘왜 이렇게 오래 생각하나’
27B 모델이 노트북에서도 까다로운 추론과 코딩을 해냈다는 경험담이 이어졌지만, 관심은 곧 긴 추론 시간과 VRAM 비용으로 옮겨갔다. Qwen3.8-27B의 진짜 시험대는 벤치마크보다 reasoning_effort를 어떻게 다루느냐에 가깝다.