Quantized Gemma 4 31B, 메모리 절반으로 tokens/sec를 거의 두 배 끌어올리다
Quantization 얘기는 accuracy가 버티지 못하면 곧바로 무너진다. Red Hat AI는 quantized Gemma 4 31B가 메모리를 절반으로 줄이면서 tokens/sec를 거의 2배로 높이고, baseline accuracy의 99%+를 유지한다고 적었다.
원문: What compression looks like on @vllm_project. Same Gemma 4 31B. Red Hat AI's quantized version runs at nearly 2x tokens/sec, half the memory, 99%+ accuracy retained. Open source. Quantized with LLM Compressor. Links in comments. @_soyr_ for the 2-minute demo. 원문 보기 →
트윗이 내놓은 숫자
Quantization은 숫자만 화려하고 실제 서비스에서는 미묘한 품질 손실로 무너지는 경우가 많다. 그래서 Red Hat AI가 2026년 4월 13일 X에 올린 요약은 단순하지만 강하다.
“nearly 2x tokens/sec, half the memory, 99%+ accuracy retained.”
비교 대상도 명확하다. 같은 Gemma 4 31B를 두고 quantized variant가 tokens/sec를 거의 2배로 끌어올리고, 메모리는 절반으로 줄이며, 정확도는 99%+를 유지했다는 주장이다. 이 수치가 흔한 inference setup에서도 재현된다면 31B급 open model을 어떤 hardware tier에서 돌릴 수 있는지, 그리고 batching과 latency budget을 어디까지 밀 수 있는지가 달라진다.
왜 open-source 문맥이 중요한가
Red Hat AI 계정은 consumer teaser보다 open model serving, quantization, vLLM ecosystem 관련 실무 신호를 많이 올린다. 이번 post도 그 연장선에 있지만, 단순한 “더 빨라졌다”가 아니라는 점이 핵심이다. 댓글에는 LLM Compressor repo와 여러 Gemma 4 quantized checkpoint가 직접 연결돼 있다. GitHub 설명에 따르면 LLM Compressor는 vllm 배포 최적화를 위한 library로, weight-only 및 activation quantization, Hugging Face integration, safetensors 기반 포맷 호환성을 제공한다.
후속 reply는 근거를 더 보탠다. Red Hat AI는 팀이 quantized models에 대해 500,000 evals를 수행했고, 결과를 “Give Me BF16 or Give Me Death?” 논문과 연결했다. 핵심은 checkpoint를 더 작게 만드는 데 그치지 않고, 포맷을 잘 고르면 baseline accuracy의 99%+를 회복하면서도 serving 비용을 실질적으로 낮출 수 있다는 주장이다.
이제 봐야 할 것은 재현성이다. X에서는 throughput screenshot이 빠르게 확산되지만, 실제 현장에서는 GPU 종류, prompt 길이, tool calling trace, chat template 민감한 작업에서 품질이 어떻게 유지되는지가 더 중요하다. independent builder들이 open Gemma 4 variants가 메모리 압박을 줄이면서도 품질을 지킨다고 확인한다면, 이번 post는 단순 benchmark 홍보가 아니라 강한 open model을 더 싼 비용으로 굴릴 수 있다는 실무 신호가 된다.
Sources: Red Hat AI X post · LLM Compressor · quantization paper · Red Hat AI Hugging Face models
관련 기사
익명으로 등장해 리더보드 석권한 Ox Alpha, 정체는 Z.AI
OpenRouter에 익명으로 공개돼 각종 벤치마크 상위권을 차지한 오픈소스 모델 Ox Alpha가 GLM 시리즈를 만든 중국 AI 연구소 Z.AI의 작품으로 밝혀졌다. 코딩·장기 에이전트·멀티모달 워크플로 특화 설계가 특징이다.
DeepSeek, 멀티모달 API 출시 — V4 Flash Vision Exp, Opus 4.8에 근접
DeepSeek이 V4 Flash의 비전 확장 버전 V4-Flash-Vision-Exp를 공개하고 멀티모달 API 서비스를 시작했다. 텍스트 성능을 유지하면서 멀티모달 에이전트 벤치마크에서 Claude Opus 4.8에 근접한 수준을 기록했다.
LocalLLaMA 벤치마크: RTX PRO 6000 SM120의 병목은 깨진 CUTLASS NVFP4 MoE 커널
2026년 3월 12일 LocalLLaMA 게시글은 4x RTX PRO 6000 Blackwell 환경에서 Qwen3.5-397B NVFP4의 지속 decode 최고값이 Marlin 기준 50.5 tok/s라고 주장했다. 이유는 SM120에서 CUTLASS grouped GEMM 경로가 실패하거나 느린 fallback으로 떨어지기 때문이라는 설명이다.