본문으로 건너뛰기

GLM-5.3-Flash 공식 출시 — 중국 AI 칩으로 구동되는 멀티모달 고효율 모델

Original: GLM-5.3-Flash: Frontier Intelligence, Flash Cost View original →

Read in other languages: English日本語
LLM Aug 26, 2026 By Insights AI (HN) 1 min read 1 views Source

GLM-5 시리즈의 첫 멀티모달 모델

Z.ai가 GLM-5.3-Flash를 공식 출시했다. GLM-5 시리즈 최초의 네이티브 멀티모달 모델로, 총 320B 파라미터 중 18B만 활성화하는 MoE 구조를 채택해 이전 세대 GLM-5.2 대비 10분의 1 수준의 비용으로 더 높은 성능을 달성했다.

공개 전 Z.ai는 이 모델을 ox-alpha라는 익명으로 OpenCode와 OpenRouter에서 테스트했다. 그 결과 당주의 가장 인기 있는 모델로 올라섰으며, 이 트래픽 전체가 중국산 AI 칩으로 처리됐다.

하이브리드 어텐션 아키텍처

핵심 혁신은 선형(Linear) 어텐션과 희소(Sparse) 어텐션을 결합한 하이브리드 아키텍처다. 선형 어텐션은 상태 모델링으로 로컬 의존성을 처리하고, 희소 어텐션은 경량 인덱서로 전역 문맥에서 중요한 정보를 선택한다. IndexPool 기법을 적용해 1M 토큰 문맥에서 인덱서 키 벡터 4개를 1개로 압축한다. GLM-5.3 대비 어텐션 연산량 3배, KV 캐시 4.4배 절감했다.

벤치마크 성능

코딩·에이전트 6개 벤치마크에서 GLM-5.3-Flash는 GLM-5.2를 일관되게 앞섰다. DeepSWE v1.1에서 63.4 대 46.2, AutomationBench에서 48.8 대 26.2의 격차를 보였다. Z.ai 내부 코딩 평가 최대 노력 수준에서 29.0점으로 Claude Opus 4.8(29.5점)에 근접했다. 비전 능력으로는 OfficeQA Pro 62.4점, CharXiv Reasoning 89.4점을 기록했다.

중국산 칩으로의 대규모 서빙

SGLang 기반의 전용 추론 엔진, W8A8 양자화, 하이브리드 INT8/FP8/BF16 캐시 양자화를 적용해 초기 베이스라인 대비 3배 향상된 서빙 성능을 달성했다. 주류 NVIDIA GPU에 필적하는 비용 효율을 중국산 칩으로 구현했다는 점이 주목된다.

이용 방법

모델 가중치는 HuggingFace(zai-org/GLM-5.3-Flash)에서 공개 제공된다. SGLang, vLLM, TokenSpeed를 통한 로컬 배포를 지원하며, GLM Coding Plan 사용자에게는 GLM-5.3 대비 3배의 쿼터와 함께 제공된다.

Share: Long

Related Articles