본문으로 건너뛰기
부식 중

r/LocalLLaMA가 주목한 GigaChat 3.1 open weights, 10B부터 702B까지

r/LocalLLaMA는 GigaChat 3.1에 강하게 반응했다. 이번 공개는 local-friendly 10B A1.8B MoE와 702B frontier-scale MoE를 모두 아우르며, 둘 다 MIT terms 아래 공개됐고 둘 다 scratch부터 학습했다고 제시됐다.

원문: New open weights models: GigaChat-3.1-Ultra-702B and GigaChat-3.1-Lightning-10B-A1.8B 원문 보기 →

LLM 레딧 작성자 Insights AI (Reddit) 2분 소요 43 조회 출처

반응이 큰 r/LocalLLaMA post는 MIT license 아래의 두 가지 새로운 open-weights release를 알렸다. GigaChat-3.1-Ultra는 702B A36B mixture-of-experts model이고, GigaChat-3.1-Lightning은 훨씬 더 작은 deployments를 겨냥한 10B A1.8B MoE다. 이 post가 눈에 띄는 이유는 release를 사소한 fine-tune으로 제시하지 않기 때문이다. 팀은 두 모델 모두 자체 data와 hardware로 scratch부터 pretrain했으며, English와 Russian을 핵심 최적화 대상으로 삼고 14 languages를 학습에 포함했다고 말한다.

더 작은 Lightning model이 local-model community에는 더 즉각적으로 실용적인 이야기다. 저자들은 256k context window, 강한 tool-calling behavior, 그리고 단일 H100 benchmark setup에서 throughput을 높게 유지하는 FP8 및 multi-token prediction 지원을 주장한다. 그들은 tool use에 대해 BFCL v3 score 0.76을 보고하고, Lightning을 Qwen3, SmolLM3, Gemma 3, YandexGPT lite models와 비교한다. 더 큰 Ultra release는 multi-node environments를 겨냥하며, post는 이것이 three HGX instances에서 실행될 수 있고 팀의 internal benchmark table에서 several open-weight comparators를 능가한다고 말한다.

헤드라인 수치를 넘어 흥미로운 점은 packaging이다. release에는 Hugging Face의 weights와 GGUF variants가 포함되고, 팀은 더 긴 technical report on Habr로 연결한다. 이는 community에 teaser보다 훨씬 유용한 것을 제공한다. 사람들은 licensing을 살펴보고, deployment 적합성을 평가하고, multilingual 및 CIS 중심 관점이 US와 China 중심 open model ecosystems가 자주 남겨두는 공백을 메우는지 판단할 수 있다.

통상적인 caveat도 적용된다. 이 benchmark tables는 독립 재현이 아니라 vendor-reported claims이므로, 실제 시험대는 coding, reasoning, latency, 그리고 quantized inference에 대한 community evaluations가 될 것이다. 그럼에도 r/LocalLLaMA는 이 발표를 frontier-scale과 실제 배포 가능한 크기를 모두 아우르는, open-weights landscape에 대한 의미 있는 추가로 받아들였다.

이 게시물이 눈에 띈 이유

  • 매우 큰 702B MoE와 local-friendlier 10B A1.8B MoE를 함께 내놓았다.
  • 모델들이 MIT terms 아래 공개됐고 Hugging Face weights와 GGUFs를 제공한다.
  • 팀은 단순한 downstream fine-tune이 아니라 scratch부터 학습했다고 주장한다.
  • multilingual 지원과 Russian/CIS 최적화가 이 release에 뚜렷한 지역적 각도를 부여한다.
공유: 긴글

관련 기사

LLM 해커뉴스

DeepSeek V4, 프런티어급 성능에 1/10 가격 — 1.6조 파라미터 오픈웨이트 공개

DeepSeek이 DeepSeek-V4-Pro와 V4-Flash 두 가지 모델을 공개했다. Pro는 1.6조 파라미터(활성 49B)의 Mixture-of-Experts 구조로, 현재까지 공개된 오픈웨이트 모델 중 최대 규모다. 가격은 GPT-5.4와 Gemini 3.1 Pro 대비 절반 이하로, 비용 효율성이 핵심 차별점이다.

1분 소요 39 조회
LLM 레딧

r/LocalLLaMA가 본 NVIDIA Nemotron 3 Super 공개

NVIDIA의 Nemotron 3 Super는 120B total / 12B active hybrid Mamba-Transformer MoE, native 1M-token context, 그리고 open weights·datasets·recipes를 함께 내세운다. LocalLLaMA discussion은 이 openness와 efficiency claim이 실제 home-lab deployment로 이어질 수 있는지에 집중했다.

1분 소요 38 조회