HN 스포트라이트: Sarvam, IndiaAI 기반의 풀스택 전략으로 30B·105B 공개
Hacker News에서 주목받은 Sarvam AI의 발표는 IndiaAI mission 기반으로 인도에서 학습한 reasoning 중심 MoE 모델 Sarvam 30B와 105B를 오픈소스로 공개했다는 점에 있다. 공개 범위가 단순한 weights를 넘어 제품 배치, inference 최적화, Indian-language benchmark 성과까지 포함한다는 점이 핵심이다.
원문: Sarvam 105B, the first competitive Indian open source LLM 원문 보기 →
Hacker News에서는 2026년 3월 6일 Sarvam AI가 Sarvam 30B와 Sarvam 105B를 오픈소스로 공개했다는 발표가 빠르게 확산됐다. 회사 설명에 따르면 두 모델은 IndiaAI mission이 제공한 compute 위에서 인도 내에서 처음부터 학습된 reasoning 중심 모델이다. 발표의 초점은 단순한 model release가 아니라 data curation, training, inference optimization, tokenizer, product deployment까지 포함한 full stack 역량을 함께 보여주는 데 있다.
기술 구성도 비교적 구체적이다. 두 모델 모두 128 experts를 사용하는 sparse MoE Transformer backbone을 채택한다. Sarvam 30B는 KV-cache 사용량을 줄이기 위해 Grouped Query Attention을 사용하고, Sarvam 105B는 긴 context에서 메모리 효율을 더 끌어올리기 위해 Multi-head Latent Attention을 사용한다. Sarvam은 30B가 16T tokens, 105B가 12T tokens로 학습됐다고 밝히며, code, web data, mathematics, multilingual content, synthetic data를 함께 섞은 학습 구성을 강조했다. 또한 12개 scripts에 걸친 22개 scheduled Indian languages용 tokenizer 최적화도 전면에 내세웠다.
Hacker News에서 반응을 키운 것은 benchmark 숫자들이다. Sarvam 105B는 reasoning, coding, agentic workloads를 겨냥한 competitive open model로 소개되며 LiveCodeBench v6 71.7, MMLU 90.6, AIME 25 Pass@1 88.3, Tau2 average 68.3 같은 수치를 제시한다. Sarvam 30B는 2.4B active parameters 기반의 효율 중심 모델로 설명되며 HumanEval, MBPP, BrowseComp, Tau2에서 강한 결과를 내세운다. 회사는 이미 30B가 Samvaad를, 105B가 Indus를 구동하고 있다고 밝힌다.
이번 공개가 특히 눈에 띄는 이유는 운영 관점의 이야기까지 포함하고 있기 때문이다. 발표문은 fused kernels, scheduling, disaggregated serving, 그리고 H100, L40S, Apple Silicon에서의 throughput 개선을 길게 설명한다. 즉 Sarvam은 weights만 공개하는 것이 아니라, 실제 workload와 regional language coverage에 맞게 inference stack을 튜닝할 때 open model의 가치가 커진다고 주장하고 있다.
빌더 입장에서 핵심은 분명하다. 이것은 reasoning quality, agentic utility, serving efficiency를 동시에 경쟁력으로 만들려는 sovereign-model 시도다. Hacker News의 관심은 결국 같은 질문을 향한다. 지역 기반 모델 랩이 headline parameter 수치 경쟁이 아니라 전체 pipeline 소유를 통해 차별화할 수 있는가 하는 점이다.
관련 기사
Mistral, reasoning·coding·multimodal 통합한 오픈소스 모델 Mistral Small 4 공개
Mistral이 2026년 3월 16일 Mistral Small 4를 공개했다. 119B total parameters, 6B active parameters, 256k context window, Apache 2.0, configurable reasoning_effort를 결합해 reasoning·coding·multimodal 작업을 한 모델에 모았다.
Hacker News가 본 no-training LLM surgery, 레이어 3개 복제로 reasoning을 끌어올린다는 주장
Show HN로 소개된 llm-circuit-finder는 GGUF 안의 특정 layer block을 한 번 더 통과시키는 방식으로 reasoning을 높일 수 있다고 주장한다. repo는 training이나 weight 변경 없이도 logical deduction 개선이 가능하다고 설명하지만, 핵심 수치는 모두 repo author의 자체 측정이다.
K2 Horizon 6종, 0.9B~375B 전면 공개…코드·훈련 데이터까지 연 공개형 LLM
0.9B부터 375B까지 이어지는 6개 모델이 가중치뿐 아니라 코드, 훈련 데이터, 방법론까지 Apache 2.0으로 풀렸다. 가장 작은 모델은 시계급 기기를, 가장 큰 모델은 기업용 추론을 겨냥하며 토큰 블록 병렬 생성으로 약 3배 속도 향상을 내세운다.