본문으로 건너뛰기

태그

#local-llm

#local-llm 태그가 달린 기사

RSS 피드
LLM 레딧

r/LocalLLaMA가 재조명한 Nemotron Cascade, 작은 activated params로도 강한 coding 성능

r/LocalLLaMA의 새 스레드는 NVIDIA의 Nemotron-Cascade-2-30B-A3B가 중형 Qwen 3.5 계열보다 더 강한 coding 결과를 낼 수 있다고 주장하며 주목을 끌었다. community benchmark와 NVIDIA의 model card를 함께 보면, local inference 비용과 reasoning 성능 사이의 새로운 균형점을 찾으려는 흐름이 읽힌다.

1분 소요 50 조회
LLM X/Twitter

Ollama, NVIDIA Nemotron-Cascade-2 공개… local·agent workflow용 30B MoE reasoning 모델 투입

Ollama는 2026년 3월 20일 NVIDIA의 Nemotron-Cascade-2를 자사 로컬 모델 스택에서 실행할 수 있다고 밝혔다. 공식 모델 페이지는 이를 3B activated parameter를 쓰는 open 30B MoE 모델로 소개하며, thinking·instruct 모드와 OpenClaw·Codex·Claude 연동 경로를 함께 제공한다.

2분 소요 42 조회
LLM 해커뉴스

Hacker News가 포착한 GreenBoost, system RAM과 NVMe로 GPU VRAM을 늘리는 Linux 스택

2026년 3월 15일 GreenBoost 관련 Hacker News 게시물은 124 points와 25 comments를 기록했다. 이 open-source Linux 프로젝트는 kernel module과 CUDA shim을 결합해 model memory를 VRAM, DDR4, NVMe로 계층화함으로써 inference app을 바꾸지 않고도 더 큰 local LLM을 실행하려 한다.

2분 소요 40 조회
LLM 레딧

LocalLLaMA PSA: 새 모델 평가는 편의 래퍼보다 기본 런타임부터 맞추라는 조언

r/LocalLLaMA에서 주목받은 PSA는 Ollama나 LM Studio 같은 편의 레이어가 model behavior를 바꿀 수 있으므로, 새 모델 평가는 먼저 llama.cpp, transformers, vLLM, SGLang 같은 기본 런타임에서 해야 한다고 조언한다. 댓글에서도 핵심은 특정 툴 선호가 아니라 template, stop token, sampling, quantization을 고정한 재현성이라는 점이 강조됐다.

2분 소요 40 조회