본문으로 건너뛰기

카테고리

LLM

Insights의 LLM 기사

RSS 피드
LLM 해커뉴스

Idle Mac으로 private inference? HN은 Darkbloom의 계산보다 신뢰 모델을 따졌다

HN은 아이디어의 야심에는 반응했지만 곧바로 약한 지점을 찔렀다. marketplace demand, MDM trust, Mac privacy claim, operator economics가 핵심이었다. Darkbloom은 idle Apple Silicon으로 OpenAI-compatible private inference를 더 싸게 제공할 수 있다고 말하지만, 댓글은 이를 landing page가 아니라 architecture와 incentive 문제로 읽었다.

2분 소요 42 조회
LLM 해커뉴스

Qwen3.6-35B-A3B, HN이 주목한 건 3B active MoE의 코딩 성능이었다

HN이 먼저 본 포인트는 open weights였다. 35B MoE지만 active parameter가 3B인 모델이 실제 coding agent 일을 버틸 수 있느냐가 핵심이었다. Qwen은 Qwen3.5-35B-A3B 대비 큰 개선을 내세웠고, 댓글은 곧바로 GGUF 변환, Mac 메모리 한계, open model끼리만 비교한 benchmark 해석으로 옮겨갔다.

1분 소요 51 조회
LLM 레딧

VRAM에 자주 쓰는 expert만 올리자, LocalLLaMA가 본 27% 속도 향상

LocalLLaMA가 반응한 이유는 큰 MoE model을 작은 VRAM에서 굴릴 때 생기는 병목을 꽤 현실적인 방식으로 찔렀기 때문이다. 작성자는 Qwen3.5-122B-A10B에서 최근 token들이 자주 route한 expert를 VRAM cache에 올리는 llama.cpp fork를 실험했고, 같은 22GB대 VRAM 사용량에서 layer-based offload보다 token generation이 26.8% 빨랐다고 공유했다.

2분 소요 49 조회
LLM 레딧

LocalLLaMA가 꽂힌 자동 튜닝, Qwen3.5-27B가 40 tok/s까지 올랐다

LocalLLaMA가 반응한 포인트는 “LLM이 스스로 빨라진다”는 농담 같은 구조가 실제 benchmark 숫자로 이어졌다는 점이었다. 작성자는 llm-server v2의 --ai-tune이 llama-server help를 context로 읽고 flag 조합을 돌며 fastest config를 cache한다고 설명했고, Qwen3.5-27B Q4_K_M은 18.5 tok/s에서 40.05 tok/s까지 올라갔다고 공유했다.

2분 소요 45 조회
LLM 해커뉴스

HN은 Ollama 논쟁을 로컬 LLM 신뢰 문제로 읽었다

HN이 크게 반응한 이유는 한 wrapper의 호불호가 아니라, local LLM stack에서 누가 credit과 control을 가져가는지에 대한 불편함이었다. Sleeping Robots의 글은 Ollama가 llama.cpp 위에서 성장했지만 attribution, model packaging, cloud routing, model storage에서 사용자 신뢰를 깎았다고 주장했고, 댓글은 “그래도 UX는 압도적으로 쉽다”는 반론까지 붙었다.

2분 소요 44 조회