본문으로 건너뛰기

태그

#llm

#llm 태그가 달린 기사

RSS 피드
LLM 해커뉴스

Hacker News가 본 no-training LLM surgery, 레이어 3개 복제로 reasoning을 끌어올린다는 주장

Show HN로 소개된 llm-circuit-finder는 GGUF 안의 특정 layer block을 한 번 더 통과시키는 방식으로 reasoning을 높일 수 있다고 주장한다. repo는 training이나 weight 변경 없이도 logical deduction 개선이 가능하다고 설명하지만, 핵심 수치는 모두 repo author의 자체 측정이다.

2분 소요 41 조회
LLM 해커뉴스

HN이 주목한 llm-circuit-finder: layer duplication은 LLM 향상의 지름길인가, capability steering인가

Hacker News에서 화제가 된 llm-circuit-finder는 training 없이 layer routing만으로 reasoning score를 끌어올릴 수 있다고 주장한다. 하지만 README의 전체 benchmark는 IFEval/MBPP와 평균 점수 하락도 보여 주며, 이 접근은 universal improvement보다 capability steering으로 보는 편이 더 타당하다.

3분 소요 40 조회
LLM 레딧

LocalLLaMA가 주목한 Mamba-3, inference 효율 중심으로 설계된 state space model

2026년 3월 18일 LocalLLaMA에서 화제가 된 Mamba-3는 Together AI와 CMU, Princeton, Cartesia AI 연구진이 공개한 state space model 연구다. 설계 목표를 training speed보다 inference efficiency에 두고, 1.5B scale에서 Mamba-2와 Gated DeltaNet, Llama-3.2-1B 대비 prefill+decode latency 우위를 주장한다.

2분 소요 37 조회
LLM 레딧

Covenant-72B, permissionless 분산 GPU 학습을 내세운 72B base model

r/LocalLLaMA에서 92점과 25개 댓글을 받은 Covenant-72B는 20+ 참여자가 Bittensor blockchain 기반 인프라를 통해 72B parameters 모델을 from scratch로 함께 학습한 사례로 주목받았다. 공개된 핵심은 benchmark 우위 주장보다 permissionless collaborative training, SparseLoCo 기반 통신 절감, Apache 2.0 license, 그리고 separate Chat variant의 존재다.

2분 소요 32 조회