본문으로 건너뛰기

태그

#inference

#inference 태그가 달린 기사

RSS 피드
LLM 해커뉴스

Hacker News가 포착한 GreenBoost, system RAM과 NVMe로 GPU VRAM을 늘리는 Linux 스택

2026년 3월 15일 GreenBoost 관련 Hacker News 게시물은 124 points와 25 comments를 기록했다. 이 open-source Linux 프로젝트는 kernel module과 CUDA shim을 결합해 model memory를 VRAM, DDR4, NVMe로 계층화함으로써 inference app을 바꾸지 않고도 더 큰 local LLM을 실행하려 한다.

2분 소요 40 조회
AI X/Twitter

NVIDIA, Dynamo 1.0를 AI factories용 inference OS로 production 단계에 투입

NVIDIA는 2026년 3월 16일 Dynamo 1.0이 generative·agentic inference at scale용 open source software로 production 단계에 들어간다고 밝혔다. 회사는 이 스택이 Blackwell inference 성능을 최대 7배 높일 수 있고, 주요 cloud provider와 inference platform, AI-native 회사 전반에서 이미 지원되고 있다고 설명한다.

2분 소요 49 조회
LLM 해커뉴스

Hacker News, transformer 내부에서 program execution을 수행한다는 Percepta 주장에 주목

Percepta는 2026년 3월 11일 공개한 글에서 transformer 내부에 computer를 만들고, arbitrary C program을 수백만 step 실행하며, 2D attention head로 inference를 지수적으로 가속할 수 있다고 주장했다. HN 이용자들은 흥미로운 연구 방향으로 봤지만, 더 명확한 설명과 benchmark, 실제 확장성에 대한 근거를 요구했다.

2분 소요 41 조회
AI

Meta, 2년간 4세대 개발 속도로 MTIA 로드맵 공개

Meta는 next-gen AI 확장에 custom silicon이 필수라며 Meta Training and Inference Accelerator(MTIA) 로드맵을 공개했다. 회사는 전통적인 chip cycle과 빠른 model architecture 변화의 간격을 줄이기 위해 2년 만에 4세대를 출시했다고 설명했다.

1분 소요 54 조회
LLM 레딧

Reddit, Mac용 Qwen 3.5 llama.cpp Metal speedup를 주목하다

r/LocalLLaMA 게시글은 Mac 사용자를 March 11, 2026에 merge된 llama.cpp pull request #20361로 이끌었다. 이 PR은 fused GDN recurrent Metal kernel을 추가하며, Qwen 3.5 계열에서 대략 12-36% throughput 향상을 제시한다. Reddit commenters는 change가 master에는 들어갔지만 일부 local benchmark에서는 여전히 MLX가 더 빠를 수 있다고 덧붙였다.

2분 소요 55 조회
LLM 레딧

r/LocalLLaMA가 주목한 llama.cpp reasoning budget 제어

새로운 llama.cpp 변경은 <code>--reasoning-budget</code>를 template stub이 아니라 sampler 차원의 실제 제어로 바꾼다. LocalLLaMA thread는 긴 think loop를 줄이는 것과 answer quality를 지키는 것 사이의 tradeoff, 특히 local Qwen 3.5 환경에서의 의미를 집중적으로 논의했다.

1분 소요 51 조회