Nemotron-TwoTower 공개, autoregressive LLM을 diffusion으로 돌리는 실험
LocalLLaMA의 관심은 “diffusion LLM이 실제로 빠른가”에 모였다. NVIDIA는 98.7% 품질 유지와 2.42배 throughput을 제시했다.
태그
#inference 태그가 달린 기사
LocalLLaMA의 관심은 “diffusion LLM이 실제로 빠른가”에 모였다. NVIDIA는 98.7% 품질 유지와 2.42배 throughput을 제시했다.
LLM 경쟁의 병목이 모델 크기에서 추론 인프라로 이동하고 있다. OpenAI는 Broadcom과 만든 Jalapeno가 9개월 만에 테이프아웃됐고 2026년 말부터 기가와트 규모 배치를 목표로 한다고 밝혔다.
댓글의 관심은 모델 성능보다 비용 통제에 모였다. 생성형 AI가 실험 예산을 넘어 업무 예산으로 들어가면서 token 단가와 사용량 감시가 실제 구매 결정을 흔들고 있다.
Alex Ellis의 글이 주목받은 이유는 local LLM을 benchmark 순위가 아니라 실제 사업과 agent 작업의 비용·통제 문제로 다뤘기 때문이다.
LocalLLaMA의 관심은 속도 숫자보다 FP4, DFlash speculative decoding, commodity GPU 조합이 실제로 어디까지 재현될 수 있느냐에 모였다.
AI agent 인프라 경쟁이 토큰 처리량이 아니라 동시 작업 수와 전력 효율로 옮겨가고 있다. NVIDIA는 Artificial Analysis의 새 AA-AgentPerf에서 GB300 NVL72가 H200보다 MW당 동시 coding agent 처리량을 최대 20배 높였다고 밝혔다.
Google DeepMind가 26B MoE open model DiffusionGemma를 공개했다. 256-token 블록을 병렬로 다듬는 text diffusion 방식으로 전용 GPU에서 최대 4x 빠른 생성을 노린다.
관심은 성능 자랑보다 README의 학습 설계에 모였다. vLLM의 핵심을 작은 코드와 수업 흐름으로 재구성한 점이 반응을 얻었다.
토큰 사용량과 투자자 구성이 함께 주목을 받았다. HN 댓글의 관심은 “모델 라우터가 독립 인프라로 남을 수 있나”에 모였다.
NVIDIA가 Dynamo serving stack을 빠르게 실험하는 DynoSim을 공개했다. 기술 블로그 기준 Apple M4 MacBook Air에서 23,608개 요청, 60.1분 분량 트래픽을 2.41초에 재현해 약 1,500배 빠른 시뮬레이션을 보였다.
LLM inference 운영에서 비싼 GPU 실험을 먼저 돌릴 필요가 줄어든다. NVIDIA DynoSim은 23,608개 request trace를 Apple M4 MacBook Air에서 2.41초에 재생하며 real time 대비 약 1,500배 빠른 serving simulation을 제시했다.
새로운 초점은 챗봇이 아니라 항공기, 자동차, 반도체 장비 설계다. Mistral은 Airbus, BMW, ASML 사례와 Q3 2026 개소 예정인 10MW Les Ulis inference 시설을 함께 제시하며 산업용 AI stack을 전면에 세웠다.