대형 모델 서빙의 병목이 가중치 이동으로 좁혀졌다. NVIDIA는 ModelExpress로 DeepSeek-V4 Pro 시작 시간을 8분에서 1분 44초 수준으로 줄였다고 밝혔다.
대형 모델 서빙의 병목이 가중치 이동으로 좁혀졌다. NVIDIA는 ModelExpress로 DeepSeek-V4 Pro 시작 시간을 8분에서 1분 44초 수준으로 줄였다고 밝혔다.
744B MoE 모델을 소비자용 PC에서 돌리겠다는 실험에 관심이 모였다. Colibri는 GLM-5.2의 활성 파라미터와 전문가 라우팅 구조를 이용해, 거대한 모델을 전부 RAM이나 GPU에 올리지 않는 쪽으로 설계를 잡았다.
5개의 RTX PRO 6000과 5090까지 동원한 실험은 로컬 LLM의 낭만보다 전력, VRAM, 예산의 현실을 더 선명하게 보여줬다.
작동하는 칩, $800M 누적 조달, $1B 이상 고객 계약이 한 번에 공개됐다. Etched의 메시지는 명확하다. AI 인프라 병목이 학습용 GPU 확보에서 대규모 추론을 싸고 빠르게 처리하는 시스템 경쟁으로 이동하고 있다.
$800M 시리즈C와 $8.3B 기업가치는 오픈소스 모델 운영 비용을 낮추는 인프라 경쟁이 본게임에 들어섰다는 신호다. Together AI는 지난 분기 annual bookings가 $1.15B를 넘었고, 향후 5년간 인프라 용량을 약 50배 키우겠다고 제시했다.
기업 AI 도입의 병목이 모델 부족에서 운영 복잡도로 이동하고 있다. NVIDIA는 내부 Enterprise Inference Hub가 100개 넘는 모델 엔드포인트와 매주 수조 토큰 규모의 사용을 처리한다고 밝혔다.
LocalLLaMA의 관심은 “diffusion LLM이 실제로 빠른가”에 모였다. NVIDIA는 98.7% 품질 유지와 2.42배 throughput을 제시했다.
LLM 경쟁의 병목이 모델 크기에서 추론 인프라로 이동하고 있다. OpenAI는 Broadcom과 만든 Jalapeno가 9개월 만에 테이프아웃됐고 2026년 말부터 기가와트 규모 배치를 목표로 한다고 밝혔다.
댓글의 관심은 모델 성능보다 비용 통제에 모였다. 생성형 AI가 실험 예산을 넘어 업무 예산으로 들어가면서 token 단가와 사용량 감시가 실제 구매 결정을 흔들고 있다.
Alex Ellis의 글이 주목받은 이유는 local LLM을 benchmark 순위가 아니라 실제 사업과 agent 작업의 비용·통제 문제로 다뤘기 때문이다.
LocalLLaMA의 관심은 속도 숫자보다 FP4, DFlash speculative decoding, commodity GPU 조합이 실제로 어디까지 재현될 수 있느냐에 모였다.
AI agent 인프라 경쟁이 토큰 처리량이 아니라 동시 작업 수와 전력 효율로 옮겨가고 있다. NVIDIA는 Artificial Analysis의 새 AA-AgentPerf에서 GB300 NVL72가 H200보다 MW당 동시 coding agent 처리량을 최대 20배 높였다고 밝혔다.