NVMe-to-GPU로 RTX 3090 단일 GPU에서 Llama 3.1 70B 실행
CPU RAM을 우회하고 NVMe 저장장치에서 GPU로 직접 가중치를 스트리밍하는 방식으로, RTX 3090 단일 소비자용 GPU에서 700억 파라미터 Llama 3.1 모델을 실행하는 오픈소스 프로젝트가 공개됐습니다.
카테고리
Insights의 LLM 기사
CPU RAM을 우회하고 NVMe 저장장치에서 GPU로 직접 가중치를 스트리밍하는 방식으로, RTX 3090 단일 소비자용 GPU에서 700억 파라미터 Llama 3.1 모델을 실행하는 오픈소스 프로젝트가 공개됐습니다.
Andrej Karpathy가 새로운 AI 에이전트 패러다임 "Claws"를 소개했습니다. OpenClaw와 같은 시스템이 LLM 에이전트 위에서 오케스트레이션, 스케줄링, 컨텍스트, 도구 호출, 지속성을 제공하는 새로운 AI 스택 레이어입니다.
Bloomberg 보도에 따르면 Anthropic의 AI 코딩 에이전트 Claude Code의 연간반복매출(ARR)이 25억 달러를 돌파했다. 출시 6개월 만에 10억 달러를 달성한 후 계속 성장해 현재 Anthropic 전체 엔터프라이즈 지출의 50% 이상을 차지하며, 사용자들은 평균 주당 20시간씩 사용하고 있다.
Elon Musk의 xAI가 2월 17일 Grok 4.20 공개 베타를 출시했다. 배포 이후에도 매주 사용자 피드백을 반영해 능력을 업데이트하는 지속학습 아키텍처를 탑재한 시리즈 최초 모델로, 4개 전문 에이전트 협업 시스템과 의료 문서 분석 기능이 추가됐다.
GitHub가 Anthropic의 Claude Sonnet 4.6을 Copilot에 공식 도입했다. 에이전틱 코딩과 검색 작업에서 뛰어난 성능을 보이며 VS Code와 Copilot CLI에서 바로 사용할 수 있다.
Google DeepMind가 Gemini 3.1 Pro를 공개했다. 더 어려운 문제를 해결할 수 있도록 모델 전반의 지능을 대폭 향상시켰으며, Google AI Pro 및 Ultra 사용자를 시작으로 Gemini 앱과 NotebookLM, API를 통해 순차 제공된다.
r/LocalLLaMA 고반응 글이 ggml.ai 팀의 Hugging Face 합류 소식을 확산시켰다. GitHub 공지는 ggml/llama.cpp의 full-time 유지보수 지속과 Local AI 생태계 확장을 핵심 메시지로 제시했다.
r/LocalLLaMA 인기 기술 글은 2026년 2월 20일 병합된 llama.cpp PR #19765를 공유했다. 해당 변경은 Qwen3-Coder-Next 파싱 문제 대응용 stop-gap으로, parallel tool calling과 JSON schema 지원 보완을 포함한다.
r/singularity 고반응 게시물은 arXiv 2602.15322를 공유했다. 논문은 masked adaptive update와 Magma 기법이 1B 모델 설정에서 Adam·Muon 대비 perplexity를 개선하면서 오버헤드는 작다고 보고한다.
Hacker News 고득점 스레드는 Together AI의 CDLM 글을 공유했다. 해당 글은 확산형 언어모델에서 trajectory-consistent step reduction과 exact block-wise KV caching을 결합해 최대 14.5배 지연시간 개선을 보고한다.
Hacker News 고득점 스레드는 ggml-org/llama.cpp 공지 #19759를 조명했다. ggml.ai 핵심 팀은 Hugging Face에 합류하지만, ggml/llama.cpp는 기존처럼 오픈소스·커뮤니티 중심으로 운영된다고 명시했다.
LocalLLaMA 인기 스레드에서 Kitten TTS v0.8이 주목받았다. 80M/40M/14M 오픈 모델과 CPU 구동, 25MB 미만 경량 모델이 핵심 포인트로 제시됐다.