LocalLLaMA가 다시 소환한 Qwen2-72B layer duplication 실험
LocalLLaMA에서 재조명된 글은 Qwen2-72B의 중간 7개 layer block을 weight 수정 없이 반복 실행해 benchmark를 끌어올렸다는 David Noel Ng의 실험을 다뤘다.
카테고리
Insights의 LLM 기사
LocalLLaMA에서 재조명된 글은 Qwen2-72B의 중간 7개 layer block을 weight 수정 없이 반복 실행해 benchmark를 끌어올렸다는 David Noel Ng의 실험을 다뤘다.
r/MachineLearning에서 다시 주목받은 arXiv 2603.01919는 GPT-5와 Gemini-2.5 접근을 내세우는 shadow API를 감사해 큰 성능 편차, 불안정한 safety 동작, 빈번한 model identity 실패를 보고했다.
Launch HN 스레드로 RunAnywhere의 RCLI가 부각됐다. 이 프로젝트는 Apple Silicon에서 STT, LLM, TTS, 로컬 RAG, 38개 macOS action을 모두 로컬로 묶어 macOS용 Voice AI를 구축하려는 시도다.
Google DeepMind는 Gemini 3.1 Flash-Lite가 Gemini API와 Google AI Studio를 통해 preview로 제공된다고 밝혔다. 회사는 이를 가장 cost-efficient한 Gemini 3 모델로 소개하며, 더 낮은 가격과 더 빠른 성능, 조절 가능한 thinking levels를 강조했다.
Claude는 Claude Code에 Code Review를 추가하고 PR마다 여러 agent가 병렬로 버그를 찾는 구조를 도입했다고 밝혔다. 기능은 Team과 Enterprise 대상 research preview로 제공된다.
LocalLLaMA 게시글은 Hugging Face의 새 인간 코드 리뷰 데이터셋을 조명했다. inline reviewer comment, 코드 수정 전후, 그리고 negative example을 37개 언어에 걸쳐 묶은 구성이 특징이다.
r/artificial 게시글은 OpenClaw 사례가 이미 OWASP Agentic 취약점 10개 중 8개를 현실에서 건드렸다고 주장하는 3월 2일자 분석 글을 재조명했다. 공급망 오염과 localhost WebSocket 신뢰 문제가 핵심이다.
Perplexity의 Computer 계정은 2026년 3월 9일 X를 통해 Claude Code와 GitHub CLI가 Perplexity Computer 안에서 직접 실행되는 모습을 공개했다. 데모에서는 Openclaw 이슈를 받아 저장소를 fork하고, 수정 계획 작성부터 구현과 pull request 제출까지 Computer 환경 내부에서 수행했다.
GitHub는 2026년 3월 9일 X를 통해 multi-agent 시스템 설계 가이드를 다시 강조했다. 회사는 대부분의 실패가 모델 성능이 아니라 구조 부족에서 발생한다며 typed schema, action schema, Model Context Protocol을 핵심 제어 장치로 제시했다.
높은 점수를 받은 LocalLLaMA 글은 16GB M1 Pro에서 Qwen 3.5 9B가 memory recall과 기본 tool calling을 실제 agent 작업에 쓸 만큼 처리했지만, creative reasoning은 여전히 frontier model보다 뒤처졌다고 전했다.
화제가 된 HN 스레드는 Claude Code 사용자 1명당 월 $5,000이 든다는 숫자가 Anthropic의 실제 serving cost가 아니라 retail API 기준 사용액을 가리킬 가능성이 크다고 본다.
Google는 2026년 2월 24일 Opal에 모든 사용자가 바로 쓸 수 있는 새로운 agent step을 추가했다고 밝혔다. 사용자가 model call을 수동으로 조합하는 대신, Opal이 목표에 맞는 tools와 models를 고르고 Memory까지 활용해 더 interactive한 workflow를 만들 수 있다는 설명이다.