본문으로 건너뛰기

카테고리

LLM

Insights의 LLM 기사

RSS 피드
LLM 해커뉴스

Hacker News가 주목한 ATLAS, local coding agent 비용 모델에 던지는 질문

Hacker News에서 화제가 된 ATLAS는 consumer GPU 기반 local coding agent의 비용 효율을 크게 강조한다. 다만 README의 74.6% LiveCodeBench 수치는 best-of-3 plus repair 파이프라인과 다른 task 수를 전제로 하므로, Claude 4.5 Sonnet과의 비교는 비통제 비교로 읽어야 한다.

2분 소요 47 조회
LLM 해커뉴스

Hacker News가 본 `.claude` 폴더, Claude Code 운영을 repo에 담는 방식

Hacker News에서 화제가 된 `.claude` 폴더 가이드는 Claude Code 설정을 repo 안의 운영 자산으로 다루는 방식을 보여준다. `CLAUDE.md`, rules, commands, skills, agents를 분리해 관리하면 prompt 반복을 줄일 수 있지만, 동시에 instruction governance가 새 과제로 떠오른다.

2분 소요 38 조회
LLM 레딧

LocalLLaMA가 본 Qwen 3.5 27B 110만 tok/s, 핵심은 B200보다 vLLM 튜닝

2026년 3월 26일 Google Cloud B200 cluster에서 Qwen 3.5 27B를 서빙한 사례를 다룬 r/LocalLLaMA 글은 크롤링 시점 기준 205 points와 52 comments를 기록했다. 링크된 글은 tensor parallelism에서 data parallelism으로 바꾸고, context length를 줄이며, FP8 KV cache와 MTP-1 speculative decoding을 적용해 12 node에서 총 1,103,941 tokens per second를 달성했다고 설명한다.

2분 소요 52 조회
LLM 레딧

LocalLLaMA가 본 NVIDIA gpt-oss-puzzle-88B, gpt-oss-120b를 더 싸게 서빙하려는 88B 재설계

2026년 3월 26일 NVIDIA의 `gpt-oss-puzzle-88B` 모델 카드를 링크한 r/LocalLLaMA 글은 크롤링 시점 기준 284 points와 105 comments를 기록했다. NVIDIA는 이 88B MoE 모델이 Puzzle post-training NAS 파이프라인으로 파라미터와 KV-cache 부담을 줄이면서도 reasoning 정확도를 부모 모델 수준으로 유지하거나 소폭 높인다고 설명한다.

2분 소요 53 조회
LLM 해커뉴스

Hacker News가 본 Claude Code 웹 스케줄러, 반복형 agent 작업이 cloud 운영으로 넘어간다

2026년 3월 27일 Claude Code의 웹 scheduling 문서를 다룬 Hacker News 글은 크롤링 시점 기준 282 points와 230 comments를 기록했다. Anthropic는 scheduled task가 Anthropic-managed infrastructure에서 실행되고, GitHub repo를 fresh clone한 세션에서 동작하며, Pro, Max, Team, Enterprise 사용자가 쓸 수 있다고 설명한다.

2분 소요 42 조회
LLM X/Twitter

Together Research, divide-and-conquer long-context 파이프라인이 GPT-4o single-shot를 앞설 수 있다고 보고

Together Research는 2026년 3월 27일 divide-and-conquer를 적용한 더 작은 모델이 long-context task에서 GPT-4o single-shot를 맞추거나 앞설 수 있다고 밝혔다. Together 블로그와 arXiv 논문은 이 방법이 planner-worker-manager 구조와 task, model, aggregator noise 분석에 기반한다고 설명한다.

2분 소요 39 조회
LLM 레딧

LocalLLaMA가 주목한 TurboQuant 구현, sparse V dequant로 32K decode 22.8% 개선

LocalLLaMA self-post는 attention weight가 무시 가능한 위치에서 V dequant를 건너뛰는 sparse V dequant 기법을 공개하며, llama.cpp 기반 TurboQuant 구현에서 32K context decode를 22.8% 끌어올렸다고 주장했다. Qwen3.5-35B-A3B와 Apple M5 Max 기준으로 perplexity는 유지됐고 NIAH는 7/9에서 9/9로 개선됐다는 설명이다.

2분 소요 44 조회
LLM 해커뉴스

Hacker News가 주목한 Cog, Claude Code용 plain-text memory architecture

Show HN 글로 소개된 Cog는 Claude Code의 persistent memory를 database가 아니라 markdown, CLAUDE.md, filesystem 규칙으로 구성하는 설계다. hot/warm/glacier memory와 reflection pipeline을 plain text와 git log로 드러내어, agent memory를 숨겨진 state가 아니라 검토 가능한 project asset으로 다루려는 접근이 핵심이다.

2분 소요 40 조회
LLM X/Twitter

Ollama 모델, VS Code GitHub Copilot Chat 모델 선택기에서 직접 사용 가능

Ollama는 2026년 3월 26일 VS Code가 GitHub Copilot을 통해 Ollama와 통합되어 로컬 또는 cloud Ollama models를 editor 안에서 직접 선택할 수 있다고 밝혔다. Ollama docs는 VS Code 1.113+, GitHub Copilot Chat 0.41.0+, Ollama v0.18.3+에서 GitHub Copilot Free만으로도 custom model selection이 가능하다고 설명한다.

1분 소요 48 조회
LLM X/Twitter

OpenAI, Codex 접근 범위 넓히고 plugins를 재사용 workflow 패키지로 확대

OpenAIDevs는 2026년 3월 27일 사용자가 새로 출시된 plugins를 시험할 수 있도록 Codex usage limits를 전 플랜에서 reset했다고 밝혔다. OpenAI Help Center는 Codex가 Free와 Go에 한시적으로 제공되고, 유료 플랜은 2x rate limits를 받으며, plugins가 skills·app integrations·MCP configurations를 묶은 재사용 workflow 패키지라고 설명한다.

2분 소요 50 조회