LocalLLaMA, Mi50에서 ROCm 7과 Vulkan을 비교한 llama.cpp 벤치마크 공유
r/LocalLLaMA의 Mi50 벤치마크 글은 llama.cpp에서 ROCm 7 nightly와 Vulkan을 비교하며, 짧은 문맥에서는 Vulkan이 강하지만 긴 문맥과 MoE에서는 ROCm이 앞선다는 관찰을 제시했다.
카테고리
Insights의 LLM 기사
r/LocalLLaMA의 Mi50 벤치마크 글은 llama.cpp에서 ROCm 7 nightly와 Vulkan을 비교하며, 짧은 문맥에서는 Vulkan이 강하지만 긴 문맥과 MoE에서는 ROCm이 앞선다는 관찰을 제시했다.
Hacker News에서 주목받은 Flash-MoE는 SSD 스트리밍과 Metal 커널을 이용해 Qwen3.5-397B-A17B를 48GB M3 Max 노트북에서 대화 가능한 속도로 실행하는 방법을 공개했다.
r/LocalLLaMA의 rerun benchmark는 Apple M5 Max가 token generation보다 prompt processing에서 더 큰 이득을 보인다고 주장한다. 특히 Qwen 3.5 35B-A3B MoE는 2,845 tok/s PP512와 92.2 tok/s generation을 기록했다고 post author가 설명한다.
Show HN로 소개된 llm-circuit-finder는 GGUF 안의 특정 layer block을 한 번 더 통과시키는 방식으로 reasoning을 높일 수 있다고 주장한다. repo는 training이나 weight 변경 없이도 logical deduction 개선이 가능하다고 설명하지만, 핵심 수치는 모두 repo author의 자체 측정이다.
Hacker News에서 1,238 points와 614 comments를 모은 OpenCode는 terminal, IDE, desktop을 모두 지원하는 open source AI coding agent다. 프로젝트 사이트는 75+ providers 연결, LSP integration, multi-session workflow, privacy-first 운영을 핵심 특징으로 내세운다.
r/LocalLLaMA 게시물은 Qwen3.5-122B-A10B Uncensored (Aggressive) GGUF와 새 K_P quants를 소개한다. 작성자는 0/465 refusals와 zero capability loss를 주장했지만, 이는 작성자 본인 테스트에 기반한 self-reported claim이다.
GitHub가 Jira issue를 Copilot coding agent에 직접 할당해 draft pull request를 생성하는 integration을 public preview로 공개했다. Jira와 GitHub 사이의 context switching을 줄이면서도 기존 review·approval 규칙은 유지하는 것이 핵심이다.
OpenAI Developers는 2026-03-20 X 게시물에서 미국과 캐나다의 인증된 대학생이 Codex용 $100 크레딧을 받을 수 있다고 발표했다. OpenAI 안내 페이지는 이것이 2,500 ChatGPT credits에 해당하며, SheerID 인증이 필요하고, grant 날짜 기준 12 months 후 만료된다고 설명한다.
Google AI Studio는 2026-03-12 X 게시물에서 Gemini Embedding 2를 소개했고, Google의 2026-03-10 블로그 글은 이 model이 text, images, video, audio, documents를 하나의 embedding space로 매핑한다고 설명한다. Google은 이 model이 Gemini API와 Vertex AI에서 public preview로 제공되며 multimodal retrieval과 classification을 주요 활용처로 내세운다고 밝혔다.
Google AI Studio는 2026-03-19 X 게시물에서 vibe coding 워크플로에 multiplayer 협업, live data 연결, persistent builds, 그리고 shadcn, Framer Motion, npm 지원이 추가됐다고 밝혔다. 이번 업데이트는 AI Studio를 prompt 중심의 시제품 도구에서 browser 기반 app-building 환경으로 더 가깝게 만든다.
OpenAI가 2026년 3월 11일 Responses API에 shell tool과 hosted container workspace를 결합한 computer environment 설계를 공개했다. 회사는 이를 통해 agent가 파일, 데이터, 네트워크 접근을 더 안전하고 반복 가능하게 처리할 수 있다고 설명했다.
OpenAI가 2026년 3월 17일 GPT-5.4 mini와 nano를 공개했다. 회사는 두 모델을 coding, tool use, multimodal reasoning, high-volume subagent workload에 맞춘 저지연 소형 모델로 설명했다.