작은 microcontroller에서 LLM을 돌린다는 말은 과장이 아니다. 핵심은 flash에 25M parameter lookup table을 두고 token마다 필요한 일부만 읽는 메모리 배치다.
#llm
RSS 피드오픈 가중치 모델을 둘러싼 관심은 “중국 모델을 막을 수 있나”보다 더 넓다. 모델 자체보다 그 위에 쌓이는 agent runtime, serving, 평가, 운영 도구가 다음 경쟁장이 되고 있다.
Claude Opus 5가 GitHub Copilot 모델 선택지에 들어오면서 고난도 코딩 작업을 GitHub 작업면 안에서 바로 맡길 수 있게 됐다. Pro+, Max, Business, Enterprise 사용자는 VS Code, Copilot CLI, cloud agent, JetBrains 등 9개 표면에서 순차적으로 접근한다.
2.8조 파라미터와 100만 토큰 context를 앞세운 Kimi K3가 HN 논쟁의 중심에 섰다. 관심은 benchmark 숫자보다 open model이 proprietary frontier와 얼마나 가까워졌는지에 모인다.
2.8T 파라미터와 1M-token context를 내건 Kimi K3가 공개되며 open-weight 모델의 규모 경쟁이 다시 커졌다. 전체 가중치는 2026년 7월 27일까지 공개될 예정이고, 현재는 Kimi.com·Kimi Code·API에서 사용할 수 있다.
1.6T total, 48B active라는 숫자보다 인프라가 논점이다. HN 댓글은 모델 구조보다 국산 AI ASIC cluster 훈련을 더 큰 신호로 봤다.
점수보다 논점이 더 흥미롭다. HN 댓글은 새 benchmark 자체보다 “시니어 엔지니어”를 어떻게 재현할 수 있느냐에 모였다.
Snyk VulnBench JS 1.0은 같은 JavaScript 취약점 리뷰를 300번 반복해 LLM 보안 점검의 재현성을 측정했다. 최고 LLM 설정도 Snyk-reference F1 75.4%에 그쳤고, reference 밖 추가 보고의 49.7%는 5번 중 1번만 나타났다.
OpenRouter는 6월 오픈 weight 모델 흐름을 DeepSeek V4 Flash, GLM 5.2, MiniMax M3, NVIDIA Nemotron 3 Ultra 네 축으로 정리했다. 핵심 숫자는 SWE-bench Verified 79.0%, Intelligence Index 51, 1M context, 그리고 frontier API 대비 큰 가격 차이다.
Google Research는 Gemini-2.5와 Qwen3-32B 실험에서 reasoning이 단순 사실 질문의 회상을 돕는 두 메커니즘을 분리했다. 추가 토큰은 계산 시간을 주고, 관련 사실은 정답 회상을 prime하지만 hallucination이 끼면 정확도가 떨어졌다.
가장 큰 논점은 기능 안내가 아니라 고성능 LLM 접근이 신원 확인과 점점 묶인다는 점이다.
보안 알림의 양보다 신뢰도가 더 중요한 단계로 들어섰다. GitHub는 LLM 기반 문맥 검증을 적용해 secret scanning 오탐을 목표치 65%보다 높은 75.76% 줄였다고 공개했다.