Grok Build 공개, coding agent가 privacy fork까지 부른 이유
xAI의 terminal coding agent가 공개되자 HN의 관심은 기능보다 신뢰와 통제권으로 향했다. Rust TUI, shell 실행, ACP 지원보다 더 뜨거운 쟁점은 telemetry와 fork 가능성이었다.
카테고리
Insights의 LLM 기사
xAI의 terminal coding agent가 공개되자 HN의 관심은 기능보다 신뢰와 통제권으로 향했다. Rust TUI, shell 실행, ACP 지원보다 더 뜨거운 쟁점은 telemetry와 fork 가능성이었다.
2.8조 파라미터와 100만 토큰 context를 앞세운 Kimi K3가 HN 논쟁의 중심에 섰다. 관심은 benchmark 숫자보다 open model이 proprietary frontier와 얼마나 가까워졌는지에 모인다.
OpenAI가 AI 비용 논쟁의 기준을 토큰 가격에서 성공한 작업당 비용으로 옮기려 한다. GPT-5.6 Sol은 DeepSWE v1.1에서 72.7%를 기록했고, Claude Fable 5의 69.9%보다 높으면서 추정 API 비용은 36.2% 낮다고 제시됐다.
NVIDIA의 Nemotron 3 Embed가 LMEB에서 8B 모델 1위, 1B 모델 2위를 기록하며 에이전트 기억 검색 경쟁을 넓혔다. Hugging Face 글에 따르면 8B는 LMEB 64.4, 1B BF16은 61.5를 기록해 장기 대화 검색 성능을 전면에 세웠다.
GPT-5.6 Sol이 “The Last Ones” 사이버 레인지에서 새 최고 기록을 세우며, OpenAI는 이 성능을 Codex Security의 코드 취약점 탐지와 검증 흐름으로 연결했다. 보안팀 관점에서는 벤치마크 점수보다 실제 저장소에서 취약점을 찾고 고치는 시간이 핵심 숫자다.
2.8T 파라미터와 1M-token context를 내건 Kimi K3가 공개되며 open-weight 모델의 규모 경쟁이 다시 커졌다. 전체 가중치는 2026년 7월 27일까지 공개될 예정이고, 현재는 Kimi.com·Kimi Code·API에서 사용할 수 있다.
RAG와 에이전트의 품질 병목이 검색 모델로 이동하고 있다. NVIDIA는 Nemotron 3 Embed 8B가 RTEB 전체 1위에 올랐고 32k context와 1B 변형을 함께 제공한다고 밝혔다.
멀티모달 추론 모델의 공개 경쟁이 한 단계 더 치열해졌다. Thinking Machines는 Inkling 전체 가중치를 공개하고, 64K와 256K 컨텍스트 옵션 및 Tinker fine-tuning 경로를 함께 열었다.
HN의 논점은 “느리지만 된다”가 아니라 비용과 제어권이었다. 오래된 dual Xeon E5-2690 v2가 ik_llama.cpp 패치로 Gemma 4 26B-A4B를 CPU-only로 돌리며 local inference의 현실선을 다시 그었다.
HN의 관심은 benchmark 1등보다 조합에 모였다. Thinking Machines Lab의 Inkling은 multimodal MoE, 조절 가능한 reasoning effort, Tinker fine-tuning을 한 묶음으로 내세우며 open-weight 모델의 쓰임새를 다시 묻는다.
코딩 에이전트 경쟁이 폐쇄형 제품만의 싸움이 아니게 됐다. xAI는 Grok Build와 CLI 코드를 공개하고 모든 사용자의 사용량 제한을 초기화했다고 밝혔다.
자율 에이전트 위험은 블랙메일 실험에서 끝나지 않았다. Anthropic은 코드 사보타주, 사기 지원, 라벨 조작, 내부고발 유도 등 4가지 시뮬레이션 실패 모드를 제시했다.