DeepSeek 시각 토큰 추론, LocalLLaMA가 더 크게 반응한 건 아이디어와 삭제 타이밍
LocalLLaMA가 크게 반응한 건 DeepSeek가 점과 박스를 추론 단위로 끌어올렸기 때문이다. 저장소가 곧바로 비공개로 바뀌면서 관심은 더 커졌다.
카테고리
Insights의 LLM 기사
LocalLLaMA가 크게 반응한 건 DeepSeek가 점과 박스를 추론 단위로 끌어올렸기 때문이다. 저장소가 곧바로 비공개로 바뀌면서 관심은 더 커졌다.
Warp가 여는 것은 소스코드만이 아니다. 클라이언트를 AGPL로 공개하고 제품 이슈와 로드맵을 GitHub 앞으로 옮기면서, 거의 100만 명의 활성 개발자가 Oz 기반 에이전트 빌드를 공개적으로 감독하는 구조를 만들었다.
중요한 점은 장문맥과 edge-side agent가 말만 그럴듯한지, 실제로 돌릴 만한지의 갈림길이 결국 커널 최적화에 있다는 데 있다. Qwen는 FlashQLA가 NVIDIA Hopper에서 FLA Triton 대비 전방 2~3배, 역전파 2배 속도를 냈다고 적었다.
중요한 점은 model이 빨라져도 orchestration 비용이 이득을 잡아먹을 수 있다는 데 있다. OpenAI는 WebSocket 모드로 agent workflow를 종단 간 최대 40% 줄였고, 체감 추론 속도도 초당 약 65토큰에서 1,000토큰에 가깝게 끌어올렸다고 적었다.
LocalLLaMA가 이 글에 반응한 이유는 홍보 문구가 아니라 숫자였다. RTX 5060 Ti 16GB 두 장으로 Qwen3.6 27B를 약 60 tok/s, 204k 컨텍스트까지 밀어본 실측값이 나왔다.
HN은 농담보다 원인을 봤다. OpenAI가 Nerdy 성격 보상 신호 때문에 goblin 비유가 GPT-5 계열 전반으로 번졌다고 풀어낸 글이다.
멀티모달 에이전트의 병목은 정확도보다 처리량이다. NVIDIA Nemotron 3 Nano Omni는 최대 9배 높은 처리량, 256K 컨텍스트, 6개 리더보드 1위를 앞세워 그 병목을 정면으로 겨냥했다.
Musk v. Altman 재판 4일차에서 일론 머스크가 xAI가 지식 증류 기법으로 OpenAI 모델을 활용해 Grok을 훈련했다고 인정했다. 이용약관 위반 여부와 소송 전략의 자기모순이 쟁점으로 부상했다.
코딩 에이전트 경쟁이 IDE 안에서 끝나지 않는다는 점을 Cursor가 분명히 했다. Cursor는 동일한 runtime·harness·model을 SDK로 열어 CI/CD, 백그라운드 자동화, 제품 내 임베드까지 노린다고 적었다.
LocalLLaMA가 Granite 4.1에 반응한 이유는 IBM이 요즘 유행과 반대로 갔기 때문이다. 3B·8B·30B dense 모델을 중심에 두고 instruction following과 tool calling, 운영 비용, 예측 가능한 동작을 전면에 세우자 “실서비스용 모델”로 읽는 반응이 나왔다.
LocalLLaMA가 MiMo-V2.5-Pro에 크게 반응한 이유는 오픈소스와 스펙이 동시에 세게 들어왔기 때문이다. MIT 라이선스, 1.02T total, 42B active, 1M context라는 숫자는 매력적이었지만, 댓글은 곧바로 “이걸 누가 어떤 장비로 돌리나”로 넘어갔다.
HN이 이 버그에 몰린 이유는 이상해서다. 최근 git 커밋 메시지에 HERMES.md가 있으면 Claude Code 요청이 Max 포함량이 아니라 extra usage 과금으로 빠졌다는 재현이 올라왔고, 환불 대응까지 얽히며 논쟁이 더 커졌다.