Nemotron-TwoTower 공개, autoregressive LLM을 diffusion으로 돌리는 실험
LocalLLaMA의 관심은 “diffusion LLM이 실제로 빠른가”에 모였다. NVIDIA는 98.7% 품질 유지와 2.42배 throughput을 제시했다.
카테고리
Insights의 LLM 기사
LocalLLaMA의 관심은 “diffusion LLM이 실제로 빠른가”에 모였다. NVIDIA는 98.7% 품질 유지와 2.42배 throughput을 제시했다.
300점 안팎의 HN 반응은 “secret이 안 샜다”보다 실험 조건이 실제 에이전트 위험을 얼마나 반영하는지에 모였다.
241점을 받은 HN 논의는 기능 출시보다 실제 작업을 맡길 때의 신뢰 경계에 집중했다.
Google Research는 Gemini-2.5와 Qwen3-32B 실험에서 reasoning이 단순 사실 질문의 회상을 돕는 두 메커니즘을 분리했다. 추가 토큰은 계산 시간을 주고, 관련 사실은 정답 회상을 prime하지만 hallucination이 끼면 정확도가 떨어졌다.
모델 선택이 정적 리더보드에서 실행 중 라우팅 문제로 바뀌고 있다. OpenRouter는 Benchmarks API로 Artificial Analysis와 Design Arena 등 실시간 점수를 에이전트가 조회할 수 있게 했고, GLM-5.2가 코딩과 디자인 모두에서 최상위라고 적었다.
에이전트 경쟁의 초점이 답변 생성에서 화면 조작으로 이동하고 있다. Google DeepMind는 Gemini 3.5 Flash에 브라우저, 모바일, 데스크톱 인터페이스를 다루는 기본 computer use 도구를 넣었다고 밝혔다.
Codex가 코딩 도구를 넘어 지식노동의 실행 계층으로 이동하고 있다. OpenAI의 새 Economic Research는 조직 사용자 중 비개발자 Codex 사용자가 2025년 8월 이후 189배 늘었고, 개인 사용자 70.2%가 1시간 이상 걸릴 작업을 맡겼다고 집계했다.
ChatGPT의 기본 사용 경험이 더 많은 의사결정·추천 질의를 겨냥해 조정된다. OpenAI는 GPT-5.5 Instant가 복잡한 제약을 더 안정적으로 따르고, 유료 사용자는 6월 24일, 무료 사용자는 6월 25일부터 받는다고 밝혔다.
LLM 경쟁의 병목이 모델 크기에서 추론 인프라로 이동하고 있다. OpenAI는 Broadcom과 만든 Jalapeno가 9개월 만에 테이프아웃됐고 2026년 말부터 기가와트 규모 배치를 목표로 한다고 밝혔다.
r/MachineLearning의 관심은 새 OCR 모델 이름보다 비교 가능한 기준에 모였다. Baidu Unlimited-OCR와 Mistral OCR 4가 같은 주에 나오면서 문서 ingestion 성능을 한곳에서 보려는 수요가 커졌다.
AI agent가 개인 채팅창을 벗어나 팀 채널의 기억과 권한을 갖기 시작했다. Anthropic은 2026년 6월 23일 Claude Tag를 Claude Enterprise·Team 고객용 Slack beta로 열고, 내부 제품팀 코드의 65%가 이 방식에서 나온다고 밝혔다.
취약점 탐지가 빨라진 뒤 남은 병목은 실제 패치다. OpenAI는 GPT-5.5-Cyber가 CyberGym에서 85.6%를 기록했고 Codex Security가 3만 개 이상 코드베이스를 스캔했다고 밝혔다.