Composer 2.5, Grok Build에 장기 작업용 코딩 모델로 투입되며 xAI 도구 확장
xAI가 Composer 2.5를 Grok Build 안에 넣었다. 공식 트윗은 복잡한 지시와 장기 작업에 강한 모델이라고 설명했고, 64만 회 이상 조회되며 개발자 도구 경쟁을 키웠다.
카테고리
Insights의 LLM 기사
xAI가 Composer 2.5를 Grok Build 안에 넣었다. 공식 트윗은 복잡한 지시와 장기 작업에 강한 모델이라고 설명했고, 64만 회 이상 조회되며 개발자 도구 경쟁을 키웠다.
OpenAI frontier models와 Codex가 Amazon Bedrock에서 일반 제공으로 전환됐다. 100만 회 이상 조회된 공식 트윗은 기업 보안·컴플라이언스 흐름 안에서 OpenAI 도구를 쓰는 새 경로를 제시했다.
NVIDIA가 GTC Taipei에서 550B 파라미터 MoE 모델 Nemotron 3 Ultra와 Agent Toolkit을 묶어 기업용 장시간 에이전트 스택을 전면에 세웠다. 공개 모델 대비 최대 5배 빠른 추론과 최대 30% 낮은 비용, 6월 4일 배포 일정이 핵심이다.
LocalLLaMA의 관심은 “돌아간다”보다 메모리 숫자에 있었다. RDNA3에서 Flash Attention과 KV quantization 조합이 실제 local LLM 운영에 어떤 여유를 주는지가 쟁점이다.
관심은 성능 자랑보다 README의 학습 설계에 모였다. vLLM의 핵심을 작은 코드와 수업 흐름으로 재구성한 점이 반응을 얻었다.
토큰 사용량과 투자자 구성이 함께 주목을 받았다. HN 댓글의 관심은 “모델 라우터가 독립 인프라로 남을 수 있나”에 모였다.
Anthropic이 5월 29일 Claude Platform on AWS에 Managed Agents webhooks, multiagent orchestration, self-hosted sandboxes를 열었다. Claude API를 AWS 결제·IAM 안에서 쓰는 흐름이 단순 모델 호출을 넘어 agent 운영 계층으로 확장된다.
NVIDIA가 Dynamo serving stack을 빠르게 실험하는 DynoSim을 공개했다. 기술 블로그 기준 Apple M4 MacBook Air에서 23,608개 요청, 60.1분 분량 트래픽을 2.41초에 재현해 약 1,500배 빠른 시뮬레이션을 보였다.
xAI가 Grok Build CLI의 기반 모델을 API 베타로 열며 가격을 전면에 세웠다. 입력 100만 토큰당 $1, 출력 100만 토큰당 $2는 코딩 에이전트 비용 경쟁을 직접 겨냥한 수치다.
Liquid AI가 38조 토큰으로 학습한 8B-A1B MoE 모델 LFM2.5를 공개했다. M5 Max에서 초당 253토큰, 모바일에서 30토큰, H100에서 초당 1만 8500토큰의 추론 성능을 자랑하며 동급 밀집 모델을 상회한다.
LLM inference 운영에서 비싼 GPU 실험을 먼저 돌릴 필요가 줄어든다. NVIDIA DynoSim은 23,608개 request trace를 Apple M4 MacBook Air에서 2.41초에 재생하며 real time 대비 약 1,500배 빠른 serving simulation을 제시했다.
OpenAI가 Codex의 computer use를 Windows로 넓히며 코딩 에이전트의 실행 위치를 바꿨다. 2026년 5월 29일 게시물 기준 조회수는 95만 회를 넘었고, ChatGPT 모바일 앱에서 Windows 작업을 검토하고 지시할 수 있다.