Perplexity가 agent 검색을 단일 API 호출이 아니라 Python code로 조립하는 구조로 바꿨다. 회사는 CVE vendor advisory 사례에서 token 사용량이 288.7K에서 42.9K로 85.1% 줄었다고 제시했다.
Perplexity가 agent 검색을 단일 API 호출이 아니라 Python code로 조립하는 구조로 바꿨다. 회사는 CVE vendor advisory 사례에서 token 사용량이 288.7K에서 42.9K로 85.1% 줄었다고 제시했다.
LocalLLaMA의 관심은 “Claude 대체”보다 tool call 오류율 12%라는 구체적 한계에 모였다.
NVIDIA Vera가 full production에 들어가며 agentic AI 인프라의 병목을 CPU 작업으로 끌어올렸다. OpenAI, Anthropic, SpaceXAI, ByteDance, CoreWeave 등이 도입 또는 평가 대상으로 언급됐고, x86 대비 1.8배 빠른 task completion이 핵심 수치다.
NVIDIA가 GTC Taipei에서 550B 파라미터 MoE 모델 Nemotron 3 Ultra와 Agent Toolkit을 묶어 기업용 장시간 에이전트 스택을 전면에 세웠다. 공개 모델 대비 최대 5배 빠른 추론과 최대 30% 낮은 비용, 6월 4일 배포 일정이 핵심이다.
Anthropic이 5월 29일 Claude Platform on AWS에 Managed Agents webhooks, multiagent orchestration, self-hosted sandboxes를 열었다. Claude API를 AWS 결제·IAM 안에서 쓰는 흐름이 단순 모델 호출을 넘어 agent 운영 계층으로 확장된다.
Google I/O 2026의 핵심은 Gemini를 앱 안의 챗봇보다 넓은 실행 계층으로 밀어 올리는 흐름이다. Gemini 3.5 Flash는 API와 Antigravity, Search, Gemini app에 풀렸고, Gemini Omni는 video 생성과 편집을 전면에 세웠다.
Claude Opus 4.8의 강점이 코딩 벤치마크를 넘어 실제 업무형 에이전트 평가로 확장됐다. Artificial Analysis는 max effort 기준 1890점을 기록해 GPT-5.5 xhigh보다 121점 앞섰다고 밝혔다.
Le Chat이 Vibe로 바뀌며 장시간 업무 처리와 코딩 에이전트가 같은 제품 안으로 들어왔다. 웹·모바일 Work Mode, 원격 Code Mode, VS Code 확장, CLI가 함께 열렸고 Pro는 월 $14.99부터 시작한다.
벤치마크 점수 경쟁의 약한 고리가 문제 자체라는 연구가 나왔다. ABA는 168개 벤치마크를 훑어 평가 과제의 25.7% 이상에서 치명적 결함을 찾았고, 필터링 뒤 SWE-bench Verified 평균 성능은 9.9% 달라졌다.
xAI가 Grok Build를 유료 사용자 전체 베타로 열며, 챗봇을 앱·자동화 제작 도구로 확장했다. 트윗은 Plan Mode, Imagine, CLI를 한 흐름에 묶고 조회수 5,300만 회를 넘기며 빠르게 확산됐다.
Claude Code와 Cowork 같은 에이전트가 실제 업무 권한을 얻으면서, 위험의 초점은 모델 설득이 아니라 실행 환경 통제로 이동했다. Anthropic은 사용자 승인 프롬프트의 93%가 그대로 통과된다는 수치를 근거로 샌드박스와 격리를 전면에 세웠다.
관심은 병렬 agent 자체보다 “검토 가능한 단위로 쪼갤 수 있나”와 local-first 설계에 모였다.