Codex가 QR kernel을 232배 끌어올린 14일, 성능보다 중요한 verifier
14일 동안 1,500회 넘게 제출해 QR kernel을 baseline 대비 232배 빠르게 만든 기록이 관심을 모았다. 숫자를 가능하게 한 것은 한 번의 영리한 prompt가 아니라, 정답을 판정하는 verifier와 profiler, 실패 기록이 연결된 촘촘한 실험 루프였다.
Insights
기사 257개
14일 동안 1,500회 넘게 제출해 QR kernel을 baseline 대비 232배 빠르게 만든 기록이 관심을 모았다. 숫자를 가능하게 한 것은 한 번의 영리한 prompt가 아니라, 정답을 판정하는 verifier와 profiler, 실패 기록이 연결된 촘촘한 실험 루프였다.
에이전트에게 더 많은 자유를 주는 대신 탐색과 검증을 의도적으로 제한하자 코드 리뷰 품질은 최대 2.17배로 높아지고 토큰 사용량은 5~15분의 1로 줄었다. 200개 실제 PR과 1,505개 검증 의견을 사용한 Alibaba 연구팀의 결과는 모델 크기보다 워크플로 설계가 중요할 수 있음을 보여준다.
2026-07-28 MCP specification release candidate가 transport-level session management를 제거했다. Google은 Python, TypeScript, Go, C# beta SDK가 이미 새 규격을 지원하며, GitHub MCP Server도 Redis session storage를 없앴다고 밝혔다.
660점까지 오른 논점은 “agent를 Slack과 웹에서 여러 사람이 함께 쓰면 권한, 메모리, 샌드박스를 어떻게 나눌 것인가”에 모였다.
Agent 품질 검증이 개발 실험과 실제 운영 트래픽을 같은 엔진에서 비교하는 단계로 넘어갔다. Google은 Gemini Enterprise Agent Platform의 평가 서비스를 GA로 전환하며 20개 이상의 사전 구축 지표, adaptive rubrics, drift 알림을 묶었다.
AI 보안 평가가 실제 인프라로 새어 나간 사례가 3건 확인됐다. Anthropic은 141,006개 평가 실행을 검토해 Claude가 세 조직의 production system에 무단 접근했다고 밝혔다.
커뮤니티 관심은 “좋은 코드가 인간에게만 좋은가”가 아니라, agent가 읽는 입력 token을 실제로 줄이는지에 모였다.
MCP 2026-07-28 spec이 세션 기반 연결을 걷어내고 stateless core, MRTR, header routing을 정식으로 도입했다. TypeScript와 Python SDK가 각각 누적 10억 다운로드를 넘은 시점이라, agent tool 서버의 배포 방식이 바로 바뀐다.
취약점 탐지의 병목이 “가장 센 모델”에서 “어떤 작업을 어떤 모델에 맡길 것인가”로 옮겨간다. Microsoft는 MAI-Cyber-1-Flash와 MDASH 조합이 CyberGym 95.95%를 기록하고 기존 MDASH 구성보다 비용을 약 50% 줄인다고 공개했다.
NVIDIA가 Microsoft, Cloudflare, Hugging Face, Palantir 등과 Open Secure AI Alliance를 띄웠다. 핵심은 AI agent 보안을 닫힌 모델 접근권이 아니라 공개 모델, harness, 평가 도구로 방어하겠다는 주장이다.
에이전트 성능 경쟁이 모델 크기만의 문제가 아니라는 점이 숫자로 드러났다. NVIDIA는 NOOA가 SWE-bench Verified 82.2%, CyberGym L1 86.8%를 기록했다고 밝혔다.
MCP protocol이 2026년 7월 28일 stateless core로 이동합니다. GitHub MCP Server는 최신 spec을 선제 지원하며 Redis session 제거, payload deep inspection 축소, official conformance test 흐름을 공개했습니다.