Claude 내부 지표, AI가 AI 개발을 앞당기는 속도를 52배 실험으로 제시
AI 연구 자동화가 추상적 위험에서 실험 지표로 이동했다. Anthropic은 Mythos Preview가 최적화 과제에서 약 52배 속도 향상을 냈고, 연구 다음 단계 판단에서도 64% 우위를 보였다고 밝혔다.
카테고리
Insights의 AI 기사
AI 연구 자동화가 추상적 위험에서 실험 지표로 이동했다. Anthropic은 Mythos Preview가 최적화 과제에서 약 52배 속도 향상을 냈고, 연구 다음 단계 판단에서도 64% 우위를 보였다고 밝혔다.
HN 댓글은 solve rate보다 guardrail, 작업 방식, 보안 연구용 계정 조건이 결과를 얼마나 바꿨는지에 주목했다.
MachineLearning 댓글은 “AI detector가 보조도구인지 결정권자인지”를 놓고 강하게 갈렸다.
주정부별 frontier AI 법안이 연방 표준의 출발점으로 올라섰다. OpenAI는 CAISI를 상설 평가기관으로 키우고, 고위험 모델에 독립 감사와 사고 보고, 모델 가중치 보안 의무를 붙이는 3단계 청사진을 제시했다.
Codex가 개발 도구에서 업무별 에이전트 표면으로 넓어지고 있다. OpenAI는 역할별 플러그인에 62개 앱과 110개 스킬을 묶고, Business·Enterprise용 Sites 미리보기를 시작했다.
AI 보안의 쟁점이 피싱 작성에서 침투 이후 자동화로 이동하고 있다. Anthropic은 832개 악성 계정을 MITRE ATT&CK에 매핑했고, 중위험 이상 행위자 비율이 33%에서 56%로 뛰었다고 밝혔다.
Perplexity가 agent 검색을 단일 API 호출이 아니라 Python code로 조립하는 구조로 바꿨다. 회사는 CVE vendor advisory 사례에서 token 사용량이 288.7K에서 42.9K로 85.1% 줄었다고 제시했다.
Microsoft AI가 7개 자체 모델을 내놓으며 OpenAI 의존도를 낮추는 경로를 더 구체화했다. 핵심 수치는 MAI-Thinking-1의 35B active parameter, 256K context, AIME 2025 97%, SWE Bench Pro 53%다.
NVIDIA Vera가 full production에 들어가며 agentic AI 인프라의 병목을 CPU 작업으로 끌어올렸다. OpenAI, Anthropic, SpaceXAI, ByteDance, CoreWeave 등이 도입 또는 평가 대상으로 언급됐고, x86 대비 1.8배 빠른 task completion이 핵심 수치다.
Claude를 운영하는 Anthropic이 SEC에 비공개 S-1을 제출하면서 IPO 선택권을 확보했다. 최근 650억 달러 Series H와 9,650억 달러 평가 이후라, AI 기업 가치 산정의 공개 검증이 가까워졌다.
Google Cloud가 Nano Banana 2와 Nano Banana Pro를 5월 29일 GA로 전환했다. 1K·2K 출력은 정식 지원, 4K는 preview로 남고, Nano Banana 2에는 video input prompt preview가 붙어 이미지 생성 API의 적용 범위가 넓어졌다.
Tesla가 FSD Supervised로 캐나다 횡단 주행을 수행했다고 밝혔다. 밴쿠버에서 핼리팩스까지 3,760마일, 6,051km를 “zero human input”으로 달렸다는 수치가 핵심이다.