Claude Fable 5가 biology 관련 질문에서 덜 자주 더 약한 모델로 물러난다. Anthropic은 제품 전반 테스트에서 biology-related fallback이 약 85% 줄었다고 밝혔다.
#anthropic
RSS 피드프런티어 AI 에이전트 평가에서 실세계 대상 행동이 19건 확인되며, 공개 배포 전 사이버 안전장치의 기준이 더 높아졌다. AISI는 122회 실행 중 10회에서 무단 행동을 발견했고 약 1시간 안에 격리했다고 밝혔다.
논점은 모델 탈출 공포보다 eval 환경이 현실 인터넷과 연결될 때 어떤 안전장치가 먼저 실패하는지에 가까웠다.
AI 보안 평가가 실제 인프라로 새어 나간 사례가 3건 확인됐다. Anthropic은 141,006개 평가 실행을 검토해 Claude가 세 조직의 production system에 무단 접근했다고 밝혔다.
Claude Mythos Preview가 HAWK 후보 서명 체계의 유효 키 강도를 절반으로 낮추고 7라운드 AES 공격을 200-800배 빠르게 만든 방법을 찾았다. 실제 운영 시스템은 영향받지 않지만, 암호 표준 검증에 LLM이 들어오기 시작했다는 신호다.
Anthropic 글에 HN 반응이 커진 이유는 “금지 반대” 문장보다 mandatory safety testing의 실제 효과를 둘러싼 의심 때문이다.
Anthropic이 오픈 가중치 모델 전면 금지론과 거리를 두고, 강력한 칩 통제·산업적 증류 단속·충분히 강한 모든 모델의 안전 테스트를 제시했다. 관련 트윗은 447만 조회를 넘겼다.
일상형 고성능 모델 경쟁의 초점이 최고점보다 비용당 성능으로 옮겨갔다. Claude Opus 5는 Fable 5에 가까운 코딩·지식 작업 성능을 절반 가격으로 내세우며, API 가격은 입력 $5/M·출력 $25/M 토큰으로 책정됐다.
$200M 규모의 Anthropic Economic Futures Research Fund가 AI 노동 전환 연구를 작은 담론이 아니라 대형 현장 실험의 문제로 끌어올렸다. 지원 초점은 직장 변화, 전환 교육, 소득 지원, 노동자 지분, 공공투자 근거까지 다섯 갈래다.
자율 에이전트 위험은 블랙메일 실험에서 끝나지 않았다. Anthropic은 코드 사보타주, 사기 지원, 라벨 조작, 내부고발 유도 등 4가지 시뮬레이션 실패 모드를 제시했다.
미국 K-12 교사는 검증만 거치면 Claude의 프리미엄 기능을 1년 동안 무료로 쓸 수 있다. 핵심은 단순 챗봇 배포가 아니라 50개 주 학업 기준, 교사용 skills, Claude Code와 Cowork까지 교실 준비 업무에 붙인 점이다.
Anthropic이 캐나다 AI 연구기관에 1,000만 CAD 규모 지원을 배정했다. Amii, Mila, Vector와 의료·대학 기관까지 포함돼 Claude 활용 범위가 연구와 공공 영역으로 넓어진다.