Claude Fable 5.1, 과학 벤치마크 52.6%로 두 배…캐시 비용은 75% 인하
과학 연구 벤치마크 점수가 24.7%에서 52.6%로 뛰고, 일반 작업 비용은 약 25% 낮아졌다. Anthropic은 같은 기반 모델을 일반용 Fable 5.1과 제한형 Mythos 5.1로 나눠 배포하면서 성능·가격·안전장치를 한꺼번에 손봤다.
원문: Claude Fable 5.1 and Mythos 5.1 원문 보기 →
과학 연구 벤치마크 성적이 한 세대 안에서 두 배 넘게 뛰었다. Anthropic이 9월 1일 공개한 Claude Fable 5.1은 Terminal-Bench-Science 0.1에서 52.6%를 기록했다. 이전 Fable 5의 24.7%, Opus 5의 29.0%, GPT-5.6 Sol의 22.4%와 비교하면 이번 갱신의 무게중심이 단순한 코딩 개선에만 있지 않다는 뜻이다.
Fable 5.1과 Mythos 5.1은 같은 기반 모델이지만 안전장치의 범위가 다르다. Fable 5.1은 Claude.ai와 Claude Code, API, AWS·Google Cloud·Microsoft Azure에서 바로 쓸 수 있다. Mythos 5.1은 사이버보안과 생명과학 전문 조직을 위한 신뢰 접근 프로그램에 한정된다. 일반 사용자에게 가장 강한 모델을 그대로 푸는 대신, 위험도가 높은 능력은 검증된 조직에만 열어 두는 이중 배포 구조다.
에이전트 코딩 지표도 상승했다. Terminal-Bench 4.0에서 Fable 5.1은 55.8%, 제한을 덜 적용한 Mythos 5.1은 60.9%를 기록했다. 이전 Fable 5는 42.0%, Opus 5는 52.3%였다. 업무 자동화 평가 AutomationBench에서는 31.4%로 Fable 5의 17.1%를 크게 앞섰고, CursorBench 3.2.0은 73.4%였다. 다만 이 수치들은 Anthropic이 자사 환경에서 측정한 결과이며, 일부 평가에서는 안전장치가 개입한 작업을 0점 처리하거나 다른 Claude 모델로 넘겼다는 조건도 함께 봐야 한다.
비용 변화는 장시간 에이전트 작업에 직접적이다. 캐시 읽기 가격은 100만 토큰당 0.25달러로 75% 내려갔다. Anthropic은 일반적인 토큰 과금 작업의 총비용이 Fable 5보다 약 25%, 에이전트 비중이 높은 작업은 최대 약 45% 줄어든다고 계산했다. 입력과 출력 가격은 각각 100만 토큰당 10달러와 50달러다.
연구 사례에는 실험 검증이 붙었다. Mythos 5.1이 설계한 단백질 결합체는 12개 표적에서 약 50%의 적중률을 냈다. Anthropic이 제시한 통상 범위 10~15%보다 높다. 세 표적에서는 기존 단백질 설계 대회 최상위 결과보다 결합 친화도가 10배 높았다. 또 공개된 생물학 모델 7개의 GPU 커널을 고쳐 최대 2.5배 빠르게 만들었고, 전장유전체 분석 비용 추정치는 30~60% 낮췄다.
안전장치도 더 세밀해졌다. 새 사이버보안 필터는 정상 요청을 막는 비율을 이전보다 60% 줄였고, 방어 목적의 취약점 탐색은 허용한다. 침투 테스트와 익스플로잇 생성, 바이너리 기반 취약점 스캔은 여전히 더 제한된 모델로 전환된다. 성능 향상보다 눈여겨볼 변화는 강한 능력을 하나의 공개 범위로 묶지 않았다는 점이다. 앞으로의 경쟁은 점수뿐 아니라 어떤 능력을 누구에게, 어떤 데이터 보존 조건으로 제공하는지에서도 갈릴 가능성이 크다.
관련 기사
연구자, Claude Code 자동 모드 프롬프트 인젝션 공격 시연
보안 연구자 요한 레버거가 8월 27일 Claude Code 자동 모드에서 프롬프트 인젝션 공격에 성공했다고 공개했다. Anthropic의 보안 조치에도 불구하고 코딩 에이전트의 구조적 취약점이 다시 확인됐다.
Claude가 실제 시스템 3건 침범…Anthropic, 사이버 평가에 실시간 차단 도입한 후속 조치
사전 출시 모델의 사이버 평가가 실제 시스템 침범으로 이어진 3건 이후, Anthropic이 단일 샌드박스 의존을 버리고 실시간 차단 분류기를 배치했다. 외부 평가를 일시 중단한 뒤 재개했으며, 고위험 RL 환경 일부는 아직 멈춰 있다.
Claude Opus 5, Fable급 코딩 성능을 절반 가격대로 낮춘 일상형 고성능 모델
일상형 고성능 모델 경쟁의 초점이 최고점보다 비용당 성능으로 옮겨갔다. Claude Opus 5는 Fable 5에 가까운 코딩·지식 작업 성능을 절반 가격으로 내세우며, API 가격은 입력 $5/M·출력 $25/M 토큰으로 책정됐다.