본문으로 건너뛰기

Claude Opus 5, Fable급 코딩 성능을 절반 가격대로 낮춘 일상형 고성능 모델

Original: Introducing Claude Opus 5 View original →

Read in other languages: English日本語
LLM Jul 25, 2026 By Insights AI 2 min read Source

최고 모델을 매번 쓰기 부담스러웠던 개발팀에는 가격표가 먼저 보인다. Claude Opus 5는 Anthropic의 최상위 Fable 5에 가까운 코딩·지식 작업 성능을 절반 비용으로 제공한다는 점을 앞세운 모델이다. API 가격은 입력 $5 per million tokens, 출력 $25 per million tokens로 Opus 4.8과 같고, Claude Max의 기본 모델이자 Claude Pro에서 쓸 수 있는 가장 강한 모델로 배치됐다.

성능 메시지는 단순한 세대 교체보다 비용당 작업 완료율에 맞춰져 있다. Anthropic은 Opus 5가 Frontier-Bench v0.1에서 다른 모델을 앞섰고, Opus 4.8 대비 성능을 두 배 이상 끌어올렸다고 설명한다. CursorBench 3.2의 max effort 기준으로는 Fable 5 최고 점수와 0.5% 안쪽 차이에 머물렀고, 비용은 절반 수준이라는 점을 내세웠다. ARC-AGI 3에서는 다음 순위 모델보다 3배 높은 점수, Zapier AutomationBench에서는 같은 비용당 약 1.5배 높은 pass rate를 기록했다는 설명도 붙었다.

실제 제품 선택에서 중요한 대목은 agent 작업의 안정성이다. Anthropic은 Opus 5가 코드베이스를 오래 따라가며 검증과 반복을 더 잘 수행한다고 주장한다. 예시로는 그림을 직접 볼 수 없는 조건에서 픽셀을 분석하는 컴퓨터 비전 파이프라인을 만들어 FreeCAD 모델을 복원한 Frontier-Bench 과제, 오픈소스 패키지 매니저의 실제 버그에서 표면 증상이 아닌 근본 원인을 고친 사례가 제시됐다. 이런 사례는 모델 홍보 문구보다 “긴 작업을 끝까지 밀고 갈 수 있는가”라는 구매 기준에 가깝다.

과학 작업에서도 개선 폭을 강조했다. Opus 5는 구조생물학, 유기화학, 생물정보학을 포함한 Anthropic의 생명과학 평가 전반에서 Opus 4.8보다 높았고, 분광 데이터로 분자 구조를 추론하는 유기화학 과제에서는 내부 benchmark 기준 10.2 percentage points, 단백질 변이 기능 예측에서는 7.7 percentage points 앞섰다고 밝혔다. 범용 모델이 연구 보조 도구로 들어갈 때, 이런 세부 과제 점수는 단순 채팅 성능보다 더 직접적인 신호다.

안전 설계는 더 미묘하다. Opus 5는 Mythos 5보다 생물학 연구와 offensive cybersecurity에서 뒤처지도록 평가됐고, Anthropic은 Opus 4.8과 비슷한 safeguards를 적용하되 일부 cyber task에는 더 강한 guardrail을 넣었다고 설명한다. 다만 Fable 5보다 cyber classifier가 덜 제한적이어서, 안전 분류기가 개입하는 빈도는 약 85% 낮을 것으로 예상했다. Claude.ai, Claude Code, Claude Cowork에서는 플래그된 요청이 기본적으로 Opus 4.8로 fallback될 수 있고, API에도 automatic fallbacks beta가 붙는다.

이번 출시의 관전점은 “가장 강한 모델” 자체보다 배치 방식이다. Anthropic은 Fable 5를 정점 모델로 남겨두면서, Opus 5를 매일 쓰는 고성능 기본값으로 밀고 있다. 비용, safeguards, fallback, effort setting을 함께 조정하는 구조라면 기업 고객은 모델 하나를 고르는 대신 작업 위험도와 예산에 따라 라우팅을 설계하게 된다. 다음 비교 대상은 공개 benchmark의 순위보다 실제 코드 리뷰, 데이터 분석, 과학 워크플로에서 Opus 5가 Fable 5 사용량을 얼마나 대체하는지다.

Share: Long

Related Articles