7월 24일 출시된 Claude Opus 5는 상위 모델 Fable 5와 대등한 성능을 절반 가격에 제공한다. ARC-AGI 3에서 전작의 20배인 30.2%를 기록했고 100만 토큰 컨텍스트를 기본 지원한다.
플래그십 성능을 절반 가격에 제공하는 Claude Opus 5
| 구분 | 내용 |
|---|---|
| 모델 | Claude Opus 5 (claude-opus-5) |
| 개발사 | Anthropic |
| 출시일 | 2026년 7월 24일 |
| 공식 발표 | anthropic.com/news/claude-opus-5 |
지난 두 달 사이 네 번째 모델을 내놓은 Anthropic이 이번에는 방향을 바꿨다. 더 강한 모델이 아니라 플래그십급 성능을 절반 가격에 제공하는 모델이다. 7월 24일 출시된 Claude Opus 5는 자사 최상위 모델인 Claude Fable 5와 대부분의 코딩 및 지식노동 벤치마크에서 대등하거나 앞선다. 그러면서 토큰 가격은 절반이다.
핵심 스펙
| 항목 | 내용 |
|---|---|
| 모델 타입 | 프론티어 LLM (텍스트와 비전 입력을 지원하며 thinking이 기본 활성화) |
| 컨텍스트 윈도우 | 100만 토큰 (단일 구성이며 축소 버전 없음) |
| 최대 출력 | 128K 토큰 |
| 지식 컷오프 | 2026년 5월 (Anthropic 라인업 중 가장 최신) |
| 가격 | 100만 토큰 기준 입력 $5 / 출력 $25 (Opus 4.8과 동일) |
| 접근 방식 | API 전용 (클로즈드 웨이트) |
주목할 점은 가격 정책이다. Opus 4.8과 같은 가격을 유지하면서 성능만 끌어올렸다. 결과적으로 상위 티어인 Fable 5 대비 토큰당 비용이 절반이 됐다. 별도의 Fast mode는 약 2.5배 빠른 속도를 2배 가격에 제공한다.
벤치마크 결과
Opus 4.8 대비 향상 폭이 이례적으로 크다.
| 벤치마크 | Opus 5 성적 | 비교 |
|---|---|---|
| Frontier-Bench v0.1 | 43.3% | Opus 4.8(18.7%)의 2배 이상이며 경쟁 모델 전부를 더 낮은 비용으로 추월 |
| ARC-AGI 3 | 30.2% | Opus 4.8(1.5%)의 약 20배이자 차순위 모델의 약 3배 |
| CursorBench 3.2 (max effort) | Fable 5 최고 점수와 0.5%p 이내 | 작업당 비용은 절반 |
| OSWorld 2.0 (컴퓨터 사용) | Fable 5 최고 기록 상회 | 약 3분의 1 비용으로 달성 |
| Zapier AutomationBench | 경쟁 모델 대비 약 1.5배 통과율 | 동일 비용 기준 |
종합 지능 지표에서도 출시 이틀 만에 선두에 올랐다. Artificial Analysis Intelligence Index v4.1 기준 60.7로 자사 Fable 5(59.9)와 GPT-5.6 Sol(58.9)을 근소하게 앞선 1위다. BenchLM의 2026년 7월 26일 스냅샷 기준이다.
패턴이 일관적이다. 절대 성능에서 Fable 5와 붙고 비용 효율에서는 명확히 이긴다. Anthropic은 결과를 검증하고 성공할 때까지 신중하게 반복하는 능력이 크게 강해졌다고 강조했다. 이는 장시간 에이전트 작업에서 실패한 시도를 스스로 감지하고 복구하는 능력을 뜻한다.
무엇이 달라졌나
Opus 5의 강점으로 꼽힌 영역은 소프트웨어 엔지니어링과 장기 에이전트 작업 그리고 유기화학과 단백질 분석 같은 과학 연구다. 시각적 아티팩트 생성도 포함된다. 공통분모는 여러 단계에 걸쳐 스스로 작업을 검증해야 하는 태스크라는 점이다.
ARC-AGI 3에서의 20배 점프가 특히 흥미롭다. ARC-AGI는 암기가 통하지 않는 추상 추론 벤치마크다. 이 정도 상승은 단순한 스케일업이 아니라 추론 방식 자체의 개선을 시사한다.
안전성 지표도 함께 공개됐다. 최근 Anthropic 모델 중 가장 낮은 misaligned behavior 점수(2.3)를 기록했다. 사이버 보안 분류기의 개입 빈도는 Fable 5 대비 약 85% 감소했다.
한계와 맥락
사이버 공격 익스플로잇이나 자율 생물학 연구 같은 이중용도 위험 영역에서는 상위 모델인 Mythos 5보다 의도적으로 능력을 제한했다. 바이너리 취약점 스캐닝과 익스플로잇 생성 요청은 기본 차단되며 플래그된 요청은 Opus 4.8로 폴백 라우팅된다.
두 달 새 네 번째 릴리스라는 속도 자체가 시사하는 바가 있다. 프론티어 랩들의 출시 주기가 분기 단위에서 주 단위로 압축되고 있다.
Cortexys의 시각
Opus 5의 진짜 의미는 벤치마크 수치보다 가격 곡선에 있다. 플래그십급 성능이 절반 가격으로 내려오는 일이 6개월 주기로 반복된다면 지금 비용 문제로 보류된 AI 프로젝트의 상당수가 곧 채산성을 갖추게 된다. 에이전트 워크로드를 설계할 때 모델 비용을 고정 상수가 아니라 반감기를 가진 변수로 두고 아키텍처를 짜야 하는 이유다.
특히 국내 기업 입장에서는 최상위 모델과 한 단계 아래 모델 사이의 선택 계산이 달라졌다. Opus 5는 대부분의 실무 워크로드에서 그 질문 자체를 무의미하게 만든다.
참고 자료
| 자료 | 링크 |
|---|---|
| Anthropic 공식 발표 | anthropic.com/news/claude-opus-5 |
| Claude Platform Docs | What's new in Opus 5 |
| TechCrunch 보도 | Anthropic launches Opus 5 |
코텍시스 AI 인사이트 최신 논문 리뷰
활성값을 보고 가중치를 지키는 AWQ 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.ai에서 맞춤 AI 개발 서비스를 확인하세요.


![[모델] 플래그십 성능을 절반 가격에 제공하는 Claude Opus 5](https://www-cdn.anthropic.com/images/4zrzovbb/website/54b7ab1d2c2521f83ae5d2da5f9d99321c370d24-2880x1620.png)

