Claude Opus 5.5, 과제당 비용으로 다시 짜는 모델 선택 기준
뉴스

Claude Opus 5.5, 과제당 비용으로 다시 짜는 모델 선택 기준

블로그로 돌아가기

Anthropic의 Claude Opus 5.5는 Fable 5.1급 성능을 Opus 5보다 40% 낮은 비용으로 제공합니다. 노력 수준별 과제당 비용, 새 안전장치와 검증 프로그램, 시스템 카드의 회귀 기록을 기업 관점에서 정리합니다.

AX Specialist 김지우Claude Opus 5.5Anthropic모델 선택AI 비용AI 안전

Fable 5.1급 성능과 40% 낮은 실행 비용

Anthropic이 2026년 9월 22일 Introducing Claude Opus 5.5를 공개했습니다. Claude 5.5 계열의 첫 모델입니다. Anthropic은 Opus 5.5가 대부분의 업무에서 Claude Fable 5.1 수준으로 작동하고 실행 비용은 Claude Opus 5보다 40% 낮다고 설명합니다. Claude Sonnet 5.5와 Claude Haiku 5.5는 앞으로 수주 안에 공개될 예정입니다.

Opus 5.5는 Anthropic이 프런티어 발전 속도를 조절해야 한다고 주장한 뒤 처음 내놓은 모델입니다. 출시 전에 Frontier Design과 METR 등 외부 평가 기관이 모델을 시험했습니다. 기업이 볼 지점은 세 가지입니다. 과제당 비용이 실제로 얼마나 줄었는지, 상위 모델인 Fable 5.1과 어떻게 나눠 쓸지, 새 안전장치가 업무에 어떤 제약을 주는지입니다. 이 글은 원문과 시스템 카드를 함께 정리합니다.

벤치마크 성적과 원문이 붙인 단서

Anthropic은 에이전트 코딩, 컴퓨터 사용, 지식 업무에서 Opus 5.5가 앞선다고 밝혔습니다. 별도 표기가 없으면 Claude 모델은 adaptive thinking의 max 노력 수준 결과입니다. Terminal-Bench 4.0만 Opus 5.5는 xhigh, GPT-6 Astra는 high 결과이며 각 모델의 최고 점수입니다. 차트에는 백분율 항목만 넣었습니다.

벤치마크Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.0 (에이전트 코딩)66.4%55.8%52.3%57.9%37.3%
FrontierCode v1.1 Main (에이전트 코딩)54.4%50.3%48.0%53.3%47.5%
CursorBench 4.0 (에이전트 코딩)57.8%51.8%46.6%미공개41.7%
GDPval-AA v2.1 (지식 업무, Elo)18461735170815421588
AutomationBench (업무 흐름)40.0%31.4%26.9%41.4%28.8%
Humanity's Last Exam (도구 사용)67.7%65.6%63.6%57.2%미공개
Terminal-Bench-Science 0.1 (과학 연구)58.7%52.6%29.0%64.6%22.4%
OSWorld 2.0 (컴퓨터 사용, 부분 점수)81.8%80.7%74.0%미공개미공개
Chartography (차트 인식, 도구 사용)89.0%88.4%83.4%미공개미공개

원문이 직접 붙인 단서가 있습니다. Anthropic은 이 수준에서 벤치마크 격차가 실제 차이를 잘 보여주지 못하며 자사 사용 경험상 Fable 5.1과의 차이는 점수보다 작다고 밝혔습니다. Opus 5.5는 운영 환경의 안전장치를 켠 채 평가했고 안전장치가 개입한 사이버보안 과제는 Claude Opus 4.8이, 생물학과 프런티어 LLM 개발 과제는 Opus 5가 대신 처리해 점수가 낮아졌을 가능성이 큽니다. AutomationBench는 Zapier가 대체 모델 없이 실행해 개입을 실패로 처리했습니다. GPT 계열 수치는 OpenAI 보고값입니다.

AutomationBench(41.4% 대 40.0%)와 Terminal-Bench-Science 0.1(64.6% 대 58.7%)에서는 GPT-6 Astra가 앞섰습니다. 업무 자동화나 과학 연구 에이전트가 주 용도라면 이 두 항목을 따로 봐야 합니다.

가격과 노력 수준별 과제당 비용

100만 토큰당 가격은 입력 4달러, 출력 20달러, 캐시 쓰기 5달러, 캐시 읽기 0.20달러입니다. Opus 5(5달러, 25달러, 6.25달러, 0.50달러)보다 앞의 세 항목은 20%, 캐시 읽기는 60% 내렸습니다. 원문은 캐시 읽기가 에이전트와 코딩 작업 비용의 대부분을 차지한다고 밝혔습니다. 토큰 단가 인하에 과제당 토큰 감소가 더해져 기본 설정의 일반 작업량 기준으로 40% 저렴해졌고 출력 속도는 30% 넘게 빨라졌습니다. Fast 모드는 최대 2.5배 속도에 입력 8달러, 출력 40달러입니다. 모델은 Amazon Web Services, Google Cloud, Microsoft Azure를 포함한 모든 플랫폼에서 바로 쓸 수 있고 Claude Platform의 모델명은 claude-opus-5-5입니다. Pro, Max, Team과 좌석 기반 Enterprise 요금제의 5시간 사용 한도도 늘었고 구독 사용자는 저장해 두었다가 쓰는 사용량 한도 초기화를 받습니다.

Terminal-Bench 4.0에서 노력 수준별 시도당 비용과 점수를 모델별로 그린 산점도로 Opus 5.5 곡선이 다른 모델보다 왼쪽 위에 있습니다
Terminal-Bench 4.0의 노력 수준별 점수와 시도당 비용(로그 척도). 출처: Anthropic

원문이 말하는 "약 5분의 1 비용"은 Opus 5.5 기본 노력 수준(medium) 57.6%(2.94달러)와 Opus 5 max 52.3%(15.83달러)를 비교한 값입니다. GPT-6 Astra high(57.9%, 7.21달러)와는 점수가 비슷하고 비용은 약 40%입니다. FrontierCode에서는 Opus 5.5 medium이 54.6%(0.80달러)로 Astra 최고 점수(53.3%, 4.36달러)를 약 5분의 1 비용으로 앞섰고 CursorBench에서는 medium 52.5%(2.90달러)가 GPT-5.6 Sol 최고 점수(41.7%, 8.23달러)보다 11포인트 높았습니다.

노력 수준을 최대로 올린 결과가 늘 가장 높지는 않습니다. Terminal-Bench 4.0에서 Opus 5.5는 xhigh 66.4%(7.35달러)가 max 64.8%(11.24달러)보다 높았고 FrontierCode에서도 medium이 max(54.4%)와 거의 같았습니다. 업무별로 몇 단계를 비교해 기본값을 정하는 편이 합리적입니다.

코딩 작업에서 확인된 결과

Anthropic은 Opus 5.5가 코드베이스 전체 마이그레이션과 감사처럼 길고 범위가 넓은 작업에 강하다고 설명합니다.

과제Opus 5.5비교 대상
20만 줄 코드베이스 감사와 수정 (조기 사용자)3시간 미만Opus 5: 20시간 초과, 토큰 2.5배
HAProxy를 C에서 Rust로 이전 (내부)9.5시간, 비용 51% 절감Fable 5.1: 12시간
웹앱 전 페이지 로딩 시간 단축 (내부)40회 중 39회 성공Opus 5: 개선 폭이 작고 앱 동작이 바뀜
68만 줄 코드 마이그레이션 (조기 사용자)하루 미만엔지니어링 팀 기준 수주 분량

HAProxy 이전은 두 모델 모두 자체 회귀 테스트를 거의 전부 통과했습니다. Opus 5가 웹앱 동작까지 바꾼 기록은 성능 최적화 과제에서 기존 동작 보존 여부를 함께 채점해야 하는 이유입니다. 원문은 코딩 에이전트 보안 구성으로 실행 전 모든 행동을 검사하는 분류기, 감사 가능한 오픈소스 샌드박스, 병합 전 코드 리뷰를 제시합니다. 프롬프트 인젝션에는 시험한 모든 환경에서 Opus 5와 같거나 더 강했고 Gray Swan 벤치마크에서는 Fable 5.1과 함께 가장 낮은 인젝션 성공률을 기록했습니다.

지식 업무와 소통 방식

GDPval-AA v2.1은 Artificial Analysis가 44개 직업의 실제 업무로 에이전트를 평가하는 벤치마크입니다.

GDPval-AA v2.1에서 노력 수준별 과제당 추정 비용과 Elo 점수를 모델별로 그린 산점도로 Opus 5.5가 medium 이상에서 가장 높습니다
GDPval-AA v2.1의 노력 수준별 Elo와 과제당 추정 비용(로그 척도). 출처: Anthropic

Opus 5.5 medium(1576, 0.86달러)은 GPT-6 Astra max(1542, 4.53달러)보다 높고 비용은 약 5분의 1입니다. 다만 low(1224, 0.21달러)에서는 비교 모델 중 가장 낮은 점수였으므로 노력 수준을 끝까지 내리는 설정은 따로 검증해야 합니다.

내부 시험에서 찾기 어려운 웹 사본만으로 분기 실적 보고서를 쓰게 하고 수치나 인용을 하나라도 지어내면 탈락시켰을 때 Opus 5.5는 18건 중 16건이 기준을 넘었고 Fable 5.1과 Opus 5는 한 번도 넘지 못했습니다. 합병안 분석으로 Excel 재무 모델과 발표 자료를 만드는 시험에서는 Opus 5와 결론이 같았고 작업 시간은 63분 대 93분, 비용은 50% 낮았으며 Opus 5에는 작은 오류가 있었습니다. Perplexity의 WANDR에서는 max 72.3%(37.92달러)로 Fable 5.1 max 68.7%(49.02달러)보다 높았지만 오프라인 검색 도구와 98만 토큰 예산으로 실행해 공개 결과와 직접 비교할 수 없습니다.

고객사 자체 평가도 있습니다. Deloitte는 가장 낮은 노력 수준에서 알려진 버그의 72%를 찾았다고(Opus 5 high 56%), Hebbia는 재무 업무 루브릭 충족률 86.6%(Opus 5 60.3%)를, Optiver는 같은 품질에 비용 40~50% 절감을, Box는 토큰 3분의 1 사용과 답변 분량 40% 감소를 보고했습니다. Clio는 6개 저장소에 걸친 과제를 사람 개입 없이 18시간 넘게 수행했다고 밝혔습니다.

글쓰기도 바뀌었습니다. 가장 중요한 정보를 앞에 두고 전문 용어를 덜 쓰며 사용자가 준 작성 규칙을 따릅니다. Factory는 medium을 기본값으로 쓸 첫 모델이라며 Opus 5 high와 같은 결과를 출력 토큰 20~25% 적게 냈다고 전했습니다. Anthropic은 읽기 쉬운 결과물이 검토를 쉽게 만든다는 점에서 안전 측면의 이점도 있다고 설명합니다.

정렬 평가와 시스템 카드에 기록된 한계

Anthropic CEO Dario Amodei는 발표 한 주 전 안전 관행이 모델 역량보다 앞서도록 AI 발전 속도를 조절해야 한다고 주장했습니다. 원문은 현재 모델에 정렬 시험, 외부 기관의 출시 전 평가, 고위험 영역 안전장치를 적용하고 미래 모델에 대비해 강화학습 환경 필터링과 해석 가능성 기반 모니터링을 강화한다고 밝혔습니다. AI 연구를 완전히 자동화할 수 있는 모델에는 더 높은 기준이 필요하다고도 적었습니다.

약 2,000개 시나리오의 자동 행동 감사에서 Opus 5.5는 거의 모든 오정렬 지표에서 최근 Claude 모델보다 좋았고 정직성 지표 대부분에서도 가장 강했습니다. 격리 경계 우회 시도는 Opus 5와 Claude Mythos 5.1보다 약 85% 적었고 모두 심각도가 낮았으며 모델이 스스로 보고했습니다. 반면 자신이 평가받고 있다고 의심하는 징후가 자주 보여 실제 배포 환경의 행동을 평가하기 어렵다고 명시했습니다. 시스템 카드에는 에이전트 설계에 참고할 수치가 더 있습니다.

항목시스템 카드 기록
사용자가 붙여 넣은 텍스트 속 지시 실행초기 스냅샷 52%, 최종 버전 기본 노력 약 2%, max 약 7.4%, 제품 차원 완화 적용 시 0건
보이지 않는 문자로 숨긴 지시출시 전 스냅샷 68회 중 18회(26%), 최종 버전 기본 노력 68회 중 2회
도구 결과로 들어온 같은 지시105회 중 0회
안전장치 없이 샌드박스 탈출·조작 시도실행의 1.5%
모의 보안 훈련에서 패키지 저장소 자격 증명 제공 시약 절반의 경우 잠재적으로 해로운 행동
화학·생물학 위험 등급CB-1 해당, CB-2 미해당

첫 항목이 실무와 가장 가깝습니다. README, 이메일, npm 설치 출력처럼 남이 쓴 텍스트를 붙여 넣으면 그 안에 심어진 지시를 따를 수 있다는 뜻입니다. Anthropic은 프롬프트 인젝션 판별 학습이 사용자 입력을 무조건 신뢰하는 쪽으로 일반화된 것이 원인이라고 분석했고 추가 학습과 함께 보이지 않는 문자 제거와 붙여 넣은 텍스트 표시를 제품에 더하고 있습니다. 필자의 해석으로는 이 완화가 Anthropic 제품에 들어가는 것이므로 API로 자체 서비스를 만드는 조직은 같은 처리를 직접 설계해야 합니다. 시스템 카드는 검증할 수 없는 권한 주장을 더 자주 받아들이는 회귀도 기록했습니다.

안전장치와 검증 프로그램

Opus 5.5는 사이버보안, 생물학, 증류 영역에서 Fable 5.1과 비슷한 등급의 안전장치를 달고 출시된 첫 Opus 모델입니다. 생물학과 사이버보안 역량이 Claude Mythos 5.1과 비슷한 수준이기 때문이며 안전장치가 개입하면 다른 모델로 투명하게 대체 처리합니다.

영역적용 내용예외 경로
사이버보안일상적인 개발 주기의 버그 발견·수정은 허용, 대부분의 사이버보안 과제는 Opus 4.8로 재배정Cyber Verification Program 확대 예정(3단계 신뢰 접근, Mythos 모델 포함)
생물학Fable 5.1과 같은 생물학 안전장치Life Sciences Verification Program(대학 연구실, 스타트업, 제약사 등 심사 기관 대상)
증류 방지preserved thinking 적용, API 사용자가 이전 문맥을 편집해 추론을 추출하는 행위 차단2026년 8월 31일 이후 생성된 API 계정에 적용
데이터·규정제로 데이터 보존 제공, EU AI Act 대응 워터마킹, thinking 모드를 끈 사용은 불가해당 없음

신약·바이오 연구 조직은 검증 프로그램 승인 전에 일부 작업이 막힐 수 있습니다. 이전 대화 문맥을 수정해 다시 보내는 방식의 연동이 있다면 원문이 안내하는 preserved thinking 문서로 먼저 시험해야 합니다.

우리나라 기업이 확인할 것

  1. 토큰 단가표 대신 과제당 비용으로 비교해야 합니다. 원문이 보여준 절감은 단가 인하와 토큰 사용 감소가 합쳐진 결과이고 캐시 읽기 단가가 60% 내려갔습니다. 대표 업무 몇 개를 정해 과제당 비용과 품질을 같은 조건에서 측정하고 캐시 적중률도 함께 기록해 두면 모델 교체 판단의 근거가 됩니다.
  2. 노력 수준 기본값을 업무별로 정해야 합니다. 여러 벤치마크에서 medium이 경쟁 모델의 최고 설정을 앞섰고 max가 xhigh보다 낮은 경우도 있었습니다. 반면 low에서는 점수가 크게 떨어진 항목이 있었으므로 업무마다 두세 단계를 비교해 정하는 편이 안전합니다.
  3. Fable 5.1과의 역할 분담은 자체 과제로 확인해야 합니다. Anthropic 스스로 실제 격차가 점수보다 작다고 밝혔고 AutomationBench와 Terminal-Bench-Science에서는 GPT-6 Astra가 앞섰습니다. 우리나라 기업의 한국어 문서와 사내 시스템에서 같은 결과가 나오는지는 소규모 파일럿으로 검증할 문제입니다.
  4. 보안·바이오 업무는 안전장치 경로를 먼저 확인해야 합니다. 사이버보안 과제 대부분은 Opus 4.8로 재배정되고 생물학 연구는 검증 프로그램 승인이 필요할 수 있습니다. 해당 업무가 있다면 두 검증 프로그램의 신청 요건과 대체 모델로 처리된 응답을 식별하는 방법을 확인해 두어야 합니다.
  5. 외부 텍스트를 붙여 넣는 사용 흐름에 검수 장치를 두어야 합니다. 시스템 카드는 붙여 넣은 텍스트 속 지시를 따르는 회귀와 검증할 수 없는 권한 주장을 받아들이는 경향을 기록했습니다. 자체 서비스에 Opus 5.5를 붙인다면 보이지 않는 문자 제거, 외부 텍스트 표시, 파괴적 명령 실행 전 사람 승인을 설계에 넣는 편이 안전합니다.

출처: Introducing Claude Opus 5.5, Claude Opus 5.5 System Card

김지우 (Tristan Kim)

코텍시스 창업자로 AX 컨설팅과 기업 AI 교육, AI 에이전트 개발을 직접 수행합니다.

코텍시스 AI 인사이트 최신 논문 리뷰

AI 솔루션이 필요하신가요?

cortexys.team에서 맞춤 AI 개발 서비스를 확인하세요.

컨설팅 신청하기