Claude 5 패밀리와 GPT-5.6, Gemini 3.1 Pro가 석 달 사이에 모두 세대를 갈아탔습니다. 공개된 수치를 모아 기업 도입 관점에서 비교하면 벤치마크 순위보다 과금 구조와 에이전트 능력의 차이가 실무 비용을 가릅니다.
2026년 6월부터 8월 사이에 세 프런티어 회사가 모두 주력 모델을 갈아탔습니다. Anthropic은 Fable 5와 Opus 5를, OpenAI는 GPT-5.6 패밀리를, Google은 Gemini 3.1 Pro를 내놨습니다. 발표 수치는 쏟아지는데 서로 다른 벤치마크를 내세우고 있어 옆으로 놓고 읽어야 구도가 보입니다.
세 회사의 현재 라인업
| 모델 | 출시 | 입력/출력 (1M 토큰) | 컨텍스트 |
|---|---|---|---|
| Claude Fable 5 | 2026.06 | $10 / $50 | 공식 미공개 |
| Claude Opus 5 | 2026.07 | $5 / $25 | 1M |
| Claude Sonnet 5 | 2026.06 | $2 / $10 (9월부터 $3 / $15) | 공식 미공개 |
| GPT-5.6 Sol | 2026.07 | $5 / $30 | 1.05M |
| GPT-5.6 Terra | 2026.07 | $2 / $12 | 1.05M |
| GPT-5.6 Luna | 2026.07 | $0.20 / $1.20 | 1.05M |
| Gemini 3.1 Pro | 2026.02 | $2 / $12 (200K 초과 시 $4 / $18) | 1.05M |
컨텍스트는 세 회사 모두 100만 토큰 수준으로 수렴했습니다. 장문 컨텍스트는 더 이상 차별화 요소가 아니라는 뜻입니다.
코딩과 에이전트에서 갈리는 지점
실제 저장소 수준의 과제를 다루는 SWE-bench Pro에서는 Claude가 뚜렷하게 앞섭니다.
| 모델 | SWE-bench Pro | 출처 성격 |
|---|---|---|
| Claude Fable 5 | 80.0~80.3% | Anthropic 발표와 분석 매체 |
| Claude Opus 5 | 79.2% | Anthropic 발표 |
| GPT-5.6 Sol | 64.6% | 분석 매체 집계 |
| Gemini 3.1 Pro | 54.2% | Anthropic 비교 자료 기준 |
읽을 때 감안할 것이 있습니다. OpenAI는 GPT-5.6에서 SWE-bench Verified나 GPQA 같은 전통 벤치마크의 공식 수치를 내지 않았습니다. Gemini 3.1 Pro의 SWE-bench 80.6%라는 수치도 돌아다니지만 Verified와 Pro 중 어느 변종인지 표기가 없어 위 표에는 넣지 않았습니다. 반대로 터미널 기반 에이전트 작업을 보는 Terminal-bench 2.1에서는 GPT-5.6 Sol이 88.8%로 근소하게 앞선다는 집계가 있습니다. 코딩은 Claude, 브라우징과 범용 에이전트는 경합이라는 구도로 요약할 수 있습니다.
가격표에서 일어난 역전
이번 세대에서 가장 흥미로운 것은 성능 순위가 아니라 가격입니다. Opus 5는 상위 티어인 Fable 5의 절반 가격인데 SWE-bench Verified 약 96%를 포함해 다수 벤치마크에서 Fable 5를 상회하거나 근접합니다. OSWorld 2.0에서는 70.57%로 더 높은 점수를 약 3분의 1 비용에 냅니다. 최고가 모델이 곧 최적 선택이라는 등식이 깨졌습니다.
과금 구조의 결도 다릅니다. Gemini 3.1 Pro는 요청이 200K 토큰을 넘는 순간 전체 요청이 두 배 요율로 재산정되는 절벽이 있습니다. 단가표만 보고 견적을 내면 어긋나는 지점입니다. GPT-5.6 Luna는 입력 $0.20까지 내려와 대량 배치 작업의 기본값 후보가 됐습니다.
한국어 성능은 아직 공백
세 회사 모두 이번 발표에서 한국어 성능을 별도로 언급하지 않았습니다. KMMLU 리더보드에서 확인되는 최신 수치는 Claude Sonnet 4.6의 평균 85.0 수준이고 5세대 모델의 한국어 수치는 아직 검증된 것이 없습니다. 한국어 업무 문서로 도입을 검토한다면 벤치마크가 아니라 자사 데이터로 직접 평가하는 수밖에 없습니다.
기업교육 관점에서 보면
교육 설계자 입장에서 이번 세대의 의미는 두 가지입니다. 첫째, 모델 교체 주기가 분기 단위로 짧아져서 특정 도구의 사용법을 가르치는 교육은 수명이 더 짧아졌습니다. 업무를 분해하고 에이전트에 위임하는 역량을 가르쳐야 도구가 바뀌어도 남습니다. 둘째, Cowork처럼 터미널 없이 다단계 업무를 위임하는 에이전트 제품이 일반 직원에게 열리면서 비개발 직군 대상 에이전트 교육이 실습 가능한 영역이 됐습니다.
코텍시스는 이런 변화를 생성형 AI 기업교육과 AI Agent 기업교육 과정에 반영해 운영하고 있습니다.
출처
코텍시스 AI 인사이트 최신 논문 리뷰
활성값을 보고 가중치를 지키는 AWQ 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.ai에서 맞춤 AI 개발 서비스를 확인하세요.



