OpenAI가 GPT-6 Sol과 Luna를 공개하며 API 가격을 GPT-5.6 프로모션 대비 50% 내렸습니다. 업무 자동화·코딩·컴퓨터 사용 벤치마크 결과와 캐싱 개선을 정리하고, 전사 배포 단가를 다시 계산할 기준을 짚습니다.
가격을 절반으로 내린 경량 모델
OpenAI가 2026년 9월 22일 Introducing GPT-6 Sol and Luna를 공개했습니다. 같은 달 먼저 공개한 GPT-6 Astra에 이어 같은 계열의 경량 모델 두 종을 추가한 발표입니다. OpenAI는 Astra와 유사한 방법으로 Sol과 Luna를 학습시켜 전문 업무, 사실성, 코딩, 컴퓨터 사용, 정렬에서의 진전을 더 빠르고 저렴한 모델로 옮겼다고 설명합니다.
발표의 핵심은 성능보다 단가입니다. OpenAI는 캐싱과 추론 효율을 개선해 서빙 비용을 낮췄고 그 절감분을 그대로 가격에 반영했다고 밝혔습니다. Sol과 Luna의 API 가격은 GPT-5.6 프로모션 가격 대비 50% 인하됐습니다. 가장 어렵고 중요한 과제에는 여전히 Astra를 쓰라는 권고도 함께 붙었습니다. 업무는 규모와 주기와 예산이 제각각이며 모든 작업에 최상위 모델이 필요하지는 않다는 것이 이번 라인업 확장의 논리입니다.
API 가격 구조
인하 폭은 입력과 출력 모두에 적용됩니다. 가격은 100만 토큰 기준입니다.
| 모델 | 입력 | 출력 | 인하 폭 |
|---|---|---|---|
| GPT-5.6 Sol → GPT-6 Sol | $4 → $2 | $20 → $10 | 50% |
| GPT-5.6 Luna → GPT-6 Luna | $0.20 → $0.10 | $1.20 → $0.50 | 50% |
Sol과 Luna 사이의 입력 단가 차이는 20배입니다. 같은 계열 안에서도 어느 모델에 어떤 작업을 보내느냐에 따라 월 청구액이 자릿수 단위로 달라진다는 뜻입니다. 전사 규모로 AI를 돌리는 조직이라면 모델 선택 자체가 비용 통제 수단이 됩니다.
업무 자동화와 사실성
OpenAI는 AutomationBench 1.0.6 결과를 제시했습니다. 영업, 마케팅, 운영, 지원, 재무, 인사 영역에서 47개 도구를 사용하는 엔드투엔드 업무 흐름을 평가하는 벤치마크입니다.
| 모델(노력 수준) | 점수 | 과제당 비용 |
|---|---|---|
| GPT-6 Sol (xhigh) | 33.2% | $0.27 |
| GPT-6 Astra (low) | 30.3% | Sol의 3.9배 |
| Claude Opus 5 (max) | 26.9% | Sol의 11.1배 |
| Claude Fable 5.1 + Opus 5 폴백 (max) | 31.4% | Sol의 8.9배 이상 |
OpenAI는 Sol이 xhigh 설정에서 Claude Opus 5의 max 설정을 앞서면서 과제당 비용은 Opus 5의 9% 수준이라고 밝혔습니다. Claude Fable 5.1 수치는 전체 과제의 약 40%에서 발생한 Opus 5 폴백 비용이 빠져 있어 실제 비용보다 낮게 표시된다는 단서가 붙었습니다. Luna는 high 설정에서 이전 세대 대비 5.4%포인트 개선되면서 과제당 비용은 58% 낮아졌습니다.
55개 세부 산업의 장기 전문 업무를 다루는 Agents' Last Exam V1에서는 Sol이 max 설정으로 56.4%를 기록해 해당 평가에서 Claude Opus 5의 최고 점수를 넘었고 과제당 비용은 60% 낮았습니다.
사실성은 사용자가 오류를 신고한 비식별 대화를 기반으로 한 내부 평가로 측정했습니다. Sol은 이전 세대 대비 오류가 약 절반으로 줄어 Astra 수준의 신뢰도에 근접했습니다. Luna는 높은 노력 수준에서 GPT-5.6 Sol과 같은 수준을 약 100분의 1 비용으로 달성했습니다. OpenAI는 이 평가용 대화가 오류를 유도하도록 구성된 집합이어서 일반적인 사용 환경을 대표하지 않는다고 명시했습니다.
코딩과 컴퓨터 사용
OpenAI는 코딩 에이전트의 작업 범위와 지속 시간이 길어지면서 내부 사용량이 기하급수적으로 늘었다고 밝혔습니다. API 가격으로 환산한 일일 토큰 사용액이 중앙값 연구자 기준 600달러, 90분위 연구자 기준 7,000달러를 넘었다는 수치를 함께 공개했습니다. 장시간 실행되는 에이전트에서는 단가가 곧 실행 가능한 작업의 범위를 결정한다는 맥락입니다.
| 평가 | 결과 | 비용 비교 |
|---|---|---|
| FrontierCode 1.1 Main | Sol이 GPT-5.6 Sol 대비 큰 폭 개선, Claude Fable 5.1 xhigh와 동급 | 훨씬 낮은 비용 |
| DeepSWE 1.1 | Sol (max) 68.8%, Claude Fable 5 xhigh 69.9%와 1.1%포인트 차 | 과제당 약 80% 저렴 |
| DeepSWE 1.1 | Luna (max) 66.6%, Opus 5·Fable 5의 medium과 동급 | Opus 5 대비 93%, Fable 5 대비 96% 저렴 |
| OSWorld 2.0 offline | Sol (xhigh) 60.5%, Claude Opus 5 medium 60.3% | 과제당 약 80% 저렴 |
FrontierCode는 정확성뿐 아니라 테스트 품질, 범위 준수, 코드 스타일, 코드베이스 규약 준수를 포함한 병합 가능성을 채점합니다. 실제 코드베이스에 반영할 수 있는 변경인지를 본다는 점에서 개발 조직이 참고할 만한 지표입니다. 컴퓨터 사용에서는 Astra가 여전히 최고 성능이며 Luna는 max 설정에서 GPT-5.6 Sol의 medium 설정을 10분의 1 비용으로 넘어섰습니다.
평가 조건에는 단서가 있습니다. GPT 계열은 연구 환경이나 API에서 측정했고 시스템 프롬프트와 사용 가능한 도구 차이로 실제 ChatGPT 출력과 다를 수 있습니다. 경쟁 모델 점수는 공개 보고서에서 가져왔으며 Claude Fable 5.1 수치가 없는 경우 Fable 5 점수를 사용했습니다. 자체 발표 벤치마크를 읽을 때 늘 그렇듯 비교 조건을 함께 봐야 합니다.
응답 방식의 변화
OpenAI는 Astra에서 개선한 커뮤니케이션 방식을 Sol과 Luna에도 적용했습니다. 기술 대화와 코딩 대화에서 특히 눈에 띄며 전문 용어와 낮은 가치의 세부 설명이 줄고 전체 답변 길이가 약간 짧아졌다고 설명합니다.
발표에 실린 예시는 웹사이트 디자인 변경 요청에 대한 응답 비교입니다. GPT-5.6 Sol은 요청을 받자마자 결론을 내리고 사용자가 이미 아는 정보를 반복하며 이미지 생성 도구에 쓴 프롬프트까지 공유했습니다. GPT-6 Sol은 React가 필요한지 먼저 확인하겠다고 밝히고 작업 후에는 데스크톱과 좁은 모바일 화면, 브라우저 뒤로 가기까지 확인했다고 보고했습니다. OpenAI는 무엇을 확인했고 확인하지 않았는지 더 분명히 밝히는 쪽을 선호한다고 덧붙였습니다. 업무 현장에서 에이전트 출력을 검토하는 담당자에게는 검증 범위를 명시하는 응답이 실무적으로 유용합니다.
캐싱과 정렬, 제공 범위
토큰 단가 인하와 별개로 프롬프트 캐싱도 개선됐습니다. 기본 캐시 적중률이 높아졌고 캐시된 입력 토큰 읽기에는 90% 할인이 적용됩니다. 개발자가 쓸 수 있는 수단도 늘었습니다. Prompt Caching Dashboard에서 입력의 캐시 비율과 추이를 확인하고 진단 도구로 캐싱을 놓친 지점과 수정 방향을 파악할 수 있습니다. 추론 노력 수준을 조정하거나 도구를 켜고 끄는 작업이 이제 이전 컨텍스트의 캐시 재사용을 깨지 않으며, 명시적 중단점으로 캐시되는 프리픽스의 끝 지점을 직접 지정할 수 있습니다. GitHub은 지난 수개월간 수십억 건의 요청에서 새로 처리해야 하는 프롬프트 토큰 비중이 50% 넘게 줄어 Copilot 응답이 빨라졌다고 보고했습니다.
정렬 측면에서 Sol과 Luna는 각각의 GPT-5.6 대응 모델보다 개선됐으며 자신의 코딩 작업에 대해 오해를 부르는 주장을 하는 비율이 낮아졌습니다. OpenAI는 해당 평가가 의도적으로 까다로운 상황을 시험하며 일반적인 사용에서의 실패율을 측정하지 않는다고 밝혔고 전체 결과는 시스템 카드에서 확인하도록 안내했습니다.
제공 범위는 당일 기준으로 ChatGPT Work와 Codex이며 Plus, Pro, Business, Enterprise, Edu 사용자가 대상입니다. Free와 Go 사용자는 데스크톱 앱에서 Luna를 쓸 수 있습니다. Chat에는 아직 제공되지 않습니다. API 모델명은 gpt-6-sol과 gpt-6-luna이며 ChatGPT 쪽 배포는 서비스 안정을 위해 하루에 걸쳐 단계적으로 진행됩니다.
우리나라 기업이 확인할 것
첫째, 모델 선택 기준을 다시 문서화할 시점입니다. Astra, Sol, Luna는 같은 계열이면서 단가가 크게 다릅니다. 어떤 업무를 어느 등급으로 보낼지 정하지 않은 채 최상위 모델만 쓰면 비용이 빠르게 불어납니다. 사내 업무를 난이도와 반복 빈도로 나눠 등급별로 배정하는 규칙을 만들어 두는 편이 낫습니다.
둘째, 비교 근거는 자체 업무로 다시 확인해야 합니다. 발표에 실린 벤치마크는 OpenAI가 자사 환경에서 측정했고 경쟁 모델은 공개 보고서 수치를 썼으며 일부는 이전 버전 점수를 대체 사용했습니다. 우리나라 기업의 실제 업무 흐름과 한국어 문서에서 같은 격차가 재현되는지는 소규모 파일럿으로 확인할 문제입니다.
셋째, 단가 인하와 캐싱 개선을 함께 계산해야 합니다. 시스템 프롬프트와 사내 문서처럼 반복 사용되는 컨텍스트가 큰 에이전트라면 캐시 적중률이 실질 비용을 좌우합니다. 캐시된 입력 읽기에 90% 할인이 적용되므로 프롬프트 구조를 캐시 재사용에 맞게 설계하는 작업이 모델 교체만큼 효과를 낼 수 있습니다.
넷째, 에이전트가 무엇을 확인했는지 보고하게 만드는 운영 설계가 필요합니다. OpenAI가 강조한 응답 방식 변화와 코딩 작업 관련 허위 주장 감소는 검토 부담과 직결됩니다. 다만 정렬 평가는 일반 사용의 실패율을 측정하지 않으므로 사람이 확인하는 검수 단계는 그대로 두는 편이 안전합니다.
다섯째, 도입 채널을 확인해야 합니다. 현재 ChatGPT Work와 Codex, API에서 제공되며 Chat에는 아직 들어가지 않았습니다. 사내에서 어느 채널로 쓰고 있는지에 따라 적용 시점이 달라집니다.
코텍시스 창업자로 AX 컨설팅과 기업 AI 교육, AI 에이전트 개발을 직접 수행합니다.
코텍시스 AI 인사이트 최신 논문 리뷰
AWQ 양자화: 활성값을 보고 가중치를 지키는 4비트 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.team에서 맞춤 AI 개발 서비스를 확인하세요.

