OpenAI가 GPT-6.1 Sol을 공개하며 캐시 입력 100만 토큰당 $0.10을 제시했습니다. 공지에서 확인된 사실과 사내 AI 과제 예산을 다시 계산할 때 봐야 할 기준을 정리했습니다.
OpenAI가 2026년 9월 29일 Introducing GPT-6.1 Sol 공지를 게시했습니다. 상위 모델인 GPT-6 Astra에 근접한 성능을 Astra 표준 단가의 5분의 1에 제공한다는 내용이며, 입력, 캐시 입력, 출력 단가와 벤치마크, 제공 범위를 함께 밝혔습니다. 사내 AI 과제의 단가 가정을 바꾸기에 충분한 정보라서, 공지에서 확인된 사실과 자체 검증이 필요한 부분을 나눠 정리했습니다.
공지에서 확인된 사실
공지가 명시한 핵심 내용은 네 가지입니다. 첫째, GPT-6.1 Sol은 에이전트 코딩, 컴퓨터 사용, 전문 업무에서 Astra에 근접한 성능을 Astra 표준 단가의 5분의 1에 제공합니다. 둘째, 표준 API 단가는 100만 토큰당 입력 $2, 캐시 입력 $0.10, 출력 $10입니다. 셋째, 캐시 입력 단가는 표준 입력 단가보다 95% 낮고 이전 모델인 GPT-6 Sol의 캐시 입력 단가보다 50% 낮습니다. 넷째, 공개 당일부터 ChatGPT Work와 Codex의 Plus, Pro, Business, Enterprise, Edu 사용자에게 제공되고 API에서는 gpt-6.1-sol로 쓸 수 있으며, 일반 Chat에서는 아직 제공되지 않습니다.
| 항목 | 내용 |
|---|---|
| 성능 위치 | Astra에 근접, Astra 표준 단가의 5분의 1 |
| 입력 단가 | 100만 토큰당 $2 |
| 캐시 입력 단가 | 100만 토큰당 $0.10 |
| 표준 입력 대비 | 95% 낮음 |
| GPT-6 Sol 캐시 입력 대비 | 50% 낮음 |
| 출력 단가 | 100만 토큰당 $10 |
| 컨텍스트 | 105만 토큰, 최대 출력 12만 8천 토큰 (API 문서) |
공지는 DeepSWE v1.1, GDP.pdf, AutomationBench, OSWorld 2.0, Terminal-Bench Science 0.1 결과도 제시했습니다. DeepSWE v1.1에서는 약 5분의 1 비용으로 GPT-6 Astra와 같은 점수를 냈고, OSWorld 2.0 오프라인 세트에서는 최대 추론 강도 기준으로 Astra와 2.1%포인트 차이였습니다. 성능 수치는 OpenAI가 제시한 것이며 제3자 검증 결과는 이 공지에 포함되어 있지 않습니다.
캐시 입력 단가가 바꾸는 계산
프롬프트 캐싱은 요청마다 반복되는 앞부분을 재사용할 때 할인을 적용하는 방식입니다. 시스템 프롬프트, 사내 규정 문서, 도구 정의, 누적된 대화 이력처럼 매 호출에서 동일하게 들어가는 구간이 여기에 해당합니다. 캐시 적중 비율이 높을수록 실제로 지불하는 평균 입력 단가는 표준 단가에서 멀어집니다.
공지에 적힌 표준 입력 단가는 100만 토큰당 $2.00, 캐시 입력 단가는 $0.10입니다. 두 단가로 캐시 적중률에 따른 평균 입력 단가를 계산하면 아래와 같습니다.
| 캐시 적중률 | 평균 입력 단가(100만 토큰) |
|---|---|
| 0% | $2.00 |
| 50% | $1.05 |
| 80% | $0.48 |
| 95% | $0.20 |
이 표는 캐시 쓰기 비용을 뺀 계산 예시입니다. API 문서 기준으로 캐시 쓰기는 표준 입력의 1.25배인 100만 토큰당 $2.50이고, 입력이 27만 2천 토큰을 넘는 요청은 요청 전체에 입력·캐시 단가 2배와 출력 단가 1.5배가 적용됩니다. 여기서 읽을 점은 단가 인하 폭 자체보다 적중률이 총비용을 좌우한다는 구조입니다. 같은 모델을 쓰더라도 프롬프트를 매번 다르게 조립하는 시스템과 고정 구간을 앞에 두는 시스템의 청구액은 크게 벌어집니다.
예산을 다시 볼 과제 유형
캐시 입력 단가 인하의 효과는 과제 성격에 따라 갈립니다. 긴 사내 문서를 매 호출에 붙이는 문서 질의응답, 동일한 응대 지침을 상주시키는 상담 보조, 코드베이스 일부를 반복 참조하는 개발 지원처럼 고정 입력 비중이 큰 과제에서 체감이 큽니다. 여러 턴에 걸쳐 이력이 쌓이는 에이전트 워크플로도 같은 범주입니다.
반대로 짧고 매번 다른 입력을 처리하는 분류 작업이나 출력 토큰 비중이 큰 생성 작업에서는 효과가 제한적입니다. 출력 단가는 100만 토큰당 $10으로 입력 단가의 5배이므로, 이 유형의 과제는 출력 토큰 비중을 넣어 총비용을 따로 계산해야 합니다.
지난해 단가 때문에 보류한 과제 목록이 있다면 지금이 재검토 시점입니다. 특히 전사 사용자에게 열려는 내부 지식 검색이나 상시 실행되는 배치 요약처럼 호출량이 많아 보류된 건들은 판단이 뒤집힐 수 있습니다.
공지만으로 결정할 수 없는 것
성능 주장은 자체 과제 데이터로 확인해야 합니다. Astra에 근접한다는 표현은 일반 평가 기준의 이야기이며, 우리말 문서 처리나 업종 용어가 많은 과제에서 같은 격차가 유지된다는 보장은 공지에 없습니다.
모델 교체에는 단가 외의 비용도 붙습니다. 기존 프롬프트를 새 모델에 맞춰 조정하고 회귀 테스트를 다시 돌리는 작업, 출력 형식이 달라질 때 후처리 코드를 손보는 작업이 따라옵니다. 캐시 유지 시간과 최소 토큰 길이 같은 캐싱 적용 조건도 실제 적중률을 결정하므로 공식 문서에서 확인이 필요합니다.
우리나라 기업이 확인할 것
첫째, 현재 운영 중인 과제의 캐시 적중률을 먼저 측정합니다. 단가 인하 폭보다 적중률이 청구액을 크게 좌우하므로, 프롬프트 구조를 고정 구간 우선으로 재배치하는 작업이 모델 교체보다 먼저일 수 있습니다.
둘째, 성능은 사내 평가 세트로 검증합니다. 자주 쓰는 업무 10여 건을 기준 문항으로 만들어 두면 모델이 바뀔 때마다 같은 잣대로 비교할 수 있습니다.
셋째, 출력 단가 $10과 27만 2천 토큰 초과 요청의 할증을 넣어 총비용을 계산합니다. 입력 단가만으로 과제 승인 여부를 결정하면 출력 비중이 큰 과제에서 예산이 어긋납니다.
넷째, 가격 조건과 무관하게 데이터 처리 범위는 동일한 기준으로 검토합니다. 우리나라 개인정보보호법상 처리 위탁 고지와 국외 이전 관련 검토 사항은 단가가 낮아졌다고 달라지지 않습니다.
다섯째, 보류 과제 목록을 다시 펼쳐 봅니다. 비용을 이유로 접었던 사내 과제 중 어떤 것이 새 단가에서 성립하는지 확인하는 작업은 한 주면 끝나며, 예산 재산정의 출발점이 됩니다.
출처: Introducing GPT-6.1 Sol (OpenAI, 2026-09-29) · GPT-6.1 Sol 모델 문서 (OpenAI API Docs)
코텍시스 창업자로 AX 컨설팅과 기업 AI 교육, AI 에이전트 개발을 직접 수행합니다.
코텍시스 AI 인사이트 최신 논문 리뷰
AWQ 양자화: 활성값을 보고 가중치를 지키는 4비트 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.team에서 맞춤 AI 개발 서비스를 확인하세요.

