알리바바가 8월 3일 Qwen3.8-Max를 공개했습니다. 2.4조 파라미터 MoE에 100만 토큰 컨텍스트, 입력 100만 토큰당 2달러입니다. 성능보다 가격표를 먼저 볼 만한 모델입니다.
알리바바가 2026년 8월 3일 Qwen3.8-Max를 공개했습니다. 2.4조 파라미터 규모의 MoE 모델이고 텍스트와 이미지, 영상을 입력으로 받습니다. 컨텍스트는 100만 토큰이며 실제 최대 입력은 991K 토큰입니다.
알리바바가 공개한 벤치마크
| 벤치마크 | 점수 |
|---|---|
| GPQA Diamond | 92.6 |
| PaperBench | 93.0 |
| OmniDocBench 1.5 | 92.1 |
| Parametric CAD Bench | 91.5 |
| Terminal-Bench 2.1 | 86.6 |
| OSWorld-Verified | 86.1 |
| IFBench | 82.8 |
| FrontierSWE | 73.5 |
| SWE-bench Pro | 67.7 |
자체 발표 수치라는 점은 감안해야 합니다. 다만 항목 구성은 눈여겨볼 만합니다. 터미널 작업, 실제 저장소 수준의 SWE 과제, 데스크톱 환경 조작이 앞자리에 있습니다. 대화 품질이 아니라 컴퓨터를 다루는 능력을 내세우는 배치입니다.
한 가지 짚어둘 것은 활성 파라미터 수를 공개하지 않았다는 점입니다. MoE에서 활성 파라미터는 실제 추론 비용을 좌우하는 값이라 이것이 없으면 총 파라미터 2.4조라는 숫자만으로는 규모를 가늠하기 어렵습니다. 일부 매체가 특정 수치를 적고 있으나 1차 발표에는 없는 값입니다.
독립 측정치
Artificial Analysis의 측정 결과는 아래와 같습니다.
| 항목 | 측정값 |
|---|---|
| Intelligence Index | 58 (185개 모델 중 9위) |
| 출력 속도 | 초당 85.0 토큰 (중앙값 77) |
| 첫 토큰까지 | 2.90초 |
같은 측정에서 지능 지표 평가 중 생성한 출력 토큰이 1억 5천만 개로, 중앙값 6천 6백만 개에 비해 상당히 장황하다는 지적이 붙어 있습니다. 토큰 단가가 낮아도 출력량이 두 배를 넘으면 실제 청구액은 줄지 않습니다. 도입 검토 시 단가표만 보고 계산하면 어긋납니다.
가격
| 구분 | 100만 토큰당 |
|---|---|
| 입력 | 2.00달러 |
| 출력 | 6.00달러 |
| 캐시된 입력 | 0.25달러 |
입력 단가는 동급 추론 모델 중앙값인 1.75달러보다 조금 높고, 출력 단가는 낮은 편입니다. 캐시 입력이 0.25달러라는 점이 실무에서는 가장 큽니다. 긴 문서를 반복해서 참조하는 RAG 구성이라면 이 차이가 월 비용을 가릅니다.
오픈웨이트
발표 시점 기준으로 가중치 공개를 다음 주로 예고했고, 별도의 27B 체크포인트도 함께 공개한다고 밝혔습니다. 27B는 사내 GPU에 올려볼 수 있는 크기라 실질적인 선택지가 됩니다.
무엇을 봐야 하나
프론티어 모델의 성능 격차가 좁아지는 국면에서는 순위표보다 제약 조건이 중요합니다. 이 모델을 검토한다면 다음 세 가지를 먼저 확인하는 편이 낫습니다.
첫째, 출력이 장황하다는 측정을 우리 작업에서도 재현해 봅니다. 실제 프롬프트로 100건만 돌려도 평균 출력 토큰이 나옵니다.
둘째, 데이터가 어디로 가는지 확인합니다. 국내 제조 기업의 도면이나 공정 데이터를 다룬다면 호스팅 API의 리전과 보관 정책이 성능보다 먼저 걸리는 조건입니다.
셋째, 27B 오픈웨이트가 나오면 그것부터 시험합니다. 온프레미스로 충분한 작업에 2.4조 모델을 호출할 이유는 없습니다.
출처: Qwen3.8-Max 공식 발표 (qwen.ai, 2026-08-03) · Artificial Analysis 측정 · MarkTechPost 정리
코텍시스 AI 인사이트 최신 논문 리뷰
활성값을 보고 가중치를 지키는 AWQ 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.ai에서 맞춤 AI 개발 서비스를 확인하세요.



