Qwen3-Omni와 Gemini와 GPT-4o Audio 같은 대형 오디오 언어 모델의 한국어 음성 이해 능력을 평가하는 최초의 종합 벤치마크 KoALa-Bench를 분석한다. ASR과 번역과 질의응답에 더해 음성 모달리티 충실성(SCA-QA)과 위치 인식 장형식 이해(PA-QA)라는 두 가지 새로운 평가 차원을 제시한다.
| 구분 | 내용 |
|---|---|
| 논문 | KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness |
| 발표 | arXiv 2604.19782 (2026년 4월) |
| 저자 | Jinyoung Kim, Hyeongsoo Lim, Eunseo Seo, Minho Jang(공동 1저자), Keunwoo Choi, Seungyoun Shin(Upstage AI), Ji Won Yoon(중앙대학교 AI학과) |
| 원문 | arxiv.org/abs/2604.19782 |
| 코드 | github.com/scai-research/KoALa-Bench |
음성 AI 시대가 열렸다. 한국어 평가는 어떨까
Qwen3-Omni와 Gemini와 GPT-4o Audio처럼 음성을 직접 이해하고 대화하는 대형 오디오 언어 모델 LALM(Large Audio Language Model)이 빠르게 진화하고 있다. 이 모델들은 이제 ASR(음성 인식)은 물론이고 음성으로 질문을 받아 텍스트로 답한다. 영어 음성을 한국어로 번역하고 복잡한 지시도 따른다.
그런데 문제가 있다. 이 모델들이 한국어 음성을 얼마나 잘 이해하는지 제대로 평가하는 벤치마크가 없었다.
기존 음성 벤치마크(AudioBench, AIR-Bench, ADU-Bench)는 압도적으로 영어 중심적이다. 전통적인 한국어 음성 데이터셋(KsponSpeech, ClovaCall)은 LALM 평가용이 아니라 기존 ASR 모델을 위한 것이다. 중앙대학교와 Upstage AI 연구팀이 만든 KoALa-Bench는 바로 그 공백을 메우기 위해 만들어졌다.
KoALa-Bench가 특별한 이유. 두 가지 새로운 태스크
KoALa-Bench는 총 6개 태스크로 구성된다. 기존 벤치마크에도 있는 4개의 기본 음성 이해 태스크에 더해 저자들이 새롭게 제안한 2개의 음성 충실성(Speech Faithfulness) 태스크가 핵심이다.
저자들은 여러 LALM을 테스트하다가 중요한 문제를 발견했다. 모델들이 음성 입력을 제대로 활용하지 않고 모델 내부에 저장된 파라메트릭 지식에 의존해 답하는 경향이 있다. 음성으로 틀린 정보를 주어도 모델이 자신이 아는 맞는 정보로 답하는 것이다.
이런 충실성(faithfulness) 문제를 체계적으로 평가하는 것이 이 벤치마크의 핵심 기여다.
벤치마크 구성과 데이터 파이프라인

데이터 구성 원칙은 명확하다. 영어 원본 데이터셋을 Gemma로 한국어로 번역한다. Qwen3-TTS로 한국어 음성을 합성한다. CER 또는 인간 검증으로 저품질 샘플을 필터링한다. 여러 데이터셋에 대해 노이즈 증강(noise-augmented) 버전을 별도로 구성한다. 이를 통해 LALM의 소음 환경 견고성(robustness)도 함께 평가한다.
태스크 1. 자동 음성 인식 ASR
음성을 입력하면 한국어 텍스트로 전사한다. 문자 오류율(CER)로 측정하며 낮을수록 좋다. 데이터셋은 KsponSpeech-Clean과 KsponSpeech-Other 각 3,000샘플과 Common Voice 523샘플과 Zeroth-Korean 457샘플이다.
태스크 2. 음성 번역 ST
영어 음성을 한국어 텍스트로 번역한다. BLEU와 METEOR와 BERTScore 세 메트릭으로 평가한다. 데이터셋은 ETRI 영한 음성 번역 코퍼스다. TST-Common은 2,532샘플에 평균 650초다. TST-HE는 고난도 표현으로 구성된 544샘플이다.
태스크 3과 4. 음성 QA와 지시 수행 SQA / SIF
| 구분 | 구성 |
|---|---|
| SQA 단형식 | CLIcK(한국어 원어 객관식 1,315샘플)과 KoBEST-BoolQ(예/아니오 1,404샘플) |
| SQA 장형식 | KCSAT(수능 듣기 82샘플에 평균 128초). 실제 수능 오디오를 문제 단위로 분할했다 |
| SIF | KUDGE와 Vicuna와 OpenHermes와 Alpaca를 TTS 합성한 뒤 GPT-4o를 판사(judge)로 채점한다 |
태스크 5. 음성 문맥에 얼마나 충실한가 SCA-QA
이 태스크가 핵심이다.

핵심 아이디어는 모델이 음성에서 말하는 내용을 듣고 답하는지 아니면 자기가 원래 알던 지식으로 답하는지를 구분하는 것이다.
구성 방법은 다음과 같다. K-pop과 K-history와 K-sports 관련 키워드로 문서를 크롤링한다. "라이즈는 SM엔터테인먼트 소속 6인조 보이그룹" 같은 문서다. GPT로 질문과 답변 쌍을 생성한다. 핵심 답변 엔티티를 다른 것으로 교체해 의도적으로 틀린 버전을 만든다. "Stray Kids는 SM엔터테인먼트 소속"이라는 식이다. 같은 음성 문맥에 대해 정답 버전과 오답 버전 쌍을 구성한다. 마지막으로 인간 주석자가 전수 검증한다.
평가 지표는 SCF(Speech Context Faithfulness)다.
$$\text{SCF} = \frac{\text{음성 문맥에 충실하게 답한 샘플 수}}{\text{전체 평가 샘플 수}}$$
채점 방식은 다음과 같다. 먼저 텍스트 질문만으로 올바르게 답할 수 있는 샘플을 식별한다. 그 뒤 오답이 포함된 음성 문맥을 추가해 재평가한다. 모델이 자기 지식 대신 음성 내용을 따라 답변을 바꾸면 음성에 충실(faithful)한 것으로 본다.
태스크 6. 긴 음성에서 위치별 이해도 PA-QA

MCTest를 기반으로 Qwen3-TTS로 합성했다(평균 96초). GPT-4.1-nano로 질문별 지원 증거 문장 위치를 [0, 1]로 정규화한 뒤 4구간으로 분류한다. front(00.25)와 front-middle(0.250.5)와 middle-late(0.50.75)와 late(0.751.0)다. 최종 327개 인스턴스로 구성된다.
평가 모델
총 5개 모델이다. white-box와 black-box를 모두 포함한다.
| 모델 | 버전 | 유형 |
|---|---|---|
| Qwen3-omni | Qwen3-Omni-30B-A3B-Instruct | White-box |
| Gemma-3n | Google-gemma-3n-E4B-it | White-box |
| GPT-audio | gpt-audio-mini (OpenAI API) | Black-box |
| Voxtral | Voxtral-Mini-3B-2507 | White-box |
| Gemini-flash | Gemini-flash-lite | Black-box |
실험 결과 1. ASR
CER은 낮을수록 좋다.
| 데이터셋 | Qwen3-omni | Gemma-3n | GPT-audio | Voxtral | Gemini-flash |
|---|---|---|---|---|---|
| Zeroth (clean) | 3.33 | 100†↑ | 6.87 | 40.92 | 13.60 |
| Zeroth (noisy) | 3.91 | 100†↑ | 9.00 | 39.07 | 14.56 |
| Common Voice (clean) | 4.96 | 100†↑ | 33.05 | 60.10 | 13.74 |
| Common Voice (noisy) | 6.78 | 100†↑ | 36.21 | 58.98 | 26.74 |
| KsponSpeech-Clean | 8.46 | 100†↑ | 100†↑ | 62.62 | 83.19 |
| KsponSpeech-Other | 7.91 | 100†↑ | 63.64 | 56.04 | 45.14 |
†는 CER이 100%를 넘어 한국어 전사에 완전히 실패했다는 표시다.
결과는 충격적이다. Gemma-3n은 모든 ASR 데이터셋에서 CER이 100%를 넘는다. 한국어 음성 인식에 완전히 실패한다. GPT-audio도 KsponSpeech-Clean에서 동일하게 실패한다. 반면 Qwen3-omni는 Zeroth 기준 CER 3.33%로 압도적인 1위를 기록한다.
노이즈 환경에서 Qwen3-omni와 GPT-audio는 성능 저하가 작다. Qwen3는 3.33에서 3.91이 되고 GPT는 6.87에서 9.00이 되는 수준이다. 반면 Gemini-flash는 Common Voice 기준 13.74에서 26.74로 거의 두 배 하락한다.
실험 결과 2. 음성 번역 ST
BERTScore는 높을수록 좋다.
| 데이터셋 | Qwen3-omni | Gemma-3n | GPT-audio | Voxtral | Gemini-flash |
|---|---|---|---|---|---|
| ETRI-TST-Common | 93.40 | 87.39 | 93.10 | 92.73 | 91.60 |
| ETRI-TST-HE | 93.96 | 87.79 | 93.69 | 93.09 | 92.17 |
BLEU와 METEOR에서도 Qwen3-omni가 전체 1위를 유지한다. ETRI-Common 기준 BLEU 28.53에 METEOR 52.02다. Gemma-3n은 ST에서도 BLEU 5.17로 저조하다. 한국어 출력 자체가 불안정한 것으로 보인다.
실험 결과 3. 음성 질의응답 SQA
정확도(Accuracy)는 높을수록 좋다.
| 데이터셋 | Qwen3-omni | Gemma-3n | GPT-audio | Voxtral | Gemini-flash |
|---|---|---|---|---|---|
| CLIcK (clean / noisy) | 64.04 / 62.30 | 35.79 / 35.71 | 61.64 / 60.07 | 42.58 / 42.92 | 67.27 / 66.69 |
| KoBEST-BoolQ (clean / noisy) | 51.34 / 51.16 | 50.89 / 50.54 | 51.88 / 50.45 | 50.54 / 50.54 | 52.86 / 54.92 |
| KCSAT 수능 (clean / noisy) | 83.53 / 84.71 | 34.12 / 40.00 | 52.90 / 47.10 | 69.41 / 72.94 | 81.18 / 78.82 |
한국 문화 상식을 다루는 CLIcK과 KoBEST-BoolQ에서는 Gemini-flash가 각각 67.27%와 52.86%로 1위다. Gemini의 한국어 사전 지식이 강하다는 뜻이다. 수능 듣기 KCSAT에서는 Qwen3-omni가 83.53%로 1위다. 장형식 음성 이해에서 강점을 보인다. GPT-audio는 52.90%로 저조하다. 수능 듣기의 긴 구간 처리에 약하다. 노이즈 조건에서 Qwen3-omni는 KCSAT 기준 오히려 84.71%로 소폭 상승한다. 노이즈에 매우 강건하다는 뜻이다.
실험 결과 4. 음성 지시 수행 SIF
GPT Judge Score는 높을수록 좋다.
| 데이터셋 | Qwen3-omni | Gemma-3n | GPT-audio | Voxtral | Gemini-flash |
|---|---|---|---|---|---|
| KUDGE (clean / noisy) | 71.87 / 71.82 | 71.38 / 70.69 | 74.07 / 73.99 | 61.97 / 61.70 | 70.29 / 70.39 |
| Vicuna (clean / noisy) | 79.64 / 78.43 | 80.21 / 80.00 | 82.14 / 81.79 | 67.79 / 69.50 | 76.43 / 73.29 |
| OpenHermes (clean / noisy) | 86.54 / 85.19 | 84.62 / 85.96 | 89.42 / 89.62 | 69.10 / 69.62 | 82.69 / 80.71 |
| Alpaca (clean / noisy) | 84.06 / 83.04 | 82.69 / 83.36 | 90.58 / 90.58 | 72.90 / 72.46 | 85.94 / 86.88 |
SIF에서는 GPT-audio가 전 데이터셋 1위다. Alpaca 기준 90.58이다. 지시 수행 능력은 GPT-4o 계열이 가장 강하다. Voxtral은 SIF에서 전반적으로 저조하다.
실험 결과 5. 음성 충실성 SCA-QA
텍스트 정확도
텍스트만으로 측정한 한국 문화 지식 정확도다. 높을수록 좋다.
| 도메인 | Qwen3-omni | Gemma-3n | GPT-audio | Voxtral | Gemini-flash |
|---|---|---|---|---|---|
| K-history (조선 이전) | 55.45 | 48.51 | 69.30 | 41.58 | 79.21 |
| K-history (조선 이후) | 79.27 | 71.95 | 79.30 | 51.22 | 87.80 |
| K-sports | 55.68 | 53.41 | 69.30 | 27.27 | 78.41 |
| K-pop | 67.96 | 68.93 | 69.90 | 42.72 | 89.32 |
한국 문화 사전 지식은 Gemini-flash가 압도적 1위다. K-pop 89.32%에 K-sports 78.41%다.
SCF Score
음성 문맥 충실성이다. 높을수록 음성을 잘 따른다.
| 도메인 | Qwen3-omni | Gemma-3n | GPT-audio | Voxtral | Gemini-flash |
|---|---|---|---|---|---|
| K-history (조선 이전) | 94.64 | 67.35 | 61.40 | 85.71 | 66.25 |
| K-history (조선 이후) | 92.31 | 45.76 | 32.30 | 85.71 | 59.72 |
| K-sports | 93.88 | 76.60 | 39.30 | 95.83 | 86.96 |
| K-pop | 95.71 | 73.24 | 37.50 | 88.64 | 78.26 |
핵심 발견은 Text-only Accuracy와 SCF Score 사이의 역전 현상이다.
GPT-audio는 한국 문화 사전 지식이 최상위권이다(K-history 69.30%). 그러나 SCF Score는 최하위다. K-history 조선 이후 기준 32.30%에 불과하다. 음성으로 틀린 정보를 줘도 자기가 아는 것으로 답한다. 음성 모달리티를 거의 활용하지 않는다는 뜻이다.
Qwen3-omni는 사전 지식 정확도가 중간 수준이다. 그러나 SCF Score는 압도적 1위다(K-pop 95.71%). 음성 문맥을 가장 충실하게 반영한다.
Gemini-flash는 한국 문화 지식 1위지만 SCF는 중하위다(K-history 조선 이후 59.72%). 강한 사전 지식이 오히려 음성 문맥 반영을 방해한다.
이 패턴이 시사하는 바는 분명하다. 사전 지식이 강한 모델일수록 음성 모달리티를 무시하는 경향이 있다. K-history 조선 이전(Before Chosun) 기준으로 Qwen3는 93%가 음성을 따랐다. 반면 GPT-audio는 49%만 음성을 따르고 51%는 자기 지식으로 답했다.
실험 결과 6. 위치 인식 장형식 이해 PA-QA
정확도는 높을수록 좋다.
| 위치 구간 | Qwen3-omni | Gemma-3n | GPT-audio | Voxtral | Gemini-flash |
|---|---|---|---|---|---|
| 전체 (clean / noisy) | 93.54 / 93.85 | 48.92 / 48.92 | 77.23 / 79.69 | 84.92 / 86.15 | 92.31 / 92.00 |
| front (앞부분) | 91.93 / 91.93 | 45.34 / 44.72 | 72.05 / 75.78 | 86.34 / 85.09 | 95.03 / 93.17 |
| front-middle | 96.70 / 94.51 | 51.65 / 53.85 | 83.52 / 83.52 | 82.42 / 85.71 | 89.01 / 87.91 |
| middle-late | 87.80 / 87.80 | 47.56 / 47.56 | 74.39 / 70.73 | 76.83 / 81.71 | 82.93 / 85.37 |
| last (뒷부분) | 94.12 / 98.04 | 45.10 / 45.10 | 80.39 / 86.27 | 82.35 / 82.35 | 92.16 / 98.04 |
Qwen3-omni는 전체 1위(93.54%)다. 노이즈 환경에서도 93.85%로 거의 동일하다. 특히 last 구간에서는 노이즈 조건에서 98.04%로 오히려 향상된다. 긴 음성의 후반부를 매우 잘 처리한다. Gemma-3n은 전 구간에서 약 50% 수준으로 일관되게 저조하다. 뚜렷한 위치 편향 없이 전반적으로 약하다. GPT-audio는 front-middle 구간에서 상대적으로 강하지만(83.52%) middle-late 구간에서 약해지는 경향을 보인다. Gemini-flash는 front 구간에서 Qwen3를 앞서지만(95.03%) front-middle부터 약해진다.
전반적으로 Qwen3-omni만이 모든 위치 구간에서 일관되게 높은 성능을 보인다.
종합 정리. 모델별 강점
| 모델 | ASR | ST | SQA | SIF | SCF(음성 충실성) | PA-QA |
|---|---|---|---|---|---|---|
| Qwen3-omni | 압도적 1위 | 1위 | 중상 | 2~3위 | 1위 | 1위 |
| Gemma-3n | 완전 실패 | 최하 | 최하 | 2~3위 | 중 | 최하 |
| GPT-audio | 중 | 2~3위 | 중 | 1위 | 최하 | 중 |
| Voxtral | 중하 | 중 | 중 | 최하 | 중상 | 중상 |
| Gemini-flash | 중 | 중 | 지식 1위 | 중 | 중 | 중상 |
이 벤치마크가 드러내는 핵심 메시지
한국어 ASR은 아직 갈 길이 멀다. Gemma-3n처럼 광범위하게 사용되는 모델이 한국어 음성 인식에 완전히 실패한다. 한국어는 영어 중심 모델에게 여전히 어려운 언어다.
한국어 사전 지식과 음성 충실성은 반비례한다. GPT-audio는 한국 문화를 가장 잘 알면서도 음성으로 다른 정보를 줘도 자기 지식으로 답하는 경향이 가장 강하다. 이는 실용적으로 심각한 문제다. 사용자가 음성으로 무언가를 지시해도 모델이 자기 학습 데이터를 우선시한다면 신뢰할 수 없다.
Qwen3-omni가 종합 최강이다. ASR과 ST와 장형식 이해(KCSAT, PA-QA)와 음성 충실성(SCF) 모두에서 1위다. 노이즈에도 강건하다. 단 지시 수행(SIF)에서는 GPT-audio에 뒤진다.
긴 음성에서도 위치 편향이 존재한다. 대부분 모델이 음성의 front-middle 구간에서 가장 강하고 middle-late에서 약해지는 경향을 보인다. Qwen3-omni만이 전 구간에서 일관된 성능을 유지한다.
결론
KoALa-Bench는 한국어 음성 AI 평가를 위한 최초의 종합 벤치마크다. 6개 태스크로 음성 인식과 번역과 QA와 지시 수행이라는 기존 평가 축에 더해 음성 모달리티 충실성과 위치 인식 장형식 이해라는 두 가지 새로운 차원을 추가했다.
핵심 기여는 다음과 같다.
| 기여 | 내용 |
|---|---|
| SCA-QA | 모델이 음성 문맥에 충실한지 파라메트릭 지식에 의존하는지를 직접 평가한다. GPT-audio의 SCF K-history 32.30%라는 충격적 결과를 발굴했다 |
| PA-QA | 긴 음성에서 지원 증거의 위치에 따른 성능 차이를 체계적으로 분석한다 |
| 한국 특화 데이터 | 수능 듣기와 K-history와 K-sports와 K-pop으로 영어 중심 벤치마크의 한계를 극복한다 |
| 공개 리더보드 | 지속적인 모델 비교를 위한 플랫폼을 제공한다 |
음성 AI가 한국어를 진짜 듣고 이해하는지 측정하는 기준이 생겼다. 그리고 현재 최선의 모델도 아직 완전하지 않다는 것이 수치로 드러났다.
코텍시스 AI 인사이트 최신 논문 리뷰
활성값을 보고 가중치를 지키는 AWQ 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.ai에서 맞춤 AI 개발 서비스를 확인하세요.



