[논문] 한국어 음성 AI를 제대로 평가하는 최초의 종합 벤치마크 KoALa
AI

[논문] 한국어 음성 AI를 제대로 평가하는 최초의 종합 벤치마크 KoALa

블로그로 돌아가기

Qwen3-Omni와 Gemini와 GPT-4o Audio 같은 대형 오디오 언어 모델의 한국어 음성 이해 능력을 평가하는 최초의 종합 벤치마크 KoALa-Bench를 분석한다. ASR과 번역과 질의응답에 더해 음성 모달리티 충실성(SCA-QA)과 위치 인식 장형식 이해(PA-QA)라는 두 가지 새로운 평가 차원을 제시한다.

Cortexys2026.05.03LALMBenchmarkKorean NLPSpeechMultimodal논문리뷰
구분내용
논문KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness
발표arXiv 2604.19782 (2026년 4월)
저자Jinyoung Kim, Hyeongsoo Lim, Eunseo Seo, Minho Jang(공동 1저자), Keunwoo Choi, Seungyoun Shin(Upstage AI), Ji Won Yoon(중앙대학교 AI학과)
원문arxiv.org/abs/2604.19782
코드github.com/scai-research/KoALa-Bench

음성 AI 시대가 열렸다. 한국어 평가는 어떨까

Qwen3-Omni와 Gemini와 GPT-4o Audio처럼 음성을 직접 이해하고 대화하는 대형 오디오 언어 모델 LALM(Large Audio Language Model)이 빠르게 진화하고 있다. 이 모델들은 이제 ASR(음성 인식)은 물론이고 음성으로 질문을 받아 텍스트로 답한다. 영어 음성을 한국어로 번역하고 복잡한 지시도 따른다.

그런데 문제가 있다. 이 모델들이 한국어 음성을 얼마나 잘 이해하는지 제대로 평가하는 벤치마크가 없었다.

기존 음성 벤치마크(AudioBench, AIR-Bench, ADU-Bench)는 압도적으로 영어 중심적이다. 전통적인 한국어 음성 데이터셋(KsponSpeech, ClovaCall)은 LALM 평가용이 아니라 기존 ASR 모델을 위한 것이다. 중앙대학교와 Upstage AI 연구팀이 만든 KoALa-Bench는 바로 그 공백을 메우기 위해 만들어졌다.


KoALa-Bench가 특별한 이유. 두 가지 새로운 태스크

KoALa-Bench는 총 6개 태스크로 구성된다. 기존 벤치마크에도 있는 4개의 기본 음성 이해 태스크에 더해 저자들이 새롭게 제안한 2개의 음성 충실성(Speech Faithfulness) 태스크가 핵심이다.

저자들은 여러 LALM을 테스트하다가 중요한 문제를 발견했다. 모델들이 음성 입력을 제대로 활용하지 않고 모델 내부에 저장된 파라메트릭 지식에 의존해 답하는 경향이 있다. 음성으로 틀린 정보를 주어도 모델이 자신이 아는 맞는 정보로 답하는 것이다.

이런 충실성(faithfulness) 문제를 체계적으로 평가하는 것이 이 벤치마크의 핵심 기여다.


벤치마크 구성과 데이터 파이프라인

KoALa-Bench 표준 음성 이해 태스크 구성 파이프라인. 영어 데이터를 한국어로 번역 후 TTS 합성

데이터 구성 원칙은 명확하다. 영어 원본 데이터셋을 Gemma로 한국어로 번역한다. Qwen3-TTS로 한국어 음성을 합성한다. CER 또는 인간 검증으로 저품질 샘플을 필터링한다. 여러 데이터셋에 대해 노이즈 증강(noise-augmented) 버전을 별도로 구성한다. 이를 통해 LALM의 소음 환경 견고성(robustness)도 함께 평가한다.


태스크 1. 자동 음성 인식 ASR

음성을 입력하면 한국어 텍스트로 전사한다. 문자 오류율(CER)로 측정하며 낮을수록 좋다. 데이터셋은 KsponSpeech-Clean과 KsponSpeech-Other 각 3,000샘플과 Common Voice 523샘플과 Zeroth-Korean 457샘플이다.


태스크 2. 음성 번역 ST

영어 음성을 한국어 텍스트로 번역한다. BLEU와 METEOR와 BERTScore 세 메트릭으로 평가한다. 데이터셋은 ETRI 영한 음성 번역 코퍼스다. TST-Common은 2,532샘플에 평균 650초다. TST-HE는 고난도 표현으로 구성된 544샘플이다.


태스크 3과 4. 음성 QA와 지시 수행 SQA / SIF

구분구성
SQA 단형식CLIcK(한국어 원어 객관식 1,315샘플)과 KoBEST-BoolQ(예/아니오 1,404샘플)
SQA 장형식KCSAT(수능 듣기 82샘플에 평균 128초). 실제 수능 오디오를 문제 단위로 분할했다
SIFKUDGE와 Vicuna와 OpenHermes와 Alpaca를 TTS 합성한 뒤 GPT-4o를 판사(judge)로 채점한다

태스크 5. 음성 문맥에 얼마나 충실한가 SCA-QA

이 태스크가 핵심이다.

SCA-QA 구성 프로세스. 세계 지식과 충돌하는 의도적인 오답이 포함된 쌍(paired) 질문을 구성

핵심 아이디어는 모델이 음성에서 말하는 내용을 듣고 답하는지 아니면 자기가 원래 알던 지식으로 답하는지를 구분하는 것이다.

구성 방법은 다음과 같다. K-pop과 K-history와 K-sports 관련 키워드로 문서를 크롤링한다. "라이즈는 SM엔터테인먼트 소속 6인조 보이그룹" 같은 문서다. GPT로 질문과 답변 쌍을 생성한다. 핵심 답변 엔티티를 다른 것으로 교체해 의도적으로 틀린 버전을 만든다. "Stray Kids는 SM엔터테인먼트 소속"이라는 식이다. 같은 음성 문맥에 대해 정답 버전과 오답 버전 쌍을 구성한다. 마지막으로 인간 주석자가 전수 검증한다.

평가 지표는 SCF(Speech Context Faithfulness)다.

$$\text{SCF} = \frac{\text{음성 문맥에 충실하게 답한 샘플 수}}{\text{전체 평가 샘플 수}}$$

채점 방식은 다음과 같다. 먼저 텍스트 질문만으로 올바르게 답할 수 있는 샘플을 식별한다. 그 뒤 오답이 포함된 음성 문맥을 추가해 재평가한다. 모델이 자기 지식 대신 음성 내용을 따라 답변을 바꾸면 음성에 충실(faithful)한 것으로 본다.


태스크 6. 긴 음성에서 위치별 이해도 PA-QA

PA-QA 파이프라인. 음성 문맥을 4구간으로 나눠 지원 증거의 위치에 따른 성능 차이 분석

MCTest를 기반으로 Qwen3-TTS로 합성했다(평균 96초). GPT-4.1-nano로 질문별 지원 증거 문장 위치를 [0, 1]로 정규화한 뒤 4구간으로 분류한다. front(00.25)와 front-middle(0.250.5)와 middle-late(0.50.75)와 late(0.751.0)다. 최종 327개 인스턴스로 구성된다.


평가 모델

총 5개 모델이다. white-box와 black-box를 모두 포함한다.

모델버전유형
Qwen3-omniQwen3-Omni-30B-A3B-InstructWhite-box
Gemma-3nGoogle-gemma-3n-E4B-itWhite-box
GPT-audiogpt-audio-mini (OpenAI API)Black-box
VoxtralVoxtral-Mini-3B-2507White-box
Gemini-flashGemini-flash-liteBlack-box

실험 결과 1. ASR

CER은 낮을수록 좋다.

데이터셋Qwen3-omniGemma-3nGPT-audioVoxtralGemini-flash
Zeroth (clean)3.33100†↑6.8740.9213.60
Zeroth (noisy)3.91100†↑9.0039.0714.56
Common Voice (clean)4.96100†↑33.0560.1013.74
Common Voice (noisy)6.78100†↑36.2158.9826.74
KsponSpeech-Clean8.46100†↑100†↑62.6283.19
KsponSpeech-Other7.91100†↑63.6456.0445.14

†는 CER이 100%를 넘어 한국어 전사에 완전히 실패했다는 표시다.

결과는 충격적이다. Gemma-3n은 모든 ASR 데이터셋에서 CER이 100%를 넘는다. 한국어 음성 인식에 완전히 실패한다. GPT-audio도 KsponSpeech-Clean에서 동일하게 실패한다. 반면 Qwen3-omni는 Zeroth 기준 CER 3.33%로 압도적인 1위를 기록한다.

노이즈 환경에서 Qwen3-omni와 GPT-audio는 성능 저하가 작다. Qwen3는 3.33에서 3.91이 되고 GPT는 6.87에서 9.00이 되는 수준이다. 반면 Gemini-flash는 Common Voice 기준 13.74에서 26.74로 거의 두 배 하락한다.


실험 결과 2. 음성 번역 ST

BERTScore는 높을수록 좋다.

데이터셋Qwen3-omniGemma-3nGPT-audioVoxtralGemini-flash
ETRI-TST-Common93.4087.3993.1092.7391.60
ETRI-TST-HE93.9687.7993.6993.0992.17

BLEU와 METEOR에서도 Qwen3-omni가 전체 1위를 유지한다. ETRI-Common 기준 BLEU 28.53에 METEOR 52.02다. Gemma-3n은 ST에서도 BLEU 5.17로 저조하다. 한국어 출력 자체가 불안정한 것으로 보인다.


실험 결과 3. 음성 질의응답 SQA

정확도(Accuracy)는 높을수록 좋다.

데이터셋Qwen3-omniGemma-3nGPT-audioVoxtralGemini-flash
CLIcK (clean / noisy)64.04 / 62.3035.79 / 35.7161.64 / 60.0742.58 / 42.9267.27 / 66.69
KoBEST-BoolQ (clean / noisy)51.34 / 51.1650.89 / 50.5451.88 / 50.4550.54 / 50.5452.86 / 54.92
KCSAT 수능 (clean / noisy)83.53 / 84.7134.12 / 40.0052.90 / 47.1069.41 / 72.9481.18 / 78.82

한국 문화 상식을 다루는 CLIcK과 KoBEST-BoolQ에서는 Gemini-flash가 각각 67.27%와 52.86%로 1위다. Gemini의 한국어 사전 지식이 강하다는 뜻이다. 수능 듣기 KCSAT에서는 Qwen3-omni가 83.53%로 1위다. 장형식 음성 이해에서 강점을 보인다. GPT-audio는 52.90%로 저조하다. 수능 듣기의 긴 구간 처리에 약하다. 노이즈 조건에서 Qwen3-omni는 KCSAT 기준 오히려 84.71%로 소폭 상승한다. 노이즈에 매우 강건하다는 뜻이다.


실험 결과 4. 음성 지시 수행 SIF

GPT Judge Score는 높을수록 좋다.

데이터셋Qwen3-omniGemma-3nGPT-audioVoxtralGemini-flash
KUDGE (clean / noisy)71.87 / 71.8271.38 / 70.6974.07 / 73.9961.97 / 61.7070.29 / 70.39
Vicuna (clean / noisy)79.64 / 78.4380.21 / 80.0082.14 / 81.7967.79 / 69.5076.43 / 73.29
OpenHermes (clean / noisy)86.54 / 85.1984.62 / 85.9689.42 / 89.6269.10 / 69.6282.69 / 80.71
Alpaca (clean / noisy)84.06 / 83.0482.69 / 83.3690.58 / 90.5872.90 / 72.4685.94 / 86.88

SIF에서는 GPT-audio가 전 데이터셋 1위다. Alpaca 기준 90.58이다. 지시 수행 능력은 GPT-4o 계열이 가장 강하다. Voxtral은 SIF에서 전반적으로 저조하다.


실험 결과 5. 음성 충실성 SCA-QA

텍스트 정확도

텍스트만으로 측정한 한국 문화 지식 정확도다. 높을수록 좋다.

도메인Qwen3-omniGemma-3nGPT-audioVoxtralGemini-flash
K-history (조선 이전)55.4548.5169.3041.5879.21
K-history (조선 이후)79.2771.9579.3051.2287.80
K-sports55.6853.4169.3027.2778.41
K-pop67.9668.9369.9042.7289.32

한국 문화 사전 지식은 Gemini-flash가 압도적 1위다. K-pop 89.32%에 K-sports 78.41%다.

SCF Score

음성 문맥 충실성이다. 높을수록 음성을 잘 따른다.

도메인Qwen3-omniGemma-3nGPT-audioVoxtralGemini-flash
K-history (조선 이전)94.6467.3561.4085.7166.25
K-history (조선 이후)92.3145.7632.3085.7159.72
K-sports93.8876.6039.3095.8386.96
K-pop95.7173.2437.5088.6478.26

핵심 발견은 Text-only Accuracy와 SCF Score 사이의 역전 현상이다.

GPT-audio는 한국 문화 사전 지식이 최상위권이다(K-history 69.30%). 그러나 SCF Score는 최하위다. K-history 조선 이후 기준 32.30%에 불과하다. 음성으로 틀린 정보를 줘도 자기가 아는 것으로 답한다. 음성 모달리티를 거의 활용하지 않는다는 뜻이다.

Qwen3-omni는 사전 지식 정확도가 중간 수준이다. 그러나 SCF Score는 압도적 1위다(K-pop 95.71%). 음성 문맥을 가장 충실하게 반영한다.

Gemini-flash는 한국 문화 지식 1위지만 SCF는 중하위다(K-history 조선 이후 59.72%). 강한 사전 지식이 오히려 음성 문맥 반영을 방해한다.

이 패턴이 시사하는 바는 분명하다. 사전 지식이 강한 모델일수록 음성 모달리티를 무시하는 경향이 있다. K-history 조선 이전(Before Chosun) 기준으로 Qwen3는 93%가 음성을 따랐다. 반면 GPT-audio는 49%만 음성을 따르고 51%는 자기 지식으로 답했다.


실험 결과 6. 위치 인식 장형식 이해 PA-QA

정확도는 높을수록 좋다.

위치 구간Qwen3-omniGemma-3nGPT-audioVoxtralGemini-flash
전체 (clean / noisy)93.54 / 93.8548.92 / 48.9277.23 / 79.6984.92 / 86.1592.31 / 92.00
front (앞부분)91.93 / 91.9345.34 / 44.7272.05 / 75.7886.34 / 85.0995.03 / 93.17
front-middle96.70 / 94.5151.65 / 53.8583.52 / 83.5282.42 / 85.7189.01 / 87.91
middle-late87.80 / 87.8047.56 / 47.5674.39 / 70.7376.83 / 81.7182.93 / 85.37
last (뒷부분)94.12 / 98.0445.10 / 45.1080.39 / 86.2782.35 / 82.3592.16 / 98.04

Qwen3-omni는 전체 1위(93.54%)다. 노이즈 환경에서도 93.85%로 거의 동일하다. 특히 last 구간에서는 노이즈 조건에서 98.04%로 오히려 향상된다. 긴 음성의 후반부를 매우 잘 처리한다. Gemma-3n은 전 구간에서 약 50% 수준으로 일관되게 저조하다. 뚜렷한 위치 편향 없이 전반적으로 약하다. GPT-audio는 front-middle 구간에서 상대적으로 강하지만(83.52%) middle-late 구간에서 약해지는 경향을 보인다. Gemini-flash는 front 구간에서 Qwen3를 앞서지만(95.03%) front-middle부터 약해진다.

전반적으로 Qwen3-omni만이 모든 위치 구간에서 일관되게 높은 성능을 보인다.


종합 정리. 모델별 강점

모델ASRSTSQASIFSCF(음성 충실성)PA-QA
Qwen3-omni압도적 1위1위중상2~3위1위1위
Gemma-3n완전 실패최하최하2~3위최하
GPT-audio2~3위1위최하
Voxtral중하최하중상중상
Gemini-flash지식 1위중상

이 벤치마크가 드러내는 핵심 메시지

한국어 ASR은 아직 갈 길이 멀다. Gemma-3n처럼 광범위하게 사용되는 모델이 한국어 음성 인식에 완전히 실패한다. 한국어는 영어 중심 모델에게 여전히 어려운 언어다.

한국어 사전 지식과 음성 충실성은 반비례한다. GPT-audio는 한국 문화를 가장 잘 알면서도 음성으로 다른 정보를 줘도 자기 지식으로 답하는 경향이 가장 강하다. 이는 실용적으로 심각한 문제다. 사용자가 음성으로 무언가를 지시해도 모델이 자기 학습 데이터를 우선시한다면 신뢰할 수 없다.

Qwen3-omni가 종합 최강이다. ASR과 ST와 장형식 이해(KCSAT, PA-QA)와 음성 충실성(SCF) 모두에서 1위다. 노이즈에도 강건하다. 단 지시 수행(SIF)에서는 GPT-audio에 뒤진다.

긴 음성에서도 위치 편향이 존재한다. 대부분 모델이 음성의 front-middle 구간에서 가장 강하고 middle-late에서 약해지는 경향을 보인다. Qwen3-omni만이 전 구간에서 일관된 성능을 유지한다.


결론

KoALa-Bench는 한국어 음성 AI 평가를 위한 최초의 종합 벤치마크다. 6개 태스크로 음성 인식과 번역과 QA와 지시 수행이라는 기존 평가 축에 더해 음성 모달리티 충실성과 위치 인식 장형식 이해라는 두 가지 새로운 차원을 추가했다.

핵심 기여는 다음과 같다.

기여내용
SCA-QA모델이 음성 문맥에 충실한지 파라메트릭 지식에 의존하는지를 직접 평가한다. GPT-audio의 SCF K-history 32.30%라는 충격적 결과를 발굴했다
PA-QA긴 음성에서 지원 증거의 위치에 따른 성능 차이를 체계적으로 분석한다
한국 특화 데이터수능 듣기와 K-history와 K-sports와 K-pop으로 영어 중심 벤치마크의 한계를 극복한다
공개 리더보드지속적인 모델 비교를 위한 플랫폼을 제공한다

음성 AI가 한국어를 진짜 듣고 이해하는지 측정하는 기준이 생겼다. 그리고 현재 최선의 모델도 아직 완전하지 않다는 것이 수치로 드러났다.

코텍시스 AI 인사이트 최신 논문 리뷰

AI 솔루션이 필요하신가요?

cortexys.ai에서 맞춤 AI 개발 서비스를 확인하세요.

컨설팅 신청하기