Benchmark 글 목록
코텍시스 기술 블로그에서 Benchmark 태그가 붙은 글 2편을 모았습니다. 기업 AI 도입과 AX 현장에서 확인한 내용을 정리합니다.
글 2편
![[논문] 문서 세트 품질로 다시 보는 RAG 검색 평가](https://cortexys-blog-images.s3.ap-northeast-2.amazonaws.com/blog/w640/20260913-rag-retrieval-evaluation-document-set-quality-m1-80b4cd.webp)
AI
[논문] 문서 세트 품질로 다시 보는 RAG 검색 평가
USTC와 Tencent Yuanbao 팀이 RAG 검색 평가를 개별 문서의 관련성이 아닌 문서 세트 품질로 재정의했다. 최신 리랭커 12종이 세트 차원에서 낙제한 반면 세트 단위 선택은 평균 2.66개 문서만으로 EM을 7.47점 높였다.
Cortexys2026.07.26
![[논문] 한국어 음성 AI를 제대로 평가하는 최초의 종합 벤치마크 KoALa](https://cortexys-blog-images.s3.ap-northeast-2.amazonaws.com/blog/w640/20260503-koala-korean-speech-ai-benchmark-m1-83b20a.webp)
AI
[논문] 한국어 음성 AI를 제대로 평가하는 최초의 종합 벤치마크 KoALa
Qwen3-Omni와 Gemini와 GPT-4o Audio 같은 대형 오디오 언어 모델의 한국어 음성 이해 능력을 평가하는 최초의 종합 벤치마크 KoALa-Bench를 분석한다. ASR과 번역과 질의응답에 더해 음성 모달리티 충실성(SCA-QA)과 위치 인식 장형식 이해(PA-QA)라는 두 가지 새로운 평가 차원을 제시한다.
Cortexys2026.05.03

