[논문] VLM은 영상을 보고 공간을 이해하지 못한다, GST-Bench
AI

[논문] VLM은 영상을 보고 공간을 이해하지 못한다, GST-Bench

블로그로 돌아가기

최신 VLM 22종을 영상 기반 전역 공간 인지로 평가했더니 최고 점수가 42.68점이었습니다. 사람은 79.08점입니다. 국소 공간 이해는 되지만 전체를 하나의 지도로 합치지 못한다는 것이 원인입니다.

김지우2026.08.09VLM공간 추론벤치마크arXivEmbodied AI

2026년 8월 6일 공개된 GST-Bench는 시각 언어 모델이 영상을 보고 공간을 얼마나 이해하는지 측정합니다. 결과는 분명합니다. 아직 못 합니다.

무엇을 측정하는가

기존 공간 인지 벤치마크는 한 장 또는 몇 장의 이미지에서 국소적인 공간 관계를 묻습니다. GST-Bench는 다르게 묻습니다. 연속된 긴 영상을 보고 전체 공간을 파악했는지를 봅니다.

구체적으로 두 가지를 요구합니다.

요구 사항내용
새로운 시점 추론입력 영상에 나오지 않은 시점에서의 공간 관계를 추론합니다
좌표계 변환1인칭 관찰을 전역 조감도 위에 매핑합니다

데이터는 합성 영상 6,790분 분량에서 뽑았고 사람이 검증했습니다.

GST-Bench의 과제 예시 — 자기 위치 추정, 객체 방향 추정, 전역 구조 이해 출처: GST-Bench 논문 (arXiv:2608.05747)

결과

최신 VLM 22종을 평가한 결과입니다.

대상점수
가장 강한 제로샷 모델42.68
사람79.08

거의 두 배 차이입니다.

원인이 흥미롭다

논문은 원인을 확인하기 위해 GST-Bench-Local을 따로 만들었습니다. 같은 형식으로 국소 공간 이해만 묻는 버전입니다.

여기서 모델들은 좋은 성적을 냅니다. 즉 개별 장면의 공간 관계는 이해합니다. 그런데도 전역 과제에서 무너지는 이유는, 논문의 표현대로 "장시간 관찰을 전역적으로 일관된 장면 표현으로 통합"하지 못하기 때문입니다.

부분은 보는데 전체 지도를 그리지 못한다는 뜻입니다.

제조 현장 관점에서

이 결과는 산업 현장에 VLM을 적용할 때 직접적인 함의를 갖습니다.

고정 카메라로 한 지점을 보는 검사 작업은 국소 공간 인지에 가깝습니다. 이 영역은 이미 실용 수준입니다. 저희가 수행한 컴퓨터 비전 기반 공정 자동화 PoC도 여기에 해당합니다.

반면 이동하는 카메라로 설비 전체를 순회하며 배치를 파악하거나, 작업자 시점 영상에서 공간 흐름을 이해하는 과제는 이 벤치마크가 지적한 약점에 정면으로 부딪힙니다. 데모에서 잘 되던 것이 현장에서 무너지는 지점이 대체로 여기입니다.

적용 범위를 정할 때 국소 인지로 풀 수 있는 문제인지 전역 인지가 필요한 문제인지 먼저 구분하는 편이 안전합니다.

논문은 후속 연구용 학습 데이터셋 GST-Train도 함께 공개했습니다.

출처: GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? (arXiv:2608.05747, 2026-08-06)

코텍시스 AI 인사이트 최신 논문 리뷰

AI 솔루션이 필요하신가요?

cortexys.ai에서 맞춤 AI 개발 서비스를 확인하세요.

컨설팅 신청하기