구글이 Gemini 3.7·3.6 Flash와 3.5 Flash-Lite에 에이전틱 비디오 이해를 추가했습니다. 모델이 필요한 구간만 골라 보는 방식으로 토큰 최대 88%, 비용 66%를 줄이면서 정확도를 올린 수치와 구축 시 판단 기준을 정리했습니다.
구글이 2026년 9월 1일 Introducing agentic video understanding with Gemini에서 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite에 에이전틱 비디오 이해를 추가했습니다. 모델이 필요한 구간을 스스로 찾아 보는 방식이며, 표준 벤치마크에서 토큰 사용량을 최대 88%, 비용을 최대 66% 줄이면서 정확도를 최대 7% 올렸습니다. 추가 요금 없이 API 설정 하나로 켭니다. 코텍시스는 이를 개발·구축 관점에서 읽습니다. 개발자가 직접 짜던 프레임 샘플링과 구간 탐색 로직이 모델 안으로 들어갔으므로, 구축 중인 시스템이라면 그 코드를 걷어낼 수 있는지 검토할 가치가 있습니다.
출처: Google, Introducing agentic video understanding with Gemini
정적 처리와 에이전틱 처리의 차이
기존 정적 처리는 기본 1FPS로 영상 전체를 토큰으로 바꿔 넣습니다. 긴 영상일수록 토큰이 늘고 줄이려면 세부를 버려야 했습니다. 에이전틱 처리는 모델의 추론에 네이티브 비디오 도구를 붙입니다. 모델이 전사(get_transcript)를 먼저 읽고, 필요한 구간의 프레임(get_frames)과 오디오(get_audio)를 원하는 FPS로 불러와 관찰하고 다시 생각하는 루프를 돕니다. 어디를 어떤 속도로 볼지 모델이 정합니다.
출처: Google, Introducing agentic video understanding with Gemini
벤치마크 수치
Gemini 3.7 Flash 기준으로 세 벤치마크의 쿼리당 토큰과 정확도가 함께 개선됐습니다.
| 벤치마크 | 토큰(정적) | 토큰(에이전틱) | 정확도(정적) | 정확도(에이전틱) |
|---|---|---|---|---|
| Minerva (복합 추론) | 80.9K | 33.6K | 73.7% | 79.0% |
| 1H-VideoQA (1시간 영상) | 397.6K | 47.7K | 87.5% | 88.5% |
| LVBench (긴 영상) | 300.3K | 36.0K | 85.1% | 88.6% |
구글은 1H-VideoQA의 정확도 대비 비용에서 에이전틱 처리를 켠 3.7 Flash가 GPT-5.6과 Claude Opus 5를 포함한 비교 모델 가운데 파레토 프런티어에 있다고 밝혔습니다.
대표 활용: 긴 영상의 바늘 찾기
구글이 든 활용은 1초 미만의 순간 검색, 여러 시간짜리 영상의 바늘 찾기, 이상 탐지, 동작·객체 계수 네 가지입니다. 가장 효과가 큰 것은 바늘 찾기입니다. 90분 강의나 여러 시간의 회의 녹화에서 전사로 후보 구간을 좁힌 뒤 그 구간만 높은 FPS로 다시 보므로 수백만 토큰을 쓰지 않습니다. 빠른 동작 계수도 같은 원리입니다.
구축 시 판단 기준
활성화는 Gemini API 입력의 video 항목에 processing을 "agentic"으로 지정하면 되고 업로드 영상과 YouTube URL을 지원합니다. 요금은 표준 토큰 단가이며 기능 추가 요금은 없습니다. 코텍시스가 보는 판단 기준은 두 가지입니다. 첫째, 이득은 긴 영상에서 큽니다. 짧은 클립 위주라면 정적 처리와 비교 측정이 먼저입니다. 둘째, 모델이 볼 구간을 고르므로 호출마다 관찰한 구간이 달라질 수 있어 결과 회귀 테스트를 갖춰야 합니다. 원문은 Introducing agentic video understanding with Gemini에서 볼 수 있습니다.
코텍시스 창업자로 AX 컨설팅과 기업 AI 교육, AI 에이전트 개발을 직접 수행합니다.
코텍시스 AI 인사이트 최신 논문 리뷰
AWQ 양자화: 활성값을 보고 가중치를 지키는 4비트 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.team에서 맞춤 AI 개발 서비스를 확인하세요.

