구글이 Gemini Omni 1.1 Flash에 장면 연장, 첫·마지막 프레임 지정, 360p 초안, 4K 업스케일을 넣었습니다. 해상도별 초당 요금을 표와 차트로 정리하고 초안과 최종본을 나누는 두 단계 파이프라인의 비용 계산을 담았습니다.
구글이 2026년 8월 27일 Gemini Omni 1.1 Flash lets you build with more control에서 개발자용 생성 비디오 제어 기능을 발표했습니다. 장면 연장, 첫·마지막 프레임 지정, 360p 초안 생성, 4K 업스케일, 비디오 참조 입력이 Gemini API에 들어왔고 구글은 이를 두고 Omni 1.1이 프로덕션에 쓸 준비가 됐다고 표현했습니다. 코텍시스는 이를 개발·구축 관점에서 읽습니다. 요금이 해상도별 초당 단가로 잡혀 있어 워크플로 설계가 곧 비용 설계이고, 초안과 최종본을 다른 해상도로 나누는 두 단계 파이프라인이 기본 구조가 됩니다.
출처: Google, Gemini Omni 1.1 Flash lets you build with more control
새로 들어온 제어 기능
| 기능 | 내용 |
|---|---|
| 장면 연장 | 직전 10초를 맥락으로 읽어 이어 생성. 10초 단위로 누적 40초까지 |
| 첫·마지막 프레임 지정 | 두 키프레임 사이를 연속 영상으로 생성. 카메라 궤도, 줌 전환, 루프 클립 |
| 360p 초안 | 720p 대비 최대 60% 빠르고 비용은 3분의 1 |
| 4K 업스케일 | 1080p 또는 4K 최종 출력 |
| 비디오 참조 | 최대 3초의 영상을 참조해 캐릭터와 시각 맥락 유지 |
장면 연장의 핵심은 맥락 길이입니다. 이전 모델은 마지막 1초만 참조했는데 Omni 1.1은 10초를 읽어 시각 일관성과 서사 유지가 나아졌다고 합니다. API에서는 previous_interaction_id로 이전 생성을 가리키고 "Continue the scene." 같은 텍스트만 넣으면 이어집니다.
해상도별 초당 요금
| 해상도 | Omni 1.1 Flash | Omni Flash | Veo 3.1 Lite | Veo 3.1 Fast |
|---|---|---|---|---|
| 360p | $0.03 | 없음 | 없음 | 없음 |
| 720p | $0.10 | $0.10 | $0.05 | $0.10 |
| 1080p | $0.15 | 없음 | $0.08 | $0.12 |
| 4K | $0.30 | 없음 | 없음 | $0.30 |
출처: Google, Gemini Omni 1.1 Flash lets you build with more control
대표 사례: 초안 방
구글이 제시한 활용 예 가운데 비용 구조를 가장 잘 보여주는 것은 Draft Room입니다. 제작자는 원래 여러 번 생성한 뒤 하나를 고르므로, 360p로 3~4개 변형을 한 번에 한 요소씩 바꿔 만들고 나란히 비교한 뒤 고른 것만 고해상도로 올리는 구조입니다. 8초 클립 기준으로 360p 초안 4개($0.96)와 4K 최종본 한 편($2.40)을 합쳐 $3.36이며, 720p로 4개를 뽑은 뒤 4K로 올리는 방식($5.60)보다 쌉니다. Adobe Firefly, Figma Weave, Runway가 Omni Flash를 제품에 넣었습니다.
구축 시 판단 기준
첫째, 초안 해상도와 최종 해상도를 분리한 두 단계 파이프라인을 기본으로 잡고 초안 개수를 곱해 비용을 계산해야 합니다. 둘째, 장면 연장은 누적 40초가 상한이므로 그보다 긴 영상은 컷 단위로 나눠 생성하고 편집 단계에서 잇는 설계가 필요합니다. 셋째, 비디오 참조는 3초로 짧아 캐릭터 일관성을 참조 영상 하나에 기대기 어렵고 이미지 참조와 함께 써야 합니다. 제공 경로는 Google AI Studio와 Gemini Enterprise Agent Platform이며 Google Flow 구독자도 같은 날부터 쓸 수 있습니다. 원문은 Gemini Omni 1.1 Flash lets you build with more control에서 볼 수 있습니다.
코텍시스 창업자로 AX 컨설팅과 기업 AI 교육, AI 에이전트 개발을 직접 수행합니다.
코텍시스 AI 인사이트 최신 논문 리뷰
AWQ 양자화: 활성값을 보고 가중치를 지키는 4비트 양자화
MIT 연구진의 AWQ는 활성값 분포를 기준으로 중요한 가중치 1%만 보호해도 저비트 양자화 오류가 크게 줄어든다는 관찰에서 출발해 재학습 없는 4비트 양자화를 구현했고 전용 커널 TinyChat으로 FP16 대비 3배 이상의 추론 속도를 달성했습니다. 온프레미스 sLLM을 소수의 GPU로 서빙해야 하는 기업에게 정확도 손실 없이 메모리와 비용을 동시에 줄이는 사실상의 표준 기법입니다.
Mixtral 8x7B로 읽는 MoE 아키텍처: 13B의 연산으로 70B급 성능 내기
총 47B 파라미터 중 토큰당 13B만 활성화하는 희소 MoE 모델 Mixtral 8x7B는 Llama 2 70B와 GPT-3.5를 대부분의 벤치마크에서 따라잡거나 능가했습니다. 추론 연산량은 소형 모델 수준으로 유지하면서 품질을 끌어올리는 MoE의 실용성을 입증한 사례로, 기업의 자체 호스팅 모델 선정 기준에 직접 영향을 줍니다.
DPO가 바꾼 선호 정렬 학습: 보상 모델 없이 RLHF를 대체하는 방법
DPO는 보상 모델의 재매개변수화를 통해 최적 정책을 닫힌 형태로 유도하고, 선호 데이터에 대한 단순 분류 손실만으로 RLHF와 같은 목적을 달성하는 기법입니다. 강화학습 파이프라인을 운영할 여력이 없는 기업 프로젝트에서 선호 정렬을 현실적인 작업 범위로 만들어 준 논문입니다.
AI 솔루션이 필요하신가요?
cortexys.team에서 맞춤 AI 개발 서비스를 확인하세요.

