DEV Community

Cover image for 제미니 옴니 1.1 플래시: 구글 GA 동영상 모델의 새로운 기능
Rihpig
Rihpig

Posted on Originally published at apidog.com

제미니 옴니 1.1 플래시: 구글 GA 동영상 모델의 새로운 기능

구글은 2026년 8월 27일 대화형 비디오 모델 gemini-omni-1.1-flash를 정식 출시했습니다. 이 모델은 2026년 6월 30일 공개 프리뷰로 출시된 gemini-omni-flash-preview를 대체하며, 프리뷰 엔드포인트는 2026년 9월 30일 중단됩니다.

지금 Apidog를 사용해 보세요

GA(정식 출시) 버전에는 장면 확장, 첫 프레임 및 마지막 프레임 제어, 360p 초안 모드, 4K 업스케일링이 추가되었습니다. 이 글에서는 주요 변경 사항, 비용, 실행 환경, 제한 사항, 마이그레이션 방법을 정리합니다.

Omni 제품군의 배경이 궁금하다면 Gemini Omni란 무엇인가부터 확인하세요.

Gemini Omni 1.1 Flash의 기능

Omni 1.1 Flash는 텍스트, 이미지, 비디오를 입력으로 받아 비디오를 출력합니다. generateContent가 아닌 Interactions API에서 실행되며, 상태 저장(stateful) 및 다중 턴 생성에 사용할 수 있습니다.

따라서 클립을 생성한 뒤 방금 만든 클립을 다시 업로드하지 않고 후속 턴에서 편집할 수 있습니다.

지원되는 작업 유형은 다음과 같습니다.

  • 텍스트를 비디오로: 프롬프트를 입력해 클립을 생성합니다.
  • 이미지를 비디오로: 이미지를 시작 프레임 또는 움직임의 스타일 가이드로 사용합니다.
  • 참조를 비디오로: 최대 3개의 3초 참조 클립에서 움직임, 외형, 캐릭터 일관성을 가져옵니다.
  • 편집: 대화 방식으로 기존 비디오의 일부를 변경합니다.
  • 확장: 클립 끝에 10초를 추가합니다.

참조 클립의 오디오는 무시되며, 모델은 움직임과 외형만 분석합니다.

장면 확장: 최대 40초

프리뷰 모델은 클립을 이어가기 전에 마지막 1초만 확인했습니다. 색상 팔레트는 어느 정도 유지했지만 캐릭터가 달라지거나 카메라 움직임이 초기화되는 문제가 있었습니다.

Omni 1.1은 이전 영상의 최대 10초를 분석합니다. 구글은 이를 통해 “향상된 시각적 일관성과 내러티브 준수”를 제공한다고 설명합니다.

클립은 10초 단위로 확장할 수 있으며, 누적 길이는 최대 40초입니다.

주의할 제한 사항은 다음과 같습니다.

  • 확장은 클립의 끝에만 추가할 수 있습니다.
  • 앞부분에 영상을 붙이거나 중간에 삽입할 수 없습니다.
  • 모델이 이전 상태를 보유한 다중 턴 상호작용이 아니라면, 업로드된 비디오는 최대 10초까지만 입력할 수 있습니다.

요청 형식과 이음새가 발생하는 지점은 40초 장면 확장 가이드에서 확인할 수 있습니다.

첫 프레임과 마지막 프레임 제어

이제 첫 프레임과 마지막 프레임을 함께 제공하고, 두 프레임 사이의 움직임을 프롬프트로 설명할 수 있습니다. 모델은 두 프레임을 연결하는 영상을 생성합니다.

주요 사용 사례는 다음과 같습니다.

  • 카메라 궤도
  • 줌 전환
  • 루프 클립
  • 예측 가능한 장면 전환

텍스트-투-비디오가 무작위성이 큰 생성 방식이라면, 키프레임 제어는 두 개의 고정점을 제공합니다. 모델이 중간 움직임만 해결하면 되므로 원하는 결과에서 벗어날 가능성이 줄어듭니다.

360p 초안 모드와 비용

Omni 1.1은 720p보다 최대 60% 빠르게 360p 미리 보기를 생성하며 비용은 3분의 1입니다.

권장 워크플로는 간단합니다.

  1. 360p로 프롬프트를 반복하며 초안을 만듭니다.
  2. 원하는 결과를 얻으면 720p, 1080p 또는 4K로 최종 렌더링합니다.

비디오 생성은 초당 비용이 높고, 프롬프트를 수정하는 동안 대부분의 결과가 버려집니다. 초안 비용이 3분의 1로 줄어들면 더 많은 시도를 하면서도 예산을 관리할 수 있습니다. 자세한 초당 비용은 전체 가격 분석을 참고하세요.

해상도는 응답 형식에서 설정합니다. 1080p4k는 네이티브 렌더링이 아니라 생성된 프레임을 업스케일한 결과입니다.

사용 가능한 환경

Omni 1.1 Flash는 다음 환경에서 사용할 수 있습니다.

  • 개발자용 Google AI Studio의 Gemini API
  • 기업 배포용 Gemini Enterprise Agent Platform API
  • AI Plus, Pro, Ultra 구독자를 위한 Google Flow
  • 구독자가 장면 확장을 사용할 수 있는 Gemini 앱

구글은 Adobe Firefly, Figma Weave, Runway, GMI Cloud를 제품 내 모델 실행 파트너로도 지명했습니다. 해당 도구를 사용하고 있다면 이미 Omni 1.1 Flash를 통해 트래픽이 처리되고 있을 수 있습니다.

API에는 무료 티어가 없습니다. AI Studio에서 사용량 제한이 있는 무료 레인을 제공하는 텍스트 Flash 모델과 달리, Omni 비디오 출력은 첫 요청부터 모든 생성 초에 비용이 청구됩니다. 다만 YouTube Shorts와 YouTube Create에서는 모델이 무료로 제공되며, 이는 별도의 제한이 적용되는 제품입니다.

각 무료 액세스 경로는 Gemini Omni 무료 사용 요약에서 확인할 수 있습니다.

아직 지원되지 않는 기능

구현 전에 다음 제한 사항을 확인하세요.

  • 세부 프롬프트 제어 부족: 시스템 지침, temperature, top_p, 중지 시퀀스, 네거티브 프롬프트를 지원하지 않습니다. 제외할 요소는 일반 프롬프트에 직접 작성해야 합니다.
  • 지역 제한: 유럽 경제 지역(EEA), 스위스, 영국에서는 비디오 업로드와 편집을 사용할 수 없습니다. 미성년자가 포함된 이미지 편집도 제한됩니다. 모델이 생성한 비디오는 해당 지역에서도 계속 편집할 수 있습니다.
  • 식별 가능한 인물: 특정 식별 가능한 인물에 대한 편집은 차단됩니다.
  • 업로드된 비디오의 대화 추가 불가: 업로드한 클립을 음소거 상태로 확장하거나 다중 턴 상호작용에서 작업할 수는 있지만, 다른 사람이 업로드한 클립에 대화를 추가할 수는 없습니다.
  • 한 번에 하나의 입력 비디오만 처리: 여러 입력 비디오를 함께 분석해 추론할 수 없습니다.
  • 영어 중심 지원: 영어가 완벽하게 지원되며, 다른 언어는 테스트되지 않았습니다.

모든 출력에는 시청자에게 보이지 않지만 프로그램으로 감지할 수 있는 SynthID 워터마크가 포함됩니다. 콘텐츠 출처를 표시해야 하는 제품이라면 이를 고려하세요.

Omni 1.1 Flash와 Veo 3.1 비교

구글은 동일한 API 키로 두 비디오 생성 제품군을 제공합니다.

모델 특징
Veo 3.1 네이티브 오디오를 지원하는 영화적 렌더러
Omni 1.1 Flash 다중 턴 편집과 대화형 작업에 적합한 모델

Omni의 720p 초당 비용은 표준 Veo 3.1의 약 4분의 1이며, Veo에는 Omni와 같은 다중 턴 편집 루프가 없습니다.

각 모델이 적합한 상황은 측면 비교에서 확인할 수 있습니다. 이미 Veo를 통합했다면 Veo 3.1 API 가이드는 여전히 유효합니다. 이번 출시로 Veo 3.1이 중단되지는 않습니다.

프리뷰 엔드포인트에서 마이그레이션하기

gemini-omni-flash-preview를 사용하는 코드는 2026년 9월 30일 이후 작동하지 않습니다. 일반적으로 모델 문자열 한 줄만 변경하면 되지만, 다음 두 가지를 반드시 확인하세요.

1. 해상도 기본값

이제 기본 해상도는 720p입니다. 360p와 4K 옵션도 추가되었습니다. 코드가 고정된 출력 크기를 가정한다면 실제 응답을 확인해야 합니다.

2. 응답 크기

4MB를 초과하는 비디오는 인라인 base64가 아니라 URI로 반환됩니다. 핸들러가 output_video.data만 읽는다면 고해상도 결과를 받지 못할 수 있습니다.

가장 안전한 마이그레이션 방법은 다음과 같습니다.

  1. API 클라이언트에 기존 요청을 저장합니다.
  2. 모델 ID를 환경 변수로 관리합니다.
  3. gemini-omni-flash-previewgemini-omni-1.1-flash를 각각 호출합니다.
  4. 해상도별 응답 형식과 URI 처리 여부를 비교합니다.

Apidog에서는 저장된 요청과 환경 변수를 사용해 이 비교를 쉽게 수행할 수 있습니다. 자세한 설정은 Gemini Omni 1.1 Flash API 사용 안내서를 참고하세요.

자주 묻는 질문

Gemini Omni 1.1 Flash의 모델 ID는 무엇인가요?

gemini-omni-1.1-flash입니다. 중단 예정인 프리뷰 ID는 gemini-omni-flash-preview입니다.

Gemini Omni 1.1 Flash는 언제 출시되었나요?

GA 버전은 2026년 8월 27일, 프리뷰 버전은 2026년 6월 30일에 출시되었습니다.

Gemini Omni 1.1 Flash는 무료인가요?

아니요. Omni에는 무료 티어가 없으며 모든 생성에 비용이 청구됩니다. Gemini 3.6 Flash 같은 텍스트 모델은 여전히 AI Studio 무료 레인을 제공하지만, Omni는 제공하지 않습니다.

Gemini Omni 비디오는 얼마나 길 수 있나요?

기본 클립은 10초입니다. 장면 확장을 사용하면 10초 단위로 최대 40초까지 늘릴 수 있습니다.

Gemini Omni는 오디오를 생성하나요?

문서는 비디오 출력에 대해 설명하며, 참조 클립의 오디오는 무시됩니다. 네이티브 오디오가 필요하다면 Veo 3.1 API부터 확인하세요.

직접 촬영한 비디오를 편집할 수 있나요?

네. EEA, 스위스, 영국 외부에서는 최대 10초의 입력 비디오를 편집할 수 있습니다. Files API로 비디오를 업로드한 뒤 URI를 입력으로 전달하면 됩니다.

마무리

Omni 1.1 Flash는 제품에 통합할 수 있는 수준으로 발전한 첫 번째 버전입니다.

  • 장면 확장으로 샷의 일관성을 유지할 수 있습니다.
  • 키프레임 제어로 결과를 더 예측할 수 있습니다.
  • 360p 초안 모드로 반복 비용을 줄일 수 있습니다.

GA 모델 ID로 저장된 요청을 만들고, 사용할 모든 해상도에서 응답 형식을 확인하세요. 그리고 2026년 9월 30일 전에 프리뷰 엔드포인트에서 마이그레이션을 완료하세요.

마이그레이션 검증을 시작하려면 Apidog를 다운로드하세요.

Top comments (0)