Gemini Omni 1.1 Flash 신규 출시: 대화로 동영상 편집하기

Google DeepMind Labs의 신작, Gemini Omni 1.1 Flash. Gemini Omni 1.1 Flash는 AI 영상 제작을 일회성 프롬프트에서 지속적인 창작 대화로 바꿉니다.

Gemini Omni 1.1 Flash 신규 출시: 대화로 동영상 편집하기
날짜: 2026-08-30

Gemini Omni 1.1 Flash 신규 출시는 AI 비디오 제작을 일회성 프롬프트에서 지속적인 창작 대화로 바꿉니다. 2026년 8월 27일 Google이 공개한 이 모델은 텍스트와 이미지로부터 비디오를 생성하고, 업로드하거나 생성한 클립을 편집하며, 장면을 확장하고, 첫 프레임과 마지막 프레임 사이를 보간하며, 여러 턴에 걸쳐 결과를 다듬을 수 있습니다. 대화를 통해 비디오를 편집하고자 하는 제작자에게는 Google Veo 3 프롬프트를 처음부터 반복해서 다시 만드는 것보다 더 유용할 수 있습니다.

Gemini Omni 1.1 Flash conversational video editing

Gemini Omni 1.1 Flash가 모든 샷에 자동으로 최고의 모델이 되는 것은 아닙니다. Google Veo 3는 사실적인 모션과 네이티브 오디오를 갖춘 시네마틱한 텍스트-투-비디오 또는 이미지-투-비디오 생성에 여전히 강력한 선택지입니다. 반면 팀이 세부적인 수정, 반복 간 연속성, 저비용 초안, 또는 편집 가능한 상호작용 이력을 필요로 할 때는 Omni가 더 잘 맞습니다.

Gemini Omni 1.1 Flash 출시에서 새로워진 점은 무엇인가요?

Google은 gemini-omni-1.1-flash 빠르고 대화형 비디오 생성 및 편집 모델의 일반 공개 버전이라고 설명합니다. 이 안정 릴리스는 텍스트, 이미지, 비디오 입력을 지원하고, 오디오가 포함된 비디오를 생성하며, Gemini Interactions API를 사용해 턴 간 창작 맥락을 유지합니다.

가장 중요한 추가 사항은 실질적인 제작 제어 기능입니다:

  • 대화형 생성 및 편집: 자연어 지시로 저장된 비디오 상호작용을 계속 다듬을 수 있습니다.
  • 첫 프레임과 마지막 프레임 제어: 샷이 어디서 시작하고 어디에 도달해야 하는지 정의할 수 있습니다.
  • 장면 확장: 최근 영상을 맥락으로 활용하면서 총 40초까지 10초 분량의 후속 장면을 추가할 수 있습니다.
  • 360p 초안 모드: 표준 720p 출력 대비 최대 60% 더 빠르고 3분의 1 비용으로 구성을 시제품화할 수 있습니다.
  • 고해상도 마무리: 지원되는 출력을 1080p 또는 4K로 생성하거나 업스케일할 수 있습니다.
  • 타이밍 지시: 자연스러운 타이밍 설명이나 단순한 타임코드로 동작을 지정할 수 있습니다.

Google의 현재 모델 페이지에는 24 FPS 기준 3~10초 개별 출력과 함께 360p, 720p, 1080p, 4K 옵션이 나와 있습니다. 확장을 통해 더 긴 시퀀스를 만들 수는 있지만, 그렇다고 이 시스템이 무제한 장편 편집기로 바뀌는 것은 아닙니다.

Gemini Omni 1.1 Flash가 대화를 통해 비디오를 편집하게 해주는 방식

대화형 편집은 작고 검증 가능한 결정들의 연속으로 접근할 때 가장 잘 작동합니다. 첫 요청이 기본 장면을 만들거나 업로드합니다. 이후 턴은 이전 상호작용을 참조하므로, 제작자는 프로젝트 전체를 다시 설명하지 않고도 하나의 목표 변경만 요청할 수 있습니다.

실용적인 대화는 다음과 같을 수 있습니다:

  1. 기본 샷 만들기: “따뜻한 아파트에서 진행되는 느린 핸드헬드 제품 데모, 자연스러운 창문광, 사실적인 실내 배경음.”
  2. 한 요소 수정하기: “카메라 움직임과 발표자는 그대로 유지하고, 테이블만 옅은 참나무색으로 바꿔줘.”
  3. 분위기 다듬기: “주황빛을 줄이고 주광을 더 부드럽게 해줘. 피부 톤과 제품 색상은 유지해.”
  4. 장면 확장하기: “10초 동안 이어줘. 발표자가 제품을 포장 옆에 놓고 미소 짓고, 실내 분위기음은 계속 유지돼야 해.”
  5. 더 높은 해상도로 마무리: 초기 실험마다 최종 품질 비용을 지불하는 대신, 승인된 초안을 업스케일합니다.

장점은 자연어가 모든 전문 편집을 대체한다는 데 있지 않습니다. 정밀한 컷 편집, 타이포그래피, 색 관리, 오디오 믹싱, 자막, 법적 검토는 여전히 타임라인 기반 편집기의 이점을 누립니다. Gemini Omni 1.1 Flash는 거친 아이디어와 검토 가능한 시각 초안 사이의 작업량을 줄여줍니다.

Gemini Omni 1.1 Flash vs Google Veo 3

Gemini Omni 1.1 Flash vs Google Veo 3 comparison

비교는 단일한 “품질” 점수보다 가격, 세부성, 편집 깊이, 입력 유연성, 전달 목표를 기준으로 할 때 더 명확해집니다.

결정 요소Gemini Omni 1.1 FlashGoogle Veo 3실용적 권장 사항
주요 워크플로저장된 대화를 통해 생성, 편집, 리믹스, 보간, 확장, 정교화텍스트 또는 이미지로부터 네이티브 사운드가 포함된 시네마틱 비디오 생성반복 편집에는 Omni, 생성 중심의 강력한 샷에는 Veo 3 선택
현재 공개 API 가격Google Standard 요금 기준 720p 비디오 초당 약 $0.10, 입력 토큰은 별도 과금Flyne AI는 자체 크레딧 기반 제공자 워크플로를 사용하며 정확한 비용은 선택 버전과 계정에 따라 달라짐현재 Omni가 더 명확한 공개 개발자 가격을 제공하므로 제작 전 Flyne 크레딧 재확인 필요
저비용 프로토타이핑360p 초안은 720p 대비 3분의 1 비용이며 최대 60% 더 빠르게 생성 가능연결된 Flyne 워크플로는 문서화된 대화형 초안 등급보다 최종 시네마틱 생성에 초점을 둠Omni는 초기 구성을 기각하는 비용을 줄일 수 있음
세부 묘사와 마감대화형 수정, 첫/마지막 프레임, 타이밍 프롬프트, 읽을 수 있는 텍스트 지침, 1080p/4K 출력 옵션강한 시네마틱 구도, 사실적인 물리, 움직임, 분위기, 효과, 대사세부 수정이 필요하면 Omni가 더 적합하고, 첫 생성의 시네마틱 룩이 우선이면 Veo 3가 여전히 강점
연속성저장된 멀티턴 맥락과 최대 40초 확장생성 주도 워크플로로, 새 프롬프트마다 브리프를 더 많이 다시 설명해야 할 수 있음변화하는 장면에는 Omni가 더 편리함
입력 유연성현재 API에서 텍스트, 이미지, 짧은 비디오 입력 지원; 더 넓은 멀티모달 기능은 인터페이스와 모드에 따라 달라짐연결된 Flyne 페이지에서는 텍스트 또는 이미지 생성Omni가 더 폭넓은 편집 상호작용 모델 제공
제한 사항편집/확장을 위한 업로드 비디오는 일반적으로 10초 제한, 음성 편집 불가, 확장은 끝부분만 가능, 지역 및 식별 가능한 인물 제한 적용제공자, 모델, 안전, 길이, 계정 제한이 여전히 적용어느 모델도 무제한은 아니며, Omni는 규제가 덜한 것이 아니라 창작적으로 더 유연함

따라서 Gemini Omni 1.1 Flash는 “더 좋다”가 여러 차례의 통제된 수정 후 더 가까운 결과를 의미할 때 더 나은 결과를 낼 수 있습니다. Veo 3는 물리, 카메라 움직임, 네이티브 사운드를 중심으로 한 시네마틱 장면에서 여전히 더 나은 첫 결과물을 만들 수 있습니다. 공정한 테스트는 생성당 가격이 아니라 승인된 클립당 비용을 비교해야 합니다.

가격: 대화형 초안 작성이 제작 비용을 낮출 수 있는 이유

직접적인 API 가격은 제작 비용의 한 부분일 뿐입니다. Google의 현재 Gemini API 가격표는 Omni의 Standard 720p 출력 가격이 대략 초당 $0.10에 해당한다고 명시합니다. 더 중요한 점은 360p 초안 등급이 720p의 약 3분의 1 비용이라는 것입니다. 팀은 고해상도 마무리를 선택하기 전에 프레이밍, 동작 순서, 피사체 배치, 장면 리듬을 저렴하게 테스트할 수 있습니다.

대화형 편집은 낭비도 줄일 수 있습니다. 제품, 배우, 카메라 경로가 이미 유용하다면, 목표 지시 하나로 전체 재생성보다 승인된 클립의 더 많은 부분을 보존할 수 있습니다. 실제 절감 효과는 모델이 요청된 편집을 얼마나 잘 따르는지, 그리고 최종 클립이 검토를 통과하는지에 달려 있습니다.

Flyne AI 사용자라면 생성 직전에 Gemini Omni, Google Veo 3, Google Veo 3.1의 표시된 크레딧 요구량을 비교하세요. 제공자 크레딧, 선택한 모드, 프로모션, 가용성은 Google의 API 정가와 별개로 변할 수 있습니다.

세부성과 제어: Gemini Omni가 더 정밀할 수 있는 지점

Gemini Omni 1.1 Flash는 지시문이 변경 사항과 불변 요소를 모두 설명할 때 가장 정밀합니다. “더 시네마틱하게 만들어줘”는 범위가 넓습니다. “배우, 카메라 경로, 방 배치, 제품 색상, 오디오는 그대로 두고, 주광만 더 차가운 흐린 날씨 느낌으로 바꿔줘”라고 하면 모델에 더 명확한 편집 경계를 제시할 수 있습니다.

첫 프레임과 마지막 프레임 제어는 계획된 전환을 개선합니다. 제품 샷은 매크로 텍스처로 시작해 승인된 히어로 구도로 끝날 수 있습니다. 짧은 드라마는 통제되지 않은 마지막 프레임 없이 불확실성에서 인식으로 이동할 수 있습니다. 타이밍 프롬프트는 캐릭터가 언제 등장하는지, 컷이 언제 일어나는지, 음악이 언제 바뀌는지를 지정할 수 있습니다.

이 모델은 미세한 디테일, 표정, 자연스러운 타이밍, 배경의 사실감, 읽을 수 있는 화면 텍스트를 강조하는 프롬프트도 지원합니다. 하지만 이는 유용한 지침이지 보장이 아닙니다. 사람 검토자는 얼굴, 손, 라벨, 로고, 반사, 연속성, 오디오, 그리고 모든 사실 주장을 여전히 점검해야 합니다.

비디오 생성 및 편집 활용 사례

Gemini Omni 1.1 Flash video editing workflow

UGC 및 소셜 광고

크리에이터 스타일의 제품 클립에서 시작한 뒤, 발표자와 카메라 동작은 유지하면서 더 깔끔한 배경, 더 따뜻한 조명, 다른 제품 배치, 또는 더 짧은 시각적 훅을 요청할 수 있습니다. 최종 자막, 주장 문구, 가격, 콜투액션은 텍스트 정확성을 검증할 수 있는 기존 편집기에서 추가하세요.

제품 및 이커머스 비디오

팩샷, 소재 클로즈업, 테이블탑 데모, 언박싱 장면을 여러 차례의 작은 변경을 통해 다듬을 수 있습니다. 대화형 워크플로는 브랜드 팀이 승인된 카메라 움직임을 포기하지 않고 환경이나 조명 연출을 비교해야 할 때 유용합니다.

단편 영화와 내러티브 연속성

최근 움직임과 오디오를 맥락으로 유지하면서 장면을 확장하고, 참조 캐릭터를 도입하며, 분위기를 바꾸거나, 다음 행동을 유도할 수 있습니다. 짧은 비트 단위로 작업하세요: 턴당 하나의 등장, 반응, 드러남, 또는 전환.

스토리보드와 프리비주얼라이제이션

스케치나 참조 프레임을 움직이는 콘셉트로 바꾼 뒤, 대화를 통해 프레이밍과 페이싱을 수정합니다. 감독은 실제 제작 자원을 투입하기 전에 오빗, 돌리, 컷, 조명 전환, 최종 구도를 테스트할 수 있습니다.

교육 및 훈련 콘텐츠

시연 영상을 만든 후, 보여지는 물체, 카메라 각도, 환경, 동작 순서를 수정할 수 있습니다. AI가 생성한 교육용 영상에는 오류가 포함될 수 있으므로, 분야 전문가가 모든 단계, 라벨, 안전 지침을 검증해야 합니다.

캠페인 현지화 및 포맷 변형

핵심 제품 장면은 유지하면서 시장, 계절, 채널별 시각 버전을 개발할 수 있습니다. API는 현재 음성 편집을 지원하지 않으므로 더빙과 최종 언어 오디오는 별도로 처리해야 합니다. 게시 전에 생성된 가시 텍스트를 반드시 검토하세요.

음악 및 퍼포먼스 클립용 장면 확장

일관된 움직임과 오디오를 유지하며 생성된 클립을 확장하거나, 동일한 캐릭터로 다음 장면으로의 컷을 요청할 수 있습니다. 기존 음성이 있는 업로드 클립은 추가 제한이 있으므로, 대화형으로 확장할 수 있다고 가정하기 전에 대사를 미리 계획하세요.

대화형 비디오 편집을 위한 더 나은 프롬프트 패턴

다섯 부분으로 된 편집 요청을 사용하세요:

  1. 대상: 정확히 무엇이 바뀌어야 하는지 식별합니다.
  2. 불변 요소: 그대로 유지되어야 하는 사람, 사물, 움직임, 구도, 소리를 나열합니다.
  3. 대체 내용: 새로운 사물, 빛, 환경, 동작, 또는 결말을 설명합니다.
  4. 타이밍: 변경이 언제 일어나고 얼마나 빠르게 진행되는지 명시합니다.
  5. 검토 규칙: 생성 후 점검해야 할 일반적인 실패 지점을 지정합니다.

예시:

이전 비디오를 편집해줘. 발표자의 정체성, 손 움직임, 제품 형태, 라벨 색상, 카메라 경로, 방 배치, 기존 분위기음은 그대로 유지해. 배경 창문 풍경만 비 오는 저녁 도시로 바꿔줘. 전환은 2초 후 시작해서 6초까지 점진적으로 완료돼야 해. 사실적인 반사를 유지하고 텍스트, 로고, 추가 물체는 넣지 마.

턴마다 의미 있는 변수 하나만 바꾸세요. 그래야 어떤 지시가 결과를 개선했는지 또는 망쳤는지 더 쉽게 파악할 수 있습니다.

워크플로를 구축하기 전에 알아야 할 중요한 한계

Gemini Omni의 현재 API 문서는 제작자에게 더 넓은 제어를 제공하지만, 구체적인 한계도 문서화하고 있습니다:

  • 편집 또는 확장을 위한 업로드 비디오는 일반적으로 10초 이하여야 합니다.
  • 확장은 시작이나 중간에 장면을 삽입하는 것이 아니라 끝에 이어 붙입니다.
  • 음성 편집은 지원되지 않습니다.
  • 다른 Gemini Omni 인터페이스가 더 넓은 멀티모달 워크플로를 제공할 수 있더라도, 현재 Gemini API는 업로드 오디오 참조를 지원하지 않습니다.
  • 일부 편집 작업에는 식별 가능한 인물 및 지역 제한이 적용됩니다.
  • 업로드 비디오의 편집 또는 확장은 현재 EEA, 스위스, 영국에서 사용할 수 없지만, 모델이 생성한 확장은 여전히 지원될 수 있습니다.
  • 비디오에는 보이지 않는 SynthID 출처 워터마킹이 포함됩니다.
  • 안전 필터는 입력과 출력 모두에 적용됩니다.

“더 유연하다”는 말은 결코 사람을 사칭하거나, 허위 지지를 만들어내거나, 저작권을 무시하거나, 플랫폼 규칙을 우회해도 된다는 뜻으로 해석되어서는 안 됩니다. 권리가 정리된 미디어를 사용하고, 초상 사용 동의를 얻고, 필요한 경우 합성 콘텐츠임을 고지하며, 사람의 승인 단계를 유지하세요.

더 살펴볼 만한 AI 비디오 도구

  • Flyne AI의 Google Veo 3.1은 네이티브 오디오, 향상된 프롬프트 준수, 참조 기반 제어를 갖춘 더 새로운 Veo 세대 워크플로를 원하는 팀에게 더 강한 대안입니다.
  • Flyne AI의 Google Veo 3는 네이티브 사운드를 갖춘 시네마틱 텍스트-투-비디오 및 이미지-투-비디오 실험에 여전히 유용합니다.
  • Flyne AI의 Gemini Omni는 멀티모달 비디오 제작과 자연어 편집 개념을 탐색할 수 있는 브라우저 경로를 제공합니다. 생성 전에 선택된 백엔드 버전과 표시되는 제어 항목을 확인하세요.
  • Best Image AI의 Google Veo 3.1 API는 통합 이미지 및 비디오 API 플랫폼 내에서 텍스트-투-비디오 엔드포인트를 원하는 개발자에게 유용합니다.
  • VideoWeb AI는 브라우저 기반 텍스트-투-비디오, 이미지-투-비디오, UGC, TikTok, 뮤직비디오, 레퍼런스 비디오, 비디오-투-비디오 워크플로를 제공합니다.
  • Hey Dream AI는 모델별 입력과 출력 제어를 갖춘 하나의 작업공간에서 이미지, 비디오, 3D 생성을 결합합니다.

FAQ

Gemini Omni 1.1 Flash는 신규 출시인가요?

네. Google은 2026년 8월 27일 안정 버전 gemini-omni-1.1-flash 모델을 출시했습니다. 이 모델은 유료 Gemini API와 지원되는 Google 제작 인터페이스를 통해 일반적으로 사용할 수 있습니다.

Gemini Omni 1.1 Flash는 기존 비디오를 편집할 수 있나요?

네, 문서화된 한계 내에서 가능합니다. 현재 API는 편집 및 확장을 위해 최대 10초의 비디오 입력을 허용하고, 자연어 변경을 지원하며, 이후 턴을 위해 저장된 상호작용을 유지할 수 있습니다.

Gemini Omni 1.1 Flash의 비용은 얼마인가요?

Google은 현재 입력에 대해 텍스트, 이미지, 비디오, 오디오 토큰 백만 개당 $1.50, 비디오 출력에 대해 토큰 백만 개당 $17.50를 제시하고 있습니다. 문서화된 720p 토큰 비율 기준으로 출력은 대략 초당 $0.10입니다. 제공자 크레딧은 다를 수 있습니다.

Gemini Omni 1.1 Flash가 Google Veo 3보다 더 낫나요?

대화형 편집, 통제된 수정, 장면 확장, 키프레임 보간, 저비용 초안 작성에서는 더 나을 수 있습니다. 반면 Veo 3는 사실적인 움직임과 네이티브 오디오를 갖춘 시네마틱한 첫 결과물을 생성하는 데 더 나은 선택일 수 있습니다.

Gemini Omni는 음성이나 대사를 편집할 수 있나요?

현재 API에서는 음성 편집이 지원되지 않습니다. 멀티턴 확장은 지원되는 경우 음성을 생성할 수 있지만, 업로드된 음성 영상에는 추가 제한이 있습니다. 더빙과 최종 대사 작업은 별도로 계획하세요.

결론

Gemini Omni 1.1 Flash 신규 출시대화를 통해 비디오를 생성하고 편집할 수 있게 하며, 반복적인 프롬프트 작성을 줄이고 시각적 탐색 비용을 낮출 수 있습니다. Google Veo 3에 비해 가장 큰 강점은 보편적인 이미지 품질이 아니라, 편집 대화 전반에 걸쳐 정교화, 확장, 보간, 맥락 유지가 가능하다는 점입니다. 접근성 높은 실험을 위해 Flyne AI의 Gemini Omni를 사용하고, Veo 옵션과 비교해 보며, 생성당 가격이 아니라 승인된 클립당 비용을 기준으로 모델을 판단하세요.

Flyne AI로 창작하는 더 많은 기사

Flyne AI로 창작하기 위한 더욱 많은 기사와 소식을 확인하세요.

Android 및 iOS용 Flyne AI 모바일 애플리케이션

지금 Flyne AI 모바일 애플리케이션을 다운로드하고 Flyne AI의 강력한 도구를 경험하세요—영감을 불러일으키는 창의력으로 단어를 멋진 비주얼로 바꿔보세요!

웹 앱에서 시작하기
flux-ai-app-download

Flyne AI의 고급 이미지 & 동영상 AI 도구

Flyne AI의 강력한 도구로 멋진 이미지와 매력적인 영상을 만들어보세요. 고급 AI 기술로 창의력을 발휘하세요.

Flyne 이미지 AI 도구

Flux AI의 텍스트-이미지 및 이미지-이미지 생성 기술로 즉시 멋진 이미지를 만드세요.

Flyne 동영상 AI 도구

Flux AI의 텍스트-비디오 및 이미지-비디오 기술로 마법 같은 애니메이션 영상을 만드세요.

Android 및 iOS용 Flyne AI 모바일 애플리케이션

지금 Flyne AI 모바일 애플리케이션을 다운로드하고 Flyne AI의 강력한 도구를 경험하세요—영감을 불러일으키는 창의력으로 단어를 멋진 비주얼로 바꿔보세요!

웹 앱에서 시작하기
flux-ai-app-download

지금 바로 Flyne AI로 창작을 시작하세요

지금 무료로 Flyne AI를 체험해보세요.