Gemini Omni 1.1 Flash 全新發佈:透過對話編輯影片

Google DeepMind Labs 全新發佈的 Gemini Omni 1.1 Flash。Gemini Omni 1.1 Flash 將 AI 影片創作從一次性的提示,轉變為持續進行的創意對話。

Gemini Omni 1.1 Flash 全新發佈:透過對話編輯影片
日期: 2026-08-30

Gemini Omni 1.1 Flash 全新發布將 AI 影片創作從一次性提示,轉變為持續進行的創意對話。Google 於 2026 年 8 月 27 日發布此模型,它可以從文字與圖片生成影片、編輯上傳或已生成的片段、延長場景、在首尾影格之間進行插值,並在多輪互動中持續精修結果。對想要透過對話編輯影片的創作者來說,這可能比一再從零重建 Google Veo 3 提示更有用。

Gemini Omni 1.1 Flash conversational video editing

Gemini Omni 1.1 Flash 並不會自動成為每一個鏡頭的最佳模型。Google Veo 3 仍然是在電影感文字轉影片或圖片轉影片生成方面的強力選項,具備逼真的動作與原生音訊。當團隊需要細緻修訂、迭代間的一致性、低成本草稿,或可編輯的互動歷史時,Omni 會更適合。

Gemini Omni 1.1 Flash 這次發布有什麼新內容?

Google 將 gemini-omni-1.1-flash描述為其快速、對話式影片生成與編輯模型的正式可用版本。這個穩定版支援文字、圖片與影片輸入,產出含音訊的影片,並使用 Gemini Interactions API 在多輪互動之間保留創作脈絡。

最重要的新增功能是實際製作層面的控制能力:

  • 對話式生成與編輯: 透過自然語言指令持續精修已儲存的影片互動。
  • 首尾影格控制: 定義鏡頭如何開始,以及最終應該落在哪個畫面。
  • 場景延長: 在使用最近片段作為上下文的情況下,每次新增 10 秒續段,總長可達 40 秒。
  • 360p 草稿模式: 以最高快 60% 的速度、標準 720p 輸出的三分之一成本來原型化構圖。
  • 高解析收尾: 將支援的輸出生成或升級至 1080p 或 4K。
  • 時間節奏指引: 以自然語言的時間描述或簡單時間碼來說明動作。

Google 目前的模型頁面列出單次輸出長度為 3–10 秒、24 FPS,並可選 360p、720p、1080p 與 4K。延長功能可以拼接出更長的序列,但這並不代表系統已成為毫無限制的長篇剪輯器。

Gemini Omni 1.1 Flash 如何讓你透過對話編輯影片

對話式編輯最適合拆成一連串小而可驗證的決策。第一次請求先建立或上傳基礎場景。之後的回合會參照前一次互動,因此創作者可以針對單一目標變更提出要求,而不必重新敘述整個專案。

實際對話可能會像這樣:

  1. 建立基礎鏡頭:「在溫暖公寓中拍攝緩慢手持產品展示,自然窗光、真實房間環境音。」
  2. 修正單一元素:「保留相機運動與主持人不變。只將桌子替換成淺色橡木。」
  3. 微調氛圍:「減少橘色偏色,讓日光更柔和。保留膚色與產品顏色。」
  4. 延長場景:「再延續十秒。主持人將產品放到包裝旁邊並微笑;房間環境音持續。」
  5. 以更高解析完成: 將已核准的草稿升級,而不是讓每一次前期嘗試都付出最終品質的成本。

它的優勢不在於自然語言能取代所有專業剪輯。精準剪接、字體排版、色彩管理、音訊混音、字幕以及法務審核,仍然適合在時間軸編輯器中完成。Gemini Omni 1.1 Flash 減少的是從粗略想法到可供審閱的視覺草稿之間的工作量。

Gemini Omni 1.1 Flash vs Google Veo 3

Gemini Omni 1.1 Flash vs Google Veo 3 comparison

當比較標準改為價格、細節、編輯深度、輸入彈性與交付目標,而不是單一的「品質」分數時,差異會更清楚。

決策因素Gemini Omni 1.1 FlashGoogle Veo 3實用建議
主要工作流程透過已儲存的對話來生成、編輯、混搭、插值、延長與精修從文字或圖片生成具電影感且帶原生聲音的影片需要反覆編輯選 Omni;想先拿到強力初始生成鏡頭則選 Veo 3
目前公開 API 價格依 Google Standard 定價,720p 影片約每秒 $0.10;輸入 token 另行計費Flyne AI 採用自有的點數型供應商工作流程,實際成本取決於可選版本與帳號Omni 目前提供較清楚的公開開發者價格;正式製作前請再次確認 Flyne 點數
低成本原型化360p 草稿成本是 720p 的三分之一,生成速度最高可快 60%連結中的 Flyne 工作流程強調最終電影感生成,而非有明確文件說明的對話式草稿層級Omni 可降低淘汰早期構圖的成本
細節與完成度對話式修正、首尾影格、時間提示、可讀文字指引,以及 1080p/4K 輸出選項擅長電影感構圖、逼真物理、動作、環境氛圍、特效與對白當細節需要反覆修訂時 Omni 更好;若首要是第一次生成就有電影感,Veo 3 依然很強
一致性支援多輪儲存上下文,以及最長 40 秒延長偏生成導向流程;新提示可能需要更多重述需求對於持續演變的場景,Omni 更方便
輸入彈性目前 API 支援文字、圖片與短影片輸入;更廣泛的多模態能力取決於介面與模式在連結的 Flyne 頁面上支援文字或圖片生成Omni 提供更完整的編輯互動模型
限制用於編輯/延長的上傳影片通常限制在 10 秒;不支援語音編輯;只能從尾端延長;並有區域與可辨識人物限制仍受供應商、模型、安全、時長與帳號限制影響兩者都不是無限制模型;Omni 在創作上更靈活,但並非監管更少

因此,當「更好」的意思是經過多次可控修訂後更貼近需求時,Gemini Omni 1.1 Flash 可能產出更好的結果。若是針對依賴物理表現、鏡頭運動與原生聲音的電影感場景,Veo 3 仍可能給出更好的初稿。真正公平的測試,應比較每個核准片段的成本,而不只是每次生成的價格。

價格:為什麼對話式打草稿能降低製作成本

直接的 API 價格只是製作成本的一部分。Google 目前的 Gemini API 定價顯示,Omni 的 Standard 720p 輸出約為每秒 $0.10。更重要的是,360p 草稿層級的成本大約只有 720p 的三分之一。團隊可以先以低成本測試取景、動作順序、主體位置與場景節奏,再決定是否做高解析收尾。

對話式編輯也能減少浪費。如果產品、演員與鏡頭路徑本身已經可用,那麼有針對性的指令可能能保留更多已核准片段,而不必整段重生。實際省下多少,仍取決於模型是否正確執行所要求的修改,以及最終片段是否通過審核。

對 Flyne AI 使用者來說,在生成前請立即比較 Gemini OmniGoogle Veo 3Google Veo 3.1 顯示的點數需求。供應商點數、所選模式、促銷與可用性,可能會獨立於 Google 的 API 列表價格而變動。

細節與控制:Gemini Omni 在哪裡能更精準

當指令同時描述「要改什麼」與「哪些不能變」時,Gemini Omni 1.1 Flash 的精準度最高。「讓它更有電影感」這種說法很廣泛;「保留演員、鏡頭路徑、房間配置、產品顏色與音訊不變;只把日光改成較冷的陰天質感」則給了模型更清楚的編輯邊界。

首尾影格控制能改善有計畫的轉場。產品鏡頭可以從微距材質開始,最後落在核准過的主視覺構圖。短篇戲劇則能從不確定感推進到辨識與領悟,而不至於讓最後一格失控。時間提示還可以指定角色何時進場、何時切換鏡頭,或音樂何時變化。

此模型也支援強調微細節、表情、自然節奏、背景真實感以及畫面中可讀文字的提示。這些是有用的方向,不是保證。人工審閱者仍應檢查臉部、手部、標籤、Logo、反射、連戲、音訊,以及所有事實性陳述。

影片創作與編輯使用情境

Gemini Omni 1.1 Flash video editing workflow

UGC 與社群廣告

先從創作者風格的產品片段開始,再要求更乾淨的背景、更溫暖的燈光、不同的產品擺位,或更短的視覺鉤子,同時保留主持人與攝影機行為。最後的字幕、宣稱、價格與行動呼籲,仍應放在傳統剪輯器中完成,以便驗證文字正確性。

產品與電商影片

透過數次小幅修改來精修 packshot、材質特寫、桌面示範或開箱場景。當品牌團隊需要比較不同環境或打光處理,但又不想放棄已核准的鏡頭運動時,對話式工作流程特別有用。

短片與敘事連戲

延長場景、引入參考角色、改變氛圍,或在保留最近動作與音訊作為上下文的情況下引導下一個動作。請以短節拍方式工作:每一輪只處理一次進場、反應、揭露或轉場。

分鏡與前期預演

把草圖或參考影格轉成動態概念,然後透過對話修正構圖與節奏。導演可以在投入製作資源前,先測試環繞運鏡、推軌、剪接、燈光轉換或最終構圖。

教育與訓練內容

先生成示範影片,再修正展示物件、鏡頭角度、環境或動作順序。由於 AI 生成的教學畫面可能包含錯誤,領域專家應逐步驗證每個步驟、標示與安全指示。

行銷活動在地化與格式變體

在保留核心產品場景的前提下,為不同市場、季節或平台開發不同的視覺版本。API 目前不支援語音編輯,因此配音與最終語言音訊應分開處理。任何生成的可見文字,在發布前都必須審查。

音樂與表演片段的場景延長

可延長已生成的片段,並保持動作與音訊一致,或要求切到有相同角色的下一個場景。上傳含有既有語音的片段會有額外限制,因此在預設可以用對話方式延長對白前,應先規劃好對話內容。

一種更好的對話式影片編輯提示模式

使用五段式編輯請求:

  1. 目標: 明確指出到底要改什麼。
  2. 不變項: 列出必須保持穩定的人物、物件、動作、構圖與聲音。
  3. 替換內容: 描述新的物件、光線、環境、動作或結尾。
  4. 時間: 說明變化何時發生,以及發展速度。
  5. 審查規則: 指出生成後需要檢查的常見失敗點。

範例:

編輯上一支影片。保留主持人的身份、手部動作、產品形狀、標籤顏色、鏡頭路徑、房間配置與既有環境音不變。只將背景窗外景色替換為下雨的夜晚城市。轉換在兩秒後開始,並於六秒前逐漸完成。保留真實反射,不要加入文字、Logo 或額外物件。

每一輪只改變一個有意義的變數。這樣更容易辨識到底是哪一條指令改善了結果,或損害了結果。

建立工作流程前的重要限制

Gemini Omni 目前的 API 文件讓創作者擁有更大的控制力,但同時也列出了明確限制:

  • 用於編輯或延長的上傳影片通常必須為 10 秒或以下;
  • 延長是接在尾端,而不是插入到開頭或中間;
  • 不支援語音編輯;
  • 目前 Gemini API 不支援上傳音訊參考,即使其他 Gemini Omni 介面可能提供更廣泛的多模態工作流程;
  • 某些編輯操作受到可辨識人物與地區限制;
  • 目前在 EEA、瑞士與英國,無法編輯或延長上傳影片,但模型生成的延長功能仍可能受支援;
  • 影片包含不可見的 SynthID 來源水印;
  • 安全過濾器會同時套用於輸入與輸出。

「更靈活」絕不應被理解為可以冒充他人、製造虛假背書、忽視版權,或繞過平台規則。請使用已取得權利的媒體素材、取得肖像同意、在需要時揭露合成內容,並保留人工核准流程。

更多值得探索的 AI 影片工具

  • Flyne AI 上的 Google Veo 3.1 是更強的替代方案,適合希望使用較新 Veo 世代工作流程、原生音訊、更佳提示遵循能力與參考引導控制的團隊。
  • Flyne AI 上的 Google Veo 3 仍適合用於具電影感的文字轉影片與圖片轉影片實驗,並支援原生聲音。
  • Flyne AI 上的 Gemini Omni 提供瀏覽器路徑來探索多模態影片創作與自然語言編輯概念。生成前請確認所選後端版本與可見控制項。
  • Best Image AI 上的 Google Veo 3.1 API 適合希望在統一的圖片與影片 API 平台內使用文字轉影片端點的開發者。
  • VideoWeb AI 提供瀏覽器式文字轉影片、圖片轉影片、UGC、TikTok、音樂影片、參考影片與影片轉影片工作流程。
  • Hey Dream AI 將圖片、影片與 3D 生成整合在同一工作區,並提供模型專屬輸入與輸出控制。

FAQ

Gemini Omni 1.1 Flash 是新發布的嗎?

是。Google 於 2026 年 8 月 27 日發布穩定版 gemini-omni-1.1-flash 模型。它已透過付費 Gemini API 與 Google 支援的創作介面正式提供。

Gemini Omni 1.1 Flash 可以編輯現有影片嗎?

可以,但需在文件列出的限制範圍內。現行 API 接受最長 10 秒的影片輸入用於編輯與延長,支援自然語言修改,並可保留已儲存的互動供後續回合使用。

Gemini Omni 1.1 Flash 的價格是多少?

Google 目前列出的輸入費率為每百萬文字、圖片、影片或音訊 token 收費 $1.50,影片輸出為每百萬 token 收費 $17.50。按文件記載的 720p token 速率換算,輸出約為每秒 $0.10。不同供應商的點數計價可能不同。

Gemini Omni 1.1 Flash 比 Google Veo 3 更好嗎?

在對話式編輯、可控修訂、場景延長、關鍵影格插值與低成本打草稿方面,它可能更好。若是要生成具逼真動作與原生音訊的電影感初稿,Veo 3 仍可能是更佳選擇。

Gemini Omni 可以編輯聲音或對白嗎?

目前 API 不支援語音編輯。多輪延長在支援情況下可以生成語音,但上傳的含口語片段有額外限制。配音與最終對白工作應另行規劃。

結論

Gemini Omni 1.1 Flash 全新發布讓人可以透過對話建立並編輯影片,從而減少重複下提示的需求,並降低視覺探索的成本。它相對於 Google Veo 3 最強的優勢,不是普遍性的畫質更好,而是在編輯對話中精修、延長、插值並保留上下文的能力。可使用 Flyne AI 上的 Gemini Omni 進行更易上手的實驗,並與 Veo 系列選項比較,最終以每個核准片段的成本來評估這些模型。

Flyne AI 安卓及 iOS 手機應用程式

立即下載 Flyne AI 手機 APP,體驗 Flyne AI 強大的工具組——激發你的創意靈感,將文字化為驚艷視覺作品!

立即體驗網頁版
flux-ai-app-download

Flyne AI 先進圖片與影片 AI 工具

運用 Flyne AI 強大工具打造絢麗圖片和吸睛影片。發揮您的創造力,盡情享受我們先進的 AI 科技。

Flyne 圖片 AI 工具

結合 Flux AI 強大文字生成圖及圖轉圖技術,立即生成驚豔圖片。

Flyne 影片 AI 工具

運用 Flux AI 文字轉影片、圖片轉影片技術創造神奇動畫影片。

Flyne AI 安卓及 iOS 手機應用程式

立即下載 Flyne AI 手機 APP,體驗 Flyne AI 強大的工具組——激發你的創意靈感,將文字化為驚艷視覺作品!

立即體驗網頁版
flux-ai-app-download

立即用 Flyne AI 創作

現在就免費體驗 Flyne AI。