Google 影片生成模型 Gemini Omni 1.1 Flash,指定首尾影格並延伸40秒
Google推出生成式影片模型Gemini Omni 1.1 Flash,新增影片延伸、首尾影格控制、360p快速草稿與最高4K解析度輸出等功能,並已透過Gemini API提供。開發者可從既有影片繼續生成後續畫面,也能指定影片開頭與結尾的影格,再由模型產生中間的連續畫面。
新版主要改善長影片製作能力,Gemini Omni 1.1 Flash延伸影片時,可參考前面最多10秒的內容,每次向後生成10秒,累計影片長度最高40秒。先前版本只能參考影片最後1秒,Google表示,增加可參考的前段內容後,有助於維持人物、場景與故事前後一致。
首尾影格控制則讓使用者指定影片開始與結束的兩個畫面,模型會自動生成兩者之間的連續影像。製作者可以藉此控制鏡頭從哪裡開始、最後停在哪裡,用於製作鏡頭移動、畫面轉場或可重複播放的短片,比單純用文字描述影片內容多一層畫面控制。
Gemini Omni 1.1 Flash也新增360p低解析度草稿,Google表示,相較720p影片,360p生成速度最高可快60%,成本約為三分之一,適合先快速測試不同版本,確認內容後再製作較高解析度影片。模型可將影片輸出成1080p或4K,也就是透過後續處理提高解析度,而非直接以4K解析度生成。
新版另外可使用最長3秒的影片作為參考素材,模型會依照參考影片中的動作與畫面內容生成新影片,例如提供人物圖片與舞蹈影片後,可要求圖片中的角色模仿參考影片的動作,讓開發者在生成影片時更容易維持人物與動作的一致性。
Gemini Omni 1.1 Flash目前已透過Gemini API提供,並可在Google AI Studio使用,Google也在Flow向Google AI Plus、Pro與Ultra訂閱用戶提供新版模型,Gemini應用程式則加入影片場景延伸功能。