Google представи новото семейство генеративни AI модели Gemini Omni, предназначено за създаване на съдържание от всякакъв вид входни данни. Първият продукт от тази серия се нарича Gemini Omni Flash – той е способен да генерира видеоклипове въз основа на текст, снимки, аудио или други видеозаписи. Алгоритъмът съчетава мултимодални възможности с дълбоко разбиране на законите на физиката и реалния свят.

Ключовата разлика между Gemini Omni Flash и съществуващия модел Veo, както пише Google в своя блог, е функцията за преобразуване на едно видео в друго. Алгоритъмът не просто генерира визуална поредица, но и позволява редактиране на изходните кадри с помощта на естествен език в диалогов формат, запазвайки логиката на сцената и последователността на действията на героите при всякa нова заявка. Както отбелязва старшия директорът по изследванията в Google DeepMind Думитру Ерхан, в момента системата може да създава клипове със звук с продължителност до 10 секунди, но компанията вече работи по увеличаването на този лимит.

Заявка: Генерирай скулптура от мехурчета

AI моделът се основава на обширната база от знания на екосистемата Gemini, което му позволява да създава сцени, отчитащи историческия и научния контекст, както и да възпроизвежда точно гравитацията или динамиката на течностите. Техническият директор на Google DeepMind и главен архитект по изкуствен интелект в Google Корай Кавукчуоглу подчерта, че новата технология разполага с много по-голяма информация за устройството на света, отколкото предишните разработки. Потребителите също така ще получат възможност да генерират свой собствен цифров аватар и да му придадат своя глас. Ръководителката на екипа разработчици на продукта Никол Брихтова посочи, че подобна функция за интегриране на собствения външен вид е била изключително търсена в миналогодишния модел за генериране на изображения Nano Banana, с помощта на който са създадени над 50 милиарда изображения.

Заявка: Динамично видео в стила на научнофантастичен филм, базирано на image_0.png. Елементите да светят по подобие на video_0.mp4, синхронизирани с ритъма на музиката от audio_0.wav

От съображения за сигурност корпорацията засега ограничава алгоритъма във възможността да променя чужда реч във видеоклипове, а всички генерирани клипове автоматично се маркират с невидим цифров воден знак SynthID за проверка на автентичността на съдържанието. В бъдеще разработчиците планират да добавят поддръжка за извеждане на аудио и статични изображения. Gemini Omni Flash вече е достъпен в световен мащаб за абонатите на плановете Google AI Plus, Pro и Ultra чрез приложението Gemini и услугата Google Flow.

От тази седмица безплатен достъп до генератора се отваря и за потребителите в приложенията YouTube Shorts и YouTube Create App.