Google выпустила Gemini Omni 1.1 Flash: больше контроля над генерацией видео

· Искусственный интеллект
Google представила обновление своей модели генеративного видео Gemini Omni 1.1 Flash. Разработчики получили расширение сцен, задание опорных кадров и вывод в 4K.

cover.svg

Google объявила о выходе Gemini Omni 1.1 Flash — обновлённой версии модели генеративного видео, ориентированной на разработчиков. По словам компании, релиз готов к промышленному использованию и доступен через Gemini API в Google AI Studio, а также на платформе Gemini Enterprise Agent Platform.

Что нового

Главный акцент сделан на управляемости. Функция расширения сцены (scene extension) позволяет продолжать существующее видео с того момента, где оно оборвалось. По утверждению Google, модель теперь анализирует до 10 секунд предыдущего контекста — против одной секунды у прежних версий, что улучшает визуальную связность и следование сюжету. Продлевать ролик можно шагами по 10 секунд, вплоть до суммарной длины в 40 секунд.

Появилась возможность задавать первый и последний кадры: модель генерирует непрерывное видео между двумя ключевыми кадрами. Это удобно для сложных облётов камеры, наездов и бесшовно зацикленных клипов. Также можно передавать до трёх секунд видео в качестве референса, чтобы сохранить визуальный контекст и постоянство персонажей.

Дешевле черновики, полированный результат

Для быстрого прототипирования предлагаются облегчённые превью в разрешении 360p — по данным Google, они генерируются до 60% быстрее и втрое дешевле, чем стандартные 720p. Финальный материал можно масштабировать до 1080p или 4K.

Google иллюстрирует возможности примерами промптов и сценариев: приложение, которое проводит камеру по комнатам дома «в идеальное время суток, не добавляя несуществующей мебели»; «черновая комната» (Draft Room), где можно сгенерировать три-четыре варианта в 360p, меняя по одному параметру за раз, и сравнить их бок о бок.

Партнёры

Компания приводит отзывы клиентов, уже использующих модель. Adobe встроила Gemini Omni Flash в Firefly, модель доступна в Figma Weave и в Runway. Представитель GMI Cloud отдельно отмечает точность модели — по его словам, для образовательного и объясняющего контента надёжность важнее любой отдельной функции.

Omni 1.1 разворачивается по экосистеме Google: помимо AI Studio и Agent Platform, модель доступна подписчикам Google AI Plus, Pro и Ultra в сервисе Google Flow, а расширение сцен — в приложении Gemini.


Источник: Hacker News

Комментарии

Войдите, чтобы комментировать.

  • Пока нет комментариев.