Сбер обновил ИИ-модель Kandinsky 6.0: нейросеть научилась генерировать видео со звуком — и в Full HD
Пользователи могут создавать ролики с речью, музыкой и звуками окружения без навыков монтажа, а разработчики — бесплатно интегрировать модель в свои продукты
Пользователи ГигаЧата получили возможность создавать видео с синхронным звуком с помощью новой модели Сбера Kandinsky 6.0 Video, сообщили Russian Business в пресс-службе компании. Нейросеть генерирует ролики с речью, музыкой и звуками окружения. Для создания видео достаточно описать сцену текстом или загрузить первый кадр и указать, какой звук должен сопровождать ролик.

ИИ-модель подбирает звуковой ряд под происходящее в кадре
Kandinsky 6.0 Video одновременно обрабатывает визуальную и звуковую составляющие ролика. Благодаря этому речь синхронизируется с движением губ, а звуки и музыка соответствуют происходящему в кадре. При необходимости пользователь может попросить модель создать видео без звука.
Нейросеть умеет генерировать разные типы аудио — от диалогов и музыкального сопровождения до звуков шагов, ветра и проезжающего автомобиля. Звук создаётся с частотой 44 кГц, которая используется большинством стриминговых сервисов.
Максимальная продолжительность видео со звуком — пять секунд
Модель также научилась точнее передавать физику реального мира: движения людей, животных и техники стали естественнее, в том числе в динамичных сценах.
Максимальная продолжительность видео со звуком составляет пять секунд. В будущем компания планирует увеличить этот показатель.
Разработчики смогут бесплатно интегрировать модель в свои продукты
Kandinsky 6.0 Video доступна разработчикам в открытом виде под лицензией MIT. Модель можно интегрировать в собственные продукты бесплатно.
По словам старшего вице-президента Сбербанка, руководителя блока «Развитие генеративного ИИ» Антона Фролова, компания рассчитывает сделать генеративный ИИ инструментом для создания контента не только для профессионалов, но и для обычных пользователей.
«Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство», — заявил Антон Фролов.
Пользователи ГигаЧата смогут выбирать качество видео
В ГигаЧате доступны три варианта качества генерации:
- SD — для более быстрой генерации;
- HD — для более детализированного изображения;
- Full HD — для максимальной детализации ролика.
По данным Сбера, Kandinsky 6.0 Video Pro точнее предыдущей модели следует заданному сценарию и лучше передаёт движение камеры. Новая версия превосходит Kandinsky 5.0 в среднем в 71% случаев по совокупности критериев.
Модель обучали на более чем 20 млн видео со звуком
Kandinsky 6.0 Video состоит из двух связанных модулей — для генерации видео и звука. Звуковой модуль обучали на более чем 20 млн видео со звуком.
Для обучения отбирали ролики с чистой аудиодорожкой, а также видео с крупными планами говорящих людей, чтобы улучшить синхронизацию речи и мимики.
