Сбер обновил ИИ-модель Kandinsky 6.0: нейросеть научилась генерировать видео со звуком — и в Full HD

Пользователи могут создавать ролики с речью, музыкой и звуками окружения без навыков монтажа, а разработчики — бесплатно интегрировать модель в свои продукты
06 октября 2026, 13:23
Время прочтения 3 минуты
Девушка сидит на полу у кровати с телефоном в руках

Пользователи ГигаЧата получили возможность создавать видео с синхронным звуком с помощью новой модели Сбера Kandinsky 6.0 Video, сообщили Russian Business в пресс-службе компании. Нейросеть генерирует ролики с речью, музыкой и звуками окружения. Для создания видео достаточно описать сцену текстом или загрузить первый кадр и указать, какой звук должен сопровождать ролик.

Alice AI от Яндекса вошла в число главных мировых релизов недели: российскую ИИ-модель заметили эксперты Google
Alice AI от Яндекса вошла в число главных мировых релизов недели: российскую ИИ-модель заметили эксперты Google
Модель Яндекса обучили с нуля и открыли по лицензии Apache 2.0 — разработчики уже адаптируют её для локального запуска на устройствах Apple
Подробнее

ИИ-модель подбирает звуковой ряд под происходящее в кадре

Kandinsky 6.0 Video одновременно обрабатывает визуальную и звуковую составляющие ролика. Благодаря этому речь синхронизируется с движением губ, а звуки и музыка соответствуют происходящему в кадре. При необходимости пользователь может попросить модель создать видео без звука.

Нейросеть умеет генерировать разные типы аудио — от диалогов и музыкального сопровождения до звуков шагов, ветра и проезжающего автомобиля. Звук создаётся с частотой 44 кГц, которая используется большинством стриминговых сервисов.

Максимальная продолжительность видео со звуком — пять секунд

Модель также научилась точнее передавать физику реального мира: движения людей, животных и техники стали естественнее, в том числе в динамичных сценах.

Максимальная продолжительность видео со звуком составляет пять секунд. В будущем компания планирует увеличить этот показатель.

Разработчики смогут бесплатно интегрировать модель в свои продукты

Kandinsky 6.0 Video доступна разработчикам в открытом виде под лицензией MIT. Модель можно интегрировать в собственные продукты бесплатно.

По словам старшего вице-президента Сбербанка, руководителя блока «Развитие генеративного ИИ» Антона Фролова, компания рассчитывает сделать генеративный ИИ инструментом для создания контента не только для профессионалов, но и для обычных пользователей.

«Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство», — заявил Антон Фролов.

Пользователи ГигаЧата смогут выбирать качество видео

В ГигаЧате доступны три варианта качества генерации:

  • SD — для более быстрой генерации;
  • HD — для более детализированного изображения;
  • Full HD — для максимальной детализации ролика.

По данным Сбера, Kandinsky 6.0 Video Pro точнее предыдущей модели следует заданному сценарию и лучше передаёт движение камеры. Новая версия превосходит Kandinsky 5.0 в среднем в 71% случаев по совокупности критериев.

Модель обучали на более чем 20 млн видео со звуком

Kandinsky 6.0 Video состоит из двух связанных модулей — для генерации видео и звука. Звуковой модуль обучали на более чем 20 млн видео со звуком.

Для обучения отбирали ролики с чистой аудиодорожкой, а также видео с крупными планами говорящих людей, чтобы улучшить синхронизацию речи и мимики.

Яндекс представил ИИ-модель рекомендаций Sona — она сама формирует подборки контента для пользователей
Яндекс представил ИИ-модель рекомендаций Sona — она сама формирует подборки контента для пользователей
В ходе тестирования пользователи стали слушать треки из рекомендаций на 6,3% дольше
Подробнее
Подписаться на телеграм-канал