К содержанию
НовостьВидео3 мин

Сбер выпустил Kandinsky 6.0 Video: ролики сразу с речью, музыкой и шумами

Модель генерирует видео вместе с синхронным звуком. В ГигаЧате она бесплатна, а веса открыты под лицензией MIT.

Редакция Стек AI·

6 октября Сбер представил Kandinsky 6.0 Video — модель, которая создаёт ролик и звуковую дорожку к нему за один проход. В звук входят речь, музыка и шумы окружения, синхронизированные с тем, что происходит в кадре.

Как это работает

Сцену можно описать текстом или загрузить первый кадр и добавить описание звука. Длительность ролика со звуком пока ограничена пятью секундами — по словам разработчиков, из-за вычислительной стоимости. Увеличить её обещают позже.

Семейство состоит из двух моделей: облегчённой Lite на 3 млрд параметров и Pro — около 30 млрд. Отдельная модель повышает разрешение готового ролика до Full HD.

Где попробовать

  • ГигаЧат — бесплатно, без настройки.
  • Hugging Face — код и веса под лицензией MIT, разрешено коммерческое использование.
  • Интеграции заявлены для Diffusers, ComfyUI, FAL, FastVideo, SGLang и vLLM-omni.

Для локального запуска есть режим на видеокартах с 16 ГБ памяти.

Что это значит для вас

Это первый российский генератор видео со встроенным звуком, и он доступен без зарубежной карты. Пять секунд — мало для полноценного ролика, но достаточно для заставки, перехода или короткого рилса. Если звук не нужен, его можно отключить и озвучить ролик отдельно.

Источники

  1. 1Lenta.ru — Сбер о выходе Kandinsky 6.0 Video
  2. 23DNews — Kandinsky 6.0 Video с синхронным звуком
  3. 3Хабр — новость о релизе
Подробнее в проекте
HiggsVids ↗
Higgsfield AI: гайды, промпты и движения камеры.