Открыть сервисСервис

Kandinsky Video: нейросетевая генерация видео

Kandinsky Video — семейство нейросетевых моделей для генерации и редактирования видео по текстовому описанию, разработанное российской компанией «Сбер» на основе архитектуры диффузионных трансформеров. Модель является развитием линейки генеративных моделей Kandinsky, создаваемых в лаборатории Sber AI и партнёрских исследовательских группах, и предназначена для синтеза коротких видеороликов из текстовых подсказок (промптов), а также для анимации статичных изображений.

История и развитие

Анонс технологии Kandinsky Video состоялся в сентябре 2023 года в рамках конференции Artificial Intelligence Journey (AIJ). Разработка велась совместно командой Sber AI, исследовательским центром «Сбера» и учёными из ряда российских вузов, включая Высшую школу экономики. Первая публичная версия модели была представлена в ноябре 2023 года и стала доступна широкой аудитории через сервис «Шедеврум» (мобильное приложение «Сбера»), что сделало технологию одной из первых в России, доступных массовому пользователю.

В отличие от зарубежных аналогов, таких как Runway Gen-2 или Pika Labs, Kandinsky Video изначально разрабатывалась с учётом работы с русскоязычными текстовыми запросами. В основе модели лежит гибридная архитектура, объединяющая возможности большой языковой модели для понимания промпта и диффузионного трансформера для генерации видеопоследовательности. В 2024 году вышло обновление Kandinsky Video 1.1, которое повысило стабильность объектов в кадре и улучшило качество проработки деталей.

Технические характеристики

Kandinsky Video относится к классу латентных диффузионных моделей (Latent Diffusion Models). Ключевой особенностью является использование трёхэтапного пайплайна генерации. На первом этапе языковая модель преобразует текстовое описание в векторное представление (эмбеддинги). На втором этапе диффузионная модель, работающая в сжатом латентном пространстве, создаёт ключевые кадры будущего ролика. На завершающем этапе специальный интерполятор (модель Temporal Interpolation) достраивает промежуточные кадры для обеспечения плавности движения, после чего видео декодируется в полном разрешении.

Основные параметры первой версии:

  • Длительность генерируемого ролика: 4 секунды.
  • Частота кадров: от 8 до 30 кадров в секунду (зависит от настроек).
  • Разрешение: до 2048×2048 пикселей (с последующим масштабированием).
  • Поддержка анимации загруженного изображения (Image-to-Video).

Обучение модели проводилось на суперкомпьютере «Кристофари» (Christofari), одном из мощнейших в России, с использованием датасета, включающего пары «текст-видео», собранные из открытых источников и размеченные с помощью алгоритмов. Точный объём обучающих данных не раскрывался, однако, по заявлениям разработчиков, он включал сотни миллионов текстовых описаний и десятки миллионов видеороликов.

Функциональные возможности

Генерация по текстовому описанию

Основной режим работы — создание видео из текстового запроса. Модель способна интерпретировать сложные сцены, включающие несколько объектов, действия и стилистику. Например, по запросу «космонавт на лошади в стиле киберпанк» модель генерирует анимированную сцену с соответствующими атрибутами. Поддерживается указание художественного стиля (акварель, пиксель-арт, фотореализм), движения камеры и временных характеристик (день, ночь, закат).

Анимация изображений

Kandinsky Video позволяет «оживлять» статичные фотографии или картинки. Пользователь загружает изображение и добавляет текстовое описание желаемого движения (например, «волосы развеваются на ветру»). Модель анализирует глубину сцены и объекты, создавая эффект параллакса или динамических изменений.

Редактирование видео

В более поздних версиях и через API появилась возможность частичного редактирования: изменение фона, замена объекта или перекраска элементов с сохранением остальной части видеоряда. Эта функция реализована через механизм маскирования и повторной генерации затронутых областей.

Применение и доступность

Технология ориентирована как на массового пользователя, так и на профессиональные задачи. В приложении «Шедеврум» Kandinsky Video встроена в раздел создания контента, позволяя любому желающему сгенерировать ролик для социальных сетей. Для бизнеса и разработчиков «Сбер» предоставляет доступ к модели через облачную платформу и API, что позволяет интегрировать генерацию видео в рекламные продукты, производство контента для маркетплейсов и создание черновых раскадровок в индустрии кино и анимации.

Ключевые сценарии использования включают:

  • Создание креативов для таргетированной рекламы;
  • Генерацию фоновых видеозаставок для сайтов и презентаций;
  • Прототипирование сцен в игровой индустрии;
  • Образовательные проекты по визуализации исторических событий.

Ограничения и критика

Несмотря на прогресс, Kandinsky Video уступает западным аналогам в детализации движений мелких объектов (рук, мимики) и в стабильности физики движения. При генерации сложных сцен могут возникать артефакты: искажение пропорций, «плывущие» текстуры или неестественная смена освещения. Длительность ролика в 4 секунды является существенным ограничением для использования в полноценном видеопроизводстве, хотя разработчики анонсировали работы по увеличению хронометража.

Критике подвергается и цензура модели: алгоритмы фильтрации запрещают генерацию сцен насилия, политических деятелей и узнаваемых брендов, что сужает творческие возможности. Эксперты также отмечают, что модель обучалась преимущественно на синтетических данных и стоковых видео, что иногда приводит к шаблонности визуальных решений.

Перспективы развития

Дальнейшее развитие Kandinsky Video связывают с интеграцией аудиодорожки (генерация звука) и увеличением разрешения до 4K. Планируется внедрение управления движением камеры через числовые параметры (зум, панорамирование) и улучшение работы с длинными сценариями. «Сбер» рассматривает модель как часть экосистемы генеративного ИИ, включающей текстовые модели GigaChat и графические Kandinsky 3.0, что в перспективе позволит создавать полностью автоматизированные видео-сюжеты «из одного промпта».

Источники

  • Материалы конференции Artificial Intelligence Journey 2023 (доклад о модели Kandinsky Video).
  • Официальный блог и пресс-релизы ПАО «Сбер» (2023–2024).
  • Технический отчёт команды Sber AI о латентных диффузионных моделях.
  • Публикации исследовательского центра «Сбер» о гибридных архитектурах генерации видео.
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru