Kandinsky Video: нейросетевая генерация видео¶
Kandinsky Video — семейство нейросетевых моделей для генерации и редактирования видео по текстовому описанию, разработанное российской компанией «Сбер» на основе архитектуры диффузионных трансформеров. Модель является развитием линейки генеративных моделей Kandinsky, создаваемых в лаборатории Sber AI и партнёрских исследовательских группах, и предназначена для синтеза коротких видеороликов из текстовых подсказок (промптов), а также для анимации статичных изображений.
¶История и развитие
Анонс технологии Kandinsky Video состоялся в сентябре 2023 года в рамках конференции Artificial Intelligence Journey (AIJ). Разработка велась совместно командой Sber AI, исследовательским центром «Сбера» и учёными из ряда российских вузов, включая Высшую школу экономики. Первая публичная версия модели была представлена в ноябре 2023 года и стала доступна широкой аудитории через сервис «Шедеврум» (мобильное приложение «Сбера»), что сделало технологию одной из первых в России, доступных массовому пользователю.
В отличие от зарубежных аналогов, таких как Runway Gen-2 или Pika Labs, Kandinsky Video изначально разрабатывалась с учётом работы с русскоязычными текстовыми запросами. В основе модели лежит гибридная архитектура, объединяющая возможности большой языковой модели для понимания промпта и диффузионного трансформера для генерации видеопоследовательности. В 2024 году вышло обновление Kandinsky Video 1.1, которое повысило стабильность объектов в кадре и улучшило качество проработки деталей.
¶Технические характеристики
Kandinsky Video относится к классу латентных диффузионных моделей (Latent Diffusion Models). Ключевой особенностью является использование трёхэтапного пайплайна генерации. На первом этапе языковая модель преобразует текстовое описание в векторное представление (эмбеддинги). На втором этапе диффузионная модель, работающая в сжатом латентном пространстве, создаёт ключевые кадры будущего ролика. На завершающем этапе специальный интерполятор (модель Temporal Interpolation) достраивает промежуточные кадры для обеспечения плавности движения, после чего видео декодируется в полном разрешении.
Основные параметры первой версии:
- Длительность генерируемого ролика: 4 секунды.
- Частота кадров: от 8 до 30 кадров в секунду (зависит от настроек).
- Разрешение: до 2048×2048 пикселей (с последующим масштабированием).
- Поддержка анимации загруженного изображения (Image-to-Video).
Обучение модели проводилось на суперкомпьютере «Кристофари» (Christofari), одном из мощнейших в России, с использованием датасета, включающего пары «текст-видео», собранные из открытых источников и размеченные с помощью алгоритмов. Точный объём обучающих данных не раскрывался, однако, по заявлениям разработчиков, он включал сотни миллионов текстовых описаний и десятки миллионов видеороликов.
¶Функциональные возможности
¶Генерация по текстовому описанию
Основной режим работы — создание видео из текстового запроса. Модель способна интерпретировать сложные сцены, включающие несколько объектов, действия и стилистику. Например, по запросу «космонавт на лошади в стиле киберпанк» модель генерирует анимированную сцену с соответствующими атрибутами. Поддерживается указание художественного стиля (акварель, пиксель-арт, фотореализм), движения камеры и временных характеристик (день, ночь, закат).
¶Анимация изображений
Kandinsky Video позволяет «оживлять» статичные фотографии или картинки. Пользователь загружает изображение и добавляет текстовое описание желаемого движения (например, «волосы развеваются на ветру»). Модель анализирует глубину сцены и объекты, создавая эффект параллакса или динамических изменений.
¶Редактирование видео
В более поздних версиях и через API появилась возможность частичного редактирования: изменение фона, замена объекта или перекраска элементов с сохранением остальной части видеоряда. Эта функция реализована через механизм маскирования и повторной генерации затронутых областей.
¶Применение и доступность
Технология ориентирована как на массового пользователя, так и на профессиональные задачи. В приложении «Шедеврум» Kandinsky Video встроена в раздел создания контента, позволяя любому желающему сгенерировать ролик для социальных сетей. Для бизнеса и разработчиков «Сбер» предоставляет доступ к модели через облачную платформу и API, что позволяет интегрировать генерацию видео в рекламные продукты, производство контента для маркетплейсов и создание черновых раскадровок в индустрии кино и анимации.
Ключевые сценарии использования включают:
- Создание креативов для таргетированной рекламы;
- Генерацию фоновых видеозаставок для сайтов и презентаций;
- Прототипирование сцен в игровой индустрии;
- Образовательные проекты по визуализации исторических событий.
¶Ограничения и критика
Несмотря на прогресс, Kandinsky Video уступает западным аналогам в детализации движений мелких объектов (рук, мимики) и в стабильности физики движения. При генерации сложных сцен могут возникать артефакты: искажение пропорций, «плывущие» текстуры или неестественная смена освещения. Длительность ролика в 4 секунды является существенным ограничением для использования в полноценном видеопроизводстве, хотя разработчики анонсировали работы по увеличению хронометража.
Критике подвергается и цензура модели: алгоритмы фильтрации запрещают генерацию сцен насилия, политических деятелей и узнаваемых брендов, что сужает творческие возможности. Эксперты также отмечают, что модель обучалась преимущественно на синтетических данных и стоковых видео, что иногда приводит к шаблонности визуальных решений.
¶Перспективы развития
Дальнейшее развитие Kandinsky Video связывают с интеграцией аудиодорожки (генерация звука) и увеличением разрешения до 4K. Планируется внедрение управления движением камеры через числовые параметры (зум, панорамирование) и улучшение работы с длинными сценариями. «Сбер» рассматривает модель как часть экосистемы генеративного ИИ, включающей текстовые модели GigaChat и графические Kandinsky 3.0, что в перспективе позволит создавать полностью автоматизированные видео-сюжеты «из одного промпта».
¶Источники
- Материалы конференции Artificial Intelligence Journey 2023 (доклад о модели Kandinsky Video).
- Официальный блог и пресс-релизы ПАО «Сбер» (2023–2024).
- Технический отчёт команды Sber AI о латентных диффузионных моделях.
- Публикации исследовательского центра «Сбер» о гибридных архитектурах генерации видео.