Открыть сервис

OpenAI Sora

OpenAI Sora — это генеративная модель искусственного интеллекта, разработанная компанией OpenAI (организация, зарегистрированная в США; деятельность, связанная с распространением информации о технологиях компании, может подпадать под регулирование в РФ), способная создавать видеоролики на основе текстовых описаний (промптов). Модель относится к классу диффузионных трансформеров и предназначена для генерации фотореалистичного, анимационного или стилизованного видео продолжительностью до одной минуты, сохраняющего визуальную согласованность, временную динамику и следование заданному сценарию.

История и развитие

Предпосылки создания

Разработка Sora стала продолжением исследований OpenAI в области генеративных моделей, начатых с языковых моделей серии GPT (Generative Pre-trained Transformer) и моделей генерации изображений DALL-E. Ключевой задачей было преодоление ограничений предыдущих систем синтеза видео, которые часто создавали короткие, низкокачественные или артефактные ролики, неспособные моделировать сложные физические взаимодействия и длительные временные последовательности.

Анонс и публичный доступ

Модель была впервые анонсирована компанией OpenAI 15 февраля 2024 года. В момент анонса Sora не была предоставлена для широкого доступа. Доступ к ней получили ограниченные группы тестировщиков (red teamers) для оценки рисков, а также ряд художников, дизайнеров и кинематографистов для изучения творческого потенциала. По состоянию на начало 2025 года, дата публичного запуска продукта для массового пользователя оставалась неопределённой, а сама модель продолжала дорабатываться.

Технологическая основа

Sora основана на архитектуре диффузионного трансформера (Diffusion Transformer, DiT), которая объединяет принципы диффузионных моделей (постепенное удаление шума из данных) с механизмами внимания трансформеров. В отличие от многих предшественников, работающих с пикселями, Sora оперирует пространственно-временными патчами (spacetime patches) — небольшими фрагментами видео, которые позволяют модели обрабатывать данные различного разрешения, длительности и соотношения сторон без привязки к фиксированному размеру кадра.

Архитектура и принцип работы

Пространственно-временные патчи

Ключевое нововведение Sora — представление видео как набора патчей. Модель сжимает исходное видео в низкоразмерное латентное пространство, после чего разбивает его на патчи, аналогично тому, как языковые модели разбивают текст на токены. Это позволяет Sora обучаться на огромных массивах видеоданных разного качества (от низкого разрешения до 4K) и разной длительности, а затем генерировать видео с произвольными параметрами.

Диффузионный процесс

Генерация происходит в два этапа:

  1. Прямой процесс (зашумление): На этапе обучения модель учится добавлять гауссов шум к исходному видео.
  2. Обратный процесс (денойзинг): На этапе генерации модель, начиная с чистого шума, последовательно восстанавливает структуру видео, руководствуясь текстовым промптом. Трансформер обрабатывает последовательность патчей, предсказывая, как убрать шум на каждом шаге, что позволяет создавать согласованную сцену.

Обработка текстовых запросов

Для понимания текстовых описаний Sora использует механизм перекрёстного внимания (cross-attention) с эмбеддингами, полученными от большой языковой модели (предположительно, GPT-4 или её модификации). Это позволяет модели связывать абстрактные понятия (например, «человек, идущий по снегу») с конкретными визуальными паттернами (текстура снега, анимация походки).

Возможности и характеристики

Генерация видео из текста

Основная функция Sora — создание видеоролика по текстовому описанию на естественном языке. Модель способна интерпретировать сложные запросы, включающие:

  • Объекты и их атрибуты: «Пушистый рыжий кот в очках».
  • Действия и движения: «Лыжник спускается с горы, поднимая снежную пыль».
  • Пространственные отношения: «Книга лежит на столе слева от чашки с кофе».
  • Стилистику и атмосферу: «В стиле киберпанк, неон, дождь, отражения в лужах».

Генерация видео из изображения

Sora может принимать статичное изображение в качестве входных данных и «оживлять» его, создавая короткое видео, где объекты на картинке начинают двигаться в соответствии с контекстом сцены. Также поддерживается дорисовка (inpainting) или расширение (outpainting) существующего видео.

Редактирование и анимация

Модель позволяет выполнять операции по редактированию сгенерированного контента, включая:

  • Стилизация: Изменение визуального стиля видео (например, превращение реалистичного видео в анимацию).
  • Замена объектов: Изменение конкретного объекта в сцене при сохранении остального фона.
  • Продление видео: Бесшовное добавление секунд к началу или концу существующего ролика.

Физическая согласованность

Одной из заявленных целей разработки Sora было достижение базового понимания физики трёхмерного мира. Модель демонстрирует способность моделировать:

  • Движение объектов: Правильная траектория, ускорение, инерция.
  • Взаимодействие с окружением: Отбрасывание теней, отражение света, деформация объектов (например, трава, приминаемая ногой).
  • Персистентность объектов: Объекты, выходящие за кадр и возвращающиеся обратно, сохраняют свою идентичность.

Однако, как отмечали разработчики, Sora не является симулятором физического мира и может допускать ошибки, такие как неправильное поведение жидкости, странная анимация конечностей или внезапное исчезновение объектов.

Ограничения и критика

Технические недостатки

Несмотря на прорывные возможности, Sora имеет ряд ограничений, признанных самими разработчиками:

  • Сложные физические взаимодействия: Модель может некорректно моделировать разбивание стекла, текучесть жидкости или сложные деформации тканей.
  • Детализация мелких объектов: Часто возникают проблемы с генерацией мелких деталей, таких как пальцы рук (слипание, неправильное количество), текст на вывесках (нечитаемые символы) или глаза персонажей.
  • Временная согласованность: В длинных роликах (ближе к 60 секундам) могут наблюдаться скачки в анимации, мерцание текстур или изменение формы объектов.
  • Причинно-следственные связи: Sora не всегда понимает логику событий (например, человек может взять яблоко, а затем в следующем кадре оно исчезнет, не будучи съеденным).

Этические и социальные риски

Публичный анонс Sora вызвал широкую дискуссию об этических аспектах генеративного видео:

  • Дезинформация и дипфейки: Возможность создания фотореалистичных видео, изображающих события, которые никогда не происходили, вызывает опасения по поводу использования модели для распространения ложной информации, политической пропаганды или создания компрометирующих материалов.
  • Нарушение авторских прав: Обучение модели на огромных массивах видеоданных, в том числе из интернета, порождает вопросы о правомерности использования контента, защищённого авторским правом, без согласия правообладателей.
  • Влияние на индустрию: Представители творческих профессий (художники, аниматоры, видеографы) выразили обеспокоенность по поводу потенциального сокращения рабочих мест и обесценивания ручного труда.
  • Безопасность контента: Существует риск генерации жестокого, насильственного, порнографического или иного нежелательного контента, что требует внедрения мощных фильтров и модерации.

Позиция регуляторов

В различных странах, в том числе в России, обсуждается необходимость регулирования технологий генеративного ИИ. В Российской Федерации законодательство в сфере информации и информационных технологий требует маркировки контента, созданного с использованием искусственного интеллекта, а также устанавливает ответственность за распространение недостоверной информации. Применение моделей, подобных Sora, для создания дипфейков может подпадать под действие статей о клевете, нарушении неприкосновенности частной жизни или мошенничестве.

Перспективы и влияние

Потенциальные области применения

В случае успешного решения проблем безопасности и качества, Sora и подобные ей модели могут найти применение в:

  • Кинематограф и анимация: Быстрое создание раскадровок, концепт-видео, фоновых планов и спецэффектов.
  • Реклама и маркетинг: Генерация персонализированных видеороликов для A/B-тестирования.
  • Образование: Создание наглядных пособий и симуляций для объяснения сложных процессов.
  • Видеоигры: Процедурная генерация игровых видеороликов и окружений.
  • Архитектура и дизайн: Визуализация проектов в движении.

Конкуренция и развитие

Анонс Sora стимулировал развитие конкурентных решений от других компаний, включая Meta (организация признана экстремистской и запрещена в РФ), Google (модель Lumiere), Runway ML, Pika Labs и китайские компании (например, Kuaishou). Основные направления развития включают улучшение физической симуляции, увеличение длительности и разрешения генерируемого видео, а также создание инструментов для точного контроля над сюжетом и кадрированием.

Источники

  1. OpenAI. "Video generation models as world simulators." Technical report, February 2024.
  2. Brooks, T., Peebles, W., et al. "Video generation models as world simulators." OpenAI Blog, 2024.
  3. Peebles, W., & Xie, S. "Scalable Diffusion Models with Transformers." ICCV 2023.
  4. Публикации в профильных изданиях (The Verge, Wired, MIT Technology Review) за февраль-март 2024 года.
  5. Материалы дискуссий на конференциях NeurIPS и CVPR 2024, посвящённых генеративному ИИ.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →