Открыть сервис

Sora: видео-модель OpenAI

Sora — генеративная нейросетевая модель компании OpenAI, предназначенная для создания реалистичных видеороликов по текстовому описанию (text-to-video). Модель способна генерировать видео высокой степени детализации, включая сложные сцены с несколькими персонажами, специфическими движениями и точной проработкой фона. Помимо текста, Sora также принимает на вход статические изображения, анимируя их, и способна расширять существующие видео во времени.

История разработки

Впервые о существовании Sora было публично объявлено 15 февраля 2024 года. В анонсе компания OpenAI представила несколько демонстрационных роликов, созданных моделью, которые поразили общественность кинематографическим качеством и физической правдоподобностью. Однако в момент анонса Sora находилась в стадии ограниченного тестирования: доступ к ней имели лишь избранные художники, дизайнеры и команда «красной команды» (red team), занимающаяся поиском уязвимостей и вредоносных сценариев использования.

В течение 2024 года модель совершенствовалась. В сентябре 2024 года появилась информация о разработке версии Sora 2.0, которая, по заявлениям, должна была превзойти конкурентов в скорости генерации и качестве изображения. Официальный публичный запуск продукта состоялся 9 декабря 2024 года в рамках мероприятия OpenAI «Shipmas». Вместе с запуском компания представила обновлённую версию — Sora 2.0, которая стала доступна подписчикам платных тарифов ChatGPT Plus и ChatGPT Pro. Для пользователей из России и ряда других стран сервис официально недоступен.

Технические характеристики и архитектура

Точные технические детали архитектуры Sora официально не раскрываются, однако, по данным из открытых источников и научных публикаций OpenAI, модель построена на гибридной архитектуре, объединяющей подходы диффузионных моделей (diffusion models) и трансформеров (transformers).

Ключевые особенности технологии:

  • Обработка видео как последовательности патчей. По аналогии с тем, как языковые модели обрабатывают текст токенами, Sora разбивает визуальные данные (кадры) на пространственно-временные патчи. Это позволяет модели работать с видео произвольного разрешения и длительности, а также с изображениями.
  • Масштабируемость. Архитектура на основе трансформеров демонстрирует хорошую масштабируемость: увеличение объёма обучающих данных и вычислительных мощностей напрямую повышает качество генерации.
  • Обучение на видео с субтитрами. Модель обучалась на огромном массиве видеоданных с текстовыми описаниями, что позволило ей установить прочную связь между визуальными сценами и естественным языком.
  • Глубинное понимание сцены. Благодаря обучению на больших данных Sora демонстрирует зачаточное понимание физики трёхмерного мира, причинно-следственных связей и поведения объектов, хотя и не всегда последовательное.

Функциональные возможности

Sora 2.0, запущенная в декабре 2024 года, предлагает пользователям несколько ключевых функций:

  • Генерация по текстовому промпту. Основной режим — создание видео от 5 до 15 секунд (в зависимости от тарифа) с разрешением до 1080p.
  • Анимация изображений (Image-to-Video). Пользователь может загрузить статичную картинку (например, сгенерированную в DALL-E 3), и Sora «оживит» её, добавив движение.
  • Редактирование видео (Video-to-Video). Модель может принимать существующий видеоролик и модифицировать его: менять стиль, окружение, добавлять или удалять объекты, а также продлевать видео во времени (Outpainting и Inpainting).
  • Режиссёрский режим (Storyboard). В веб-интерфейсе Sora.com доступен инструмент «Storyboard», позволяющий разбивать сцену на отдельные кадры с текстовыми подписями и управлять временной шкалой, что даёт пользователю более тонкий контроль над повествованием, чем одиночный промпт.
  • Функция «Blend». Позволяет объединять два разных видео в одно, создавая плавные переходы и комбинируя сюжеты.

Интерфейс и доступность

Доступ к Sora осуществляется через веб-платформу Sora.com. Интерфейс включает в себя ленту с работами других пользователей, что превращает сервис в социальную сеть для обмена генеративным контентом. Пользователи могут публиковать свои творения, ставить лайки и подписываться на авторов.

Тарифные планы на момент запуска:

  • ChatGPT Plus (около 20 долларов США в месяц): предоставляет до 50 генераций видео с разрешением до 720p и длительностью до 5 секунд.
  • ChatGPT Pro (200 долларов США в месяц): предоставляет значительно больше генераций (до 500), доступ к разрешению 1080p, длительности до 15 секунд и возможность скачивания видео без водяного знака.

Ограничения и критика

Несмотря на впечатляющие возможности, Sora имеет ряд существенных ограничений, признаваемых самой OpenAI:

  • Проблемы с физикой. Модель часто допускает ошибки в моделировании физических законов: например, стакан может не разбиться при падении, а человек — пройти сквозь стол. Отсутствие последовательной симуляции физики является главным недостатком.
  • Непостоянство объектов. Объекты могут менять форму или цвет в течение видео, а персонажи — внезапно исчезать или появляться.
  • Сложность с точными движениями. Модель испытывает трудности с корректной симуляцией движений рук, ног и мелкой моторики, что приводит к визуальным артефактам.
  • Отсутствие звука. Sora генерирует только немое видео. Генерация звуковой дорожки не поддерживается.
  • Высокая стоимость вычислений. Генерация видео является чрезвычайно ресурсоёмкой задачей, что ограничивает скорость работы и увеличивает стоимость подписки.
  • Этические риски. Существует опасение, что технология может быть использована для создания дипфейков и дезинформации. Для борьбы с этим OpenAI внедрила водяные знаки (C2PA) и метаданные в генерируемые файлы, а также фильтры безопасности, блокирующие создание контента с публичными личностями и насилием.

Конкуренты

Sora — не единственная модель в категории text-to-video. На рынке существуют сильные конкуренты, включая:

  • Runway Gen-3 Alpha — модель от компании Runway, ориентированная на профессиональных кинематографистов.
  • Luma Dream Machine — сервис, предлагающий высокое качество генерации и редактирования.
  • Kling AI — модель китайской компании Kuaishou, отличающаяся хорошей физической симуляцией.
  • Veo 3 — модель от Google DeepMind, интегрированная в экосистему YouTube Shorts.

Каждая из этих моделей имеет свои сильные и слабые стороны, и конкуренция в данной области крайне высока.

Влияние на индустрию

Появление Sora вызвало широкий резонанс в креативных индустриях. Технология открывает новые возможности для кинематографа, рекламы, видеоигр и дизайна, позволяя быстро создавать прототипы сцен и визуальные эффекты без дорогостоящих съёмок. Одновременно это порождает опасения по поводу сокращения рабочих мест для художников, операторов и монтажёров. Юридические аспекты, связанные с авторскими правами на обучающие данные и генерируемый контент, также остаются предметом активных дискуссий.

Загружаем BFOmetr…