Открыть сервис

Immersity AI: технология и применение

Immersity AI — это технология искусственного интеллекта, предназначенная для преобразования двухмерных изображений и видео в трёхмерный контент с эффектом глубины и параллакса. Разработанная австралийской компанией Levi's (подразделение Immersity), технология позволяет создавать пространственные фотографии и видео, пригодные для просмотра на устройствах виртуальной реальности (VR), в социальных сетях и на платформах с поддержкой 3D-форматов. Основное назначение Immersity AI — автоматизация трудоёмкого процесса стереоскопической конвертации, который ранее требовал ручной работы специалистов по 3D-графике.

История и разработка

Технология Immersity AI является результатом развития алгоритмов глубинного обучения и компьютерного зрения. Компания Immersity, основанная в 2015 году в Сиднее, изначально специализировалась на создании программного обеспечения для обработки пространственного контента. В 2023 году Immersity была приобретена корпорацией Levi's, которая интегрировала технологию в свою экосистему цифровых продуктов. После слияния технология получила публичное название Immersity AI и стала доступна широкому кругу пользователей через веб-платформу и мобильные приложения.

Ключевым этапом развития стало внедрение нейросетевых моделей, обученных на больших наборах стереоскопических данных. Это позволило значительно повысить точность оценки глубины сцены и уменьшить количество артефактов, возникающих при конвертации.

Принцип работы

В основе Immersity AI лежит комбинация нескольких методов машинного обучения:

  • Оценка глубины (depth estimation)нейросеть анализирует исходное 2D-изображение и для каждого пикселя определяет расстояние до объекта съёмки. Для этого используются свёрточные нейронные сети (CNN) и трансформерные архитектуры, обученные на размеченных наборах данных.
  • Создание карты несоответствий (disparity map) — на основе карты глубины алгоритм генерирует смещение пикселей для левого и правого глаза, имитируя естественное бинокулярное зрение человека.
  • Постобработка и заполнение пробелов (inpainting) — при смещении пикселей возникают области, невидимые на исходном кадре. Для их заполнения используются генеративные модели, которые дорисовывают недостающие фрагменты фона, сохраняя целостность изображения.

Пользователь загружает обычное фото или видео, после чего система автоматически создаёт 3D-версию. Доступны параметры регулировки силы эффекта глубины, а также выбор формата выходного файла: анаглиф, стереопара, видео с параллаксом для социальных сетей или полноценный VR-формат.

Классификация и форматы вывода

Immersity AI поддерживает несколько типов входных данных и форматов выходного контента:

  • По типу исходных данных: одиночные фотографии (JPG, PNG), серии снимков, видеофайлы (MP4, MOV).
  • По типу 3D-эффекта: статическая глубина (фото с эффектом параллакса), динамический параллакс (видео с изменением точки обзора), стереоскопическое видео для VR-шлемов.
  • По целевому применению: публикации в социальных сетях (например, для платформ, поддерживающих 3D-фотографии), создание контента для маркетплейсов, предварительный просмотр сцен для разработчиков игр и приложений дополненной реальности (AR).

Применение

Технология Immersity AI нашла применение в ряде областей:

  • Социальные медиа и развлечения. Пользователи создают объёмные фотографии для публикации в сетях, поддерживающих 3D-форматы. Эффект глубины повышает вовлечённость аудитории за счёт нестандартной подачи контента.
  • Электронная коммерция. Интернет-магазины используют 3D-изображения товаров для улучшения визуального восприятия. Покупатель может рассмотреть товар под разными углами, что снижает количество возвратов из-за несоответствия ожиданиям.
  • Образование и музеи. Оцифровка экспонатов и исторических фотографий с эффектом объёма позволяет создавать интерактивные экспозиции, доступные удалённо.
  • Кинопроизводство и видеоигры. Технология применяется на этапе pre-visualization для быстрой конвертации концепт-артов в объёмные сцены, а также для создания стереоскопических версий существующих фильмов.
  • Недвижимость и туризм. Виртуальные туры по объектам недвижимости и достопримечательностям становятся более реалистичными благодаря эффекту глубины.

Преимущества и ограничения

К сильным сторонам Immersity AI относятся автоматизация сложного процесса конвертации, доступность для непрофессиональных пользователей и высокая скорость обработки. Технология позволяет получить приемлемый результат для большинства типов сцен без ручной настройки.

Ограничения связаны с качеством исходного материала. Сложные сцены с тонкими объектами (волосы, листва, прозрачные поверхности) могут содержать артефакты. Резкие перепады глубины и движущиеся объекты в видео иногда приводят к искажениям. Кроме того, технология не воссоздаёт истинную геометрию объектов, а лишь имитирует эффект объёма, что может быть недостаточным для задач профессиональной 3D-графики.

Критика и вопросы авторского права

Использование генеративных алгоритмов для заполнения пробелов вызывает вопросы о соответствии созданного контента исходному изображению. В ряде случаев дорисованные фрагменты могут содержать фактические ошибки. Также обсуждается проблема авторских прав: преобразование чужих изображений в 3D-формат и их последующее распространение может нарушать права правообладателей. Разработчики Immersity AI в пользовательском соглашении указывают на ответственность пользователя за наличие прав на загружаемый контент.

Источники

  • Официальная документация и блог компании Immersity.
  • Публикации в профильных изданиях о технологиях компьютерного зрения и 3D-конвертации.
  • Материалы конференций по искусственному интеллекту, освещающие методы оценки глубины и генеративного заполнения изображений.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →