Открыть сервис

DeepFaceLab: технология синтеза лиц

DeepFaceLab — это программное обеспечение с открытым исходным кодом для создания дипфейков, то есть синтеза и подмены человеческих лиц на видео и изображениях с использованием технологий глубокого обучения. Инструмент предназначен для работы на персональных компьютерах с видеокартами NVIDIA и позволяет пользователю создавать высокореалистичные поддельные видеоролики без необходимости написания программного кода.

История и происхождение

Проект DeepFaceLab ведёт свою историю с 2018 года, когда он был опубликован на форуме Reddit пользователем под псевдонимом «deepfakes». Именно этот пользователь стал родоначальником термина «дипфейк» (от англ. deep learning — глубокое обучение и fake — подделка). Первоначально код существовал в виде набора скриптов, но впоследствии был оформлен в полноценный программный продукт.

Активное развитие проекта началось в 2019 году, когда была выпущена версия, получившая широкую известность в сообществе энтузиастов. В отличие от многих конкурентов, DeepFaceLab остаётся бесплатным и открытым проектом, хотя его разработка ведётся в основном силами небольшой группы волонтёров. Основной репозиторий кода размещён на платформе GitHub, где проект имеет тысячи звёзд и форков.

Технические основы

Архитектура нейросетей

В основе DeepFaceLab лежат свёрточные нейронные сети и генеративно-состязательные сети (GAN). Процесс создания дипфейка включает два основных этапа: обучение модели и синтез изображения. На этапе обучения сеть изучает особенности лица «донора» (человека, чьё лицо будет перенесено) и «цели» (человека, на чьё лицо будет наложено изображение). Модель учится воспроизводить мимику, повороты головы и освещение, характерные для целевого лица, используя черты донора.

Этапы работы

Программа разделена на несколько последовательных стадий, каждая из которых запускается отдельным скриптом:

  1. Извлечение кадров — видеоролик разбивается на отдельные изображения.
  2. Детекция лиц — на каждом кадре программа находит и вырезает область лица.
  3. Извлечение признаков — производится анализ ключевых точек лица (глаза, нос, рот, контуры).
  4. Обучение моделинейросеть тренируется на парах изображений лиц донора и цели.
  5. Конвертация — обученная модель применяется к исходному видео для замены лица.
  6. Сборка видео — обработанные кадры склеиваются в итоговый файл.

Аппаратные требования

Для комфортной работы DeepFaceLab требует наличия видеокарты NVIDIA с поддержкой технологии CUDA и объёмом видеопамяти не менее 4 гигабайт. Время обучения модели может варьироваться от нескольких часов до нескольких недель в зависимости от сложности задачи, качества исходного материала и производительности графического ускорителя. Использование центрального процессора для обучения возможно, но крайне неэффективно.

Версии и модификации

Проект существует в двух основных ветках: оригинальная версия DeepFaceLab и ответвление DeepFaceLab Mega, которое отличается оптимизированным кодом и более широким набором настроек. Разработчики регулярно выпускают обновления, добавляя новые архитектуры нейросетей, например SAEHD (Supervised AutoEncoder High Definition) и AMP (Advanced Model Pretraining), которые позволяют добиваться более высокого разрешения и реалистичности результата.

Применение

Развлекательная сфера

Наиболее массовое применение DeepFaceLab нашёл в создании развлекательного контента. С его помощью создаются пародийные видеоролики, в которых лица актёров заменяются на лица других знаменитостей или обычных пользователей. Также технология используется в моддинге видеоигр для замены моделей лиц персонажей и в любительском кино для изменения внешности актёров.

Образовательные и исследовательские цели

Технология используется исследователями в области компьютерного зрения для изучения методов синтеза изображений и разработки алгоритмов детекции подделок. Учебные заведения используют DeepFaceLab для демонстрации возможностей генеративно-состязательных сетей студентам, изучающим машинное обучение.

Коммерческое использование

Отдельные студии и фрилансеры применяют инструмент для постпродакшна в киноиндустрии, например, для замены лиц дублёров на лица актёров или для «омоложения» персонажей. Однако коммерческое использование ограничено этическими соображениями и законодательством.

Риски и этические проблемы

Злоупотребление технологией

Основной проблемой DeepFaceLab является его использование для создания порнографических материалов без согласия изображённых лиц, а также для фабрикации компрометирующих видео. Такие действия нарушают законодательство многих стран и права личности. В России распространение подобных материалов может быть квалифицировано как нарушение неприкосновенности частной жизни или клевета.

Дезинформация

Дипфейки, созданные с помощью DeepFaceLab, представляют угрозу для информационной безопасности, так как могут использоваться для распространения ложных заявлений от имени политиков и публичных личностей. Это привело к разработке методов цифровой криминалистики, направленных на автоматическое обнаружение синтезированных видео.

Правовое регулирование

В ряде стран приняты законы, ужесточающие ответственность за создание и распространение дипфейков. В России в 2021 году были внесены поправки в законодательство, предусматривающие ответственность за использование синтезированных изображений для распространения фейковой информации. Однако полного запрета на технологию как таковую не существует.

Альтернативы и конкуренты

На рынке существуют аналогичные коммерческие и открытые продукты, такие как FaceSwap, Roop и Reface. Коммерческие сервисы, как правило, предлагают более простое использование через мобильные приложения, но имеют ограничения по качеству и разрешению. DeepFaceLab сохраняет популярность благодаря бесплатности, гибкости настроек и наилучшему на данный момент качеству результата при условии достаточной мощности оборудования.

Критика и ограничения

Несмотря на высокую реалистичность результатов, технология имеет ряд ограничений. Качество дипфейка сильно зависит от качества исходных материалов: углы съёмки, освещение и разрешение видео должны быть сопоставимы. При сильных поворотах головы, изменении ракурса или перекрытии лица посторонними предметами возникают артефакты и искажения. Также модель может испытывать трудности с передачей мелкой мимики и эмоций, что приводит к эффекту «стеклянных глаз» или «пластикового лица».

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →