Сгенерированные изображения¶
Сгенерированные изображения (англ. generated photos) — фотографии, созданные с помощью алгоритмов искусственного интеллекта, а не съёмкой реальных объектов и людей. В отличие от обычной фотографии, сгенерированное изображение не фиксирует событие в реальном мире: оно синтезируется нейросетью на основе обучающих данных и текстового описания (промпта). К настоящему времени технология достигла качества, при котором сгенерированные кадры визуально неотличимы от реальных фотографий, что порождает как практическое применение, так и этические и правовые вопросы.
¶История развития
Первые попытки синтеза изображений с помощью компьютеров относятся к 1960-м годам, но качество результатов было далёким от фотографического. Существенный прорыв произошёл в 2014 году с публикацией архитектуры GAN (Generative Adversarial Networks) Яна Гудфеллоу и коллег: две нейросети — генератор и дискриминатор — соревновались друг с другом, что позволило получать всё более реалистичные изображения.
В 2020-х годах технология перешла в стадию массового применения:
- 2021 — появление StyleGAN3 от NVIDIA, улучшившее качество генерации лиц и устранившее артефакты предыдущих версий.
- 2022 — выход диффузионных моделей (Stable Diffusion, DALL-E 2, Midjourney), работавших по принципу «шум — изображение» и позволивших создавать картинки по текстовому описанию.
- 2023–2024 — появление моделей, обученных на миллиардах пар «текст — изображение» (DALL-E 3, Stable Diffusion XL, Flux), а также инструментов для анимации и редактирования сгенерированных кадров.
¶Технологии генерации
¶Основные архитектуры
| Тип модели | Принцип работы | Особенности |
|---|---|---|
| GAN | Соревнование генератора и дискриминатора | Высокое качество лиц, сложность обучения |
| Диффузионные модели | Последовательное удаление шума из случайного изображения | Текстовое управление, массовое распространение |
| VAE | Сжатие изображения в латентное пространство и обратное восстановление | Часто используются как компонент диффузионных моделей |
| Нейроадаптация (NeRF) | Реконструкция 3D-сцены по фотографиям | Генерация новых ракурсов реальных объектов |
¶Генерация лиц
Отдельную нишу занимает синтез портретов несуществующих людей. Сайт This Person Does Not Exist, запущенный в 2019 году компанией NVIDIA, демонстрировал случайно сгенерированные лица с помощью StyleGAN. В России подобные сервисы используются для тестирования систем биометрической идентификации и в образовательных целях.
¶Применение
- Реклама и маркетинг — создание визуального контента без съёмочной группы, фотостудии и моделей.
- Иллюстрации и медиа — обложки, новостные иллюстрации, обучающие материалы.
- Кинематограф и игры — генерация текстур, персонажей, концепт-артов.
- Медицина — синтез редких клинических случаев для обучения врачей, дополнение баз данных изображений.
- Наука — создание синтетических наборов данных для обучения моделей компьютерного зрения, когда реальных данных недостаточно.
- Личное использование — аватары, альтернативные портреты, художественные эксперименты.
¶Правовые и этические вопросы
¶Авторское право
Правовой статус сгенерированных изображений в разных странах различается. В США Управление по патентам и товарным знакам (USPTO) неоднократно указывало, что произведение, созданное без участия человека, не может быть защищено авторским правом. В России вопрос остаётся дискуссионным: действующий Закон «Об авторском праве» не содержит прямого регулирования для полностью машинной генерации.
¶Мошенничество и дезинформация
Сгенерированные изображения используются для создания фейковых новостей, подделки документов и порнографии без согласия изображённых лиц. В ряде стран приняты законы, прямо запрещающие публикацию синтетических интимных изображений (например, закон штата Калифорния 2024 года).
¶Маркировка
Крупнейшие технологические компании внедряют стандарт C2PA (Coalition for Content Provenance and Authenticity), встраивающий в файлы метаданные о происхождении изображения. В России в 2023 году вступили в силу поправки в законодательство, обязывающие интернет-площадки маркировать сгенерированный контент.
¶См. также
- Искусственный интеллект
- Диффузионная модель
- Генеративно-состязательная сеть
- Дипфейк
- Синтетические данные
¶Источники
- Goodfellow I. et al. Generative Adversarial Networks // Advances in Neural Information Processing Systems, 2014.
- Rombach R. et al. High-Resolution Image Synthesis with Latent Diffusion Models // CVPR, 2022.
- Karras T. et al. Analyzing and Improving the Image Quality of StyleGAN // CVPR, 2020.
- Материалы NVIDIA Research (StyleGAN, This Person Does Not Exist).
- Публикации USPTO о статусе произведений искусственного интеллекта.
