Открыть сервис

Генеративные модели искусственного интеллекта

Генеративная модель искусственного интеллекта — это тип алгоритма машинного обучения, предназначенный для создания нового контента (текста, изображений, аудио, видео, программного кода и т.д.), который статистически или семантически схож с данными, на которых модель была обучена. В отличие от дискриминативных моделей, которые классифицируют или размечают существующие данные, генеративные модели изучают распределение вероятностей обучающего набора и способны порождать новые, ранее не существовавшие примеры, принадлежащие тому же распределению.

Основные принципы работы

Генеративные модели решают задачу моделирования распределения вероятностей \( P(X) \) для данных \( X \) (безусловная генерация) или \( P(Y|X) \) для условной генерации (например, создание изображения по текстовому описанию). В основе большинства современных архитектур лежат нейронные сети, обучаемые на больших объёмах данных (Big Data) с использованием методов обратного распространения ошибки и градиентного спуска.

Ключевым этапом является обучение: модель настраивает свои внутренние параметры (веса) так, чтобы минимизировать разницу между распределением реальных данных и распределением, которое она генерирует. Для оценки этого различия используются различные функции потерь, такие как дивергенция Кульбака — Лейблера (KL-дивергенция) или состязательная потеря (adversarial loss).

История развития

Ранние этапы (1950-е — 2000-е)

Первые попытки создания генеративных моделей относятся к середине XX века. В 1950-х годах Клод Шеннон предложил использовать цепь Маркова для генерации текста, моделируя последовательности букв на основе их вероятностей. В 1970-1980-х годах получили распространение скрытые марковские модели (HMM) для генерации речи и анализа последовательностей. В 1990-х годах появились вариационные автокодировщики (VAE) — один из первых подходов, использующих нейронные сети для генерации данных.

Эпоха глубокого обучения (2010-е)

Переломным моментом стало развитие глубоких нейронных сетей. В 2013 году Diederik Kingma и Max Welling представили вариационный автокодировщик (VAE), который стал основой для многих последующих моделей. В 2014 году Ян Гудфеллоу и его коллеги предложили генеративно-состязательные сети (GAN), где две нейросети — генератор и дискриминатор — соревнуются друг с другом, что привело к значительному улучшению качества генерируемых изображений.

Современный этап (2020-е — настоящее время)

С 2017 года, после публикации статьи «Attention Is All You Need» (Vaswani et al.), доминирующей архитектурой стала трансформерная нейросеть. На её основе были созданы большие языковые модели (LLM), такие как GPT (OpenAI), LLaMA (Meta — организация признана экстремистской и запрещена в РФ), YandexGPT (Yandex) и GigaChat (Сбер). Параллельно развивались диффузионные модели (DDPM, 2020), которые вытеснили GAN в задачах синтеза изображений (DALL-E, Stable Diffusion, Midjourney). В 2023-2024 годах появились мультимодальные модели, способные одновременно генерировать и понимать текст, изображения, аудио и видео (например, GPT-4o, Gemini).

Классификация генеративных моделей

По архитектуре

  1. Вариационные автокодировщики (VAE) — состоят из энкодера (сжимает входные данные в скрытое представление) и декодера (восстанавливает данные из скрытого представления). Обучаются с регуляризацией, чтобы скрытое пространство было непрерывным и гладким. Позволяют генерировать новые данные, интерполируя между точками в скрытом пространстве. Примеры: VAE, β-VAE, VQ-VAE.
  1. Генеративно-состязательные сети (GAN) — состоят из двух нейросетей: генератора (создаёт поддельные данные) и дискриминатора (пытается отличить подделку от реальных данных). Обучение происходит в процессе состязания: генератор учится всё лучше обманывать дискриминатор, а дискриминатор — лучше распознавать подделки. Примеры: DCGAN, StyleGAN, CycleGAN (для переноса стиля).
  1. Авторегрессионные модели — генерируют данные последовательно, элемент за элементом, предсказывая следующий элемент на основе предыдущих. Широко используются в обработке естественного языка (NLP). Примеры: GPT (все версии), LLaMA, Transformer XL.
  1. Диффузионные модели (DDPM) — обучаются обращать процесс постепенного зашумления данных. На этапе генерации модель берёт случайный шум и последовательно удаляет его, восстанавливая структурированное изображение или аудио. Обеспечивают высокое качество и разнообразие результатов. Примеры: Stable Diffusion, DALL-E 2, Imagen, Sora (OpenAI).
  1. Модели на основе потока (Normalizing Flows) — используют последовательность обратимых преобразований для преобразования простого распределения (например, нормального) в сложное распределение данных. Точны в вычислении правдоподобия, но менее масштабируемы.

По типу генерируемого контента

  • Текстовые модели (LLM): GPT-4, LLaMA, YandexGPT, GigaChat.
  • Изобразительные модели: Stable Diffusion, Midjourney, Kandinsky (Сбер).
  • Аудиомодели: Jukebox (OpenAI), MusicGen (Meta), WaveNet (DeepMind).
  • Видеомодели: Sora (OpenAI), Make-A-Video (Meta), VideoPoet (Google).
  • Мультимодальные модели: GPT-4o, Gemini (Google), Claude (Anthropic).

Применение

В науке и исследованиях

  • Молекулярный дизайн: генерация новых химических соединений с заданными свойствами (например, AlphaFold, RFdiffusion).
  • Синтез белков: создание новых ферментов и антител.
  • Медицинская визуализация: улучшение качества МРТ/КТ-снимков, генерация синтетических данных для обучения моделей.

В промышленности и бизнесе

  • Автоматизация контента: написание статей, рекламных текстов, сценариев, кода (GitHub Copilot, Codex).
  • Дизайн и архитектура: генерация эскизов, 3D-моделей, интерьеров.
  • Разработка игр: создание текстур, персонажей, диалогов, игровых уровней.
  • Маркетинг: персонализированная генерация изображений, видео и аудиорекламы.

В творчестве

  • Цифровое искусство: создание иллюстраций, анимации, фотографий.
  • Музыка: сочинение мелодий, аранжировок, голосов.
  • Литература: написание стихов, рассказов, сценариев.

Критика и ограничения

Этические проблемы

  • Глубокие подделки (deepfakes): генерация реалистичных видео и аудио с участием реальных людей без их согласия, что может использоваться для дезинформации, шантажа и мошенничества.
  • Нарушение авторских прав: модели часто обучаются на данных, защищённых авторским правом, без разрешения правообладателей. В 2023-2024 годах в США и Европе подано несколько коллективных исков против компаний-разработчиков (OpenAI, Stability AI, Meta — организация признана экстремистской и запрещена в РФ).
  • Усиление предвзятости (bias): модели могут воспроизводить и усиливать социальные стереотипы, содержащиеся в обучающих данных (расовые, гендерные, политические).

Технические ограничения

  • Галлюцинации (hallucinations): генерация правдоподобных, но фактически неверных сведений (особенно характерно для языковых моделей).
  • Вычислительные затраты: обучение больших моделей требует огромных ресурсов (электроэнергия, GPU-часы), что приводит к значительному углеродному следу.
  • Сложность контроля: точное управление выходными данными (например, стилем, содержанием) остаётся нетривиальной задачей.

Правовое регулирование в России

В Российской Федерации генеративные модели ИИ не регулируются отдельным законом, но подпадают под общие нормы об информации, авторском праве и персональных данных. В 2023 году был принят Федеральный закон № 258-ФЗ «Об экспериментальных правовых режимах в сфере цифровых инноваций», который позволяет тестировать технологии ИИ в особых условиях. Разработчики обязаны маркировать контент, созданный с помощью ИИ, если он может быть воспринят как реальный (например, deepfakes). В 2024 году Роскомнадзор начал разработку требований к идентификации синтетического контента.

Интересные факты

  • Первая генеративная модель, способная создавать реалистичные изображения лиц (StyleGAN, 2019), использовалась для создания сайта «This Person Does Not Exist» (этот человек не существует).
  • Языковая модель GPT-3 (2020) содержала 175 миллиардов параметров; её обучение обошлось в несколько миллионов долларов.
  • В 2023 году модель Stable Diffusion была использована для генерации более 100 миллионов изображений в день по всему миру.
  • В России в 2024 году была запущена нейросеть Kandinsky 3.0 (Сбер), способная генерировать изображения и видео по текстовому описанию на русском языке.

Источники

  1. Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. «Generative Adversarial Nets». NIPS, 2014.
  2. Kingma, D. P., Welling, M. «Auto-Encoding Variational Bayes». ICLR, 2014.
  3. Vaswani, A., et al. «Attention Is All You Need». NIPS, 2017.
  4. Ho, J., Jain, A., Abbeel, P. «Denoising Diffusion Probabilistic Models». NeurIPS, 2020.
  5. Brown, T., et al. «Language Models are Few-Shot Learners». NeurIPS, 2020.
  6. Федеральный закон «Об экспериментальных правовых режимах в сфере цифровых инноваций» от 31.07.2023 № 258-ФЗ.
  7. Доклад «Искусственный интеллект в России: состояние и перспективы» (Аналитический центр при Правительстве РФ, 2024).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →