Открыть сервис

Генеративные нейросети

Генеративные нейросети — это класс искусственных нейронных сетей, способных создавать новый контент (изображения, текст, аудио, видео, программный код, трёхмерные модели) на основе обучающих данных. В отличие от дискриминативных моделей, которые классифицируют или предсказывают метки, генеративные модели моделируют распределение вероятностей исходных данных и генерируют новые образцы, статистически подобные обучающей выборке. Ключевая особенность — способность к творческому синтезу, а не просто к распознаванию или регрессии.

История развития

Ранние этапы (1980-е — 2000-е)

Первые подходы к генеративному моделированию появились в 1980-х годах с развитием байесовских сетей и скрытых марковских моделей. В 1990-е годы стали применяться ограниченные машины Больцмана (RBM) и вариационные автокодировщики (VAE), предложенные в 2013 году Дидериком Кингмой и Максом Веллингом. Однако качество генерируемого контента оставалось низким из-за ограниченной вычислительной мощности и объёмов данных.

Прорыв с GAN (2014)

В 2014 году Ян Гудфеллоу и его коллеги из Университета Монреаля предложили генеративно-состязательные сети (GAN). Эта архитектура состоит из двух нейросетей: генератора, создающего поддельные образцы, и дискриминатора, пытающегося отличить их от реальных. Состязательный процесс обучения позволил получать изображения высокого качества. В 2015 году появилась архитектура DCGAN (Deep Convolutional GAN), стабилизировавшая обучение.

Развитие трансформеров (2017–2020)

В 2017 году исследователи Google представили архитектуру трансформер, изначально разработанную для машинного перевода. В 2018 году OpenAI выпустила GPT-1 — первую генеративную языковую модель на основе трансформеров. В 2020 году GPT-3 (175 миллиардов параметров) продемонстрировала способность генерировать связные тексты, писать код и выполнять логические задачи без дополнительного обучения (few-shot learning).

Диффузионные модели (2020-е)

В 2020 году была предложена архитектура диффузионных моделей (DDPM — Denoising Diffusion Probabilistic Models), которые постепенно зашумляют изображение, а затем учатся восстанавливать его. В 2022 году компания Stability AI выпустила Stable Diffusion — открытую модель для генерации изображений по текстовому описанию. В 2023–2024 годах появились мультимодальные модели (например, GPT-4, DALL-E 3, Sora от OpenAI), способные генерировать изображения, видео и аудио.

Классификация генеративных нейросетей

По типу генерируемого контента

  • Текстовые модели: GPT (OpenAI), LLaMA (Meta — организация признана экстремистской и запрещена в РФ), YandexGPT (Россия). Генерируют статьи, диалоги, код, стихи.
  • Графические модели: Stable Diffusion, Midjourney, DALL-E, Kandinsky (Сбер, Россия). Создают изображения по текстовым запросам.
  • Аудиомодели: Jukebox (OpenAI), MusicGen (Meta — организация признана экстремистской и запрещена в РФ), Voicebox (Meta — организация признана экстремистской и запрещена в РФ). Генерируют музыку, звуки и речь.
  • Видеомодели: Sora (OpenAI), VideoPoet (Google), CogVideo (Tsinghua University). Создают короткие видеоролики по тексту или изображению.
  • Кодовые модели: GitHub Copilot (Microsoft), Codex (OpenAI), Tabnine. Генерируют программный код по описанию задачи.

По архитектуре

  • Генеративно-состязательные сети (GAN): состоят из генератора и дискриминатора. Используются для генерации изображений, но сложны в обучении (нестабильность, коллапс мод).
  • Вариационные автокодировщики (VAE): обучаются сжимать данные в скрытое пространство и восстанавливать их. Дают более гладкие распределения, но менее резкие изображения.
  • Диффузионные модели: постепенно добавляют шум к данным, а затем учатся его удалять. Обеспечивают высокое качество и разнообразие, но требуют много итераций для генерации.
  • Трансформеры: используют механизм внимания. Доминируют в текстовой генерации (GPT, LLaMA, Gemini) и активно применяются в мультимодальных моделях.
  • Авторегрессионные модели: генерируют контент последовательно (токен за токеном). Например, GPT-4 генерирует текст по одному слову.

Устройство и принцип работы

Основные компоненты

  • Скрытое пространство (latent space): многомерное векторное представление, в котором модель кодирует семантические признаки данных. Изменение вектора в скрытом пространстве приводит к контролируемым изменениям в выходном контенте.
  • Энкодер и декодер: в VAE и диффузионных моделях энкодер сжимает входные данные в скрытое представление, а декодер восстанавливает их. В трансформерах энкодер обрабатывает входную последовательность, а декодер генерирует выходную.
  • Механизм внимания (attention): позволяет модели учитывать взаимосвязи между всеми элементами последовательности, что критически важно для длинных текстов и изображений.

Процесс обучения

  1. Сбор данных: большие наборы текстов (Common Crawl, Wikipedia), изображений (LAION-5B, ImageNet), аудио (AudioSet) и видео.
  2. Предобработка: токенизация текста, нормализация изображений, аугментация данных.
  3. Обучение: минимизация функции потерь (например, кросс-энтропия для текста, L2-расстояние для изображений). Для GAN — состязательная игра между генератором и дискриминатором.
  4. Тонкая настройка (fine-tuning): дообучение на специализированных датасетах (например, медицинских текстах, фотографиях животных) для улучшения качества в конкретной области.

Параметры и вычислительные затраты

Современные генеративные модели содержат от нескольких миллиардов до сотен миллиардов параметров. Обучение GPT-4 оценивается в десятки миллионов долларов США и требует тысяч графических процессоров (GPU) в течение нескольких месяцев. Например, для обучения Stable Diffusion использовалось 256 GPU NVIDIA A100 в течение 150 000 часов.

Применение

Создание контента

  • Графический дизайн: генерация иллюстраций, логотипов, концепт-артов. Используется в рекламе, кинопроизводстве, видеоиграх.
  • Музыка и звук: создание фоновой музыки, звуковых эффектов, синтез речи (например, голосовые ассистенты).
  • Текст: написание статей, сценариев, рекламных текстов, переводов, юридических документов.

Научные исследования

  • Биоинформатика: генерация новых белковых структур (AlphaFold, RFdiffusion), молекул для лекарств (MoleculeGAN).
  • Материаловедение: предсказание свойств новых материалов, генерация кристаллических решёток.
  • Астрономия: восстановление изображений с телескопов, генерация симуляций космических объектов.

Образование и обучение

  • Персонализированные учебные материалы: генерация задач, тестов, объяснений под уровень ученика.
  • Симуляторы: создание диалоговых тренажёров (например, для отработки навыков переговоров).

Развлечения

  • Видеоигры: процедурная генерация уровней, персонажей, диалогов.
  • Кино и анимация: создание CGI-эффектов, анимации персонажей.
  • Социальные сети: генерация аватаров, фильтров, стикеров.

Критика и ограничения

Этические проблемы

  • Дезинформация: генерация фейковых изображений, видео (deepfake) и текстов, которые могут использоваться для манипуляции общественным мнением.
  • Нарушение авторских прав: модели обучаются на данных, защищённых авторским правом, что порождает судебные иски (например, иск Getty Images против Stability AI).
  • Предвзятость (bias): модели могут воспроизводить и усиливать социальные стереотипы, содержащиеся в обучающих данных.

Технические ограничения

  • Галлюцинации (hallucinations): генерация правдоподобных, но фактически неверных утверждений, особенно в текстовых моделях.
  • Высокая стоимость: обучение и запуск больших моделей требуют значительных вычислительных ресурсов, что ограничивает доступность для малых компаний и исследователей.
  • Нестабильность обучения: GAN-модели часто страдают от коллапса мод (генератор производит ограниченное разнообразие образцов).

Регулирование в России

В Российской Федерации действуют законы, регулирующие использование генеративных нейросетей. В 2023 году вступил в силу Федеральный закон № 258-ФЗ, который обязывает маркировать контент, созданный с помощью ИИ. Также в 2024 году Роскомнадзор начал блокировать сайты, распространяющие дипфейки без предупреждения. Модели, обученные на данных, содержащих экстремистские материалы, подлежат блокировке.

Интересные факты

  • Первая генеративная нейросеть, способная создавать изображения по тексту, — DALL-E (OpenAI, 2021) — была названа в честь художника Сальвадора Дали и робота WALL-E.
  • Модель GPT-3 (2020) содержит 175 миллиардов параметров, что примерно в 100 раз больше, чем у человека (около 100 триллионов синапсов, но параметры — не синапсы).
  • В 2023 году российская компания «Сбер» выпустила модель Kandinsky 3.0, которая генерирует изображения с разрешением 1024×1024 пикселя и поддерживает русскоязычные запросы.
  • Диффузионные модели для генерации видео (Sora, 2024) способны создавать реалистичные ролики длительностью до 60 секунд с учётом физики объектов и освещения.

Источники

  • Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. (2014). Generative Adversarial Nets. Advances in Neural Information Processing Systems.
  • Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems.
  • Ho, J., Jain, A., Abbeel, P. (2020). Denoising Diffusion Probabilistic Models. Advances in Neural Information Processing Systems.
  • Brown, T., Mann, B., Ryder, N., et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems.
  • Rombach, R., Blattmann, A., Lorenz, D., et al. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. IEEE/CVF Conference on Computer Vision and Pattern Recognition.
  • Федеральный закон от 31.07.2023 № 258-ФЗ «О внесении изменений в Федеральный закон "Об информации, информационных технологиях и о защите информации"».
  • Отчёты компаний OpenAI, Stability AI, Сбер (2023–2024).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →