Генеративные нейросети
Генеративные нейросети — это класс искусственных нейронных сетей, способных создавать новый контент (изображения, текст, аудио, видео, программный код, трёхмерные модели) на основе обучающих данных. В отличие от дискриминативных моделей, которые классифицируют или предсказывают метки, генеративные модели моделируют распределение вероятностей исходных данных и генерируют новые образцы, статистически подобные обучающей выборке. Ключевая особенность — способность к творческому синтезу, а не просто к распознаванию или регрессии.
История развития
Ранние этапы (1980-е — 2000-е)
Первые подходы к генеративному моделированию появились в 1980-х годах с развитием байесовских сетей и скрытых марковских моделей. В 1990-е годы стали применяться ограниченные машины Больцмана (RBM) и вариационные автокодировщики (VAE), предложенные в 2013 году Дидериком Кингмой и Максом Веллингом. Однако качество генерируемого контента оставалось низким из-за ограниченной вычислительной мощности и объёмов данных.
Прорыв с GAN (2014)
В 2014 году Ян Гудфеллоу и его коллеги из Университета Монреаля предложили генеративно-состязательные сети (GAN). Эта архитектура состоит из двух нейросетей: генератора, создающего поддельные образцы, и дискриминатора, пытающегося отличить их от реальных. Состязательный процесс обучения позволил получать изображения высокого качества. В 2015 году появилась архитектура DCGAN (Deep Convolutional GAN), стабилизировавшая обучение.
Развитие трансформеров (2017–2020)
В 2017 году исследователи Google представили архитектуру трансформер, изначально разработанную для машинного перевода. В 2018 году OpenAI выпустила GPT-1 — первую генеративную языковую модель на основе трансформеров. В 2020 году GPT-3 (175 миллиардов параметров) продемонстрировала способность генерировать связные тексты, писать код и выполнять логические задачи без дополнительного обучения (few-shot learning).
Диффузионные модели (2020-е)
В 2020 году была предложена архитектура диффузионных моделей (DDPM — Denoising Diffusion Probabilistic Models), которые постепенно зашумляют изображение, а затем учатся восстанавливать его. В 2022 году компания Stability AI выпустила Stable Diffusion — открытую модель для генерации изображений по текстовому описанию. В 2023–2024 годах появились мультимодальные модели (например, GPT-4, DALL-E 3, Sora от OpenAI), способные генерировать изображения, видео и аудио.
Классификация генеративных нейросетей
По типу генерируемого контента
- Текстовые модели: GPT (OpenAI), LLaMA (Meta — организация признана экстремистской и запрещена в РФ), YandexGPT (Россия). Генерируют статьи, диалоги, код, стихи.
- Графические модели: Stable Diffusion, Midjourney, DALL-E, Kandinsky (Сбер, Россия). Создают изображения по текстовым запросам.
- Аудиомодели: Jukebox (OpenAI), MusicGen (Meta — организация признана экстремистской и запрещена в РФ), Voicebox (Meta — организация признана экстремистской и запрещена в РФ). Генерируют музыку, звуки и речь.
- Видеомодели: Sora (OpenAI), VideoPoet (Google), CogVideo (Tsinghua University). Создают короткие видеоролики по тексту или изображению.
- Кодовые модели: GitHub Copilot (Microsoft), Codex (OpenAI), Tabnine. Генерируют программный код по описанию задачи.
По архитектуре
- Генеративно-состязательные сети (GAN): состоят из генератора и дискриминатора. Используются для генерации изображений, но сложны в обучении (нестабильность, коллапс мод).
- Вариационные автокодировщики (VAE): обучаются сжимать данные в скрытое пространство и восстанавливать их. Дают более гладкие распределения, но менее резкие изображения.
- Диффузионные модели: постепенно добавляют шум к данным, а затем учатся его удалять. Обеспечивают высокое качество и разнообразие, но требуют много итераций для генерации.
- Трансформеры: используют механизм внимания. Доминируют в текстовой генерации (GPT, LLaMA, Gemini) и активно применяются в мультимодальных моделях.
- Авторегрессионные модели: генерируют контент последовательно (токен за токеном). Например, GPT-4 генерирует текст по одному слову.
Устройство и принцип работы
Основные компоненты
- Скрытое пространство (latent space): многомерное векторное представление, в котором модель кодирует семантические признаки данных. Изменение вектора в скрытом пространстве приводит к контролируемым изменениям в выходном контенте.
- Энкодер и декодер: в VAE и диффузионных моделях энкодер сжимает входные данные в скрытое представление, а декодер восстанавливает их. В трансформерах энкодер обрабатывает входную последовательность, а декодер генерирует выходную.
- Механизм внимания (attention): позволяет модели учитывать взаимосвязи между всеми элементами последовательности, что критически важно для длинных текстов и изображений.
Процесс обучения
- Сбор данных: большие наборы текстов (Common Crawl, Wikipedia), изображений (LAION-5B, ImageNet), аудио (AudioSet) и видео.
- Предобработка: токенизация текста, нормализация изображений, аугментация данных.
- Обучение: минимизация функции потерь (например, кросс-энтропия для текста, L2-расстояние для изображений). Для GAN — состязательная игра между генератором и дискриминатором.
- Тонкая настройка (fine-tuning): дообучение на специализированных датасетах (например, медицинских текстах, фотографиях животных) для улучшения качества в конкретной области.
Параметры и вычислительные затраты
Современные генеративные модели содержат от нескольких миллиардов до сотен миллиардов параметров. Обучение GPT-4 оценивается в десятки миллионов долларов США и требует тысяч графических процессоров (GPU) в течение нескольких месяцев. Например, для обучения Stable Diffusion использовалось 256 GPU NVIDIA A100 в течение 150 000 часов.
Применение
Создание контента
- Графический дизайн: генерация иллюстраций, логотипов, концепт-артов. Используется в рекламе, кинопроизводстве, видеоиграх.
- Музыка и звук: создание фоновой музыки, звуковых эффектов, синтез речи (например, голосовые ассистенты).
- Текст: написание статей, сценариев, рекламных текстов, переводов, юридических документов.
Научные исследования
- Биоинформатика: генерация новых белковых структур (AlphaFold, RFdiffusion), молекул для лекарств (MoleculeGAN).
- Материаловедение: предсказание свойств новых материалов, генерация кристаллических решёток.
- Астрономия: восстановление изображений с телескопов, генерация симуляций космических объектов.
Образование и обучение
- Персонализированные учебные материалы: генерация задач, тестов, объяснений под уровень ученика.
- Симуляторы: создание диалоговых тренажёров (например, для отработки навыков переговоров).
Развлечения
- Видеоигры: процедурная генерация уровней, персонажей, диалогов.
- Кино и анимация: создание CGI-эффектов, анимации персонажей.
- Социальные сети: генерация аватаров, фильтров, стикеров.
Критика и ограничения
Этические проблемы
- Дезинформация: генерация фейковых изображений, видео (deepfake) и текстов, которые могут использоваться для манипуляции общественным мнением.
- Нарушение авторских прав: модели обучаются на данных, защищённых авторским правом, что порождает судебные иски (например, иск Getty Images против Stability AI).
- Предвзятость (bias): модели могут воспроизводить и усиливать социальные стереотипы, содержащиеся в обучающих данных.
Технические ограничения
- Галлюцинации (hallucinations): генерация правдоподобных, но фактически неверных утверждений, особенно в текстовых моделях.
- Высокая стоимость: обучение и запуск больших моделей требуют значительных вычислительных ресурсов, что ограничивает доступность для малых компаний и исследователей.
- Нестабильность обучения: GAN-модели часто страдают от коллапса мод (генератор производит ограниченное разнообразие образцов).
Регулирование в России
В Российской Федерации действуют законы, регулирующие использование генеративных нейросетей. В 2023 году вступил в силу Федеральный закон № 258-ФЗ, который обязывает маркировать контент, созданный с помощью ИИ. Также в 2024 году Роскомнадзор начал блокировать сайты, распространяющие дипфейки без предупреждения. Модели, обученные на данных, содержащих экстремистские материалы, подлежат блокировке.
Интересные факты
- Первая генеративная нейросеть, способная создавать изображения по тексту, — DALL-E (OpenAI, 2021) — была названа в честь художника Сальвадора Дали и робота WALL-E.
- Модель GPT-3 (2020) содержит 175 миллиардов параметров, что примерно в 100 раз больше, чем у человека (около 100 триллионов синапсов, но параметры — не синапсы).
- В 2023 году российская компания «Сбер» выпустила модель Kandinsky 3.0, которая генерирует изображения с разрешением 1024×1024 пикселя и поддерживает русскоязычные запросы.
- Диффузионные модели для генерации видео (Sora, 2024) способны создавать реалистичные ролики длительностью до 60 секунд с учётом физики объектов и освещения.
Источники
- Goodfellow, I., Pouget-Abadie, J., Mirza, M., et al. (2014). Generative Adversarial Nets. Advances in Neural Information Processing Systems.
- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. Advances in Neural Information Processing Systems.
- Ho, J., Jain, A., Abbeel, P. (2020). Denoising Diffusion Probabilistic Models. Advances in Neural Information Processing Systems.
- Brown, T., Mann, B., Ryder, N., et al. (2020). Language Models are Few-Shot Learners. Advances in Neural Information Processing Systems.
- Rombach, R., Blattmann, A., Lorenz, D., et al. (2022). High-Resolution Image Synthesis with Latent Diffusion Models. IEEE/CVF Conference on Computer Vision and Pattern Recognition.
- Федеральный закон от 31.07.2023 № 258-ФЗ «О внесении изменений в Федеральный закон "Об информации, информационных технологиях и о защите информации"».
- Отчёты компаний OpenAI, Stability AI, Сбер (2023–2024).
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →


