Открыть сервис

Генеративность

Генеративность — это свойство системы, модели или процесса порождать (генерировать) новые, ранее не существовавшие данные, объекты, структуры или решения, которые соответствуют определённым закономерностям, правилам или распределениям, извлечённым из обучающей выборки или заданным изначально. В широком смысле генеративность противопоставляется дискриминативности (способности различать или классифицировать) и подразумевает активное создание контента, а не его пассивный анализ.

История развития понятия

Истоки в лингвистике и философии

Термин «генеративность» (от лат. generare — порождать) впервые получил строгое научное обоснование в работах американского лингвиста Ноама Хомского в 1950-х годах. В рамках теории генеративной (порождающей) грамматики Хомский предложил рассматривать язык как конечную систему правил, способную порождать бесконечное множество грамматически правильных предложений. Это свойство — конечный набор правил, дающий бесконечное разнообразие осмысленных высказываний — стало ключевым для понимания генеративности в когнитивных науках.

Развитие в математике и теории алгоритмов

В математике понятие генеративности тесно связано с теорией формальных языков и алгоритмов. Формальная грамматика считается генеративной, если она задаёт процедуру (алгоритм) для построения всех цепочек языка. Иерархия Хомского (типы 0–3) классифицирует грамматики по их генеративной мощности: от самых мощных (неограниченные, тип 0) до самых простых (регулярные, тип 3). В теории вычислимости генеративность ассоциируется с понятием рекурсивно перечислимого множества — множества, все элементы которого могут быть порождены некоторым алгоритмом.

Генеративность в эпоху машинного обучения

Современный этап развития понятия связан с бурным прогрессом в области искусственного интеллекта, особенно генеративных моделей. Начиная с 2010-х годов, с появлением генеративно-состязательных сетей (GAN) и вариационных автоэнкодеров (VAE), термин «генеративность» стал прежде всего ассоциироваться со способностью нейросетей создавать реалистичные изображения, тексты, аудио и видео. В 2020-х годах распространение получили большие языковые модели (LLM), такие как GPT, и модели диффузии, которые демонстрируют высокую степень генеративности, порождая контент, неотличимый от созданного человеком.

Классификация генеративных систем

По типу порождаемого контента

  • Текстовые генеративные модели: порождают последовательности слов (статьи, стихи, код, диалоги). Примеры: GPT-4, YandexGPT, GigaChat.
  • Графические генеративные модели: создают изображения, рисунки, 3D-объекты. Примеры: Stable Diffusion, Midjourney, Kandinsky.
  • Аудиогенеративные модели: синтезируют речь, музыку, звуковые эффекты. Примеры: WaveNet, MusicLM.
  • Видеогенеративные модели: порождают последовательности кадров, анимацию. Примеры: Sora, Make-A-Video.
  • Гибридные (мультимодальные) модели: работают с несколькими типами данных одновременно (например, текст + изображение).

По архитектуре и принципу работы

  • Генеративно-состязательные сети (GAN): состоят из двух нейросетей — генератора (создаёт фальшивые данные) и дискриминатора (пытается отличить их от реальных). В процессе состязания генератор учится создавать всё более правдоподобные образцы.
  • Вариационные автоэнкодеры (VAE): кодируют входные данные в вероятностное латентное пространство, а затем декодируют случайные точки из этого пространства в новые данные.
  • Модели диффузии: постепенно добавляют шум к данным, а затем обучаются обратному процессу — восстановлению данных из шума. Наиболее популярны для генерации изображений и видео.
  • Авторегрессионные модели (трансформеры): предсказывают следующий элемент последовательности на основе предыдущих. Лежат в основе большинства современных языковых моделей.
  • Модели на основе потока (Normalizing Flows): используют обратимые преобразования для отображения простого распределения (например, нормального) в сложное распределение данных.

По степени контролируемости

  • Безусловные модели: генерируют данные без какого-либо внешнего сигнала (например, случайное изображение лица).
  • Условные модели: генерируют данные на основе заданного условия (текстового описания, класса объекта, частичного изображения). Большинство современных прикладных моделей являются условными.

Применение генеративных моделей

В искусстве и дизайне

Генеративные модели широко используются для создания визуального контента: иллюстраций, концепт-арта, текстур, логотипов. Художники и дизайнеры применяют их как инструмент для поиска идей, быстрого прототипирования и создания финальных работ. В музыке генеративные алгоритмы сочиняют мелодии, аранжировки и целые композиции в заданном стиле.

В науке и инженерии

  • Медицина: генерация синтетических медицинских изображений (рентгеновских снимков, МРТ) для обучения диагностических моделей при нехватке реальных данных, а также для планирования операций.
  • Химия и фармацевтика: генерация новых молекул с заданными свойствами (например, потенциальных лекарственных препаратов). Модели, такие как MolGAN, способны порождать химические структуры, удовлетворяющие целевым характеристикам.
  • Материаловедение: поиск новых материалов с определёнными физическими или химическими свойствами путём генерации кристаллических решёток или полимерных цепочек.

В разработке программного обеспечения

Генеративные модели (особенно большие языковые модели) используются для автоматической генерации кода, написания документации, создания тестов, исправления ошибок и рефакторинга. Инструменты вроде GitHub Copilot и Tabnine стали неотъемлемой частью рабочего процесса многих разработчиков.

В развлечениях и медиа

  • Игры: генерация игровых уровней, персонажей, диалогов, текстур и целых игровых миров.
  • Кино и анимация: создание спецэффектов, анимации лиц, генерация фонов и декораций.
  • Социальные сети: создание аватаров, фильтров, стикеров и другого пользовательского контента.

Критика и ограничения

Проблема авторства и интеллектуальной собственности

Генеративные модели обучаются на огромных массивах данных, часто включающих произведения, защищённые авторским правом. Это порождает юридические и этические споры о том, кому принадлежат права на сгенерированный контент — разработчику модели, пользователю, или владельцам исходных данных. В ряде стран (включая Россию) законодательство в этой области ещё не сформировано окончательно.

Риски дезинформации и манипуляции

Способность генеративных моделей создавать реалистичные, но ложные тексты, изображения и видео (дипфейки) создаёт угрозу для информационной безопасности. Генеративный контент может использоваться для распространения дезинформации, создания компрометирующих материалов, мошенничества и манипуляции общественным мнением.

Технические ограничения

Регулирование в России

В Российской Федерации деятельность, связанная с разработкой и использованием генеративных моделей, регулируется общими нормами законодательства об информации, интеллектуальной собственности и персональных данных. В 2023 году были приняты рекомендации по этике использования искусственного интеллекта, которые затрагивают и вопросы генеративного контента. Отдельные случаи использования генеративных моделей для создания противоправного контента (например, порнографических изображений с участием несовершеннолетних или материалов, разжигающих ненависть) преследуются по закону.

Интересные факты

  • Первая генеративная модель, способная создавать изображения по текстовому описанию (DALL-E), была представлена компанией OpenAI в январе 2021 года.
  • В 2023 году генеративная модель GPT-4 успешно сдала Единый государственный экзамен по русскому языку, набрав баллы, сопоставимые с результатами лучших выпускников.
  • Генеративные модели используются для восстановления утраченных исторических артефактов: например, реконструкции разрушенных архитектурных памятников или реставрации старых фотографий.
  • Термин «генеративный искусственный интеллект» (Generative AI) стал одним из самых популярных технологических терминов 2023 года по версии словарей Collins и Merriam-Webster.

Источники

  • Хомский Н. «Синтаксические структуры» (1957)
  • Goodfellow I. et al. «Generative Adversarial Nets» (2014)
  • Kingma D. P., Welling M. «Auto-Encoding Variational Bayes» (2013)
  • Ho J. et al. «Denoising Diffusion Probabilistic Models» (2020)
  • Vaswani A. et al. «Attention Is All You Need» (2017)
  • Федеральный закон «Об информации, информационных технологиях и о защите информации» от 27.07.2006 № 149-ФЗ
  • Гражданский кодекс РФ, часть четвертая (интеллектуальная собственность)
  • Кодекс этики в сфере искусственного интеллекта (утвержден Минэкономразвития России, 2023)

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →