Открыть сервисСервис

Развитие нейронных сетей

Развитие нейронных сетей — это исторический процесс создания, теоретического обоснования и совершенствования математических моделей, воспроизводящих принципы работы биологических нейронных систем, а также их последующего перехода от лабораторных экспериментов к массовому промышленному применению. Хронологически охватывает период с 1940-х годов до настоящего времени и включает несколько волн подъёма и спада интереса к технологии, получивших в англоязычной литературе название «зим нейросетей».

Истоки и первая волна

Идея искусственного нейрона была сформулирована Уорреном Маккаллоком и Уолтером Питтсом в 1943 году в статье, описавшей логическую модель нейрона. В 1957 году Фрэнк Розенблатт предложил перцептрон — обучаемую модель, способную решать задачи классификации. Перцептрон вызвал широкий интерес, однако в 1969 году Марвин Мински и Сеймур Пейперт опубликовали книгу «Перцептроны», в которой доказали ограниченность однослойных перцептронов (например, их неспособность решать задачу «исключающее ИЛИ»). Работа существенно снизила финансирование исследований и положила начало первой «зиме» нейросетей, продлившейся до конца 1970-х годов.

Вторая волна: обратное распространение ошибки

В 1986 году Дэвид Румельхарт, Джеффри Хинтон и Рональд Уильямс опубликовали метод обратного распространения ошибки (backpropagation), позволивший обучать многослойные перцептроны. Алгоритм решал проблему, обозначенную Мински и Пейпертом, и открыл путь к созданию сетей со скрытыми слоями. В СССР вклад в развитие нейросетей внёс математик Алексей Иванович Галушкин, разработавший теорию обучения многослойных перцептронов (1980-е годы). В 1989 году Джордж Сиебенс и Курт Хорник доказали универсальную аппроксимацию: однослойная сеть с одним скрытым слоем может приблизительно воспроизвести любую непрерывную функцию. Тем не менее вычислительные мощности и объёмы данных оставались недостаточными, и интерес к нейросетям снова ослаб к середине 1990-х годов.

Ренессанс: глубокое обучение

Поворотным стал 2006 год, когда Джеффри Хинтон опубликовал метод предобучения глубоких ботовых машин (deep belief networks), а в 2012 году команда Хинтона победила на конкурсе ImageNet с сетью AlexNet, превзошедшей традиционные методы компьютерного зрения по точности более чем на 10 процентных пунктов. Ключевую роль сыграли три фактора: рост вычислительных мощностей на графических процессорах (GPU), накопление больших размеченных наборов данных и развитие алгоритмов регуляризации, включая dropout (2012, Хинтон и др.).

В 2013 году компания Google приобрела лабораторию DeepMind, а в 2014 году появилась архитектура генеративно-состязательных сетей (GAN), предложенная Яном Гудфеллоу. В 2017 году исследователи Google опубликовали статью «Attention Is All You Need», описавшую архитектуру трансформера, ставшую основой современных языковых моделей.

Эпоха больших моделей

С 2018 года развитие нейросетей определяется трендом масштабирования: рост числа параметров модели сопровождается качественным улучшением возможностей. Модели GPT (OpenAI), BERT (Google) и их российские аналоги, такие как RuGPT и SberGPT от «Сбера», продемонстрировали способность к генерации текста и пониманию контекста. В 2022—2023 годах появились системы генеративного искусственного интеллекта — ChatGPT, Stable Diffusion, Midjourney, — вызвавшие широкий общественный и деловой интерес.

В России развитие нейросетей ведётся в рамках национального проекта «Искусственный интеллект» (2020—2030), включает создание суперкомпьютеров (например, «Яндекса» — «Лобачёвский» и «Кристофари» от Сбера) и разработку отечественных больших языковых моделей, включая YandexGPT и GigaChat.

Применение

Современные нейросети используются в распознавании речи и изображений, машинном переводе, автономном транспорте, медицинской диагностике, генерации кода и научных расчётах. Ключевые направления исследований включают обучение с подкреплением, нейросети с вниманием, диффузионные модели и попытки создания систем с обобщением, близким к человеческому.

Источники:

  • Галушкин А. И. «Теория нейронных сетей»
  • Goodfellow I., Bengio Y., Courville A. «Deep Learning» (2016)
  • Krizhevsky A., Sutskever I., Hinton G. «ImageNet Classification with Deep CNNs» (2012)
  • Vaswani A. et al. «Attention Is All You Need» (2017)
  • Минский М., Пейперт С. «Перцептроны» (1969)
Заметили ошибку или не согласны с информацией в статье? Напишите нам support@bfometr.ru