Развитие нейросетей¶
Развитие нейросетей — исторический процесс создания, теоретического обоснования и совершенствования искусственных нейронных сетей — вычислительных систем, вдохновлённых принципами работы биологических нейронных систем мозга. Под нейросетью понимается математическая модель, состоящая из узлов (нейронов), соединённых весами, которая обучается на данных и способна решать задачи распознавания, генерации и прогнозирования. Развитие охватывает период с 1940-х годов до настоящего времени и включает несколько волн активности, разделённых периодами «зим», когда интерес к теме заметно снижался.
¶Исторические предпосылки
Идея создания искусственных нейронов восходит к работам Уоррена Маккаллока и Уолтера Питтса, которые в 1943 году предложили логико-математическую модель нейрона — формальный нейрон Маккаллока — Питтса. Модель описывала нейрон как элемент, выполняющий логические операции над входными сигналами. В 1949 году Дональд Хебб сформулировал правило пластичности синапсов: «Нейроны, которые активируются вместе, связываются вместе» — принцип, ставший основой обучения нейросетей.
¶Первая волна: перцептроны
В 1958 году Фрэнк Розенблатт создал перцептрон — простейшую нейросеть с обучением по правилу смещения весов. Перцептрон решал задачи линейной классификации и вызвал широкий интерес, в том числе в СССР, где аналогичные исследования проводились под руководством А. И. Галушкина и В. Б. Бычкова. В 1969 году Марвин Мински и Сеймур Пейперт опубликовали книгу «Перцептроны», в которой доказали ограничения однослойных перцептронов — например, их неспособность решать задачу исключающего ИЛИ (XOR). Результат стал одним из факторов первого «зимнего» периода в нейросетевых исследованиях.
¶Вторая волна: обратное распространение ошибки
В 1986 году группа учёных во главе с Дэвидом Румелхартом, Джеффри Хинтоном и Рональдом Уильямсом опубликовала алгоритм обратного распространения ошибки (backpropagation), позволивший обучать многослойные перцептроны. Алгоритм решал проблему XOR и открыл путь к обучению глубоких сетей. В СССР методы обучения нейросетей активно разрабатывались в 1980-е годы: работы А. И. Галушкина по теории нейронных сетей, исследования В. Л. Стеценко, Ю. И. Калмыкова и других учёных заложили основы отечественной школы нейросетевого моделирования.
¶Третья волна: глубокое обучение
Развитие вычислительных мощностей (графические процессоры GPU), появление больших наборов данных и усовершенствование алгоритмов привели к прорыву глубокого обучения в 2010-е годы. В 2012 году свёрточная нейросеть AlexNet, созданная группой Алексея Крижевского, Ильи Суцкевича и Джеффри Хинтона, победила на конкурсе ImageNet с отрывом, продемонстрировав практическое преимущество глубоких сетей. В 2017 году исследователи Google опубликовали архитектуру Transformer, ставшую основой современных языковых моделей. На её основе созданы BERT, GPT и другие системы, показавшие способность к генерации текста, переводу и ответам на вопросы.
¶Развитие в России
В России нейросетевые исследования имеют давнюю традицию. В 2020-е годы в стране работают собственные модели: YandexGPT от компании «Яндекс», GigaChat от Сбербанка, Kandinsky от «Сбера» (генерация изображений), а также модели от «МТС», «VK» и других компаний. Правительством РФ приняты программы развития искусственного интеллекта, включая национальный проект «Искусственный интеллект». В 2024 году в России заработал суперкомпьютер «Крио» и расширяются вычислительные кластеры для обучения моделей. Развитие отрасли поддерживается инициативами по подготовке кадров в области ИИ и математического моделирования.
¶Современные направления
К основным направлениям развития нейросетей в 2020-е годы относятся:
- Мультимодальные модели — системы, работающие одновременно с текстом, изображениями, звуком и видео.
- Малые языковые модели — компактные модели, работающие на локальных устройствах без обращения к облаку.
- Нейроморфные процессоры — специализированные чипы, имитирующие работу биологических нейронов (проекты «Сбербанк», «Яндекс», Intel Loihi).
- Объяснимый ИИ — методы, повышающие прозрачность решений нейросетей.
- Энергоэффективное обучение — снижение энергозатрат на тренировку моделей.
¶Источники
- Галушкин А. И. «Теория нейронных сетей».
- Goodfellow I., Bengio Y., Courville A. «Deep Learning» (2016).
- Rumelhart D., Hinton G., Williams R. «Learning representations by back-propagating errors» (1986).
- Krizhevsky A., Sutskever I., Hinton G. «ImageNet Classification with Deep Convolutional Neural Networks» (2012).
- Vaswani A. et al. «Attention Is All You Need» (2017).