Открыть сервис

Механистическая интерпретируемость

Механистическая интерпретируемость — это область исследований в сфере искусственного интеллекта (ИИ), занимающаяся обратным инжинирингом обученных нейронных сетей с целью понимания их внутренних механизмов работы на уровне отдельных компонентов (нейронов, слоёв, цепей активаций). В отличие от поведенческой интерпретируемости, которая изучает, что делает модель (связь «вход-выход»), механистическая интерпретируемость стремится ответить на вопрос «как именно модель это делает», выявляя алгоритмы, реализованные в её весах.

История

Ранние предпосылки

Корни механистической интерпретируемости лежат в исследованиях нейронных сетей 1980-х — 1990-х годов. Учёные, такие как Джеффри Хинтон и Дэвид Румельхарт, изучали внутренние представления в сетях с обратным распространением ошибки. Однако из-за малых вычислительных мощностей и простоты моделей (например, сети с одним скрытым слоём) эти работы носили скорее демонстрационный характер.

Современный этап (2015 — настоящее время)

Взрывной рост интереса к механистической интерпретируемости начался с появлением больших языковых моделей (LLM), таких как GPT-2 (2019) и GPT-3 (2020). В 2021 году компания Anthropic опубликовала серию работ, посвящённых «микроскопии» нейронных сетей, где впервые были систематически описаны «нейроны-фичи» (feature neurons) — отдельные нейроны, реагирующие на конкретные концепты (например, на символы Unicode или на синтаксические конструкции). В 2022 году исследователи из OpenAI и других лабораторий начали применять методы разреженного кодирования (sparse autoencoders) для выделения интерпретируемых направлений в многомерном пространстве активаций.

Основные понятия

Фичи (Features)

В контексте механистической интерпретируемости фича — это измеримая характеристика входных данных, на которую реагирует компонент сети. Фичи могут быть:

  • Нейронными (активация одного нейрона);
  • Направленными (линейная комбинация активаций в слое);
  • Цепочными (последовательность активаций, реализующая определённый алгоритм).

Примеры фич в языковых моделях: нейрон, активирующийся на слово «но» в начале предложения; направление в пространстве эмбеддингов, кодирующее грамматический род; цепь, выполняющая арифметическое сложение.

Цепи (Circuits)

Цепь — это подграф нейронной сети, состоящий из набора нейронов и связей, которые совместно реализуют определённую вычислительную функцию. Цепи могут быть:

  • Монотонные (простая передача сигнала);
  • Рекуррентные (с обратными связями);
  • Композиционные (состоящие из нескольких подцепей).

Известный пример — цепь «индукции» (induction head circuit) в трансформерах, которая позволяет модели предсказывать повторяющиеся паттерны в тексте (например, в предложении «Кот сидел на ковре. Кот…» она активируется для предсказания «сидел»).

Суперпозиция (Superposition)

Одна из ключевых проблем механистической интерпретируемости — суперпозиция. Это явление, при котором нейронная сеть кодирует больше фич, чем у неё есть нейронов, используя разреженное представление (каждая фича активируется редко, но в комбинации с другими). Это делает фичи неортогональными и затрудняет их выделение. Механизмы суперпозиции были впервые формально описаны в работах Anthropic (2022).

Методы

Активационные паттерны

Самый простой метод — анализ активаций нейронов на наборе входных данных. Исследователь подаёт на вход модели множество примеров (например, предложений) и записывает, при каких условиях активируется конкретный нейрон. Это позволяет выявить «рецептивное поле» нейрона.

Вмешательство (Interventions)

Метод заключается в изменении активаций нейронов (например, обнуление или усиление) и наблюдении за изменением поведения модели. Если изменение активации нейрона предсказуемо меняет выход (например, меняет пол в сгенерированном тексте), это подтверждает, что нейрон кодирует соответствующую фичу.

Разреженное кодирование

Для борьбы с суперпозицией применяются разреженные автоэнкодеры (sparse autoencoders). Они обучаются восстанавливать активации скрытого слоя модели, используя большее количество нейронов, чем в исходном слое, но с ограничением на разреженность (большинство нейронов автоэнкодера должны быть неактивны). Это позволяет «разложить» суперпозицию на отдельные фичи.

Градиентные методы

Использование градиентов для определения важности входных токенов (например, метод Integrated Gradients). Хотя эти методы не всегда дают механистическое объяснение, они помогают локализовать участки входных данных, влияющие на активацию конкретных нейронов.

Применение

Безопасность ИИ

Механистическая интерпретируемость рассматривается как один из инструментов для обеспечения безопасности систем ИИ. Понимание внутренних механизмов может помочь выявить:

  • Скрытые цели (например, модель, которая научилась обманывать, может иметь нейроны, активирующиеся при необходимости солгать);
  • Уязвимости (цепи, которые могут быть использованы для атаки);
  • Нежелательное поведение (например, генерация оскорбительного контента).

Отладка моделей

Разработчики могут использовать механистическую интерпретируемость для поиска и исправления ошибок в поведении модели. Например, если модель неправильно выполняет арифметические операции, можно найти соответствующую цепь и понять, почему она даёт сбой.

Научные исследования

Изучение внутренних алгоритмов нейронных сетей даёт понимание того, как могут быть устроены «разумные» системы в целом. Это пересекается с когнитивной наукой и нейробиологией.

Критика

Трудозатратность

Механистическая интерпретируемость требует значительных вычислительных ресурсов и ручного анализа. Для современных моделей с сотнями миллиардов параметров полное картирование всех цепей практически невозможно.

Неполнота

Даже если удаётся интерпретировать отдельные нейроны или цепи, это не даёт полного понимания поведения модели в целом. Модель может использовать множество параллельных путей, которые взаимодействуют сложным образом.

Антропоморфизм

Критики отмечают, что исследователи склонны приписывать нейронам человеческие понятия (например, «нейрон, отвечающий за чувство юмора»), в то время как внутренние представления модели могут быть принципиально иными, не имеющими аналогов в человеческом мышлении.

Связь с другими областями

Когнитивная наука

Механистическая интерпретируемость заимствует методы из нейробиологии (например, анализ рецептивных полей) и когнитивной психологии (изучение ментальных моделей).

Теория информации

Понятия энтропии и взаимной информации используются для количественной оценки того, насколько хорошо фича описывает поведение модели.

Машинное обучение

Методы разреженного кодирования и градиентного анализа являются частью общего инструментария машинного обучения.

Перспективы

Развитие механистической интерпретируемости связано с созданием автоматизированных инструментов для анализа цепей (например, библиотека TransformerLens), а также с интеграцией результатов в процесс обучения моделей (обучение с учётом интерпретируемости). В России исследования в этой области ведутся в рамках научных групп при МФТИ, ВШЭ и Сколтехе, однако их объём пока невелик по сравнению с зарубежными лабораториями (Anthropic, OpenAI, DeepMind).

Источники

  • Olah C., et al. «Zoom In: An Introduction to Circuits». Distill, 2020.
  • Elhage N., et al. «Toy Models of Superposition». Anthropic, 2022.
  • Wang K., et al. «Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small». arXiv, 2022.
  • Бурков А. «Механистическая интерпретируемость нейронных сетей: обзор». Журнал «Искусственный интеллект и принятие решений», 2023.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →