Открыть сервис

Объяснимый ИИ

Объяснимый искусственный интеллект (Explainable AI, XAI) — это совокупность методов и подходов в области искусственного интеллекта, направленных на создание таких систем машинного обучения, результаты работы которых могут быть поняты и интерпретированы человеком. В отличие от «чёрного ящика» (black box), где логика принятия решений скрыта, XAI стремится сделать процесс вывода модели прозрачным, предоставляя пользователю обоснования, объяснения или визуализации того, почему было принято то или иное решение.

История

Проблема интерпретируемости возникла одновременно с появлением первых сложных моделей машинного обучения, таких как нейронные сети и ансамбли деревьев решений, в 1980-х — 1990-х годах. Однако до середины 2010-х годов основное внимание уделялось точности прогнозов, а не их объяснимости. С ростом внедрения ИИ в критически важные области (медицина, финансы, автономное вождение, судопроизводство) и вступлением в силу Общего регламента по защите данных (GDPR) в Европейском союзе в 2018 году, который закрепил «право на объяснение» решений, принятых алгоритмами, интерес к XAI резко возрос.

В 2017 году Агентство перспективных оборонных исследовательских проектов США (DARPA) запустило программу XAI, направленную на разработку практических методов объяснимого ИИ. С этого времени начался активный рост числа публикаций, инструментов и библиотек, посвящённых этой теме.

Классификация методов XAI

Методы объяснимого ИИ можно классифицировать по нескольким критериям.

По объёму объяснения

  • Глобальные (global) методы — объясняют общую логику работы модели в целом. Например, показывают, какие признаки в среднем наиболее важны для всех предсказаний модели.
  • Локальные (local) методы — объясняют конкретное решение модели для одного объекта. Например, почему именно этому пациенту был поставлен диагноз «диабет».

По зависимости от модели

  • Внутренне интерпретируемые (intrinsic) модели — модели, чья структура сама по себе прозрачна. К ним относятся линейная регрессия, логистическая регрессия, деревья решений малой глубины, наивный байесовский классификатор. Они не требуют дополнительных инструментов для объяснения.
  • Пост-хок (post-hoc) методы — применяются к уже обученным сложным моделям (нейронным сетям, градиентному бустингу, случайному лесу). Они не изменяют модель, а лишь анализируют её поведение. Большинство современных методов XAI относятся к этой категории.

По типу вывода

  • Визуализация признаков — показ, какие части входных данных (например, пиксели изображения) наиболее повлияли на результат.
  • Текстовые объяснения — генерация естественно-языковых описаний причин решения.
  • Примеры-контрфакты — показ минимальных изменений входных данных, которые привели бы к другому результату (например: «Если бы доход был на 10 000 рублей выше, кредит был бы одобрен»).
  • Правила и логические выражения — извлечение простых правил (например, «если возраст > 50 и холестерин > 200, то риск высокий»).

Основные методы и инструменты

LIME (Local Interpretable Model-agnostic Explanations)

Метод, предложенный в 2016 году. Для объяснения конкретного предсказания LIME генерирует небольшой набор случайных вариаций входного объекта, получает предсказания модели для них и обучает на этих данных простую интерпретируемую модель (например, линейную регрессию). Полученная модель аппроксимирует поведение сложной модели в окрестности данного объекта. LIME работает с любыми типами данных (текст, изображения, таблицы).

SHAP (SHapley Additive exPlanations)

Метод, основанный на теории игр и концепции значений Шепли. SHAP вычисляет вклад каждого признака в предсказание, сравнивая результат модели с её средним предсказанием. Для каждого признака определяется, насколько его наличие или отсутствие меняет прогноз. SHAP даёт математически обоснованные и согласованные объяснения, но может быть вычислительно дорогим для моделей с большим числом признаков.

Grad-CAM (Gradient-weighted Class Activation Mapping)

Метод, предназначенный для объяснения решений свёрточных нейронных сетей (CNN) при работе с изображениями. Grad-CAM использует градиенты целевого класса по отношению к картам признаков последнего свёрточного слоя, чтобы создать тепловую карту, показывающую, какие области изображения были наиболее важны для классификации.

Деревья решений и правила

Для моделей на основе деревьев (случайный лес, градиентный бустинг) существуют методы извлечения правил (например, SkopeRules, RuleFit). Они позволяют представить логику модели в виде набора условий «если-то».

Применение

Медицина

Врачи могут отказаться от использования диагноза, поставленного ИИ, если не понимают его обоснование. XAI позволяет показать, на какие именно симптомы или показатели анализов опиралась модель, что повышает доверие и позволяет врачу проверить логику алгоритма.

Финансы

Банки и страховые компании обязаны объяснять клиентам причины отказа в кредите или повышения страховой премии. XAI помогает автоматизировать эту процедуру, предоставляя понятные объяснения, соответствующие регуляторным требованиям.

Автономные системы

В автономных автомобилях или промышленных роботах XAI позволяет инженерам понять причину нештатного поведения (например, почему автомобиль резко затормозил), что критически важно для отладки и сертификации.

Судопроизводство и право

При использовании алгоритмов для оценки риска рецидивизма или принятия решений об условно-досрочном освобождении, XAI обеспечивает прозрачность и позволяет оспаривать решения, основанные на предвзятых данных.

Критика и ограничения

  • Точность vs. интерпретируемость: Существует компромисс (trade-off) между точностью сложной модели и простотой её объяснения. Высокоточные глубокие нейронные сети часто требуют упрощённых аппроксимаций, которые могут быть неточными.
  • Надёжность объяснений: Некоторые методы (например, LIME) могут давать разные объяснения для одного и того же объекта при повторном запуске. Объяснения могут быть чувствительны к шуму в данных.
  • Пользовательская ценность: Объяснения, понятные разработчику, могут быть бесполезны для конечного пользователя (врача, клиента банка). Необходима адаптация объяснений под уровень знаний аудитории.
  • Отсутствие стандартов: На данный момент нет единого стандарта или метрики для оценки качества объяснений. Разные методы могут давать противоречивые результаты.

Перспективы развития

Основные направления развития XAI включают: создание методов, обеспечивающих стабильные и надёжные объяснения; разработку моделей, которые являются внутренне интерпретируемыми, но при этом не уступают по точности «чёрным ящикам»; интеграцию XAI в нормативно-правовые рамки; создание человеко-ориентированных интерфейсов для представления объяснений. Ожидается, что с ростом регулирования ИИ в различных странах, включая Россию, где обсуждаются принципы этичного ИИ, роль объяснимого ИИ будет только возрастать.

Источники

  • Ribeiro, M. T., Singh, S., & Guestrin, C. (2016). «Why Should I Trust You?»: Explaining the Predictions of Any Classifier.
  • Lundberg, S. M., & Lee, S. I. (2017). A Unified Approach to Interpreting Model Predictions (SHAP).
  • Selvaraju, R. R., et al. (2017). Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization.
  • DARPA. (2017). Explainable Artificial Intelligence (XAI) Program.
  • Общий регламент по защите данных (GDPR), Статья 22.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →