Открыть сервис

Explainable AI

Explainable AI (объяснимый искусственный интеллект, XAI) — это область исследований и разработок в сфере искусственного интеллекта (ИИ), направленная на создание методов и систем, результаты работы которых могут быть поняты и интерпретированы человеком. В отличие от «чёрного ящика» (black box), где алгоритм принимает решения без объяснения причин, XAI стремится сделать процесс вывода прозрачным, предоставляя пользователю обоснования, доводы или визуализации, поясняющие, почему модель пришла к тому или иному выводу.

История и предпосылки возникновения

Проблема объяснимости ИИ возникла не сразу. В первые десятилетия развития искусственного интеллекта (1950–1980-е годы) доминировали экспертные системы и символьные подходы, где правила были явно заданы программистом. Такие системы были прозрачны по определению: каждое решение можно было проследить по цепочке логических правил. Однако с ростом сложности задач и переходом к машинному обучению, особенно к глубоким нейронным сетям (глубокое обучение), модели стали настолько сложными, что их внутренняя логика перестала быть доступной для прямого понимания.

Ключевым фактором, стимулировавшим развитие XAI, стало массовое внедрение ИИ в критически важные области: медицина (диагностика заболеваний), финансы (кредитный скоринг, обнаружение мошенничества), юриспруденция (прогнозирование судебных решений), автономные системы (беспилотные автомобили). В этих сферах недостаточно просто получить точный результат — необходимо обосновать его, чтобы доверять системе, выявить возможные ошибки или предвзятость, а также выполнить требования регулирующих органов.

В 2016 году в США было создано агентство DARPA (Defense Advanced Research Projects Agency), которое запустило программу Explainable AI (XAI) с целью разработки практических методов объяснимого машинного обучения. Этот проект дал мощный импульс академическим и прикладным исследованиям. В последующие годы, с принятием Общего регламента по защите данных (GDPR) в Европейском союзе (2018 год), появилось правовое требование «права на объяснение» для решений, принимаемых автоматизированными системами, что ещё больше усилило актуальность XAI.

Классификация методов XAI

Методы объяснимого ИИ можно классифицировать по нескольким основаниям: по объёму объяснения, по времени применения и по способу работы.

По объёму объяснения

  • Глобальные методы (global explanations): объясняют поведение модели в целом. Они показывают, какие признаки или правила являются наиболее важными для всех предсказаний. Например, для модели кредитного скоринга глобальное объяснение может показать, что «доход» и «кредитная история» — самые значимые факторы, а «цвет глаз» — незначимый.
  • Локальные методы (local explanations): объясняют конкретное решение для одного экземпляра данных. Например, почему конкретный клиент получил отказ в кредите: «из-за высокого соотношения долга к доходу и наличия просрочки в прошлом». Локальные методы наиболее востребованы на практике, так как позволяют понять единичный случай.

По времени применения

  • Анте-хок (ante-hoc) или «объяснимые по построению» модели: методы, которые изначально проектируются так, чтобы быть прозрачными. К ним относятся линейные регрессии, деревья решений, наивные байесовские классификаторы, а также специальные архитектуры нейронных сетей (например, нейросети с вниманием (attention mechanisms) или концептуальные модели). Их недостаток — часто более низкая точность по сравнению с «чёрными ящиками».
  • Пост-хок (post-hoc) или «объяснения после обучения»: методы, которые применяются к уже обученной сложной модели (например, к глубокой нейронной сети или градиентному бустингу), чтобы интерпретировать её решения. Эти методы не требуют изменения архитектуры модели и являются наиболее распространёнными на практике.

По способу работы (на примере пост-хок методов)

  • Методы на основе аппроксимации (surrogate models): строят простую, интерпретируемую модель (например, линейную регрессию или дерево решений), которая аппроксимирует поведение сложной модели в окрестности конкретного предсказания. Самый известный пример — LIME (Local Interpretable Model-agnostic Explanations).
  • Методы на основе вклада признаков (feature attribution): вычисляют, насколько каждый входной признак повлиял на итоговое предсказание. Наиболее популярный метод — SHAP (SHapley Additive exPlanations), основанный на теории кооперативных игр (значения Шепли). SHAP даёт единую меру важности для каждого признака.
  • Методы на основе визуализации (visual explanations): используются в основном для изображений. Например, Grad-CAM (Gradient-weighted Class Activation Mapping) создаёт тепловую карту, показывающую, какие участки изображения (пиксели) были наиболее важны для классификации (например, морда собаки, а не фон).
  • Методы на основе правил (rule-based explanations): извлекают из модели набор логических правил вида «ЕСЛИ условие, ТО результат». Примеры: алгоритмы Anchors (строят «якоря» — достаточные условия для предсказания) или извлечение деревьев решений из нейросети.

Применение XAI

Медицина

В диагностике заболеваний (например, рака лёгких по снимкам КТ или диабетической ретинопатии по снимкам глазного дна) XAI позволяет врачу не только получить диагноз, но и увидеть, на какие именно участки изображения опиралась модель. Это помогает врачу верифицировать диагноз, выявить редкие патологии, которые модель могла пропустить, и избежать неверных решений из-за артефактов на снимке.

Финансы

В банковской сфере XAI используется для объяснения причин отказа в кредите или установления лимита. Это необходимо как для соблюдения нормативных требований (например, закона о кредитных историях), так и для повышения доверия клиентов. Кроме того, XAI помогает выявлять дискриминационные практики (например, отказ по признаку пола или расы, если модель неявно их выучила).

Автономные системы

В беспилотных автомобилях XAI может объяснить, почему система приняла решение затормозить или повернуть. Например, «торможение вызвано пешеходом на правой стороне дороги в 10 метрах». Это критически важно для расследования аварий и для сертификации таких систем.

Юриспруденция и право

Системы прогнозирования рецидивов преступлений (например, COMPAS в США) подвергались критике за предвзятость. XAI позволяет проанализировать, какие факторы (возраст, предыдущие судимости, социально-экономический статус) влияют на прогноз, и выявить возможные системные ошибки.

Вызовы и критика

Несмотря на активное развитие, XAI сталкивается с рядом серьёзных проблем.

  • Надёжность объяснений: многие методы (особенно LIME) дают нестабильные объяснения — незначительное изменение входных данных может привести к совершенно другому объяснению. Это подрывает доверие к самому объяснению.
  • Понятность для человека: объяснения, основанные на математических концепциях (например, градиенты или значения Шепли), могут быть трудны для понимания неспециалистами. Существует разрыв между «технической объяснимостью» и «человеческой понятностью».
  • Объяснения для сложных моделей: для очень глубоких нейросетей (трансформеры, генеративные модели) построение точных и полных объяснений остаётся крайне сложной задачей. Часто объяснения являются лишь приблизительными.
  • Атаки на объяснения: злоумышленники могут обмануть не только модель, но и механизм объяснения, создавая ложные, вводящие в заблуждение обоснования. Это открывает новые векторы для манипуляций.
  • Отсутствие стандартов: на данный момент не существует единого общепризнанного стандарта качества объяснений. Разные методы могут давать противоречивые результаты для одной и той же модели.

Текущее состояние и перспективы

XAI продолжает оставаться одной из самых активно развивающихся областей машинного обучения. Исследования ведутся в направлении создания более стабильных, точных и человеко-ориентированных методов. Разрабатываются подходы, интегрирующие объяснения непосредственно в процесс обучения (contrastive explanations, counterfactual explanations). Внедрение XAI в промышленные системы становится обязательным требованием в регулируемых отраслях, особенно в Европейском союзе (в рамках AI Act). Ожидается, что в будущем объяснимость станет неотъемлемым свойством большинства ответственных систем ИИ, наряду с точностью и безопасностью.

Источники

  1. DARPA. Explainable Artificial Intelligence (XAI) Program. 2016.
  2. Ribeiro, M. T., Singh, S., & Guestrin, C. (2016). "Why Should I Trust You?": Explaining the Predictions of Any Classifier. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining.
  3. Lundberg, S. M., & Lee, S. I. (2017). A Unified Approach to Interpreting Model Predictions. Advances in Neural Information Processing Systems.
  4. Selvaraju, R. R., et al. (2017). Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization. IEEE International Conference on Computer Vision (ICCV).
  5. Arrieta, A. B., et al. (2020). Explainable Artificial Intelligence (XAI): Concepts, taxonomies, opportunities and challenges toward responsible AI. Information Fusion, 58, 82-115.
  6. Goodman, B., & Flaxman, S. (2017). European Union regulations on algorithmic decision-making and a "right to explanation". AI Magazine, 38(3), 50-57.
  7. Wachter, S., Mittelstadt, B., & Russell, C. (2017). Counterfactual Explanations without Opening the Black Box: Automated Decisions and the GDPR. Harvard Journal of Law & Technology, 31(2).

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →