Открыть сервис

KEGG

KEGG (от англ. Kyoto Encyclopedia of Genes and Genomes — Киотская энциклопедия генов и геномов) — это база данных и интегрированный набор биоинформатических ресурсов, предназначенных для систематизации и анализа геномной, химической и функциональной информации о биологических системах. KEGG представляет собой одну из наиболее авторитетных и широко используемых в мире биоинформатических платформ, позволяющую связывать гены и белки с их метаболическими, сигнальными и регуляторными функциями на уровне клетки, организма и экосистемы. Проект был запущен в 1995 году под руководством профессора Минору Канэхисы (Minoru Kanehisa) в Институте химических исследований Киотского университета (Япония).

История

Разработка KEGG началась в 1995 году в рамках японского проекта «Human Genome Program» (Программа «Геном человека»). Первоначально база данных была ориентирована на сбор и аннотацию геномов человека и модельных организмов. Однако уже к 1999 году стало очевидно, что для понимания функций генов необходимо не только их секвенирование, но и картирование на метаболические и регуляторные сети. В результате в 2000 году была запущена база данных KEGG PATHWAY, содержащая графические карты метаболических путей.

Ключевым нововведением, отличающим KEGG от других баз данных (например, GenBank или UniProt), стала концепция «функциональной аннотации» — присвоение генам и белкам идентификаторов (KO — KEGG Orthology), которые однозначно соответствуют определённым функциям в биологических процессах. Это позволило сравнивать функциональные возможности геномов разных организмов, даже если их последовательности сильно различаются.

С 2011 года KEGG стал коммерческим продуктом для академических и коммерческих пользователей, хотя базовый доступ к данным остаётся частично бесплатным. По состоянию на 2024 год KEGG включает десятки тысяч записей о генах, белках, химических соединениях и реакциях, а также сотни тысяч ссылок на научные публикации.

Структура и основные компоненты

KEGG состоит из нескольких взаимосвязанных баз данных, которые делятся на три основные категории: молекулярные, системные и химические.

Системные базы данных (Systems Information)

  • KEGG PATHWAY — коллекция графических карт метаболических, сигнальных и регуляторных путей. Каждая карта представляет собой схему взаимодействий между молекулами (генами, белками, метаболитами), сгруппированных по функциональному признаку. Примеры: «Гликолиз / Глюконеогенез», «Цикл Кребса», «Сигнальный путь p53».
  • KEGG MODULE — набор функциональных единиц (модулей), которые являются подмножествами путей. Модули описывают конкретные биохимические реакции или комплексы, например, «Дыхательная цепь» или «Биосинтез лизина».
  • KEGG BRITE — иерархическая система классификации биологических объектов (генов, белков, химических соединений, болезней, лекарств). BRITE позволяет группировать объекты по функциональным категориям, таким как «Ферменты», «Транспортёры», «Факторы транскрипции».

Молекулярные базы данных (Genomic Information)

  • KEGG GENES — коллекция генов и белков из полностью секвенированных геномов. Каждая запись содержит информацию о последовательности, аннотацию, а также ссылки на KO (ортологию) и пути.
  • KEGG ORTHOLOGY (KO) — система функциональной ортологии. Гены из разных организмов, выполняющие одинаковую функцию, объединяются в один KO-кластер. Это позволяет переносить функциональные знания между организмами.
  • KEGG GENOMEинформация о геномах организмов, включая таксономию, размер генома, количество генов и KO-присвоения.

Химические базы данных (Chemical Information)

  • KEGG COMPOUND — записи о химических соединениях (метаболитах, кофакторах, лекарствах). Каждая запись содержит структуру, молекулярную формулу, массу и ссылки на реакции.
  • KEGG GLYCAN — база данных гликанов (углеводных цепей), участвующих в клеточной сигнализации и структуре.
  • KEGG REACTION — записи о биохимических реакциях, включая стехиометрию, ферменты и условия.
  • KEGG ENZYME — аннотированные записи о ферментах, основанные на классификации EC (Enzyme Commission).
  • KEGG DRUG — информация о лекарственных препаратах, включая их мишени, механизмы действия и метаболизм.
  • KEGG DISEASE — записи о заболеваниях человека, связанных с генетическими нарушениями, инфекциями или метаболическими расстройствами.

Принцип ортологии (KO)

Центральным элементом KEGG является система KEGG Orthology (KO). Она решает проблему функциональной аннотации генов, когда один и тот же белок в разных организмах может иметь разные названия, но выполнять одну и ту же функцию. KO-идентификаторы (например, K00844 — гексокиназа) присваиваются на основе экспериментальных данных и гомологии. Это позволяет:

  • Сравнивать функциональный состав геномов разных видов.
  • Реконструировать метаболические пути для несеквенированных организмов на основе их геномов.
  • Предсказывать функции новых генов.

Применение в науке и медицине

KEGG широко используется в биоинформатике, молекулярной биологии, геномике, фармакологии и медицине. Основные области применения:

  • Метаболомика и метаболическая инженерия: анализ метаболических путей для оптимизации биотехнологических процессов (например, синтез аминокислот или антибиотиков).
  • Функциональная аннотация геномов: после секвенирования нового генома исследователи используют KEGG для присвоения функций генам и построения метаболических карт.
  • Изучение заболеваний: база KEGG DISEASE содержит информацию о генетических и молекулярных механизмах болезней, что используется для поиска мишеней лекарств.
  • Фармакогеномика и персонализированная медицина: анализ путей метаболизма лекарств позволяет предсказывать индивидуальную реакцию на препараты.
  • Экологическая и эволюционная геномика: сравнение KO-профилей разных организмов помогает изучать эволюцию метаболических систем и адаптацию к среде.

Доступ и лицензирование

KEGG является коммерческим продуктом, поддерживаемым Киотским университетом и компанией Kanehisa Laboratories. Бесплатный доступ предоставляется только для некоммерческого академического использования (с ограничением на количество запросов). Для коммерческого использования требуется приобретение лицензии. Часть данных (например, KEGG PATHWAY и KEGG COMPOUND) доступна в открытом доступе, но с ограничениями на автоматическую загрузку.

Критика и ограничения

Несмотря на широкое признание, KEGG имеет ряд недостатков:

  • Коммерциализация: с 2011 года доступ к полному набору данных для автоматического анализа стал платным, что ограничивает возможности небольших лабораторий и исследователей из развивающихся стран.
  • Неполнота данных: некоторые метаболические пути и организмы аннотированы не полностью, особенно для редких или малоизученных видов.
  • Зависимость от ручной курации: обновления базы данных происходят вручную, что может приводить к задержкам в добавлении новых данных.
  • Отсутствие интеграции с некоторыми другими базами: несмотря на обширные ссылки, KEGG не всегда полностью синхронизирован с такими ресурсами, как Reactome или MetaCyc.

Интересные факты

  • Название «KEGG» (Киотская энциклопедия генов и геномов) было выбрано в честь города Киото, где находится университет-разработчик.
  • KEGG является одной из первых баз данных, которая начала использовать графические карты для визуализации метаболических путей.
  • Ежегодно база данных обновляется несколько раз, а количество включённых организмов превышает 10 000 (включая бактерии, археи, эукариоты и вирусы).
  • KEGG используется в образовательных целях: многие университеты включают работу с KEGG в курсы биоинформатики.

Источники

  • Kanehisa, M., & Goto, S. (2000). KEGG: Kyoto Encyclopedia of Genes and Genomes. Nucleic Acids Research, 28(1), 27–30.
  • Kanehisa, M., Furumichi, M., Sato, Y., et al. (2023). KEGG: integrating viruses and cellular organisms. Nucleic Acids Research, 51(D1), D587–D592.
  • Официальный сайт KEGG: https://www.kegg.jp/
  • Руководство пользователя KEGG (KEGG Manual), версия 2023.

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →