KEGG
KEGG (от англ. Kyoto Encyclopedia of Genes and Genomes — Киотская энциклопедия генов и геномов) — это база данных и интегрированный набор биоинформатических ресурсов, предназначенных для систематизации и анализа геномной, химической и функциональной информации о биологических системах. KEGG представляет собой одну из наиболее авторитетных и широко используемых в мире биоинформатических платформ, позволяющую связывать гены и белки с их метаболическими, сигнальными и регуляторными функциями на уровне клетки, организма и экосистемы. Проект был запущен в 1995 году под руководством профессора Минору Канэхисы (Minoru Kanehisa) в Институте химических исследований Киотского университета (Япония).
История
Разработка KEGG началась в 1995 году в рамках японского проекта «Human Genome Program» (Программа «Геном человека»). Первоначально база данных была ориентирована на сбор и аннотацию геномов человека и модельных организмов. Однако уже к 1999 году стало очевидно, что для понимания функций генов необходимо не только их секвенирование, но и картирование на метаболические и регуляторные сети. В результате в 2000 году была запущена база данных KEGG PATHWAY, содержащая графические карты метаболических путей.
Ключевым нововведением, отличающим KEGG от других баз данных (например, GenBank или UniProt), стала концепция «функциональной аннотации» — присвоение генам и белкам идентификаторов (KO — KEGG Orthology), которые однозначно соответствуют определённым функциям в биологических процессах. Это позволило сравнивать функциональные возможности геномов разных организмов, даже если их последовательности сильно различаются.
С 2011 года KEGG стал коммерческим продуктом для академических и коммерческих пользователей, хотя базовый доступ к данным остаётся частично бесплатным. По состоянию на 2024 год KEGG включает десятки тысяч записей о генах, белках, химических соединениях и реакциях, а также сотни тысяч ссылок на научные публикации.
Структура и основные компоненты
KEGG состоит из нескольких взаимосвязанных баз данных, которые делятся на три основные категории: молекулярные, системные и химические.
Системные базы данных (Systems Information)
- KEGG PATHWAY — коллекция графических карт метаболических, сигнальных и регуляторных путей. Каждая карта представляет собой схему взаимодействий между молекулами (генами, белками, метаболитами), сгруппированных по функциональному признаку. Примеры: «Гликолиз / Глюконеогенез», «Цикл Кребса», «Сигнальный путь p53».
- KEGG MODULE — набор функциональных единиц (модулей), которые являются подмножествами путей. Модули описывают конкретные биохимические реакции или комплексы, например, «Дыхательная цепь» или «Биосинтез лизина».
- KEGG BRITE — иерархическая система классификации биологических объектов (генов, белков, химических соединений, болезней, лекарств). BRITE позволяет группировать объекты по функциональным категориям, таким как «Ферменты», «Транспортёры», «Факторы транскрипции».
Молекулярные базы данных (Genomic Information)
- KEGG GENES — коллекция генов и белков из полностью секвенированных геномов. Каждая запись содержит информацию о последовательности, аннотацию, а также ссылки на KO (ортологию) и пути.
- KEGG ORTHOLOGY (KO) — система функциональной ортологии. Гены из разных организмов, выполняющие одинаковую функцию, объединяются в один KO-кластер. Это позволяет переносить функциональные знания между организмами.
- KEGG GENOME — информация о геномах организмов, включая таксономию, размер генома, количество генов и KO-присвоения.
Химические базы данных (Chemical Information)
- KEGG COMPOUND — записи о химических соединениях (метаболитах, кофакторах, лекарствах). Каждая запись содержит структуру, молекулярную формулу, массу и ссылки на реакции.
- KEGG GLYCAN — база данных гликанов (углеводных цепей), участвующих в клеточной сигнализации и структуре.
- KEGG REACTION — записи о биохимических реакциях, включая стехиометрию, ферменты и условия.
- KEGG ENZYME — аннотированные записи о ферментах, основанные на классификации EC (Enzyme Commission).
- KEGG DRUG — информация о лекарственных препаратах, включая их мишени, механизмы действия и метаболизм.
- KEGG DISEASE — записи о заболеваниях человека, связанных с генетическими нарушениями, инфекциями или метаболическими расстройствами.
Принцип ортологии (KO)
Центральным элементом KEGG является система KEGG Orthology (KO). Она решает проблему функциональной аннотации генов, когда один и тот же белок в разных организмах может иметь разные названия, но выполнять одну и ту же функцию. KO-идентификаторы (например, K00844 — гексокиназа) присваиваются на основе экспериментальных данных и гомологии. Это позволяет:
- Сравнивать функциональный состав геномов разных видов.
- Реконструировать метаболические пути для несеквенированных организмов на основе их геномов.
- Предсказывать функции новых генов.
Применение в науке и медицине
KEGG широко используется в биоинформатике, молекулярной биологии, геномике, фармакологии и медицине. Основные области применения:
- Метаболомика и метаболическая инженерия: анализ метаболических путей для оптимизации биотехнологических процессов (например, синтез аминокислот или антибиотиков).
- Функциональная аннотация геномов: после секвенирования нового генома исследователи используют KEGG для присвоения функций генам и построения метаболических карт.
- Изучение заболеваний: база KEGG DISEASE содержит информацию о генетических и молекулярных механизмах болезней, что используется для поиска мишеней лекарств.
- Фармакогеномика и персонализированная медицина: анализ путей метаболизма лекарств позволяет предсказывать индивидуальную реакцию на препараты.
- Экологическая и эволюционная геномика: сравнение KO-профилей разных организмов помогает изучать эволюцию метаболических систем и адаптацию к среде.
Доступ и лицензирование
KEGG является коммерческим продуктом, поддерживаемым Киотским университетом и компанией Kanehisa Laboratories. Бесплатный доступ предоставляется только для некоммерческого академического использования (с ограничением на количество запросов). Для коммерческого использования требуется приобретение лицензии. Часть данных (например, KEGG PATHWAY и KEGG COMPOUND) доступна в открытом доступе, но с ограничениями на автоматическую загрузку.
Критика и ограничения
Несмотря на широкое признание, KEGG имеет ряд недостатков:
- Коммерциализация: с 2011 года доступ к полному набору данных для автоматического анализа стал платным, что ограничивает возможности небольших лабораторий и исследователей из развивающихся стран.
- Неполнота данных: некоторые метаболические пути и организмы аннотированы не полностью, особенно для редких или малоизученных видов.
- Зависимость от ручной курации: обновления базы данных происходят вручную, что может приводить к задержкам в добавлении новых данных.
- Отсутствие интеграции с некоторыми другими базами: несмотря на обширные ссылки, KEGG не всегда полностью синхронизирован с такими ресурсами, как Reactome или MetaCyc.
Интересные факты
- Название «KEGG» (Киотская энциклопедия генов и геномов) было выбрано в честь города Киото, где находится университет-разработчик.
- KEGG является одной из первых баз данных, которая начала использовать графические карты для визуализации метаболических путей.
- Ежегодно база данных обновляется несколько раз, а количество включённых организмов превышает 10 000 (включая бактерии, археи, эукариоты и вирусы).
- KEGG используется в образовательных целях: многие университеты включают работу с KEGG в курсы биоинформатики.
Источники
- Kanehisa, M., & Goto, S. (2000). KEGG: Kyoto Encyclopedia of Genes and Genomes. Nucleic Acids Research, 28(1), 27–30.
- Kanehisa, M., Furumichi, M., Sato, Y., et al. (2023). KEGG: integrating viruses and cellular organisms. Nucleic Acids Research, 51(D1), D587–D592.
- Официальный сайт KEGG: https://www.kegg.jp/
- Руководство пользователя KEGG (KEGG Manual), версия 2023.
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →