Protein Data Bank
Protein Data Bank (PDB, Банк данных белков) — это международная общедоступная база данных трёхмерных структур биологических макромолекул, таких как белки, нуклеиновые кислоты и их комплексы. PDB является крупнейшим и наиболее авторитетным репозиторием экспериментально полученных структур, используемым в биоинформатике, структурной биологии, фармакологии и молекулярной медицине. Данные в PDB представлены в виде координат атомов, полученных методами рентгеновской кристаллографии, ядерного магнитного резонанса (ЯМР) и криоэлектронной микроскопии.
История
Предпосылки создания
Необходимость в централизованном хранилище структурных данных возникла в 1960-х годах, когда с развитием рентгеновской кристаллографии начали появляться первые трёхмерные модели белков. В 1958 году была определена структура миоглобина кашалота, а в 1960 году — гемоглобина. Однако опубликованные координаты атомов были разрозненны и труднодоступны.
Основание
Protein Data Bank был основан в 1971 году в Брукхейвенской национальной лаборатории (США) под руководством Уолтера Хэмилтона. Изначально база содержала всего 7 структур, включая гемоглобин, миоглобин и лизоцим. В 1973 году был опубликован первый выпуск PDB на магнитной ленте.
Развитие и управление
В 1998 году управление PDB перешло к консорциуму Research Collaboratory for Structural Bioinformatics (RCSB), который базируется в Ратгерском университете и Калифорнийском университете в Сан-Диего. В 2003 году была создана Всемирная организация PDB (wwPDB), объединяющая региональные центры:
- RCSB PDB (США)
- PDBe (Европа, Кембридж)
- PDBj (Япония, Осака)
- BMRB (биохимическая ЯМР-спектроскопия, США)
К 2024 году PDB содержал более 220 000 структур, из которых около 90% получены методом рентгеновской кристаллографии, 8% — криоэлектронной микроскопией и 2% — ЯМР.
Структура и формат данных
Формат файлов
Основной формат хранения — PDB (текстовый, с фиксированной длиной полей), а также более современный mmCIF (макромолекулярный кристаллографический информационный файл). С 2020 года wwPDB рекомендует использовать mmCIF как основной формат из-за его гибкости и поддержки больших структур.
Содержание записи
Каждая запись PDB включает:
- Координаты атомов (x, y, z) в ангстремах
- Тип атома и аминокислоты/нуклеотида
- Информацию о кристаллографической симметрии
- Экспериментальные условия (температура, pH)
- Ссылки на литературу
- Аннотации (функциональные домены, сайты связывания)
Идентификаторы
Каждая структура имеет уникальный 4-символьный код (например, 1BNA — ДНК-дуплекс). Коды присваиваются автоматически и не несут смысловой нагрузки.
Применение
Биоинформатика и структурная биология
PDB служит основой для:
- Сравнительного моделирования белков (гомологичное моделирование)
- Предсказания структуры белков на основе последовательности (например, AlphaFold)
- Анализа взаимодействий белок-лиганд для разработки лекарств
- Изучения эволюционных связей через структурное сходство
Фармакология и медицина
Данные PDB активно используются в рациональном дизайне лекарств. Например, структуры вирусных белков (протеаза ВИЧ, спайк-белок SARS-CoV-2) позволили разработать ингибиторы и вакцины. В 2020 году, в период пандемии COVID-19, PDB опубликовал более 2000 структур, связанных с коронавирусом.
Образование
PDB используется в учебных курсах по биохимии, молекулярной биологии и биоинформатике. Виртуальные лаборатории и 3D-модели позволяют студентам визуализировать сложные молекулярные структуры.
Критика и ограничения
Качество данных
Не все структуры в PDB имеют одинаковое разрешение. Низкое разрешение (более 3,5 Å) может приводить к неточностям в расположении боковых цепей и водородных связей. Кроме того, кристаллографические структуры могут не отражать физиологическое состояние белка в растворе.
Предвзятость выборки
PDB содержит преимущественно структуры легко кристаллизуемых белков, таких как растворимые глобулярные белки. Мембранные белки, неупорядоченные участки и большие макромолекулярные комплексы представлены в меньшей степени.
Проблемы с аннотацией
Автоматическая аннотация может содержать ошибки, особенно в определении лигандов и ионов. Человеческая экспертиза требуется для валидации данных.
Интересные факты
- Самая первая структура в PDB (код 1MBO) — миоглобин кашалота, определённая Джоном Кендрю в 1958 году.
- Самая большая структура в PDB (на 2024 год) — рибосома человека (код 6QZP), содержащая более 200 000 атомов.
- В 2017 году wwPDB внедрила систему OneDep — единую платформу для депонирования данных во все региональные центры.
- PDB является одним из самых цитируемых научных ресурсов: ежегодно на него ссылаются более 10 000 научных статей.
Источники
- Berman, H. M., et al. (2000). The Protein Data Bank. Nucleic Acids Research, 28(1), 235–242.
- wwPDB Consortium (2019). Protein Data Bank: the single global archive for 3D macromolecular structure data. Nucleic Acids Research, 47(D1), D520–D528.
- Burley, S. K., et al. (2023). RCSB Protein Data Bank: improved tools for exploring biomolecular structures. Nucleic Acids Research, 51(D1), D488–D496.
- Официальный сайт RCSB PDB (rcsb.org)
- Официальный сайт wwPDB (wwpdb.org)
BFOmetr — база данных и аналитика по компаниям России.
На главную BFOmetr →