Открыть сервис

Protein Data Bank

Protein Data Bank (PDB, Банк данных белков) — это международная общедоступная база данных трёхмерных структур биологических макромолекул, таких как белки, нуклеиновые кислоты и их комплексы. PDB является крупнейшим и наиболее авторитетным репозиторием экспериментально полученных структур, используемым в биоинформатике, структурной биологии, фармакологии и молекулярной медицине. Данные в PDB представлены в виде координат атомов, полученных методами рентгеновской кристаллографии, ядерного магнитного резонанса (ЯМР) и криоэлектронной микроскопии.

История

Предпосылки создания

Необходимость в централизованном хранилище структурных данных возникла в 1960-х годах, когда с развитием рентгеновской кристаллографии начали появляться первые трёхмерные модели белков. В 1958 году была определена структура миоглобина кашалота, а в 1960 году — гемоглобина. Однако опубликованные координаты атомов были разрозненны и труднодоступны.

Основание

Protein Data Bank был основан в 1971 году в Брукхейвенской национальной лаборатории (США) под руководством Уолтера Хэмилтона. Изначально база содержала всего 7 структур, включая гемоглобин, миоглобин и лизоцим. В 1973 году был опубликован первый выпуск PDB на магнитной ленте.

Развитие и управление

В 1998 году управление PDB перешло к консорциуму Research Collaboratory for Structural Bioinformatics (RCSB), который базируется в Ратгерском университете и Калифорнийском университете в Сан-Диего. В 2003 году была создана Всемирная организация PDB (wwPDB), объединяющая региональные центры:

К 2024 году PDB содержал более 220 000 структур, из которых около 90% получены методом рентгеновской кристаллографии, 8% — криоэлектронной микроскопией и 2% — ЯМР.

Структура и формат данных

Формат файлов

Основной формат хранения — PDB (текстовый, с фиксированной длиной полей), а также более современный mmCIF (макромолекулярный кристаллографический информационный файл). С 2020 года wwPDB рекомендует использовать mmCIF как основной формат из-за его гибкости и поддержки больших структур.

Содержание записи

Каждая запись PDB включает:

  • Координаты атомов (x, y, z) в ангстремах
  • Тип атома и аминокислоты/нуклеотида
  • Информацию о кристаллографической симметрии
  • Экспериментальные условия (температура, pH)
  • Ссылки на литературу
  • Аннотации (функциональные домены, сайты связывания)

Идентификаторы

Каждая структура имеет уникальный 4-символьный код (например, 1BNA — ДНК-дуплекс). Коды присваиваются автоматически и не несут смысловой нагрузки.

Применение

Биоинформатика и структурная биология

PDB служит основой для:

  • Сравнительного моделирования белков (гомологичное моделирование)
  • Предсказания структуры белков на основе последовательности (например, AlphaFold)
  • Анализа взаимодействий белок-лиганд для разработки лекарств
  • Изучения эволюционных связей через структурное сходство

Фармакология и медицина

Данные PDB активно используются в рациональном дизайне лекарств. Например, структуры вирусных белков (протеаза ВИЧ, спайк-белок SARS-CoV-2) позволили разработать ингибиторы и вакцины. В 2020 году, в период пандемии COVID-19, PDB опубликовал более 2000 структур, связанных с коронавирусом.

Образование

PDB используется в учебных курсах по биохимии, молекулярной биологии и биоинформатике. Виртуальные лаборатории и 3D-модели позволяют студентам визуализировать сложные молекулярные структуры.

Критика и ограничения

Качество данных

Не все структуры в PDB имеют одинаковое разрешение. Низкое разрешение (более 3,5 Å) может приводить к неточностям в расположении боковых цепей и водородных связей. Кроме того, кристаллографические структуры могут не отражать физиологическое состояние белка в растворе.

Предвзятость выборки

PDB содержит преимущественно структуры легко кристаллизуемых белков, таких как растворимые глобулярные белки. Мембранные белки, неупорядоченные участки и большие макромолекулярные комплексы представлены в меньшей степени.

Проблемы с аннотацией

Автоматическая аннотация может содержать ошибки, особенно в определении лигандов и ионов. Человеческая экспертиза требуется для валидации данных.

Интересные факты

  • Самая первая структура в PDB (код 1MBO) — миоглобин кашалота, определённая Джоном Кендрю в 1958 году.
  • Самая большая структура в PDB (на 2024 год) — рибосома человека (код 6QZP), содержащая более 200 000 атомов.
  • В 2017 году wwPDB внедрила систему OneDep — единую платформу для депонирования данных во все региональные центры.
  • PDB является одним из самых цитируемых научных ресурсов: ежегодно на него ссылаются более 10 000 научных статей.

Источники

  • Berman, H. M., et al. (2000). The Protein Data Bank. Nucleic Acids Research, 28(1), 235–242.
  • wwPDB Consortium (2019). Protein Data Bank: the single global archive for 3D macromolecular structure data. Nucleic Acids Research, 47(D1), D520–D528.
  • Burley, S. K., et al. (2023). RCSB Protein Data Bank: improved tools for exploring biomolecular structures. Nucleic Acids Research, 51(D1), D488–D496.
  • Официальный сайт RCSB PDB (rcsb.org)
  • Официальный сайт wwPDB (wwpdb.org)

BFOmetr — база данных и аналитика по компаниям России.

На главную BFOmetr →