Когда появился COVID-19, благодаря десятилетиям исследований коронавирусов ученые знали основные белки вируса и могли разрабатывать вакцины в рекордно короткие сроки. В будущих пандемиях такого преимущества может не быть.
Чтобы усилить эту подготовку, NVIDIA в сотрудничестве с глобальными исследовательскими организациями, включая Google DeepMind и European Molecular Biology Laboratory’s European Bioinformatics Institute (EMBL-EBI), открыла доступ через AlphaFold Database к прогнозируемым 3D-структурам белковых комплексов более 2 800 вирусов. Структуры были созданы с использованием модели AlphaFold2 компании Google DeepMind, прогнозирующей укладку белков, и NVIDIA BioNeMo Inference Runtime. Система в масштабном режиме спрогнозировала группы взаимодействующих белков в тысячах вирусных протеомов.
NVIDIA также выпустила GPU-ускоряемый BioNeMo Structure Prediction Pipeline, позволяющий исследователям переходить от белковой последовательности к прогнозируемой 3D-структуре. Около 30% добавленных в базу данных белковых взаимодействий являются полностью новыми для науки; ранее эти структуры не были задокументированы в Protein Data Bank.
Согласно анализу Center for Global Development, вероятность того, что до 2050 года мир столкнется с пандемией, столь же тяжелой, как COVID-19, составляет примерно 50%. Партнеры проекта стремятся заранее накопить знания о вирусах, которые могут появиться в будущем и о которых не будет существующего объема знаний.
Белковые комплексы могут быть мишенями для вакцин и лекарств. Если традиционное определение структуры может занимать годы, AlphaFold2 способен выполнять прогнозирование на NVIDIA GPU за считаные минуты.
Почему это важно
Этот ресурс призван дать исследователям возможность во время эпидемии обращаться к заранее созданной карте белков, а не начинать с нуля. Особенно для команд, занимающихся разработкой вакцин и лекарств, совместное представление взаимодействующих групп белков создает основу, которая может ускорить оценку потенциальных мишеней. То, что примерно треть структур состоит из данных, отсутствующих в Protein Data Bank, показывает: работа не только систематизирует имеющиеся данные, но и открывает новые направления для исследований. Открытая публикация рабочего процесса позволяет различным исследователям переходить от белковых последовательностей к прогнозируемым структурам, благодаря чему использование ресурса не зависит от одной организации; при этом остается открытым вопрос о том, какие из этих прогнозов будут подтверждены в качестве мишеней для вакцин или лекарств.