Quando è emerso COVID-19, grazie a decenni di ricerca sui coronavirus gli scienziati conoscevano le proteine fondamentali del virus ed erano in grado di progettare vaccini in tempi record. Questo vantaggio potrebbe non essere disponibile nelle future pandemie.
Per rafforzare questa preparazione, NVIDIA ha collaborato con organizzazioni di ricerca globali, tra cui Google DeepMind e l’European Molecular Biology Laboratory’s European Bioinformatics Institute (EMBL-EBI), rendendo disponibili al pubblico, attraverso AlphaFold Database, le strutture 3D stimate dei complessi proteici di oltre 2,800 virus. Le strutture sono state create utilizzando il modello AlphaFold2 di Google DeepMind, che predice il ripiegamento delle proteine, e NVIDIA BioNeMo Inference Runtime. Il sistema ha stimato su vasta scala i gruppi di proteine interagenti presenti in migliaia di proteomi virali.
NVIDIA ha inoltre pubblicato la BioNeMo Structure Prediction Pipeline, accelerata da GPU, che consente ai ricercatori di passare dalla sequenza proteica alla struttura 3D stimata. Circa il 30% delle interazioni proteiche aggiunte al database è completamente nuovo per la scienza; queste strutture non erano state precedentemente documentate nella Protein Data Bank.
Secondo un’analisi del Center for Global Development, la probabilità che il mondo affronti entro il 2050 una pandemia grave quanto COVID-19 è di circa il 50%. I partner del progetto mirano ad accumulare in anticipo conoscenze sui virus che potrebbero emergere in futuro e sui quali non sarebbe disponibile il patrimonio di conoscenze attuale.
I complessi proteici possono essere bersagli di vaccini e farmaci. Mentre la determinazione tradizionale della struttura può richiedere anni, AlphaFold2 è in grado di effettuare previsioni in pochi minuti sulle GPU NVIDIA.
Perché è importante
Questa risorsa mira a consentire ai ricercatori, durante un’epidemia, di fare riferimento a una mappa proteica già realizzata invece di partire da zero. In particolare, per i team che sviluppano vaccini e farmaci, la visualizzazione congiunta dei gruppi di proteine interagenti offre una base di partenza che può accelerare la valutazione dei possibili bersagli. Il fatto che circa un terzo delle strutture sia costituito da informazioni non presenti nella Protein Data Bank dimostra che lo studio non si limita a raccogliere i dati esistenti, ma apre anche nuovi ambiti di analisi nell’agenda della ricerca. La pubblicazione aperta del flusso di lavoro consente inoltre a diversi ricercatori di passare dalle sequenze proteiche alle strutture previste, evitando di vincolare l’utilizzo della risorsa a una singola istituzione; resta tuttavia aperta la questione di quali di queste previsioni saranno validate come bersagli di vaccini o farmaci.