El consorcio formado por compañías farmacéuticas entrenó OpenFold3 con más de 20.000 estructuras proteicas de los archivos de las compañías. El nuevo modelo mostró un mejor rendimiento que los modelos entrenados únicamente con datos públicos o con los datos de una sola compañía. El estudio, que no fue sometido a revisión por pares, se anunció mediante una entrada de blog; el modelo no se hizo público.
Por qué es importante
Los resultados indican que, en el modelado de estructuras proteicas, los datos privados que pueden compartirse entre compañías podrían influir en las comparaciones de rendimiento tanto como la amplitud del conjunto de datos. Esto plantea la cuestión de cómo los archivos institucionales inaccesibles para los investigadores que trabajan con datos públicos modifican las condiciones de competencia. Para las compañías farmacéuticas, en cambio, cobra importancia determinar si los datos utilizados conjuntamente proporcionan resultados diferentes de los obtenidos en estudios basados en los recursos de una sola organización. Sin embargo, dado que el estudio aún no ha sido revisado por pares y el modelo no se ha puesto a disposición del público, por ahora no es posible validar los hallazgos de forma independiente, evaluar el método en detalle ni ponerlo a prueba con otros equipos. Ambas circunstancias dejan abierta la posibilidad de que la diferencia de rendimiento se deba a la combinación de datos o a otras características del modelo.