由制药公司组成的联盟利用公司档案中的20,000多种蛋白质结构训练了OpenFold3。与仅使用公开数据或单家公司数据训练的模型相比,新模型表现更好。这项未经同行评审的研究通过一篇博客文章公布;该模型尚未向公众开放。
为何重要
研究结果表明,在蛋白质结构建模中,除了数据池的规模外,公司之间可以共享的专有数据也可能影响性能比较。这一情况引发了这样的问题:对于使用公开数据开展研究的研究人员而言,无法获取的机构档案会如何改变竞争条件。对于制药公司来说,共同使用的数据能否带来不同于基于单一机构资源开展的研究结果,也变得十分重要。不过,由于该研究尚未接受同行评审,模型也尚未开放使用,目前还无法独立验证这些发现、对方法进行详细评估或由其他团队加以检验。这两种情况都使得性能差异究竟源于数据合并,还是源于模型的其他特征,暂时无法确定。