Консорциум, созданный фармацевтическими компаниями, обучил OpenFold3 на более чем 20 000 структурах белков из корпоративных архивов. Новая модель показала более высокую производительность по сравнению с моделями, обученными только на общедоступных данных или данных одной компании. Исследование, не прошедшее рецензирование, было представлено в записи блога; модель не была открыта для общего доступа.
Почему это важно
Результаты указывают на то, что в моделировании структуры белков на сопоставление производительности может влиять не только широта пула данных, но и закрытые данные, которыми компании могут обмениваться между собой. Это поднимает вопрос о том, как недоступные исследователям, работающим с общедоступными данными, корпоративные архивы меняют конкурентные условия. Для фармацевтических компаний приобретает значение и вопрос о том, дают ли совместно используемые данные результаты, отличающиеся от результатов исследований, основанных на ресурсах одной организации. Однако, поскольку исследование ещё не было рассмотрено рецензентами, а модель не была предоставлена для использования, независимая проверка результатов, подробная оценка метода и его испытание другими командами пока невозможны. Оба обстоятельства оставляют открытым вопрос о том, обусловлена ли разница в производительности объединением данных или другими особенностями модели.