研究人员开发了名为 MotifAE 的无监督框架,该框架基于稀疏自编码器架构,旨在使蛋白质语言模型“黑箱”结构中的序列模式变得可解释。加入平滑损失后,与标准方法相比,已知功能基序的识别效果得到了显著提升。
MotifAE 不仅识别出了短基序,还识别出了一些结构域;特征激活与残基在结构域功能中的重要程度相关。通过与实验数据进行匹配,研究人员得以预测与结构域折叠稳定性相关的特征,以及特异于稳定性的适应度景观。
为何重要
这项研究不仅将蛋白质语言模型生成的模式视为预测结果,还将其与蛋白质中的功能和结构要素联系起来,从而提供了研究这些模式的可能性。这使得研究模型特征与特定残基重要程度之间的联系成为可能,也能更直接地评估模型输出的生物学意义。该方法除了能够识别短基序,还能区分结构域,这表明其可解释性并不局限于单个序列片段。与实验数据建立的匹配关系则表明,研究人员尤其可以借助模型分析与折叠稳定性相关的特征及其适应度景观。不过,该研究提出的框架能否在不同蛋白质背景下提供同等程度的解释力,仍是一个有待明确回答的研究问题。