Google开发的名为 AlphaGenome 的人工智能系统,旨在评估人类基因组中不编码蛋白质的 DNA 可能具备的功能,并预测单个碱基变化的影响。编码蛋白质的部分占人类基因组的比例不到 3%。其余部分包括有助于染色体在细胞之间均等分配的着丝粒、保护染色体末端的结构、调控基因活性和信使 RNA 加工的序列,以及控制 DNA 在细胞内包装的区域。然而,人们认为,大部分不编码蛋白质的 DNA 由古老病毒感染、分子寄生物以及因突变而失活的基因残余组成。
区分具有功能的区域十分困难;因为与 DNA 结合的蛋白质并不严格依附于特定序列,不同细胞类型中存在不同的蛋白质,而且有时重要的并不是单个结合位点,而是狭窄区域内多个位点共同存在。AlphaGenome 分析基因表达、转录、染色质可及性、组蛋白修饰、转录因子结合和 RNA 剪接等过程。目前,该系统仅使用人类和小鼠序列,以及数量有限但经过全面研究的细胞类型进行训练。尽管如此,它仍能为基因非编码区域中的变化的重要性及其可能原因提供线索;其预测结果通常与专业工具相当,或表现更好。
Google 利用该系统评估了人类基因组中所有可能的单碱基变化。研究计算了将参考序列中的每个碱基替换为另外3种碱基后可能产生的影响。然而,大多数人的基因组与这一参考序列存在数百万个碱基的差异,还可能携带插入、缺失、重复或倒位序列;由于大多数变化位于无功能区域,因此不会产生影响。这项研究可以让研究人员提前分析可能的突变,并针对特定影响对基因组进行筛查。不过,其中一部分信息也可以通过查看用于训练模型的 ENCODE 数据获得。该系统能否在尼安德特人、丹尼索瓦人基因组或缺乏相关数据的细胞类型中进行可靠分析,目前仍不清楚。
为何重要
这项研究表明,在基因组研究中,不能仅将不产生蛋白质的区域视为无功能残余,还可以系统地筛查其可能与基因活性和 RNA 加工等过程相关的影响。这样一来,研究人员就能在开展实验研究之前,缩小此前难以确定优先级的单碱基差异范围,并获得有关其可能影响的初步线索。不过,模型生成的结果并不意味着 DNA 中的每一处变化都会产生生物学后果;人类与参考序列之间的差异以及结构变化,使评估过程变得更加复杂。尚未解决的核心问题是,这一使用有限细胞类型进行训练的系统,在缺乏数据的细胞中,以及在尼安德特人与丹尼索瓦人的基因组中,能够在多大程度上给出可靠结果。
背景
Google 并不是 FikirPilot 档案中的新面孔:过去90天内,我们发布了31篇提及这一名称的新闻;最新一篇发表于2026年9月9日。