![]()
人体由数以万亿计的细胞组成。尽管心肌细胞、神经元和免疫细胞功能迥异,它们拥有的 DNA 序列却几乎相同。真正决定细胞差异的,是 哪些基因在何时、何地被激活 ,而增强子( enhancer )正是控制这一过程的重要 DNA 调控元件。
近日,维也纳分子病理研究所( IMP )Alexander Stark实验室联合美国加州大学欧文分校Evgeny Kvon实验室,在Nature Genetics发表研究Predictive design of tissue-specific mammalian enhancers that function in vivo in the mouse embryo。研究团队利用人工智能学习哺乳动物基因调控规律,并从头设计组织特异性增强子。研究人员最终选择15条合成增强子在小鼠胚胎中进行验证,15条均能在预期目标组织——心脏、肢体和中央神经系统——驱动基因表达。这些序列并非天然增强子的简单修改或拼接,而是由模型根据学习到的调控规则设计产生。该研究首次证明,可以从头设计出在哺乳动物体内发挥组织特异性功能的增强子,推动基因调控研究从 “ 读取 ”DNA 中的调控信息 走向 “ 编写 ” 新的基因调控指令 。
![]()
哺乳动物增强子设计的一大限制,是经过 体内功能验证的组织特异性增强子数据十分有限 ,单一组织通常仅有数百个可靠样本,难以直接训练序列模型。为此,研究团队采用了两阶段迁移学习策略。首先,利用小鼠胚胎不同组织的大规模全基因组 染色质可及性数据 预训练模型,使其学习组织特异性调控 DNA 的序列特征;随后利用 VISTA Enhancer Browser【1】中经过小鼠胚胎体内验证的增强子数据进行微调,使模型进一步学习 组织特异性增强子活性 。这种策略利用大规模功能基因组数据进行预训练,再借助数量有限但功能注释更直接的体内增强子数据完成任务迁移,最终建立了针对小鼠胚胎 心脏、肢体和中央神经系统 的组织特异性增强子活性预测模型。
为了分析模型进行预测时所依赖的序列特征,研究团队进一步进行了模型解释和 motif 分析 。 结果显示,模型能够识别多类与相应组织发育相关的转录因子结合基序。例如,心脏模型中富集了与心脏发育密切相关的 GATA 、 MEF2 等转录因子 motif ;肢体和中央神经系统模型中也分别识别到与对应组织调控相关的序列特征 。 除单个 motif 外,模型还捕获到不同 motif 之间的组合和空间组织关系 。 例如,在心脏增强子中可以观察到 GATA–MEF2 相关的组合规则;在其他组织中,也检测到组织特异性的 motif 组合与排列模式 。 这些结果表明,模型所学习的并不仅是单个转录因子结合位点的存在与否,还包括一定程度上的 组合调控和局部 motif grammar 。 因此,该模型不仅可以用于增强子活性预测,也为分析哺乳动物组织特异性顺式调控规则提供了可解释的序列建模框架。
在建立组织特异性增强子预测模型后,研究团队进一步测试这些模型能否用于逆向设计 DNA 序列。设计过程中,研究人员利用模型指导的梯度优化算法 Ledidi【2】对 DNA 序列进行迭代编辑,使候选序列同时满足多个目标,提高目标组织中的预测染色质可及性和预测增强子活性。通过这一多目标优化过程,研究团队分别生成了针对小鼠胚胎 心脏、肢体和 中央神经系统 的合成增强子候选序列。这些序列并非从天然增强子中直接截取或简单拼接,而是通过模型驱动的序列优化产生。因此,这一步实现了从传统的 sequence → function 转向 desired function → sequence 即从 “ 根据 DNA 序列预测功能 ” 进一步走向 “ 根据目标功能反向设计 DNA 序列 ” 。
为了检验模型设计的序列是否能够在真实的哺乳动物发育环境中发挥功能,研究团队对候选增强子进行了小鼠胚胎体内验证。研究中共选择了 15 个合成增强子: 5 个心脏设计, 5 个肢体设计, 5 个 中央神经系统 设计。每个候选序列均与报告基因连接,并在小鼠胚胎中检测其组织特异性的转录调控活性。结果显示: 5 个 heart 中 4 个只在 heart 检测到明显活性; 5 个 CNS 中 4 个表现为 CNS-specific ; limb 设计则除了 limb 外,在 TWIST1 相关的其他 mesenchymal tissues 中也存在较弱活性。 这一结果说明,模型从天然调控序列中学习到的部分规律具有足够的预测性,可以进一步用于生成新的功能性 DNA 序列。相比单纯在计算数据集上评价预测性能,体内实验提供了更严格的检验:设计序列需要在真实胚胎中的细胞状态、转录因子环境和染色质背景下仍然保持预期功能。
![]()
经过体内验证的增强子数据仅覆盖有限的组织和发育阶段,因此该研究进一步测试: 能否利用更容易获得的基因组学数据推断增强子活性,并用于模型训练。 研究团队比较了三类推断策略,包括 启动子远端且非 CTCF 结合的 ATAC-seq peaks 、同时具有 H3K27ac 和 H3K4me1 修饰的 ATAC-seq peaks ,以及组织特异性开放的 ATAC-seq peaks 。结果显示,三类 inferred labels 均能提高对 VISTA 体内增强子活性的预测,其中部分模型的性能接近直接使用 VISTA 实验数据进行迁移学习的模型, 组织特异性 ATAC-seq peaks 表现尤其突出 。基于交叉验证结果,论文估计这类 inferred-label 模型用于小鼠心脏、肢体和中央神经系统增强子设计时, 预测成功率可达到至少约 60% 。
这项工作不仅提供了小鼠胚胎组织的增强子活性预测工具,更在于验证:哺乳动物组织特异性的顺式调控规则能否从实验数据中学习,并进一步用于序列设计。体内实验表明,模型能够学习组织特异性的序列特征和部分 motif 组合规则,并据此生成具有预期功能的全新调控序列。这推动调控基因组学从 理解和预测天然调控元件 进一步走向 根据目标功能设计新的调控元件 。未来,人工增强子有望用于更精准的细胞类型特异性基因表达控制,并为基因治疗和 可编程基因调控 ( programmable gene regulation) 提供新的工具。
与此同时,如何进一步提高增强子设计的空间和细胞类型特异性仍是下一步的重要挑战。研究团队进一步尝试设计前脑和中脑亚区特异性增强子,结果显示, 相比整个组织尺度,更精细的CNS亚区特异性设计明显更加困难,尤其是中脑设计尚未获得明确的体内验证结果 。这提示未来需要更高分辨率的功能基因组数据和模型,以进一步学习复杂组织内部的调控差异,并将增强子预测与设计从组织特异性扩展到组织亚区、细胞类型,甚至不同发育时期的特异性调控。
维也纳分子病理研究所(IMP)Stark课题组博士生陈甚之和前博士后Vincent Loubiere为该论文共同第一作者。维也纳分子病理研究所研究员Alexander Stark为论文通讯作者。
https://www.nature.com/articles/s41588-026-02729-1
制版人: 十一
参考文献
1. Kosicki, M. et al. VISTA Enhancer browser: an updated database of tissue-specific developmental enhancers.Nucleic Acids Res.53,D324–D330 (2025).
2. Schreiber, J. et al. Programmatic design and editing of cisregulatory elements. Preprint atbioRxivhttps://doi.org/10.1101/2025.04.22.650035 (2025).
学术合作组织
(*排名不分先后)
![]()
战略合作伙伴
(*排名不分先后)
推荐直播
转载须知
【非原创文章】本文著作权归文章作者所有,欢迎个人转发分享,未经作者的允许禁止转载,作者拥有所有法定权利,违者必究。
BioArt
Med
Plants
人才招聘
![]()
点击主页推荐活动
关注更多最新活动!
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.