![]()
作者 |研究团队
编辑丨ScienceAI
过渡态是化学反应势能面上的一阶鞍点,也是反应过程中能量最高、寿命极短的关键结构。它决定着反应能否发生、反应速率有多快,以及最终生成哪一种产物。准确定位过渡态,是理解反应机理、解释反应选择性和设计高效催化体系的重要基础。
然而,过渡态无法像稳定分子一样直接获得,其计算高度依赖一个接近真实鞍点的三维初始结构。长期以来,这一步通常需要研究人员根据化学直觉手动搭建,并通过大量试错不断调整。对于包含过渡金属、大型配体、自由基或复杂立体构型的反应体系,这一过程尤其困难,也成为制约反应机理自动化研究的关键瓶颈。
针对上述挑战,上海科学智能研究院(下称「上智院」)与重点孵化企业「格物智研」、复旦大学,共同提出了一套面向真实有机反应机理研究、适用于复杂反应体系的自动化过渡态生成框架 UniTS,于近日发表于《Nature Communications》。
![]()
论文标题:Automated transition state generation for mechanistic exploration in organic synthesis
论文链接:http://doi.org/10.1038/s41467-026-77230-8
该框架包括复杂过渡态数据库 UniTS-Lib,以及基于高阶等变扩散模型的过渡态生成模型 UniTS-Gen。作为上智院燧人物质科学系列模型的功能层,模型仅需输入反应前体的 2D 分子图和反应位点,即可直接生成对应的 3D 过渡态初始结构,并适用于包含过渡金属催化在内的多种复杂反应体系。
![]()
图 1 UniTS:过渡态自动化生成的统一框架
上智院物质科学方向主任研究员、格物智研算法高级专家徐丽成,为论文第一作者、共同通讯作者;上智院物质科学智能方向首席科学家、格物智研创始人曹风雷,复旦大学特聘教授、上智院院长及首席科学家漆远,为共同通讯作者。
过渡态生成,为什么仍然高度依赖化学专家?
如果将一个化学反应比作「翻越山峰」,反应物和产物分别位于山峰两侧的低谷,而过渡态就位于二者之间的山顶。只有找到这个能量最高点,计算化学家才能计算反应能垒,进一步判断不同反应路径之间的竞争关系。
但在实际计算中,过渡态搜索并不是从任意结构出发都能成功。研究人员首先需要构建一个足够接近真实过渡态的三维初始结构,再通过密度泛函理论(DFT)等量子化学方法寻找相应的鞍点。
对于结构较简单的反应,这一步尚可借助成键、断键距离等经验完成;但对于过渡金属催化、自由基反应和高立体选择性反应,体系中往往同时存在复杂配位、大型配体、多种构象以及多个可能的反应位点。初始结构中一个看似微小的构象差异,就可能导致计算无法收敛,或者收敛到错误的反应路径。
近年来,扩散生成模型开始被用于自动生成过渡态结构,但已有方法主要集中于元素种类较少、分子尺寸较小的简单反应。如何让模型处理真实有机合成中更加复杂的反应体系,仍然面临两个基础问题:一是缺少覆盖复杂化学空间的高质量过渡态数据;二是现有模型难以从有限数据中学习大型、复杂过渡态的精细三维几何特征。
针对这两个问题,研究团队从数据与模型两方面构建了统一的解决方案(图 1)。
从 300 余篇文献出发,构建复杂过渡态数据库 UniTS-Lib
高质量数据是训练通用过渡态生成模型的基础,但与稳定分子相比,经过严格计算和验证的过渡态数据十分稀缺,而且大量数据分散在化学论文的补充信息中,缺少统一的计算精度和数据格式。
为此,研究团队开发了一套自动化数据构建流程,从 346 篇有机反应机理研究论文的补充信息中提取原子类型和三维坐标,并将其标准化为量子化学计算输入文件(图 1a)。该流程累计生成了超过 10000 个初始计算任务,并进一步在统一的密度泛函理论水平下进行过渡态优化和频率分析。
研究团队还结合分子图匹配,对优化结果进行严格验证,确保最终结构不仅是具有一个虚频的一阶鞍点,而且确实对应目标反应的成键或断键过程,而非简单的构象变化。经过多轮计算与筛选,团队最终获得 4391 个经过一致性优化和验证的高质量过渡态结构,构建了复杂过渡态数据库 UniTS-Lib。
与现有的 Transition1x 和 [3+2] 环加成过渡态数据集相比,UniTS-Lib 更加贴近真实有机合成中的机理研究场景(图 2):
- 涵盖氧化加成、转金属化、环加成等超过 10 类重要反应过程;
- 包含 42 种元素,最高覆盖至金元素;
- 广泛覆盖中性、阳离子、阴离子和自由基过渡态;
- 各类结构的原子数中位数约为 50;
- 最大体系包含 231 个原子,其中 131 个结构超过 150 个原子;
- 包含铁族、铂族等在催化化学中广泛使用的过渡金属。
从最初超过 10000 个候选结构到最终 4391 个有效过渡态的大幅缩减,也从侧面说明:即便以文献报道的合理结构为起点,过渡态优化仍然具有很高的失败率。这进一步凸显了复杂过渡态数据的稀缺性、过渡态优化对初始结构和计算方法的高度敏感性,以及生成高质量初始结构的重要性。
![]()
图 2 UniTS-Lib 数据集与现有过渡态数据集的复杂度对比
UniTS-Gen:从 2D 反应图「生成」3D 过渡态
在 UniTS-Lib 的基础上,研究团队进一步开发了过渡态生成模型 UniTS-Gen,模型架构如图 3 所示。
与部分需要输入反应前后体 3D 结构的方法不同,UniTS-Gen 仅需输入反应前体的 2D 分子图,并指定目标反应位点,就可以从随机坐标出发,通过逐步去噪生成相应的三维过渡态结构。
这种输入方式具有更强的实用性。对于一个尚未被充分研究的新反应,可靠的 3D 后体结构往往难以预先获得;过度依赖固定的 3D 输入,也可能限制模型对不同构象和立体构型的探索。2D 分子图则更容易获得,同时能够保留分子连接关系、原子类型、键类型和反应位点等核心化学信息。
![]()
图 3 UniTS-Gen 架构
为了让模型准确处理复杂过渡态,研究团队设计了高阶 SE (3) 等变图神经网络 HiEGNN,并将其作为扩散模型的去噪核心。所谓「等变」,是指模型对分子进行旋转或平移后,其输出仍然保持相应的物理一致性;而高阶等变表征则能够进一步捕捉复杂分子中更加细致的方向关系与几何耦合。
研究团队还提出拓扑增强标量特征(TASFs)机制,将 2D 分子图中的连接关系、原子属性和反应位点信息持续注入 3D 去噪过程,使生成结构既遵守输入分子图所定义的化学拓扑,又能够保留充分的构象和立体构型自由度。
换言之,UniTS-Gen 并不是简单地复原某一个固定答案,而是能够从同一个 2D 反应图出发,采样多个化学上合理的 3D 过渡态构象,为后续机理研究提供更加全面的候选结构。
面向复杂体系,高阶等变模型显著减少结构坍缩
研究团队在 UniTS-Lib、Transition1x 和 [3+2] 环加成数据集上对 UniTS-Gen 进行了系统评估。
在一个钯催化 C–H 活化反应中,UniTS-Gen 从相同的 2D 分子图出发,生成了具有不同构象的过渡态结构(图 4a)。其中一个生成结构与参考结构的均方根偏差(RMSD)仅为 0.12 Å,且生成结构中的关键 C–H 和 O–H 距离均与参考过渡态高度一致。
研究也发现,单独使用均方根偏差并不足以全面评价复杂过渡态。某些发生严重原子重叠和结构坍缩的结果,可能因为整体空间范围较小,反而得到看似较低的 RMSD(图 4a 最右侧)。为此,团队进一步引入「结构碰撞率」(clash ratio),用于判断生成结构中是否存在不合理的原子间距离。
![]()
图 4 UniTS-Gen 性能分析
在结构和元素组成最复杂的 UniTS-Lib 测试集上,基于 HiEGNN 的 UniTS-Gen 将结构碰撞率控制在 3.9%,而采用常规 EGNN 作为去噪网络时,该数值达到 66.4%。与此同时,HiEGNN 模型的平均均方根偏差也由 1.34 Å 降低至 1.07 Å(图 4b)。这表明,高阶等变表征对于维持大型复杂过渡态的结构完整性具有重要作用。
为了考察模型在未知化学空间中的表现,团队还设计了三类分布外测试,包括训练集中未出现过的元素组合(Formula-OOS)、未出现过的元素(Element-OOS),以及尺寸超过训练集上限的分子(Maximum-OOS)。
在包含 403 个全新元素组合的 Formula-OOS 测试集中,UniTS-Gen 取得了 1.15 Å 的平均均方根偏差,结构碰撞率仅为 1.5%,性能接近随机划分测试集(图 4c)。这说明模型并非简单记忆训练数据,而是能够将学到的三维化学规律迁移到新的反应体系中。
更重要的是,研究团队将模型生成的结构直接用于后续 DFT 过渡态优化。在不进行人工筛选或额外规则修正的情况下,68.7% 的结构成功收敛至一阶鞍点;经进一步确认,其中 41.9% 的结构对应目标反应过渡态,并全部通过内禀反应坐标验证。
为了进一步检验模型处理复杂反应体系的能力,研究团队选取了 Formula-OOS 测试集中的三个代表性案例(图 4d),分别为包含铁卟啉结构的氢原子转移反应、涉及芳香环 π 配位的钌催化 C–H 活化反应,以及含复杂二十面体硼烷结构的 B–H 键活化反应。面对这些元素组成和三维结构高度复杂的体系,UniTS-Gen 不仅准确重建了铁卟啉大环和硼烷簇等精细结构,还合理描述了反应中心的关键成键与断键距离。三个生成结构随后均成功优化至目标过渡态,进一步验证了模型在复杂有机及过渡金属反应体系中的适用性。
从选择性预测到动态效应,模型走向真实机理研究
除了数据集测试,研究团队还将 UniTS-Gen 应用于多个具有代表性的复杂反应机理问题。
在一个路易斯碱稳定的硼自由基选择性活化氟甲烷 C–F 键或 C–H 键的体系中,团队使用相同的反应物分子图,仅通过指定不同的反应位点,分别生成了两条竞争路径的过渡态初始结构。
经过 DFT 优化,模型生成的两类结构均成功收敛至正确过渡态。计算得到 C–H 键活化路径的自由能垒为 36.0 kcal/mol,低于 C–F 键活化路径的 40.5 kcal/mol,成功复现了文献报道的动力学选择性(图 5a)。这表明,UniTS-Gen 可以根据指定反应位点生成路径特异性的过渡态,为比较竞争反应路径提供可靠起点。
![]()
图 5 UniTS-Gen 在反应机理探索中的应用
在一个具有复杂立体化学空间的 [3+2] 偶极环加成反应中,UniTS-Gen 从同一二维分子图出发,成功采样了四种可能的非对映过渡态构型。所有生成结构均顺利优化至目标反应的一阶鞍点,其中能垒最低的构型与文献报道的主要立体异构体一致(图 5b)。
传统的过渡态构象搜索通常依赖人工搭建或预先设定的模板,容易遗漏关键构象。UniTS-Gen 则可以通过生成式采样探索多种可能的构象和立体构型,为寻找动力学最有利路径提供新的技术手段。
作者还将模型应用于更加复杂的双峰过渡态体系。在这类反应中,同一个过渡态之后的反应路径会发生分岔,生成两种不同产物,因此其动力学行为无法仅通过传统的静态过渡态理论完整描述。
对于一个训练数据中从未出现过相同元素组合的体系,UniTS-Gen 生成了目标双峰过渡态结构。以该结构为起点开展准经典分子动力学模拟后,成功再现了分别生成 [4+1] 和 [2+1] 环加成产物的路径分岔行为(图 5c)。这说明模型不仅能够服务于常规反应能垒和选择性分析,也有潜力用于研究更加复杂的动态效应。
迈向自动化反应机理探索
从反应物结构出发,自动发现可能的反应路径、生成过渡态、完成量子化学优化并比较反应能垒,是实现自主反应机理研究的重要目标。
在这一流程中,过渡态初始结构生成长期以来是最依赖专家经验、也最难实现规模化自动处理的环节之一。UniTS 通过高质量复杂过渡态数据与高阶等变生成模型的协同设计,将这一过程从人工搭建转变为从 2D 分子图出发的自动 3D 结构生成,为真实有机合成场景中的机理研究自动化提供了新的解决方案。
作为「Golab 物质科学智能研发工厂」的组成部分,UniTS-Gen 还在「百题马拉松」直播中接受了真实任务检验,围绕选择性 C–H 键活化等 5 项反应机理探索任务,均成功生成了正确的过渡态初始结构,为后续量子化学优化和机理分析提供了可靠起点。
未来,通过自动化数据流程持续扩展 UniTS-Lib,并进一步融合机器学习势能面、自动反应位点识别和量子化学计算工具,该框架有望支持从反应结构输入到过渡态优化和机理分析的端到端自动化。
与此同时,HiEGNN 在有限复杂数据上表现出的 3D 结构生成能力,也为材料、催化剂及其他复杂化学体系中的结构生成任务提供了新的模型基础。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.