来源:市场资讯
(来源:江欣雨&滕丹 DrugAI)
近日,中国科学院上海药物研究所郑明月、滕丹团队联合合作者在Nature Communications在线发表题为“Deep residual learning for molecular force fields”的研究论文。研究团队提出残差学习力场Residual Learning Force Field(ResFF),将解析分子力学模型与等变神经网络相结合:前者提供稳定、可解释的物理基线,后者学习基线与较高精度量子化学计算结果之间的差值。研究表明,这一设计能够兼顾预测精度、对未见分子的泛化能力和分子动力学模拟中的稳定性,为机器学习力场的构建提供了新的思路。
![]()
研究背景:分子力场的准确性与泛化
分子动力学模拟通过计算原子的能量和受力,追踪分子体系随时间的运动。在药物研发中,它可用于研究药物分子的构象变化、蛋白质-配体相互作用及结合自由能等问题。决定模拟结果是否可靠的核心之一是分子力场,即描述分子势能及原子受力的一组数学模型。力场中很小的系统误差,在长时间模拟中也可能逐步累积,进而影响构象采样和能量评估。
传统分子力学力场采用明确的解析函数描述化学键伸缩、键角弯曲、二面角扭转和非键相互作用,具有计算效率高、物理含义清楚和模拟稳定等优点。但受固定函数形式限制,它们较难充分描述复杂的环境依赖效应,精度提升面临瓶颈。
近年来发展的神经网络力场能够从量子化学数据中学习复杂势能面,在训练数据覆盖的化学空间内通常具有较高精度。然而,当分子的骨架、构象或局部环境明显偏离训练分布时,模型的可靠性可能下降;较复杂的网络还会增加计算成本,并对长时间动力学模拟的稳定性提出更高要求。
如何结合两类方法的优势,是机器学习力场研究中的重要问题。ResFF的基本思路是保留解析模型擅长描述的部分,再由神经网络集中学习解析模型尚未准确表达的部分,以降低学习完整势能面的难度。
ResFF: 物理基线与数据驱动修正的协同
ResFF框架与训练策略
残差学习的思想源于深度残差网络(ResNet)。如果已有一个较为可靠的基线,神经网络不必从头拟合完整目标,而可以只学习“目标值减去基线值”的差。对分子力场而言,这意味着先用具有明确物理形式的模型给出主要能量贡献,再用神经网络补充其中未能充分描述的部分(图1)。与直接学习完整势能面相比,残差通常更集中,也更容易学习。
![]()
图1. 残差学习力场(ResFF)的基本思想。
ResFF借鉴ResNet的残差学习思想,结合物理分子力学模型与神经网络,以物理模型提供稳定的能量基线,由神经网络学习与高精度量子化学结果之间的能量残差 ΔE,最终获得高精度分子力场。
在ResFF中,分子力学(MM)模块根据分子拓扑生成键、键角和扭转等解析共价项参数,并在模拟过程中保持固定,构成物理基线;约32万参数的等变Transformer读取三维几何环境,学习MM基线与量子化学参考之间的差值(图2)。这里的“量子化学参考”,是指采用较高精度量子化学方法计算得到的分子能量和原子受力,用作训练和检验力场的基准数据;它并非实验真值,准确性取决于具体计算方法。“等变”表示分子整体旋转或平移后,模型输出仍遵循相应的物理变换规律。两部分相加得到体系总能量,对坐标求负梯度得到原子受力。残差项并不严格对应传统力场中的某一类非键能,而是有限截断范围内随局部环境变化的综合修正。
研究团队采用三阶段训练策略。首先训练MM模块,使其学习主要的共价能量;随后固定MM模块,训练神经网络拟合剩余误差;最后对两个模块进行联合微调,使物理基线和残差修正相互适配。这与基线始终保持不变的常规δ-learning有所不同。消融实验表明,分阶段训练和最终联合优化均有助于提高模型性能。
![]()
图2.ResFF 架构
:融合物理先验分子力学项与数据驱动残差修正。(a) ResFF总体框架。模型由两个核心模块组成:MM 模块基于解析共价函数预测能量,残差模块捕捉额外的能量贡献。分子总能量为两个模块输出之和,对坐标求负梯度得到原子受力。(b) MM模块利用二维图神经网络预测键、角及扭转角等解析共价项参数,并根据原子坐标计算共价能;残差模块采用等变神经网络,将原子表征和分子几何信息映射为残差能量,用于补偿解析MM基线未能充分描述的复杂能量贡献。
未见化学空间中的泛化表现
衡量机器学习力场的泛化能力,关键是考察模型对训练阶段未见分子的表现。研究团队按分子实体而非按构象随机划分训练集、验证集和测试集,比例为8:1:1,从而保证同一分子的不同构象不会同时出现在训练集和测试集中。Gen2-Opt数据集包含1,024个分子的244,989个构象,用于评估分子内相对能量;DES370K二聚体数据包含3,095类二聚体的326,978个构型,用于评估分子间相互作用。
在这一较严格的测试条件下,ResFF在Gen2-Opt测试集上的平均绝对误差(MAE)为1.16 kcal/mol,Pearson相关系数为0.893;在DES370K测试集上的MAE为0.90 kcal/mol,相关系数达到0.987(图3)。在论文设定的数据和监督条件下,其总体表现优于所比较的传统力场和多种神经网络力场。
这些结果说明,解析物理基线能够为模型提供稳定的初始描述,神经网络则进一步提高对复杂能量变化的表达能力。二者的结合减少了模型完全依赖训练数据拟合完整势能面的压力,有利于在陌生化学结构上保持较好的预测性能。
![]()
图3. 不同力场在Gen2-Opt和DES370K测试集上的表现。
(a-b) Gen2-Opt测试集和DES370K测试集上的RMSE与MAE。(c) Gen2-Opt和 DES370K 测试集中的能量偏差分布。数据按分子实体划分,而非随机划分构象。
扭转势能面的准确描述
药物分子中的许多化学键可以旋转,由此形成不同的三维构象。扭转角变化对应的能量曲线决定了哪些构象更容易出现,以及分子从一种构象转变为另一种构象需要跨越多高的能垒。因此,准确描述扭转势能面,对构象采样、分子对接和自由能计算都十分重要。
在TorsionNet-500和Torsion Scan基准上,结果如图4a-b所示,ResFF在TorsionNet-500数据集上取得MAE 0.45 kcal/mol,在Torsion Scan数据集上取得MAE 0.50 kcal/mol,优于多数传统分子力学力场和神经网络力场,并接近更大规模模型 MACE-OFF(S) 的表现。图4c展示了ResFF在TorsionNet-500 和Torsion Scan基准集上的扭转势能预测示例,表明ResFF能准确复现QM的扭转势能曲线。
![]()
图4.不同方法对扭转能量景观的预测表现
。(a) TorsionNet-500数据集上的RMSE、MAE和能量偏差分布。(b) Torsion Scan数据集上的相应指标。(c) TorsionNet-500和Torsion Scan中的代表性扭转势能曲线,并与QM参考结果进行比较。
分子间相互作用能预测
氢键、色散和静电等分子间相互作用共同决定蛋白质—配体识别、分子自组装和晶体堆积等过程。研究团队在S66×8基准上评估ResFF。该数据集包含66类代表性分子二聚体,每类二聚体设置8个不同距离,共528个构型。ResFF预测相互作用能的RMSE为0.55 kcal/mol,在论文主表所比较的方法中最低(图5a)。代表性体系的能量曲线表明,ResFF能够随分子间距离变化合理描述相互作用能,尤其在接近平衡距离的区域保持较高精度(图5b)。同时,ResFF的残差网络采用局部截断,并未显式描述完整的长程静电作用。论文中的进一步比较显示,扩大模型感受野或显式加入长程静电项仍可能带来改善,这也为后续模型发展提供了方向。
![]()
图5.不同方法在S66×8数据集上的表现。
(a) RMSE、MAE和能量偏差分布。(b) 代表性分子二聚体相互作用能量曲线,并与QM参考结果比较。横轴为分子间距离比r/r₀,其中r为两个单体之间的距离,r₀为平衡间距。
构象优化与外推能力
构象优化需要反复计算能量和梯度,将初始结构逐步优化到低能构象,是对势能面整体质量的综合检验。研究团队在OpenFF Industry Benchmark上比较不同力场优化后的结构与量子化学参考结果。该数据集包含9,728个类药分子的73,301个构象,评价指标包括原子坐标均方根偏差(RMSD)、扭转指纹偏差(TFD)和相对构象能误差(ΔΔE)。
对于与SPICE训练数据相似度较高的分子,ResFF的总体表现优于传统分子力学力场和Espaloma-0.3,并接近MACE-OFF(S) (图6)。对于与SPICE相似度低于0.2的分子,ResFF取得最低的ΔΔE,说明在化学结构与训练数据差异较大时,它仍能较好地判断不同构象的相对稳定性。
随着可旋转键数量增加,分子的构象空间迅速扩大,优化难度也随之提高。结果显示,在高柔性分子中,ResFF的RMSD和TFD仍保持较低水平;对可旋转键超过20个的分子,ResFF也取得较低的ΔΔE。这说明该模型在柔性类药分子的结构优化和相对能量排序方面具有较好的稳健性。
![]()
图6. 不同力场在 OpenFF Industry Benchmark 数据集上的构象优化表现
。上半部分按分子与SPICE训练数据的相似度分组,下半部分按可旋转键数量分组;评价指标包括原子坐标均方根偏(RMSD,左)、扭转指纹偏差(TFD,中)和相对能量差(ΔΔE,右)的中位数及对应曲线下面积(AUC)。
分子动力学模拟
除静态基准测试外,研究团队还在四肽、聚丙氨酸、环肽自组装体和Tyk2蛋白—配体复合物中开展分子动力学模拟,以考察ResFF在连续积分过程中的稳定性及对不同体系尺度的适应能力。
在AcAla3NMe四肽体系中,研究人员在500 K显式溶剂条件下进行了1 ns元动力学模拟。ResFF在80 GB A100 GPU上的计算速度约为5×106steps/day,并采样到PPII型构象区域、反平行β-sheet构象区域、左手和右手α螺旋区域、γ-turn等多个主链构象盆地(图7a)。在该体系中,ResFF仅用于描述四肽的分子内相互作用,其余部分由传统力场处理
在从完全伸展构象出发的Ala15模拟中,尽管ResFF主要基于小分子数据训练,Ala15仍在约100 ps内形成稳定的α螺旋(图7b)。模拟过程中观察到短暂的过渡构象;第一个螺旋转角形成后,后续螺旋结构迅速生成,与已有实验和模拟提出的螺旋成核机制一致。
研究团队进一步模拟了由8个环肽组成、共含848个原子的堆叠自组装体。在300 K显式水环境的500 ps模拟中,管状结构及相邻环之间的主链氢键网络保持稳定(图7c-d),平均环间距离为4.85 Å,与实验值4.73 Å接近,显示出模型向更大分子体系扩展的潜力。在Tyk2蛋白—配体复合物中,团队进行500 ps、300 K显式溶剂模拟。ResFF用于计算配体的分子内能量,蛋白质、溶剂及其他相互作用由传统力场处理。不同力场得到的配体RMSD相近,模拟中未出现积分失败、异常温度波动或不合理键长分布,表明ResFF能够稳定地嵌入现有蛋白质—配体模拟流程(图7e)。
![]()
图7. ResFF在不同分子体系中的动力学模拟。
(a) AcAla₃NMe四肽的自由能面。(b) Ala15折叠动力学,N端与C端α-碳距离随模拟时间变化,代表性构象展示α-螺旋形成过程。(c) 环状 α-alt(D,L)-肽结构及环肽自组装体中的分子间氢键网络。(d) 环肽自组装体RMSD随时间变化。(e) Tyk2蛋白–配体体系中不同力场模拟得到的配体RMSD。
总结与展望
ResFF通过残差学习将解析分子力学与等变神经网络组织在同一框架中。解析模块负责提供稳定且可解释的共价物理基线,神经网络则学习相对于量子化学参考的环境依赖修正。与完全由神经网络拟合势能面相比,这种任务分解提高了模型对未见分子和柔性体系的适应能力,并在多类动力学模拟中表现出良好稳定性。该研究说明,物理模型与数据驱动模型之间并非简单替代关系,合理划分二者承担的任务,也可以成为提升机器学习力场性能的有效途径。
ResFF仍有进一步完善的空间。解析共价项的函数形式可能限制模型可达到的最高精度;当前训练数据主要覆盖SPICE化学空间附近的类药分子和局部相互作用,模型也尚未显式引入长程库仑作用和极化效应。对于高度带电物种、过渡金属配合物、长程相互作用占主导的生物大分子,以及周期性液体和材料体系,仍需有针对性地扩充数据、重新训练或改进模型架构。因而,现阶段的ResFF更适合作为一种经过多项基准检验的设计框架,而非适用于所有分子模拟问题的通用模型。
上海药物研究所博士生江欣雨和上海药物研究所、上海科技大学与临港实验室联合培养博士生陈铭安为论文共同第一作者。上海药物研究所郑明月研究员和滕丹副研究员为论文共同通讯作者。该研究由上海药物研究所、中国科学院大学、上海科技大学、临港实验室、浙江大学智能创新药物研究院、乌普萨拉大学生命科学实验室和上海科技大学iHuman研究所等单位合作完成。该研究得到中国科学院战略性先导科技专项、国家重点研发计划、国家自然科学基金、临港实验室和上海市科技重大专项等项目支持。研究团队感谢纽约大学王源清、佛罗里达大学Adrian E. Roitberg,以及兰州大学袁永娜和李孝宏对研究和论文提出的建议与讨论。
参考资料
Jiang X, Chen M, et al. Deep residual learning for molecular force fields. Nature Communications 17, 8160 (2026).
DOI: 10.1038/s41467-026-74983-0
代码:https://github.com/Ameki0/ResFF
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.