化学有条铁律:分子的性质,由原子在空间里的排列方式决定。同样的原子、同样的化学键,朝向不同,稳定性和反应活性可能天差地别。这叫"构象"。
药物研发、材料设计、催化筛选,核心就是在无数构象里找最稳的那个,过去靠DFT和力场模拟,贵、慢。
实验叫LLMConfBench。从GEOM数据集选27个小有机分子,只含氢碳氮氧氟,不超过9个重原子,每个取30个最低能构象,共810个几何结构。另加两个控制组分子——一个大环抑制剂、一个氢过氧化物,都不在常见数据库里,测泛化。
任务很直接:把30个构象的XYZ坐标喂给模型,按稳定性排序。每个分子做三次,次序随机打乱防位置记忆;每个构象随机旋转,坐标变了,几何没变。评分只算能量差大于2 kcal/mol的构象对,满分1,随机猜0。
分水岭清晰:2025年7月之前发布的模型基本不会排。前沿模型很多已超过通用力场UFF。GPT-6 Astra和Claude Opus 5逼近现代力场GFN-FF。这些模型没有一个专门为化学结构训练过。
![]()
表现差的是"环张力"主导的分子。环张力定义松散,没有精确公式。所有模型里只有GPT-6 Astra和Claude Opus 5处理较好。
另一发现:排构象能力与科学问答、编程、抽象推理基准强相关。说明它不是专门学来的,是从其他任务泛化出来的——模型在训练中形成了通用空间推理和物理直觉,再迁移到从未被训练过的分子构象任务。
![]()
视角拉到中国。测试名单里,Kimi K3在列,和GPT-5.6 Sol、Gemini 3.6 Flash同台,准确率有竞争力。
中国有全球最大化工产业、最完整制药产业链,也有大量高质量化学数据。通用模型能直接迁移推理能力,意味着不必从头训一个专用化学模型。过去构象搜索和高通量筛选要烧昂贵DFT算力或力场模拟;前沿LLM若接近甚至部分替代力场,整个流程的成本和速度都会改写。
局限也清楚。模型对松散定义的概念处理不好,科学语言的模糊性会成为瓶颈。它还替代不了量子化学计算和高精度力场,更像快速预筛选工具,或辅助人类直觉的推理伙伴。
但"意外涌现"本身比准确率更有冲击力。它说明当前沿模型跨过某个阈值,会自发产生开发者没设计、没预期、甚至没测试过的能力。分子几何理解只是其中一个。
对化学和药物研发来说,AI的介入方式正在变:不是做专用模型解决专用问题,而是通用模型的能力边界在扩张,覆盖到原本需要领域专家和专用工具的场景。
— 感谢阅读 · 欢迎点赞关注 · 小编 —
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.