来源:市场资讯
(来源:科技行者)
![]()
这项由纽约大学与Matterstack公司联合完成的研究,以预印本形式发布于2026年7月30日,论文编号为arXiv:2607.28618。有兴趣深入了解技术细节的读者,可以通过该编号在arXiv平台上查阅完整论文。
**故事从一道"找答案"的难题开始**
一位化学研究员坐在电脑前,她想知道:目前科学界已经发现了哪些催化剂能把二氧化碳转化为一氧化碳?每种催化剂的转化效率分别是多少?这个问题听起来并不复杂,但现实却令人头疼——这些答案散落在成百上千篇学术论文里,每篇论文只记录了其中一小块拼图。她不得不一篇一篇地打开文献,逐段阅读,手动核对数据,再把这些碎片拼成一张完整的图。
这种工作方式就像在一座巨大的图书馆里找一句话,图书馆员告诉你"大概在三楼那个书架区域",却不能直接把那句话翻出来给你看。过去的文献检索系统——无论是谷歌学术还是其他学术搜索引擎——本质上都是这种模式:它们给你一张"书单",剩下的事情都得你自己动手。
正是为了解决这个让无数研究人员苦不堪言的问题,纽约大学与Matterstack公司的团队构建了一套名为AskChem的系统。这套系统的核心思路,是把检索的基本单位从"一篇论文"变成"一条证据"。
**一、为什么要把论文"切碎"成证据条目?**
要理解AskChem的核心创新,可以用图书馆管理的方式来类比。传统的文献检索系统,就像把每本书作为一个整体存进书架,你搜索时得到的是一本本书的目录。而AskChem做的事情,更像是把每本书的每一个重要结论都写在一张独立的便利贴上,每张便利贴都注明了"这句话来自哪本书的哪一页",然后把这些便利贴按照主题、类型、时间等方式分门别类地整理起来。
这张"便利贴"在系统里被称为"声明"(Claim)。一条声明是从某篇论文中提取出来的一个具体、有据可查的科学结论。它不是模糊的摘要,而是包含了具体信息:这是什么类型的结论?反应物是什么?实验条件如何?测量结果是多少?更关键的是,每条声明都附带着"原文引用"——也就是论文中直接支撑这个结论的原始文字,以及论文的数字对象标识符(DOI),让任何人都可以一键核查。
这种设计解决了一个在AI时代越来越严重的问题:AI语言模型在回答科学问题时,往往会编造出听起来很真实的论文引用,但那些引用根本不存在。通过让每条声明都携带可验证的来源信息,AskChem从根本上堵住了这个漏洞。
研究团队借用了一个类比:就像图像领域的"分割一切模型"(Segment Anything Model)能把一张图片分解成可重复使用的图像区域,AskChem用语言模型把论文分解成可检索、可验证、可组合的声明单元。
**二、这座"证据图书馆"到底有多大?**
在规模上,AskChem目前索引了来自147,000篇论文的240万条声明,时间跨度从1925年一直延伸到2026年,涵盖arXiv预印本、ChemRxiv、学术期刊以及Semantic Scholar的内容。其中99.9%的声明都通过了CrossRef数据库的DOI验证,证明其来源真实可查;66%的声明来自全文提取,另外34%来自摘要提取。
从内容分布来看,声明涵盖了化学领域的多个子方向。以声明类型为例,性质类声明最多,约有96万条;方法类约33万条;对比类约23万条;机制类和计算类各约22万条;反应类约12万条;此外还有限制性结论、实验性发现、意外发现以及研究范围等类型。从化学子领域来看,材料化学(约2.3万篇论文)和计算化学(约1.9万篇)是覆盖最广的方向,物理化学、生物化学、分析化学、电化学、药物化学、催化化学、环境化学等也都有收录。
从时间分布上看,2010年代有约8830篇论文入库,2020年代则骤升至约22670篇,反映了近年来化学领域论文数量的快速增长。
这些数据共同构成了AskChem的"声明仓库"——一个统一的中央存储区,所有后续的检索和分析功能都建立在这个仓库之上。
**三、三种不同的"地图"帮你找到需要的证据**
有了这个声明仓库,AskChem并不是简单地建一个搜索框了事,而是在同一批数据之上提供了三种互补的导航方式,就像同一座城市可以有街道地图、地铁线路图和地形图,各有各的用途。
第一种叫"稳定的分面分类体系"。这是为日常检索和浏览设计的导航工具。研究团队通过分析大量论文自然产生的术语,归纳出了一套持久稳定的分类路径。这套体系从多个维度同时给声明贴标签:反应类型(比如电催化、光催化、还原反应)、物质类别(溶剂和气体、无机化合物、纳米材料等)、应用领域(环境、能源、催化)、技术手段(电化学、合成、动力学)、机制主题(电子转移、键的形成与断裂、吸附与表面作用)等。
这五个内容维度是真正描述"声明是关于什么的",此外还有声明类型、提取的测量数据、时间以及作者等辅助维度。关键在于,这些维度不是相互独立的数据集,而是同一批声明的不同观察角度。就像一瓶矿泉水,从成分角度看它含有钙镁离子,从用途角度看它是饮用水,从产地角度看它来自某个山泉,这些描述指向的是同一个东西。
研究团队在技术层面做了大量工作来保证这套分类体系的稳定性:通过规范化同义词、对近似重复的子类别进行模糊聚类,确保同一个概念不会因为论文措辞的差异而被分到不同地方去。最终形成的是L1/L2/L3三层路径结构,适合生产环境中的检索和浏览。
系统的搜索功能也相当有意思——它把四种不同的检索信号融合在一起:全文关键词检索、论文层面的召回、分类节点的召回,以及基于向量相似度的语义检索。这四条路找到的结果通过一种叫"倒数秩融合"的方法综合排序,就像让四位不同风格的评委给选手打分,再把分数加权汇总,比任何单一标准都更全面可靠。
第二种导航工具叫"证据图"。这是为跨论文的关系分析设计的。光知道一条声明说了什么还不够,研究人员往往更想知道:哪些论文支持这个结论?哪些论文延伸了这个发现?有没有论文与它相矛盾?
AskChem通过一个额外的关系提取层来回答这些问题。系统会自动识别声明之间的有向关系,包括"引用为证据"、"支持"、"延伸"、"矛盾"以及"推导自"五种类型,每条关系还附带置信度分数和来源信息。目前证据图中共有171,342条有向边。
为了验证这些关系是否准确,研究团队邀请了一位领域专家对148条关系进行人工核查。排除2条无法判断的情况后,146条可判断的关系中有143条类型正确,准确率达到97.9%。这个数字意味着,这张由AI自动绘制的关系网络,可以作为一个可靠的导航层来使用。
在实际操作中,用户可以通过API接口请求某条声明的"邻域",系统会返回所有指向它的入边和从它出发的出边,也就是"谁支持了它、它支持了谁、谁否定了它"这样的关系网络。网页界面还会自动在搜索结果之上叠加一张小型的关系图,让用户在看到某个发现的同时,直接看到它在证据网络中的位置。
第三种工具叫"活态分类树",这是一个更具探索性、更偏向学术全景的导航工具。前两种工具关注的是"某条声明是关于什么的",而活态分类树关注的是"哪个科学原理或理论框架统领了这篇论文的贡献"。
它把论文级别的叶节点挂载在原理、理论、模型、机制和现象等上位节点之下。比如,关于亚硝酸盐还原的论文会被放在"电催化氧化还原"这个节点下,而关于二烯交叉复分解的论文会被放在"烯烃复分解"这个节点下。目前这棵树有4,931个节点,覆盖了约110万条声明和36万个论文节点位置,其中663个是"待提议的新分支"——当没有现有节点合适时,系统会主动提出新的分支候选,而不是强行把论文塞进一个不匹配的位置。
研究团队特别强调,活态分类树是一个探索性的全景概览工具,而非经过专家全面验证的科学本体。它的价值在于提供一种基于科学原理的宏观鸟瞰,而不是替代精确检索。
**四、声明是怎么从论文里"提取"出来的?**
AskChem的声明提取使用了两条互补的流水线。第一条是高吞吐量的摘要提取管道,使用GPT-5-mini模型处理论文标题和摘要,可以快速大规模地处理文献;第二条是更深入的全文提取管道,使用Gemini 3.1 Pro模型读取PDF原文,能够捕捉那些在摘要中通常不出现的声明类型,比如假说、研究局限性以及意外发现。目前共有44,000篇论文经过全文提取,102,000篇只进行了摘要提取。
每次提取调用都会返回一个结构化的JSON对象,并经过严格的模式验证:必须包含必要的溯源字段、数值范围检查以及化学特定字段的验证。这些检查确保了可追溯性,但研究团队也坦承,这些检查不能保证每条声明在语义上都正确地解读了原文——这是一个诚实的局限性声明。
值得一提的是,对于全文提取的声明,如果找不到连续的原文引用,系统会记录一个"证据定位符"(包含论文中的位置信息和结构化证据),以确保每条声明都有某种形式的来源锚定,无论是直接引用还是明确的位置标注。
**五、在真实测试中,它的表现究竟如何?**
研究团队设计了一个叫AskChem-Bench的基准测试来评估系统性能。这个基准包含30个跨论文的化学问题,分为三类:条件聚合类(比如"什么条件下C-N偶联效果最好")、时间演化类(比如"MOF在水溶液中的稳定性研究是如何随时间发展的")以及矛盾冲突类(比如"关于银纳米粒子安全性的研究结论之间存在哪些冲突")。
测试中对比了五种方案:单独使用GPT-5.5语言模型(不依赖任何检索系统)、将GPT-5.5与AskChem结合使用、使用Paperclip系统、使用Edison Scientific的PaperQA系列智能体,以及使用Google的NotebookLM深度研究功能。
核心指标之一是DOI有效率——也就是系统给出的论文引用中,有多少是真实存在且可以在CrossRef数据库中查到的。结果显示,单独使用GPT-5.5时,88.3%的引用是真实存在的,也就是说约12%的引用是AI编造出来的。当把GPT-5.5与AskChem结合使用时,DOI有效率达到了100%——没有一条虚假引用。Paperclip同样达到了100%,Edison Scientific为99.1%,NotebookLM为93.7%。
在引用密度(每个回答中包含的有效DOI数量)上,AskChem+GPT-5.5组合以每答18.1个有效DOI排名第一,远超单独使用GPT-5.5的9.6个,以及Paperclip的7.5个、NotebookLM的7.9个和Edison Scientific的10.7个。
在论文相关性评分(0到3分,3分表示直接相关)上,AskChem+GPT-5.5的平均分为2.15,Edison Scientific为2.07,NotebookLM为1.84,Paperclip为1.72,单独GPT-5.5为1.66。在"回答中至少得2分的比例"这个指标上,Edison Scientific以89.7%领先,AskChem+GPT-5.5以86.6%位居第二。
在近期高影响力论文覆盖率上,AskChem+GPT-5.5以18.5%排名第一,意味着它检索到的论文中有更高比例是近五年内被引超过50次的重要文献。
研究团队也坦承了AskChem的不足之处:Edison Scientific作为一个闭源的深度研究智能体系统,在"有具体数值且有引用支撑的内容量"这个指标上以29.2分远超AskChem的5.9分,也在回答的深度和细节丰富程度上有明显优势。AskChem的定位不同:它是一个开放数据、声明级别、可以实时交互浏览、且可以直接作为AI智能体工具使用的基础设施,而不是一个封闭的端到端问答系统。
**六、谁可以用它,怎么用?**
AskChem提供了四种访问方式,面向不同的使用场景。网页界面适合直接搜索和浏览,用户可以输入问题,看到按声明类型和分类路径组织的结果,还可以点击查看原文引用和DOI链接。REST API适合开发者将AskChem集成到自己的工具中。SDK(软件开发工具包)提供了更便捷的程序调用接口。MCP服务器则是为AI智能体设计的接入协议——这意味着像Claude这样的AI助手可以通过MCP协议直接调用AskChem的检索功能,在回答化学问题时实时获取有来源保障的证据。
从API接口设计来看,系统提供了搜索、声明详情查询、邻域关系查询和来源查询四个核心接口。搜索接口返回声明ID和分类路径;声明接口和邻域接口暴露溯源信息和证据边;来源接口返回某篇论文中所有被索引的声明。这种设计让人类用户和AI智能体访问的是同一批对象,保证了一致性。
研究团队还为AskChem建立了订阅和阅读列表功能,支持作者网络分析,以及保存搜索结果等功能,使其不仅是一个搜索工具,也是一个文献管理和持续跟踪的工作台。
系统的所有源代码以MIT许可证在GitHub上开放,索引数据以CC-BY许可证在HuggingFace上发布,基准测试数据和评估结果也通过专用的API端点公开提供,任何研究者都可以复现实验。
**七、局限性与诚实的自我批评**
研究团队在论文中对系统的局限性保持了罕见的坦率。从覆盖范围来看,147,000篇论文只占化学领域已有文献的一小部分,存在明显的选择性偏差;摘要提取产生的声明比全文提取要浅,很多重要的机制分析和实验细节只有在全文中才能找到。
从质量角度看,LLM生成的声明、关系和分类放置都可能存在错误。溯源检查能确保每条声明都有一个来源DOI和原文引用,但这并不能保证提取的内容在语义上忠实于原文。分面分类体系基于字符串的规范化处理,可能把本质不同的概念合并在一起,也可能保留近似重复的子类别,而且这套体系对检索性能的具体贡献还没有被单独量化。
活态分类树同样是探索性工具,专家对节点放置的验证目前还是未完成的工作。AskChem-Bench只包含30个问题,衡量的是引用的可溯源性,而非全面的事实准确性或实际使用体验。
说到底,AskChem做的事情可以用一个更直接的说法来描述:它把"给你一张书单"变成了"给你一张有出处的证据清单"。对于在文献海洋中寻找具体答案的化学研究员来说,这个变化意味着少花时间翻书,多花时间思考;对于越来越多地依赖AI辅助科研的团队来说,它意味着AI给出的每一条引用都可以被追溯和核实,而不是靠运气碰运气。
归根结底,化学知识本来就是一条条具体的发现积累起来的,而不是一篇篇论文的标题堆砌起来的。AskChem把索引的粒度推进到了知识本身,这个方向上的探索,至少在工程层面已经证明是可行的,并且在真实测试中也显示出了与现有系统不同的优势和权衡。感兴趣的读者可以通过arXiv编号2607.28618阅读原文,也可以直接访问askchem.org体验这套系统。
**Q&A**
Q1:AskChem与谷歌学术这类传统文献检索系统有什么本质区别?
A:谷歌学术返回的是论文列表,用户需要自己打开每篇论文找证据;AskChem的检索单位是从论文中提取的具体"声明",每条声明携带原文引用和DOI,用户直接拿到的就是带来源的具体结论,不需要再去翻原文定位。
Q2:AskChem怎么保证AI提取的声明是真实的?
A:AskChem通过两个机制保证可追溯性:一是每条声明都附带原始论文的DOI(99.9%已通过CrossRef验证),二是每条声明都携带论文中的原文引用或明确的位置标注。这不能保证语义完全正确,但可以让用户快速回到原文核查。在基准测试中,使用AskChem辅助GPT-5.5回答问题时,引用的DOI有效率从88.3%提升到了100%。
Q3:AskChem只能用于化学领域吗?
A:目前AskChem专注于化学领域,索引了147,000篇化学相关论文,涵盖材料化学、计算化学、物理化学、电化学等子方向。系统的声明提取、分类体系和证据图架构本身是通用方法,但当前部署的分类体系、提取提示词和领域知识都是针对化学定制的。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.