![]()
这项由谷歌云AI研究团队(Google Cloud AI Research)与加州大学洛杉矶分校(UCLA)联合开展的研究,于2026年7月30日以预印本形式发布在arXiv平台,编号为arXiv:2607.27853v1,分类为计算机科学·计算与语言(cs.CL)领域。感兴趣的读者可以通过该编号在arXiv上查阅完整论文。
一、当AI遇上"研究报告"这块硬骨头
考虑这样一个场景:你是一家基金公司的分析师,上司叫你在周一早上九点前交出一份关于某半导体企业的完整研究报告。你需要翻阅过去三年的财报,梳理竞争对手的动向,评估宏观经济对行业的影响,还要预测这家公司未来的股价走势——所有这些,都要有据可查,不能凭空捏造。这份工作,一个有经验的分析师可能需要花好几天才能完成。
近年来,各大科技公司纷纷推出了所谓的"深度研究"产品,比如谷歌的Deep Research、OpenAI的Deep Research、Perplexity的类似功能等等。这些工具的核心思路是:让AI自动上网搜集资料、整合信息、最终生成一份详尽的长篇报告。用户只需提一个问题,AI就帮你把活儿干了。
听起来很美,但问题来了——金融研究和写一篇介绍气候变化的科普文章,完全不是一回事。金融分析需要极其精准的数字依据,需要理解复杂的公司关系和行业逻辑,更重要的是,它经常需要对未来做出有根据的预判。通用型的AI深度研究工具,就像一个博学的通才,面对这种专业程度极高的金融任务,往往力不从心。
这正是谷歌云AI研究团队和UCLA联手要解决的问题。他们的回答有两个部分:一个叫做FinanceHarness的专业金融研究工具框架,以及一个叫做FinanceGym的金融研究基准测试集。前者是"工具",后者是"考卷"。这篇文章,就是带你把这两样东西彻底搞明白。
二、金融研究为什么这么难自动化?
要理解这项研究的价值,得先搞清楚金融深度研究到底难在哪里。
金融分析和一般的知识检索有个根本区别,那就是时间维度。一篇普通的深度研究报告,你可以随便上网查、随便引用现有内容,准确与否主要取决于信息是否真实存在。但金融研究不一样——它有一个核心要求叫做"不能用未来的信息来预测过去"。
举个具体例子来帮助理解。假设你要研究某家公司在2025年3月份的经营状况,你自然只能使用截止到2025年3月之前公开的信息来做分析。如果你在分析报告里偷偷用了2025年6月才公布的财报数据,那这个分析在现实中就毫无意义,因为在当时根本没有人知道这些数字。这个限制在专业术语里叫做"点位时间"(Point-in-Time,简称PIT)原则——你的分析只能基于特定时间点之前可知的信息。
更进一步,真正有价值的金融研究报告,不只是把过去的事情说清楚,还要对未来做出预判。分析师不仅要说"这家公司过去三年营收增长了30%",还要说"基于这些历史数据和当前的行业趋势,我预测它未来一年的股价走势大概是这样"。这种向前看的能力,才是金融研究的核心价值所在。
现有的AI工具在这两个维度上都面临挑战。一方面,大多数AI系统没有办法精确控制"只使用截止某个日期之前的信息",它们要么全知道,要么什么都不知道;另一方面,即便能够获取历史信息,如何将这些信息转化为对未来的合理预判,又是另一个难题。
此外,现有的金融AI基准测试也存在明显缺口。FinanceBench这样的测试集,只考察AI能不能回答关于财务报告的简单问题,比如"这家公司去年的营业利润是多少",完全没有涉及分析师真正需要做的综合性、前瞻性研究。其他通用型深度研究基准,则根本没有金融领域的专门内容。换句话说,研究团队发现,市面上根本没有一个合适的"考卷"来衡量AI到底能不能做好金融深度研究。
三、FinanceGym:专门为金融研究设计的"考卷"
既然没有合适的考卷,那就自己出一份。FinanceGym就是这样诞生的。
要出一份好的金融研究考卷,首先需要一个有足够深度和广度的信息库。研究团队从公开互联网上收集了超过一亿篇文章,这些文章全都带有可靠的发布日期。之所以要保留日期,正是为了实现前面提到的"点位时间"原则——系统可以根据每道题的截止日期,精确过滤掉那些"来自未来"的信息。
这个信息库的构建方式也很有讲究。文章使用了两个专门的工具:htmldate负责提取每篇文章的发布日期,trafilatura负责清理文章的正文内容。对于检索功能,研究团队使用了一个叫Qwen3-Embedding-4B的语义理解模型把所有文章转换成可以被计算机理解的数字向量,然后用FAISS这个高效的向量检索库来存储和查询这些内容。当AI系统想要搜索某个话题时,只需要向这个系统发出请求,系统就会返回日期符合要求的相关文章。
有了信息库,下一步是出题。研究团队的出题方式非常独特,他们把整个信息库里的信息提炼成了一张"金融实体关系图"——可以把它类比成一张错综复杂的"人际关系网络图",只不过网络中的节点不是人,而是各种金融实体(公司、商品、政策、事件等),连线代表它们之间的关系。这张图总共包含了超过437万条关系边,涵盖111万个独特实体,来源于120万篇原始文章。
从这张关系图中,研究团队挖掘出了三类有趣的"故事线"来作为出题素材。第一类叫做"跨类别联动",比如霍尔木兹海峡(地缘政治热点)→ 原油价格 → 达美航空的机票成本,这条链条把三个看似不相关的事物联系了起来,研究出题就可以问"霍尔木兹海峡局势紧张会如何影响达美航空的盈利能力"。第二类叫做"时间叙事弧",比如AI算力需求兴起 → 英伟达黑井芯片量产 → 美国出口管制政策收紧,这是一条随时间演进的故事线,能考察AI是否理解事件的时间顺序和因果逻辑。第三类叫做"分歧与张力",比如分析师对某家公司的评级升级 vs 降级,或者一家公司同时面临生产增长(利好)和利润率压缩(利空)的矛盾局面,这类题目能考察AI是否能处理信息不一致的复杂情况。
出题时,还有一个精心设计的截止日期选择机制。不是随便挑一天,而是通过一个公式来评分:一天的信息"价值"由三个因素共同决定,分别是那天发生的事件数量(热点越多越好)、涉及的实体种类多样性(越多元越好),以及关系类型的丰富程度(越丰富越好)。这样选出来的截止日期,往往是金融市场上事件密集、信息丰富的日子,能够让研究问题更有深度。
每道题的完整内容包括三个部分:一个分析师风格的研究问题、一份参考性的"投资论点"(相当于参考答案的框架),以及一套评分标准。这套评分标准又分为两层:截止日期之前的评分标准,考察AI能否找到和运用历史信息;截止日期之后的评分标准,考察AI的分析能否合理预判后续发展。这种"前后分离"的评分机制,正是FinanceGym区别于所有其他基准测试的核心设计。
出完题之后,还需要经过严格的质量控制。题目先通过一系列AI质量筛选关卡,检验可行性、机构相关性、逻辑连贯性等维度,从最初的两万九千多道原始题目中筛选出了两千零七十八道合格题目。然后,研究团队使用整数线性规划算法(一种数学优化方法)从中精选了五百道平衡性最佳的题目,确保覆盖到足够多样的主题、行业和推理类型。
最后,这五百道题接受了专业人工审核。外部专业数据供应商的专家花费平均每题1.2小时的时间,对每道题的可行性和清晰度打分,并标记每个评分标准是否合理可行。最终,四百一十一道题通过了这轮审核,通过率82%,再经过最后的平衡调整,形成了最终发布的FinanceGym基准测试集:四百道专家审核题目,包含两千四百六十四条评分标准。
这四百道题在主题分布上相当均衡,从公司战略、所有权治理、事件驱动,到分析师共识、机构资金流动、估值情绪,再到政策监管、行业主题和资产配置,九个主题都有覆盖。行业覆盖从医疗健康到半导体,从消费品到金融地产,从大宗商品到加密货币,几乎涵盖了金融市场的所有重要板块。推理类型则包括因果分析(占30%)、预测预报(占22%)、有效性评估(占20%)、风险评估(占14%)、比较分析(占10%)和定量分析(占4%)。截止日期分布在2024年12月到2025年11月的十二个月内,确保测试覆盖不同的市场环境。
四、FinanceHarness:让AI真正能做金融研究的"工具箱"
有了考卷,还得有一个能够参加考试的系统。FinanceHarness就是研究团队专门为金融深度研究打造的AI执行框架。
可以把FinanceHarness理解成一个精心设计的"工具箱加操作手册"的组合体。一般的AI系统如果要做金融研究,顶多只有一个"上网搜索"的工具,就像给一个厨师只准备了一把菜刀,让他做满汉全席。FinanceHarness则不同,它为AI配备了一整套分层的专业工具,并且规定了如何使用这些工具的工作流程。
从架构上看,FinanceHarness由几个层次构成。最底层是模型与服务层,负责承载AI的"大脑"(即语言模型)和一个专门用于处理长篇文章的轻量级阅读器。这一层被设计成完全可以替换的——不管用什么语言模型,上层的其他组件都不需要改变,这保证了系统的灵活性。
往上一层是运行时控制层,相当于整个系统的"调度室"。它负责管理AI的行动循环:确保AI按步骤行动、验证每次行动的格式是否正确、当出错时知道如何恢复、控制整体的资源消耗不超标。这一层本身不包含任何"智慧",它只是一个忠实执行规则的管理者。
再往上是工具层。FinanceHarness的工具层被设计成分层加载的形式——就像一个餐厅的菜单,先给你一个简洁的"基础套餐",等你确定要用某类工具后,再展开那类工具的详细选项。基础工具集包括在点位时间约束下的信息搜索、文章内容读取、引用整合和报告生成这几个核心动作。在此之上,还有一系列延伸工具,涵盖精确数据查询、财务计算、估值模型、同类公司比较、风险分析和情景推演等专业金融分析功能。最顶层还支持通过MCP协议或命令行接口接入付费数据服务商或企业内部系统。
此外,FinanceHarness还设计了"技能"(Skills)这个概念。技能相当于可复用的工作流程模板,比如"行业深度研究技能"、"DCF估值技能"等等,AI可以在需要时主动调用某个技能,技能会自动告诉AI应该使用哪些工具、按什么顺序操作、需要注意哪些专业细节。这样,AI就不需要每次都从零开始摸索如何做一个DCF估值,而是可以直接调用现成的专业流程。
系统还设计了几个细节来保证实用性。有一个URL预验证机制:在AI打算去读取某个网页之前,系统会先快速确认这个网页地址有效,以免AI花了很大力气才发现链接失效。研究团队的测试显示,如果关掉这个机制,读取失败的比例会从2.1%飙升到39.4%——虽然AI有时候能自我修正,但这会浪费大量计算资源。另一个设计是搜索次数上限:过度搜索往往意味着这道题太难、找不到好答案,并不是多搜几次就能解决的问题,所以设置上限主要是控制成本,对最终分析质量影响不大。
五、打分机制:一把精确到"前后"的尺子
FinanceGym的打分方式也值得详细介绍,因为它直接决定了这把"考卷"到底有多严格。
每道题的评判由一个专门的AI评分模型(使用的是Gemini-3.5-Flash)来执行。评分模型会看到研究问题、参考投资论点、截止日期、每条具体的评分标准,以及AI提交的带有引用来源的完整报告,然后对每条评分标准独立打分。打分采用五档制:0分代表完全没提到,1分代表仅仅提了一下,2分代表有部分讨论,3分代表有实质性分析,4分代表有充分论证且来源可靠。
最终得分的计算方式是:把一道题里所有评分标准的得分加总,除以满分(即标准数量乘以4),得到这道题的百分比得分;再把所有题目的百分比得分取平均值,就是系统的总体得分。这个设计保证了无论一道题有多少条评分标准,每道题在总分中的权重都是相同的。
特别值得一提的是前后分离的评分逻辑。在点位时间框架下,同一份研究报告会被分别用"截止日期之前"的评分标准和"截止日期之后"的评分标准来打分。前者考察AI能否找到并正确使用历史信息,后者考察AI的分析能否合理预判后续发展。这两个维度的得分会分别统计,让研究者能够清楚地看到AI在"回顾历史"和"展望未来"这两项能力上分别表现如何。
六、测试结果:没有人能拿高分
研究团队用FinanceGym对17个不同的AI系统进行了全面测试,结果很有意思——没有任何一个系统的总分超过40%。这不是因为题目出错了,而恰恰说明了金融深度研究这件事有多难。
参加测试的系统分为三大类。第一类是经过专门训练的开源模型,包括Tongyi-DR(通义深度研究)、OpenResearcher和MiroThinker,这些模型在训练阶段就专门针对AI搜索研究任务进行过强化学习。第二类是"基础模型+搜索工具"的组合,也就是用一个简单的搜索循环封装各种语言模型,测试了九种不同的骨干模型,其中包括FinanceHarness(使用Qwen3.6-27B作为骨干模型)。第三类是工程化的"智能体搜索系统",包括TTD-DR、GPT-Researcher、STORM、OpenClaw和deepagents,这些系统用代码硬编码了各种搜索和分析策略。
在总体得分上,专有模型(使用不开放的商业模型)组的表现最好,Claude-Opus-4.7以34.1%的总分领先,Gemini-3.1-Pro以33.2%紧随其后,GPT-5.5以31.8%位列第三。FinanceHarness则以32.4%的总分在所有开源系统中排名第一,不仅超过了同类专门训练的开源研究模型(Tongyi-DR的28.2%、OpenResearcher的27.2%、MiroThinker的21.2%),也超过了大多数工程化智能体系统(最高的TTD-DR为31.5%),并且超过了使用同类商业模型但没有专业框架加持的基础对比系统。
一个特别值得关注的发现是:在使用同一个骨干模型(Gemini-3-Flash)的情况下,不同搜索框架之间的性能差异,远没有换用不同骨干模型带来的差异大。换句话说,在当前阶段,AI的底层能力(骨干模型的强弱)对金融深度研究的质量影响更大,精心设计的框架虽然有帮助,但暂时还不能完全弥补底层模型能力的差距。
另一个贯穿所有测试系统的规律是:截止日期之前的评分标准(历史信息检索与整合)远远高于截止日期之后的评分标准(前瞻性预判)。以FinanceHarness为例,前者得分45.7%,后者只有11.8%。这个差距在所有17个系统中都有体现,且差距相当稳定。这说明了什么?说明更好的搜索能力可以帮助AI找到更多历史信息,但真正难的部分——把历史信息转化成对未来的合理预判——光靠更好的搜索是解决不了的,需要更深层的推理能力。
那些专门训练的开源研究模型(Tongyi-DR等)为什么得分反而不如通用模型加好框架的组合?研究团队认为这是"工具分布迁移"的问题。这些模型在训练时用的是真实互联网搜索工具(Serper、Jina等),而在FinanceGym的测试环境里,它们需要通过点位时间过滤的FAISS检索系统来获取信息。这就像一个司机平时开自动挡,突然让他开手动挡——技术没变,但操作界面不同,需要重新适应。更重要的是,这些模型训练出来的报告风格更像简洁的答案,而不是充分引用来源的长篇分析报告,而FinanceGym的高分要求恰恰需要后者。
七、FinanceHarness的消融实验:框架到底贡献了多少?
研究团队用一个精心设计的消融实验(即"拆零件看看哪个零件有用"的实验)来量化FinanceHarness框架本身的贡献,所有实验都使用同一个骨干模型Qwen3.6-27B。
实验设置了四个配置版本。第一个叫"Vanilla",就是最基础的"骨干模型+一个搜索工具",没有任何专业框架,总分25.3%。第二个叫"Naive",加入了一个简单的框架结构,但没有专业金融工具和工作流,总分29.6%。第三个是完整的"Harness",也就是FinanceHarness的完整版本,总分32.4%。第四个是在Harness基础上加入了强化学习训练(GRPO)的版本,总分32.8%。
从这些数字可以看出几点。首先,从Vanilla到Naive再到Harness,每一步改进都带来了明显的提升,框架设计确实有价值。从最简单的版本到完整框架,总分提升了7.1个百分点,这相当于在一张满分100分的卷子上从25.3分考到了32.4分,提升幅度接近30%。其次,强化学习训练(RFT)带来的额外提升只有0.4个百分点,相当微小。研究团队把这个结果理解为"框架设计本身承担了大部分提升,强化学习只是锦上添花",并表示更大规模的训练实验留待未来研究。
从各个细分维度看,这套框架在所有主题、所有行业、所有推理类型上都带来了一致的提升,没有明显的短板。不过,加密货币和宏观利率这两个领域的得分始终是所有行业里最低的,而因果分析和比较分析这两种推理类型在所有系统中都是最难的。这个规律在所有四种配置下都保持稳定,说明这些困难来自于任务本身的内在复杂性,不是框架能解决的。
八、跨模型测试:好框架在哪个模型上都好使
除了在FinanceGym上的正式评测,研究团队还设计了一套专门测试框架本身可靠性的实验,把FinanceHarness分别安装在三个不同的骨干模型上运行——开源的Qwen3.6-27B、谷歌的Gemini-3.5-Flash和OpenAI的GPT-5.5——使用完全相同的工具和相同的评分标准。
这套跨模型测试包括11个任务类别,每个任务重复三次,由两个独立的AI评分模型(Gemini-3.5-Flash和GPT-5.5)从忠实度、信息来源可靠性、逻辑连贯性和内容完整性四个维度打分,满分5分。
结果显示,在FinanceHarness框架下,开源的Qwen3.6-27B模型在忠实度(4.02分)和来源可靠性(4.20分)上与GPT-5.5(分别为4.36分和4.47分)的差距只有0.3分左右,甚至在这两个维度上还超过了Gemini-3.5-Flash(3.85分和3.97分)。而在连贯性和完整性这两个维度上,所有三个模型的得分都在4.68分以上,几乎饱和,没有明显差异。这个结果说明,一个好的专业框架能够有效地弥补不同模型之间的能力差距,让规模相对较小的开源模型也能达到接近顶级商业模型的表现。
在框架的可靠性方面,测试数据非常乐观:数据路由的准确率达到95.8%,专业计算任务的准确率达到90.9%,工具覆盖率达到99%,技能调用成功率94%,且在所有测试中没有出现一次"调用了不存在的工具"的错误。
九、实际效果展示:AI真的能写出什么样的报告?
论文中包含了几份由FinanceHarness实际生成的完整研究报告案例,让人可以直观感受到这套系统的实际能力。
最令人印象深刻的一份报告是关于"AI基础设施价值链"的行业深度研究,覆盖了从GPU芯片(英伟达、AMD、博通)到高带宽内存(美光、SK海力士)、芯片代工(台积电)、半导体设备(ASML、应用材料、拉姆研究、KLA)、服务器组装(戴尔、超微、惠普)、网络交换(Arista、博通)、光纤器件(Coherent、Lumentum)、电力设备(Vertiv、伊顿)、电网建设(Quanta Services、EMCOR)、发电(Constellation Energy、Vistra、GE Vernova)到数据中心房地产信托(Equinix、Digital Realty)的完整产业链分析。报告不仅对每个环节的代表公司进行了财务数据对比,还给出了每个环节的战略定位分析和关键风险识别,最终形成了一套清晰的投资优先级判断。整份报告引用了18个不同的信息来源。
另一份案例是对微软进行的五年期现金流折现估值(DCF),AI严格按照金融分析的专业规范,从最新财报出发,设定了每年的营收增长率、利润率、折旧摊销比例、资本开支比例和营运资金变化假设,然后推导出加权平均资本成本(WACC),计算了五年的自由现金流,通过终值模型得出企业价值,再扣除净债务得到股权价值,最后除以稀释股本数量得出每股内在价值约为233美元(彼时市价约382美元)。报告还附上了WACC和永续增长率的双维度敏感性分析表,取值范围分别是WACC在9.6%到13.6%之间,永续增长率在1.5%到3.5%之间,显示内在价值区间为179至340美元。
还有一份关于苹果期权定价的案例,AI用布莱克-斯科尔斯公式精确计算了欧式看涨和看跌期权的价格,并完整呈现了所有的希腊字母(Delta、Gamma、Vega、Theta、Rho),最后验证了看涨-看跌平价关系,误差只有0.00003美元。还有一份关于美国国债的分析案例,计算了特定国债的应计利息、净价、全价、麦考利久期、修正久期和凸性,并测试了利率波动±50个基点时债价的精确变化和近似误差。这些计算完全符合金融实务中的专业标准。
十、这项研究的局限性
研究团队在论文中坦诚地指出了两个主要局限性,这让整项研究更有可信度。
第一个局限是信息库的覆盖范围。FinanceGym的底层信息库是从公开互联网收集的英文文章,因此非英语市场的信息、需要付费订阅的专业数据服务(如彭博终端)以及证券交易所的结构化数据文件覆盖都相当有限。这意味着这套系统目前更适合分析以英语为主要信息载体的市场(如美国股市),对于以中文为主的中国A股市场,或者大量信息藏在付费数据库里的固定收益市场,系统的分析质量可能会大打折扣。
第二个局限是工具分布迁移问题。专门训练的开源研究模型在它们熟悉的工具环境下表现得更好,但在FinanceGym的点位时间过滤检索环境下,它们的得分不如人们预期的那么高。这提醒我们,在评估这些模型的得分时,需要考虑环境差异的因素,不应该简单地把它们的得分与其他系统直接比较。
归根结底,这项研究解决了一个真实且重要的问题:如何让AI真正胜任那些对准确性、时间维度和前瞻性都有严格要求的专业金融研究任务。FinanceGym提供了一把此前从未有过的精确尺子,而FinanceHarness则展示了一种切实可行的专业化框架方案。最有趣的发现或许是那个"40%天花板"——当今最顶尖的AI系统,哪怕是商业闭源模型,在这套专业金融研究考卷上也没有人能拿到40分以上。这不是因为AI太笨,而是因为真正的金融分析确实太难——它需要的不只是检索和整合信息,还需要在不确定性中做出有根据的判断,而这正是人类分析师最难被替代的核心价值所在。
当然,从25.3%到32.4%的提升已经说明,好的框架设计能够让AI更好地发挥潜力。随着骨干语言模型能力持续提升,以及专业框架和训练方法的不断改进,AI在金融研究这个赛道上的表现还有很大的提升空间。感兴趣的读者可以通过arXiv编号2607.27853查阅原论文,研究团队也已将FinanceHarness的代码开源,地址可在原论文中找到。
Q&A
Q1:FinanceGym基准测试集和普通AI问答测试有什么根本区别?
A:FinanceGym的核心区别在于"点位时间"机制和"前后分离"评分设计。普通AI测试通常只检验AI能否回答历史事实,而FinanceGym要求AI在只能使用截止某特定日期前的信息的条件下,不仅整合历史信息,还要对该日期之后的发展做出合理预判。这两项能力被分开独立打分,能精确揭示AI在"回顾"和"展望"两种能力上各自的短板。
Q2:FinanceHarness用的什么模型,为什么开源小模型也能和大商业模型媲美?
A:FinanceHarness默认使用Qwen3.6-27B这个开源模型作为骨干。之所以能接近商业大模型的表现,是因为专业框架承担了大量工作:分层工具设计让AI能精确调用金融专业工具,技能系统提供了可复用的专业工作流,引用管理机制保证了报告来源的可追溯性。这些框架设计有效弥补了模型规模上的差距,在跨模型测试中,Qwen3.6-27B与GPT-5.5的忠实度和来源可靠性差距仅约0.3分(满分5分)。
Q3:为什么所有AI系统在FinanceGym上的前瞻性预判得分都远低于历史信息检索得分?
A:这反映的是金融分析本身的内在难度。历史信息检索只需要AI找到正确的文章、提取准确的数字,更好的搜索工具就能帮上大忙。但前瞻性预判要求AI理解因果关系、评估不确定性、并在信息不完整的条件下做出合理判断,这是一种更深层的推理能力,不是多搜几篇文章就能提升的。研究中所有系统的前者得分大约是后者的三到四倍,说明这个差距来自任务本身的本质差异。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.