网易首页 > 网易号 > 正文 申请入驻

大模型能替人类"聪明地卖股票"吗?

0
分享至


这项由香港科技大学(广州)、浙江大学、中山大学及独立研究员联合开展的研究,以预印本形式于2026年7月30日发布在arXiv平台,编号为arXiv:2607.28410。研究聚焦于一个金融交易领域长期悬而未决的问题:大型语言模型(也就是我们熟悉的ChatGPT这类AI)能否用来执行大额股票交易?

每天股市开盘,无数基金经理面对着一个看似简单却暗藏凶险的问题:手里有一张大额订单,比如要买入或卖出一百万股某支股票,该怎么办?如果一口气全部扔进市场,就像往平静的水塘里扔下一块巨石,价格会立刻剧烈波动,自己的交易反而会造成损失。这种因为自己的买卖行为导致价格变差的现象,在金融界被称为"市场冲击"。

聪明的解法是把大订单拆成一个个小订单,慢慢地、分批地在一段时间内完成交易。但问题随之而来:什么时候多买一点?什么时候少买一点?怎么判断接下来五分钟价格会涨还是跌?这个把大订单拆小、并聪明地安排每笔小交易时机和数量的过程,就是"母单执行"(Parent Order Execution)——它是算法交易领域最核心的问题之一。

现有的解决方案大致分两类。一类是"按规则办事"型,比如最简单的TWAP策略,就是把总量平均分配到每一分钟,不管市场怎么变,雷打不动地均匀交易。还有更复杂的数学模型,比如学界著名的Almgren-Chriss框架,它假设市场冲击遵循某种固定的数学规律。但真实市场并不总是按照数学家的设想运转,规则一旦失效就束手无策。另一类是"让机器学习"型,通过强化学习等技术训练AI来做交易决策,但这类方法需要大量的特定市场数据来训练,换个市场环境或者换个任务设定,整套系统往往要重新来过。

研究团队提出了一个新思路:既然大型语言模型在语言理解、逻辑推理方面展现出强大能力,并且已经被训练了海量的金融、经济相关知识,那么能不能直接让它来做这件事?不需要预设任何市场规律假设,也不需要针对特定任务重新训练,直接在推断时生成决策。这套系统被命名为PACE,中文可以理解为"有计划地控制执行"。

一、大额交易的本质难题:为什么不能一次性全买完

要真正理解这项研究在做什么,需要先在脑海中构建一个具体的场景。假设你是一家基金公司的交易员,今天需要帮客户买入价值五亿元的某支股票,而且要在上午九点半到十一点半这两个小时内完成。

如果你在九点三十分整把这五亿的买单全部挂出去,市场上所有卖家都知道有人要大量购买,他们会立刻把价格抬高。你越急着买,价格就被你自己推得越高,最终你可能花了五亿五千万才买完,凭空多支出了一千万。

这就是为什么大额交易必须"化整为零"。但仅仅"均匀拆分"还不够聪明。假设市场在九点四十分左右会有一波上涨行情,精明的交易员应该在此之前多买一些,在涨价之后少买一些,这样平均下来的成本会更低。问题在于,没有人能准确预测未来,但可以根据当前的价格走势、成交量变化等信号做出比随机猜测更好的判断。

研究团队注意到一个有趣的自然现象:股票价格的波动可以分解成两个层次,就像地球上有洋流(缓慢移动的大趋势)也有海浪(短暂的局部起伏)。从更长的时间维度看,价格在一两个小时内会形成一个相对清晰的涨跌方向;但在每一两分钟这样的短时间尺度上,价格的波动则显得混乱而难以捉摸。

这个洞察成了PACE框架的设计核心。

二、PACE的运作原理:一位"战略家"搭档一位"战术家"

PACE的设计理念可以用一场军事行动来理解。执行一次大型作战任务,需要两个层面的角色协作:负责整体战略部署的参谋长,以及在战场一线随机应变的前线指挥官。

PACE中的"规划者"(Planner)扮演参谋长的角色。在整个交易任务开始之前,它会接收两类信息:一是"母单"的基本信息,包括要买还是卖、买卖多少股、从什么时候开始到什么时候结束;二是过去一段时间(比如过去一小时)的市场历史数据,包括每分钟的股价和成交量。同时,系统还会提供一条TWAP参考曲线,也就是"如果均匀分配应该怎么交易"的基准方案。

规划者要做的事情是:基于这些输入,对整个交易窗口期做出整体的战略判断。具体来说,它把整个交易时间段平均切分成若干个5分钟的"时间槽",然后为每个时间槽打一个分数,分数越高表示这个时间段越值得多交易。同时,规划者还会输出一个"置信度"分数,表示它对这次判断有多大把握。

这个置信度的设计非常精巧:如果规划者觉得市场信号清晰、趋势明确,置信度高,那么最终的交易计划就会较多地偏离均匀分配,向AI认为更好的时机倾斜;如果规划者觉得信号模糊、难以判断,置信度低,那么交易计划就会更接近均匀分配的TWAP基准,稳健地完成任务而不冒险。

规划完成后,整个交易窗口被分成若干个"子计划",每个子计划规定了某5分钟内要完成多少交易量。

"执行者"(Executor)则像是前线指挥官。在每一个具体的交易时刻(每隔一分钟决策一次),执行者同时接收三类信息:最近几分钟的实时市场数据(短期价格和成交量变化),规划者在开始时给出的整体趋势判断,以及当前这个子计划的TWAP基准量(也就是"平均应该交易多少")。

执行者的任务是在TWAP基准量的基础上做微调:如果当前价格对交易有利(比如卖出时价格涨到了一个高点),就多交易一些;如果不利(价格正在下跌),就少交易一些,等待更好的时机。调整的幅度由一个参数控制,确保不会偏离TWAP基准太远。

三、实验设计:如何公平地测试这套系统

研究团队使用了深圳证券交易所的Level-1快照数据,覆盖2026年4月份所有交易日。Level-1数据能提供每个时刻市场上最优的买价(Bid1,愿意出最高价的买家报价)和最优的卖价(Ask1,愿意出最低价的卖家报价),这两个价格的平均值被用作股票的参考价格(中间价)。

每个交易日随机生成10张"母单"进行测试。每张母单的开始时间固定在上午10:30,结束时间则随机选取,可能是10:40、10:50、11:00、11:10、11:20或11:30,因此执行窗口在10分钟到60分钟之间变化。订单方向(买或卖)随机确定,最终51%是买单,49%是卖单。订单数量在100股到10000股之间随机生成,且必须是100的整倍数,平均约5000股。

实验测试了两种下单方式。"激进"模式下,买单直接以市场上卖家的最低价报价,卖单直接以买家的最高价报价,这样可以立即成交,但价格不是最优的。"被动"模式下,买单以买家最高价报价(相当于挂限价单等别人来成交),卖单以卖家最低价报价,这样如果能成交,价格会更好,但存在成交不了的风险。在被动模式中,如果时间快到最后一分钟还有未成交的量,系统会切换成激进模式强制完成交易,这个操作叫"扫单"(sweep)。

为了减少AI随机性带来的干扰,每张母单都会重复运行8次,取平均结果。

参与比较的对手策略包括:最简单的TWAP均匀分配策略;经典的Almgren-Chriss(AC)数学优化策略,通过搜索最优参数κ=0.5来确定前置交易的程度;两种机器学习方法,分别是XGBoost和LSTM,它们被训练用来预测下一分钟价格涨跌方向,然后据此调整交易量。

测试用到的主要指标叫做"价格表现"(bp,单位是基点,1基点等于万分之一)。对于买单,这个指标衡量策略的平均成交价比同期TWAP均价低了多少;对于卖单,衡量高了多少。数值越大越好,正数意味着相比均匀交易节省了成本,负数意味着付出了更高代价。最终汇报的是按交易金额加权的综合指标wbp。

四、实验结果:AI到底赢了多少

在激进模式下,TWAP均匀策略的wbp是-3.28,意思是相比理论最优价格,均匀交易会损失约3.28个基点。AC策略做到了-2.93,比TWAP改善了0.35个基点。XGBoost达到-3.10(改善0.18),LSTM达到-2.91(改善0.37)。

PACE搭载ChatGPT-5.4模型达到了-2.76,改善0.52个基点;搭载DeepSeek-v4-flash模型则达到了-2.26,改善整整1.02个基点,比次优的LSTM还要好0.65个基点。

在被动模式下,各策略绝对值都更大(因为被动策略有成交风险),但相对排名和改善幅度基本一致:PACE(DeepSeek-v4-flash)达到-3.92,改善1.07个基点,比最强基准好0.71个基点。

这0.65到1个基点的提升,放到现实里意味着什么?研究团队做了一个换算:对于一个每年交易规模达到1000亿美元的基金,比TWAP每年多节省约1个基点,折算成真金白银就是大约1亿美元(约7亿人民币)的执行成本节省。即便对小一些的基金,这个数字也是实实在在的。

所有策略都实现了100%的母单完成率,这意味着PACE不是靠"挑容易做的单子"来刷数据,而是在所有情况下都完整执行了任务。

研究团队用5000次自举重采样(bootstrap)检验了这个结论的统计可靠性。DeepSeek-v4-flash在激进模式下的改善幅度,95%置信区间是[0.15, 2.12],p值为0.002,统计上非常显著,不是侥幸。

五、哪些情况下AI优势更大,哪些情况下优势缩小

实验进一步把所有母单按三个维度拆分,分别看PACE对比TWAP的改善幅度。

按交易方向分,买单的改善约为0.35个基点(激进)和0.50个基点(被动),而卖单的改善则高达1.43个基点(激进)和1.42个基点(被动)。卖单表现更好的原因与中国特有的市场制度有关:由于中国市场对卖空(即借入股票做空)存在较严格的限制,负面消息反映在股价里的速度更慢,这意味着卖出订单有更多操作空间,AI的判断也更容易产生价值。

按执行窗口长短分,执行窗口在30分钟以内的短期订单,改善幅度约为1.45到1.57个基点;而执行窗口在30到60分钟的长期订单,改善幅度仅约0.62个基点。道理很直觉:越往远处看,价格走势越难以预测,AI的判断也就越不可靠,贡献自然就小。

按订单量大小分,两个区间(0-5000股和5000-10000股)的改善幅度相差不大,约在0.77到1.16个基点之间。

在市场波动性测试中,研究团队把所有母单按执行窗口内的价格波动率分成高低两组。对比机器学习方法(XGBoost和LSTM),PACE在两组中都表现更好。这说明PACE对价格噪声有更强的抵抗力,把长期规划和短期执行分开来做,确实有助于减少局部价格噪声的干扰。

六、拆解PACE的每一块零件,看看哪个最重要

为了验证PACE各个模块的贡献,研究团队做了消融实验,也就是"拆掉某个部件,看性能如何变化"。

完整的PACE(DeepSeek-v4-flash,激进模式)wbp为-2.26。去掉规划者,只保留执行者后,wbp变为-2.88,性能下降了0.62个基点。去掉执行者,只保留规划者,wbp变为-2.62,性能下降0.36个基点。两者都去掉就等于TWAP,wbp为-3.28,是最差的。

换句话说,规划者和执行者都有独立价值,不可或缺,去掉任何一个都会造成明显性能损失。规划者的贡献在这个设定下更大,但执行者也提供了不可忽视的额外增益。

研究团队还测试了两种提示词变体:一种去掉了"方向性指导"(例如"买单希望价格更低"这类说明),另一种去掉了名词解释(例如Ask1、Bid1、TWAP的含义)。两种变体仍然比TWAP好,说明AI的基础交易知识本身已经足够有用,但完整的提示词仍能进一步提升表现。

七、AI会思考多远的未来?规划复盘实验

默认设置中,规划者在整个母单开始时只做一次规划,之后不再更新。研究团队测试了一种"动态复盘"变体:每完成一个子计划,规划者就根据最新市场数据重新规划剩余部分,相当于每5分钟更新一次战略。

结果出乎意料地呈现出两极分化:对于执行窗口在10-40分钟之间的短期母单,动态复盘使wbp从-1.99变差到-2.50;对于执行窗口在50-60分钟的长期母单,动态复盘则使wbp从-2.78改善到-2.48。

这个结论很有启发性:对于短期订单,一次性规划就足够了,频繁修改反而会打乱节奏、引入噪声;对于长期订单,由于未来太远、一次性规划难以准确,动态更新反而能更好地随市场变化调整。

八、推断成本:性价比如何

这项研究还核算了使用AI的经济账。在整个测试数据集中,共有1680张母单,总交易额约合3560万美元。DeepSeek-v4-flash方案的总API调用费用仅约30美元,换来的是约1个基点的改善,对应约3560美元的执行成本节省。也就是说,每投入1美元的AI计算成本,节省了超过100美元的交易成本,性价比相当高。

九、AI的行为心理学:它和人类交易员有何不同

这项研究最有趣的部分之一,是对AI决策行为的深入分析,揭示出若干与人类投资者截然相反的特征。

首先,研究考察了规划者每次输出是否稳定。对同一张母单反复调用8次,每次的价格走势评分是否会差异很大?用KL散度这个"衡量两个分布差异程度"的指标来看,三种模型设定(ChatGPT-5.4、DeepSeek-v4-flash低推理、DeepSeek-v4-flash高推理)的跨次散度都很低,说明规划者对同一份市场数据的判断相当稳定,不会随机乱飘。

其次,研究考察了置信度与分配集中度的关系。对同一张母单,当某次调用输出的置信度高于平均水平时,其对应的交易量分配是否也更集中在少数几个时间槽上?答案是肯定的,三种模型都呈现出正相关,高置信度意味着更集中的下注。这与人类投资者的过度自信现象有相似之处——人类越有信心,往往越把钱集中押在少数资产上。

然而,关键差异在于置信度与实际表现的关系。对人类投资者,大量研究表明过度自信往往导致更差的投资回报(1999年Terrence Odean的经典研究就记录了这一现象)。但PACE的分析显示,AI的高置信度与更好的实际交易表现呈现出统计上显著的正相关,无论是否加入控制变量都成立。这意味着,当AI"觉得自己看准了",它确实更有可能是对的,而不是盲目自信。

在执行者的行为分析上,研究团队考察了时间压力如何影响AI的决策。当子计划快到结束时间(时间压力高),执行者倾向于减少当前的交易量;当时间还很充裕(时间压力低),执行者反而会多交易一些。这与人类的"拖延"心理恰恰相反——人类往往在截止日期临近时才加速,但AI提前布局、避免在最后时刻被迫以不利价格完成任务。

还有一个有趣的发现:两款AI模型的决策机制有所不同。ChatGPT-5.4的执行决策部分遵循了"近期趋势延续"逻辑,比如价格最近涨了就多买、跌了就少买。但DeepSeek-v4-flash的决策则无法用简单的趋势追踪或均值回归来解释,它有某种更复杂的市场推理在起作用。由于去掉规划者的DeepSeek-v4-flash版本仍然优于TWAP,说明这些"无法用简单规律解释"的决策确实带来了真实的性能增益,而不是噪声。

十、一张订单的完整旅程:具体案例解读

论文中展示了一个直观的案例。有一张卖单,需要在10:30到11:20之间卖出9000股某支股票。规划者看完9:40到10:30的历史数据后,判断下行趋势将持续,因此给前面几个时间槽打了更高的分数(1, 0.5, 0.5, 0, 0, -0.5, -0.5, -1, -1, -1),也就是说前期多卖、后期少卖,整体方案前置了大量交易量。从事后复盘看,股价在母单执行期间确实持续下跌,前置交易的策略帮助以更高的价格卖出了更多股票。

在具体执行层面,有一段10:50到10:54的子计划,TWAP基准是每分钟200股。执行者在价格相对高点(10:51、10:52)把交易量增加到了300股,在价格开始下跌后(10:53、10:54)把交易量减少到了100股。结果是以高于TWAP基准的平均价格完成了这段子计划。

说到底,这项由香港科技大学(广州)等机构开展的研究,用严谨的实验证明了一件事:大型语言模型不仅能做那种"你要不要买这支股票"的宏观判断,也能在微秒与分钟之间的执行层面发挥真实价值。更令人回味的是那几个行为分析发现——AI不会因为自信而失控,不会因为时间紧迫而慌乱,不会被最近一两分钟的价格波动牵着鼻子走。这些与人类投资者的系统性偏差恰好互补,或许真的意味着AI不是要替代交易员,而是弥补他们最容易犯错的那几个地方。感兴趣的读者可通过arXiv编号2607.28410查阅原始论文。

Q&A

Q1:PACE框架的核心创新点是什么?

A:PACE的核心创新在于把母单执行拆分为两个层次:规划者负责分析整体趋势并分配长周期的交易量,执行者则在每分钟根据实时行情微调具体数量。整个系统不需要预设任何市场运作假设,也不需要针对特定任务重新训练模型,直接调用大型语言模型的已有知识在推理时生成决策,兼顾了传统策略的稳健性和AI的适应性。

Q2:PACE比TWAP好多少,实际上能省多少钱?

A:在深圳证券交易所的测试数据中,PACE(DeepSeek-v4-flash)在激进下单模式下比TWAP均匀策略好约1.02个基点,在被动模式下好约1.07个基点。对一个每年交易规模达1000亿美元的基金,这意味着每年可以节省约1亿美元的执行成本。测试期间,整个实验的AI调用费用仅约30美元,性价比极高。

Q3:AI置信度高的时候交易表现真的更好吗?

A:是的,研究通过回归分析发现,规划者的置信度与实际价格表现呈统计上显著的正相关关系,在加入订单方向、数量、执行窗口和波动率等控制变量后仍然成立。这与人类投资者的过度自信现象不同,人类越自信往往结果越差,但AI的高置信度确实对应了更准确的市场判断,是"有凭据的自信"而非盲目乐观。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
你们都是因为什么离开字节?被裁,工作6年赔偿30多万,一年后事业单位上岸

你们都是因为什么离开字节?被裁,工作6年赔偿30多万,一年后事业单位上岸

蚂蚁大喇叭
2026-08-23 17:30:39
2500万打赏风波成罗生门!原来魏莹做过邢某一年多的女朋友,曾商量生孩子,两人聊天记录多达15915条

2500万打赏风波成罗生门!原来魏莹做过邢某一年多的女朋友,曾商量生孩子,两人聊天记录多达15915条

火山詩话
2026-08-23 08:03:29
高分红、低不良 看懂宁波银行四张成长底牌

高分红、低不良 看懂宁波银行四张成长底牌

首条研究院
2026-08-24 13:52:33
退休人注意!养老金上调马上就要来了,这2项变动得盯紧

退休人注意!养老金上调马上就要来了,这2项变动得盯紧

白米饭怎么吃
2026-08-23 21:41:46
许家印被判刑的3天内,家印高中、家印小学门头接连被拆,有人感叹人走茶凉,有人支持拆除,评论区吵翻天!

许家印被判刑的3天内,家印高中、家印小学门头接连被拆,有人感叹人走茶凉,有人支持拆除,评论区吵翻天!

谭谈社会
2026-08-23 10:24:18
“美国与以色列之间发生罕见冲突”

“美国与以色列之间发生罕见冲突”

封面新闻
2026-08-23 22:39:22
美交通部长:加拿大没有军队,医疗体系也在崩溃,根本不可能对抗美国,相信卡尼会很快回到谈判桌前

美交通部长:加拿大没有军队,医疗体系也在崩溃,根本不可能对抗美国,相信卡尼会很快回到谈判桌前

扬子晚报
2026-08-24 15:47:56
施罗德谈詹姆斯加盟76人:48分钟内只有一个球,好奇球权如何分配

施罗德谈詹姆斯加盟76人:48分钟内只有一个球,好奇球权如何分配

懂球帝
2026-08-24 10:21:22
囚牢生活20载,胡风平反后仍心有余悸:坚决反对外孙走上文学之路

囚牢生活20载,胡风平反后仍心有余悸:坚决反对外孙走上文学之路

雍亲王府
2026-08-24 06:45:09
假如波兰下场,俄军还能撑几天?这么说吧,波兰若出兵乌克兰,等于往俄乌这锅沸腾的油里泼了盆冰水,炸是肯定炸,但谁先糊真不好说

假如波兰下场,俄军还能撑几天?这么说吧,波兰若出兵乌克兰,等于往俄乌这锅沸腾的油里泼了盆冰水,炸是肯定炸,但谁先糊真不好说

扶苏聊历史
2026-08-24 15:33:30
38岁女歌手取出超大假体:不想再被束缚

38岁女歌手取出超大假体:不想再被束缚

生活观察员啊
2026-08-24 03:10:14
中秋节前,我国或将迎来四大涨潮:除鸡蛋外,这三样也要涨价了!

中秋节前,我国或将迎来四大涨潮:除鸡蛋外,这三样也要涨价了!

时尚的弄潮
2026-08-24 06:40:44
中共中央,国务院,中央军委决定对张陆,武飞,张洪章进行表彰!

中共中央,国务院,中央军委决定对张陆,武飞,张洪章进行表彰!

麓谷隐士
2026-08-24 06:55:06
巴萨卖便宜了!费兰大巴黎首秀:11分钟进2球,身价5000万欧超值

巴萨卖便宜了!费兰大巴黎首秀:11分钟进2球,身价5000万欧超值

体育知多少
2026-08-24 07:21:11
北丹南维?张丹丹给张维为提鞋都不配

北丹南维?张丹丹给张维为提鞋都不配

黔有虎
2026-08-23 16:14:11
李运代理深圳市人民政府市长

李运代理深圳市人民政府市长

南方都市报
2026-08-24 15:47:14
和一个男人约会,拥抱了,接吻了,晚上也睡在了一起,残酷真相!

和一个男人约会,拥抱了,接吻了,晚上也睡在了一起,残酷真相!

大熊欢乐坊
2026-08-24 12:57:36
8月24日,国新办举行发布会,2026年养老金调整的消息有吗?

8月24日,国新办举行发布会,2026年养老金调整的消息有吗?

社保小达人
2026-08-24 11:21:47
交了18年社保,今天退休金到账了,我盯着短信看了6遍才敢信

交了18年社保,今天退休金到账了,我盯着短信看了6遍才敢信

小影的娱乐
2026-08-24 10:49:23
51:0!歼-16演习结果震惊美媒,埃及派出“阵风”仍无法避免惨败

51:0!歼-16演习结果震惊美媒,埃及派出“阵风”仍无法避免惨败

轻拂两袖风尘终
2026-08-24 12:18:18
2026-08-24 18:55:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9626文章数 568关注度
往期回顾 全部

财经要闻

宇树IPO:追高、被套,多久能回血?

头条要闻

新加坡总理用中文演讲:新加坡绝不能成为单语社会

头条要闻

新加坡总理用中文演讲:新加坡绝不能成为单语社会

体育要闻

42张照片 珍藏世界杯的热辣滚烫

娱乐要闻

韩沛颖开撕《主角》剧组引发全网热议

科技要闻

宇树科技,3天跌了1000亿

汽车要闻

智能超混 国民家轿 上汽大众ID. ERA 5S上市 限时8.99万元起

态度原创

游戏
教育
旅游
手机
公开课

PS商店榜单乱套 大热《GTA6》跌落榜首

教育要闻

小学生路队怎么管?教你5步落地,一周练出快静齐

旅游要闻

抓住暑假的尾巴 解锁海上“速度与激情”

手机要闻

海外用户抱怨谷歌Pixel 11没法玩《原神》,官方调查中

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版