![]()
你有没有想过一个问题:一个基金经理想要分散风险,把钱分散投资到52只不同的股票上,理论上他需要知道的是什么?
不是每只股票自己涨跌多少,而是它们**一起**涨跌的规律。用金融行话说,这叫协方差矩阵。可这东西有个要命的毛病:52只股票要算出所有两两之间的关系,得有1326个数字。如果你手头的历史数据只有几年,甚至只有几十个交易日,这1326个数字里大部分都是噪音,不是信号。
这就是这篇论文要解决的问题。而它给出的答案挺反直觉的:不用算股票之间的协方差,照样能给出一个"风险绝对不会超过多少"的保证。
**核心问题:数据不够,估计就会失真**
想象你要给52个人拍一张合影,来判断谁站得离谁近。如果你只有3张照片可以参考,而这52个人又老在变换位置,你估出来的"谁和谁关系好"大概率是瞎猜。
金融市场就是这样。一个协方差矩阵的自由度是 n(n+1)/2,n是资产数量。可你手上的收益率历史数据,理论上最多能提供 T-1 个独立方向的信息(T是观测天数)。当资产数量n比时间长度T大,或者两者相当时,你估出来的矩阵必然不稳定,越是想抓住的"强信号方向"越可能是噪音在捣鬼。
学界过去的解法是"打补丁":压缩估计(Shrinkage)
压缩估计*:一种把不稳定的样本协方差矩阵,往一个更简单、更稳定的目标矩阵上"拉一拉"的统计技术,用来减少估计误差。
因子模型*:假设股票收益率背后有少数几个共同驱动因素(比如市场整体涨跌、行业景气度),用这几个因子的暴露来解释股票间的相关性,从而减少需要估计的参数数量。
这些方法确实让协方差矩阵更稳定,但它们的信息来源仍然是同一个地方,历史收益率本身。这篇论文的作者换了个思路:能不能用完全独立于收益率的信息,来源,比如公司相关的新闻文本,去"框定"风险的上限?
**从新闻文本到风险上限,中间隔着什么**
这篇论文的核心贡献是一套数学框架,把"公司新闻报道的语义分布差异"一路转化成"投资组合方差的上界"。这中间要过三道关卡。
第一关:把每家公司变成一片"文字云"
论文没有把一家公司的所有新闻文章压缩成一个平均向量,那样会丢失很多信息,而是保留了每篇文章在语义空间里的位置,让每家公司对应一整片散点云。
词嵌入*:一种把文字(词语或句子)转换成高维数字向量的技术,语义相近的文字在向量空间里的位置也相近。
这篇论文用的是Qwen3-Embedding-8B,一个能把每篇新闻文章变成4096维向量的语言模型。想象每篇报道是空间里的一个点,同一家公司几十篇新闻,就是几十个点组成的一小片云雾。
两家公司的新闻云雾离得越远,说明它们讨论的话题、情绪、事件性质越不一样。论文用了一种叫Wasserstein距离的方法来衡量这种"云雾之间的最小搬运成本"。
Wasserstein距离*:又叫最优传输距离,想象一堆散落的沙子要挪到另一个地方堆成另一种形状,这个距离衡量的是"最省力气"的搬运方案需要移动沙子的总路程。用它比较两团概率分布,比简单比较两个平均值要精细得多,因为它保留了分布内部的结构信息。
这里有个技术细节值得一提:论文没有把每家公司的新闻压缩成一个点再比较点与点的距离,而是直接比较整片云雾的形状差异。这就像判断两个班级学生的整体气质差异,不是比较两个班的"平均身高",而是把两个班全体学生的身高体重分布拿来对比,信息量完全不同。如果一个班有一半姚明一半潘长江,平均身高看起来很正常,但这个班的"整体形状"其实很奇特。
第二关:文字距离不等于风险距离,需要一座桥
这是整套理论最微妙的地方。新闻文本的差异,天然就等于公司真实风险敞口的差异吗?当然不是。两家公司新闻风格差异很大,可能只是因为一家爱发通稿一家爱藏着掖着,未必是真实业务风险不同。
论文的处理方式是承认这一点,并且明确地把它写成一条"假设桥梁",而不是悄悄绕过去。
反利普希茨条件*:一个数学限制,保证"信息差异不能凭空消失"。具体说,如果两家公司的新闻在语义空间里离得远,那么经过某个映射转换后,它们在风险暴露空间里的距离也不能小于某个比例(用一个常数L控制)。
firm-specific slack(个体偏差容忍度)*:允许每家公司有自己独特的"信息表达风格",不强求所有公司都用完全一样的方式把内在风险转化为对外新闻。
打个比方:反利普希茨条件就像是给"传话游戏"设了个底线。如果两个人说的话内容天差地别,无论传话的人怎么转述、加多少个人风格,最后传到你耳朵里的两个版本也不可能变得一模一样。这个条件保证了"观察到的差异"不会在传递过程中被彻底抹平,但它并不要求传话过程本身完全忠实。反过来想,如果没有这条底线约束,两个完全不同的新闻云雾理论上也可能对应着完全相同的风险敞口,那新闻信息就毫无用处了。
有了这座桥,论文就能把观察到的新闻文本距离(乘上一个折扣系数,再减去每家公司允许的"偏差容忍度")转化成风险敞口距离的下限。用数学符号写就是:
lij = [L??W2(Ci, Cj) – τi – τj]?
这个公式的意思是:先把观测到的文本距离打个折(除以L),再扣掉两家公司各自的容忍偏差(τi和τj),如果剩下的数还是负的,那就干脆记成零,说明这次没能证明出任何有效的风险分离。这个"截断在零"的设计其实很诚实:它承认了有些情况下,凭手里的证据是没法确认两家公司风险不同的,与其硬凑一个数字,不如老实说"证据不足"。
第三关:从两两关系拼成一整个投资组合
单独两家公司之间能证明"风险不可能完全一致",这只是第一步。真正的投资组合往往有几十只股票,你不能简单地把所有两两关系堆在一起就完事,因为这些两两关系必须能够"共存"在同一个联合概率分布里,否则就是数学上不自洽的。
一致联合律*:要求所有资产的风险暴露服从同一个概率分布,这样任意两个资产之间的关系才能保证互相兼容,不会出现"A和B说好朝一个方向走,B和C说好朝另一个方向走,结果A和C自相矛盾"的情况。
论文用了一个叫Hilbert空间极化恒等式的数学工具,把"投资组合整体方差"精确拆解成"各资产自身方差的加权和"减去"两两分散度的加权和"。既然每一对资产之间的分散度都有一个可证明的下限,那减去这些下限之后,剩下的就是投资组合方差不可能超过的上限。
这就好比你想知道全班同学站队时整体的"松散程度"上限。你已经知道任意两个同学之间的最小距离不能小于多少(因为反利普希茨条件保证了这一点),把这些两两之间的最小间距综合起来,就能倒推出整个队伍不可能挤成一团超过某个程度。这不是精确算出队伍到底有多松散,而是划出一条"最多能挤成什么样"的底线。
论文最终给出的核心公式长这样:
Var(Rq) ≤ 1 – C(q)
这里的1是"完全正相关"情景下的方差基准值,也就是最坏情况,所有股票都往一个方向使劲,毫无分散效果。C(q)是观测到的新闻信息几何结构能够"证明掉"的那部分风险,权重q代表投资组合里每只股票占的比例。C(q)越大,说明能确认的分散化收益越多,风险上限就越紧。
需要强调的是,这不是在告诉你"这个组合的真实方差是多少",而是在告诉你"不管真实情况怎样,方差绝对不会超过这个数"。
**从数学证书到实际的投资决策**
有了这个风险上限公式,下一步自然是问:能不能反过来,找一个让这个上限最小的投资组合?
论文确实这么做了。它把"最小化认证风险上限"变成了一个优化问题,投资者选择资金权重x,使得
CV(x) = A(x)? {1 – C(q(x))}
最小。这里A(x)是投资组合在完全正相关情形下的波动率基准,C(q(x))是能证明掉的那部分。整个过程完全不需要输入任何预期收益率,这是一个纯粹的风险最小化问题,而不是传统意义上追求收益的资产配置。
论文还证明了三件挺实用的事情。
第一,这个优化问题一定有解,只要可行集合是紧致的(说白了就是有界且封闭),数学上保证能找到最优解,不会出现"无穷逼近却永远够不到"的尴尬。
第二,在满足一个可以直接检验的条件下(专业叫"条件负定"),这个优化问题是凸的,意味着可以用成熟高效的算法稳定求解,不会陷入局部最优的陷阱。
第三,也是最有意思的一点:当每家公司的"偏差容忍度"设为零时,那个折扣系数L完全不影响最终选出来的归一化权重分配,它只影响证书能扣掉多少风险量,但不影响"该把钱往哪儿分"这个决策本身。这意味着选股的逻辑完全由观测到的新闻几何结构决定,跟你怎么设定那个折扣系数无关。
这个"折扣系数不影响权重"的结论,有点像调整一把秤的刻度单位不会改变哪个东西更重的结论。你把秤从"克"换成"两",读数变了,但物体之间谁轻谁重的排序完全不变。这个数学性质给了这套方法一层稳健性:哪怕你对那个折扣常数L的取值没有十足把握,只要能接受零偏差容忍度这个简化假设,选出来的股票配置比例是不会变的。
**实证检验:52只股票,5年数据,AI读的新闻**
理论说得再漂亮,也得拿数据试一试。作者选了52家在2018到2022年间有完整每日收益率数据、同时也有Nasdaq新闻档案报道的美股公司,横跨医疗、通信、科技、消费、工业、金融等多个行业。
他们用Qwen3-Embedding-8B这个语言模型把每家公司的新闻文章编码成向量云,计算两两之间的Wasserstein距离,然后在零偏差容忍度的假设下,求解出让证书最大化的那组投资组合权重,称之为"新闻专属配置"。
评估方式很讲究。为了判断这个配置到底算不算"表现优异",作者没有简单地和一两个基准比一比,而是构造了四种不同的"参照人群":两种带不同持仓上限(12.5%和15%)的均匀随机组合、一种刻意匹配了有效持股数量的组合、以及一种更加集中的组合。每种参照人群生成2万个随机样本,看新闻配置的方差排在这些随机样本里的第几百分位。
结果显示,新闻专属配置的样本内方差排名,落在这四类参照人群的0.69%到1.33%百分位之间。换句话说,随机生成的组合里,只有不到1.33%能做到方差和它一样低或更低。而作为对照的"等风险权重"配置(本质上是反波动率加权),排名落在21.1%到28.6%百分位,明显逊色不少。
作为进一步的校准,论文也报告了这个新闻配置和真正用了完整协方差矩阵算出的样本内全局最小方差组合(GMV)相比的差距:新闻配置的标准化方差比等风险权重低8.3%,但比GMV高35.6%。这说明这套方法并不是凭空替代了传统协方差估计的效果,而是在完全不用协方差信息的前提下,做到了一个相当接近的次优表现。
作者还拆解了这个配置背后的逻辑。持仓最大的公司是阿斯利康(AZN),权重达到12.1%,它和谷歌(GOOG)之间的两两分散度贡献了整个证书信用的1.51%,是所有配对中最大的一项。有意思的是,在所有对证书有贡献的两两配对里,87.1%来自跨行业配对,只有12.9%来自同行业内部配对。这说明这套配置捕捉到的分散化收益,主要来自不同行业之间叙事逻辑的差异,而不是简单地把同行业股票分散开来。
论文也做了个"信息窗口扩展"实验:固定住语言模型不变,把新闻文章的时间窗口从2018年逐年扩到2022年,看每次配置结果怎么变化。结果显示,有效持股数量始终稳定在23到25只之间,没有塌缩成单一持仓,一次性换手率在13%到27%之间波动,其中从2018扩到2019那次换手最大(26.8%),但这不能简单归因于某个特定历史事件,因为整套语料库和窗口是同时在变的。
**换个语言模型结果还稳吗**
一个自然的疑问是:这套方法的结果,会不会只是因为碰巧选中了Qwen3-Embedding-8B这个模型?如果换个模型,结论还成立吗?
论文专门做了一轮"表征敏感性"检验,换了七种不同的基础表征加三个自研的历史版本编码器,一共十种设置。结果不算铁板一块。
在同一个模型内部做维度压缩(从4096维压到1024维),结果几乎没变化,配对检验区间包含零,说明适度压缩不影响结论。但换成参数量更小的Qwen3-4B模型(同样在1024维下比较),排名明显变差,这个差异在统计上是显著的。换成另一家公司训练的BGE-large模型,结果又和Qwen3-8B很接近,没能建立起清晰的"模型家族"排序规律。
最让人意外的是极端压缩到64维的那组实验:反而排名变得更好了,比256维那组的表现有统计显著的提升。这说明压缩并不总是"信息损耗越大结果越差"这种简单直觉,某些情况下压缩掉的可能恰好是噪声而不是信号,但这更像是一个值得进一步研究的现象,而不是可以直接采用的最优设置。
论文对此的态度很诚实:这条表征敏感性曲线并不支持"模型越大越好"这种简单叙事,反而说明这套方法的核心结论,在预先设定好的比较框架下确实表现优异,但对测量层(也就是用哪个语言模型、多大维度)本身是敏感的。这不是缺陷的遮掩,而是明确划出了这个结果目前的适用边界。
**这套方法到底证明了什么,又没证明什么**
读到这里,你可能已经感觉到,这篇论文最珍贵的地方不是那个漂亮的百分位数字,而是它对自己边界的坦诚交代。
论文明确指出了五道边界。
第一是识别问题:整套推导依赖于反利普希茨条件、偏差容忍度、一致联合律和收益率桥接假设这四条"维系性假设",这些假设本身并没有从数据里被验证,只是作为前提被采纳。零偏差容忍度这个特例下权重不受折扣系数影响,但这不代表整套传导机制被证实了,只是说明在这个简化边界情形下,计算出来的东西具备一种数学上的自洽性。
第二是表征依赖:换语言模型、换维度,结果会变,前面已经详细说过。
第三是对照组设计的选择性:所谓"排在前1%",是相对于论文自己设计的四种参照人群而言的,换一批参照人群(比如按市值加权抽样、按因子暴露抽样),排名结果可能完全不同。
第四是实施层面的简化:论文实证部分用的是"零偏差容忍度、标准化资产"这个特殊情形,此时资金权重恰好等于风险权重。而完整的一般性目标函数还需要引入各资产的边际波动率,这在论文里没有做实证检验。
第五也是最关键的一点:这是一个样本内(in-sample)描述性排名,新闻文本用的窗口和用来评估方差的收益率窗口是完全重叠的2018到2022年这五年。这意味着论文没有做真正的样本外测试,也就是说,没有验证"如果用2018到2021年的新闻构造组合,拿去2022年检验表现如何"这种更贴近实盘的场景。作者自己也明确说了,这是这套框架"最迫切需要补充的实证任务"。
**写在后面**
读完这篇论文,最触动我的其实不是那个漂亮的数学证明,而是作者处理"文本能不能代表风险"这个问题的方式。他们没有简单地说"新闻情绪能预测股价",而是老老实实地承认:新闻文本和真实的系统性风险暴露之间隔着一层没法直接观测的映射,所以必须引入一组明确写出来的假设作为桥梁,而不是悄悄假装两者是一回事。
这种"明确划出假设边界"的态度,其实比很多号称"AI能预测市场"的论文要诚实得多。它给出的不是一个预测模型,而是一份风险担保书,类似于银行给你的贷款额度上限,不是告诉你未来一定会花多少钱,而是告诉你最多不会超过多少。这种"一侧证书"(one-sided certificate)的思路,在金融风险管理之外的很多领域,比如医疗诊断的误诊率上限、供应链中断的最坏情形估计,似乎都有借鉴价值。
论文里那个87.1%的跨行业配对占比也挺耐人寻味。传统的分散化直觉总是"买不同行业的股票来对冲",而这套基于新闻语义的方法,某种程度上是用一种更细腻的方式在验证并量化这个直觉,不同行业公司的新闻叙事差异,恰好构成了风险分离的主要证据来源。这算不算是给"行业分散"这个老生常谈的投资常识,找到了一种新的、可计算的解释路径?
如果这套方法真的经过了样本外检验证明有效,那接下来会发生什么?把它和传统协方差估计结合起来做成一个混合模型,会不会催生出一种全新的风险管理范式:不再单纯依赖历史价格数据,而是同时纳入语言模型读懂的"叙事风险"?这个问题目前还没有答案,但足够让人期待。
Q&A
Q1:这篇论文的核心方法能替代传统的协方差矩阵估计吗?
A:不能完全替代。论文构建的新闻专属配置,实证方差比等风险权重低8.3%,但仍比用完整协方差矩阵算出的样本内全局最小方差组合高35.6%,说明这是一种不依赖协方差、能给出风险上限证书的方法,而不是精确复刻协方差矩阵的效果。
Q2:这套框架用的是什么语言模型来处理新闻文本?
A:主要使用Qwen3-Embedding-8B模型,把每篇新闻文章编码成4096维向量,保留每家公司全部文章形成的向量云,再用Wasserstein距离衡量不同公司新闻云之间的语义差异,作为构建风险证书的基础输入。
Q3:这篇论文的实证结果是样本外验证过的吗?
A:不是。论文明确说明这是样本内(in-sample)描述性排名,新闻文本窗口和收益率评估窗口都是2018到2022年,没有做真正的样本外回测,作者也把这一点列为该框架最迫切需要补充的实证任务。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.