网易首页 > 网易号 > 正文 申请入驻

南洋理工大学等揭秘AI推理链的隐藏噪音问题

0
分享至


这项由南洋理工大学计算与数据科学学院、浙江大学和悉尼科技大学澳大利亚人工智能研究院联合开展的研究,于2026年7月24日以预印本形式发布,论文编号为arXiv:2607.22098。研究提出了一种名为REDE(Reasoning Denoiser,推理去噪器)的新框架,专门用于提升大型推理模型的幻觉检测能力。

当你向一位聪明的侦探描述一个案件,并让他判断嫌疑人是否有罪,你当然希望他在得出结论之前认真推理每一条线索。但如果这位侦探的笔记本里塞满了大量无关的、甚至反复抄写的废话,他在最终判断时会不会被这些噪音干扰?这正是当今最先进的人工智能推理模型所面临的困境,而这项研究的核心任务,就是帮这位"AI侦探"清理笔记本。

如今,像DeepSeek-R1和OpenAI o系列这样的大型推理模型(Large Reasoning Models,简称LRM),已经能够在给出最终答案之前,先生成一段很长的"思考过程",也就是推理链(reasoning trace)。这种方式确实在很多任务上提升了模型的推理能力,但研究者们发现了一个令人困扰的现象:这些长长的推理链,反而会让"幻觉检测"变得更困难。所谓幻觉,是AI领域的专业说法,指的是模型自信地给出错误或捏造的答案,就像一个人在梦游时煞有介事地说着胡话。

如何判断一个AI的回答是真实可信的,还是在"做梦说胡话"?这就是幻觉检测要解决的问题。研究者们已经知道,推理链中包含着有用的线索,但他们也意识到,直接把整条推理链塞进检测工具里,效果并不理想,甚至会比不用推理链还要糟糕。南洋理工大学等机构的研究团队决定深入调查这背后的原因,并给出系统性的解决方案。

一、侦探笔记里的两种废话:无关步骤与重复步骤

研究团队首先做了一件关键的事:他们仔细阅读了AI模型生成的大量推理链,并对其中每一步推理进行了人工标注。这个工作量相当于让研究人员逐字逐句地审阅侦探的办案笔记。通过对2024年美国数学邀请赛(AIME 2024)的题目所生成的推理链进行详细分析,研究者们识别出了推理链中的两种主要"废话"。

第一种是无关步骤(irrelevant steps)。这类步骤就像侦探在笔记中突然写道"今天天气不错,适合出门散步"——完全与案情无关,对最终结论没有任何贡献,却白白占据了笔记本的篇幅。第二种更为微妙,叫做重复步骤(repetitive steps)。这类步骤的内容,已经在后面的推理中被更完整、更清晰地表达过了,就像侦探在第五页写了一条线索,然后在第三页早就写过完全相同意思、但表达更模糊的版本。前面那个旧版本,就是重复步骤——它的信息已经被后面的步骤"覆盖"了,留着反而会干扰判断。

研究团队在标注完成后统计发现,在所有被标注的推理步骤中,重复步骤占了48.8%,无关步骤占了24.1%,而真正有信息量的"有效步骤"只有27.1%。换句话说,AI侦探的笔记本里,将近四分之三的内容都是噪音。更令人震惊的是,当研究者们手动把这些噪音步骤从推理链中删掉,再用同样的幻觉检测工具进行判断时,检测准确率提升了整整13.73%。这证明了"清理笔记本"是一件非常值得做的事情。

二、现有工具为何无法清理这些噪音

既然噪音步骤如此有害,为什么不直接用现有工具把它们过滤掉呢?研究团队系统地尝试了两种直觉上看起来可行的方案,并发现两者都存在根本性的局限。

第一种方案是利用模型的"置信度"(confidence score)来判断哪些步骤有用。置信度衡量的是模型在生成某段文字时有多确定。研究者们的想法是:如果一个步骤是无关废话,模型在生成它时也许会不那么确定。但实验结果打脸了这个直觉——在图表上,有用步骤和噪音步骤的置信度分布几乎完全重叠在一起,根本无法区分。道理其实很简单:置信度反映的是模型"觉得自己说得对不对",而不是"这句话对最终答案有没有贡献"。侦探可以非常自信地在笔记本上写下无关的废话。

第二种方案是在"嵌入空间"(embedding space)中用相似度来过滤。嵌入空间是一种把文字转化为数字向量的技术,你可以把它理解为:每一段文字在一个多维地图上都有一个坐标位置,意思相近的文字坐落在地图上相近的位置。研究者们想到,无关步骤在这张地图上可能是"偏远地区"的孤立点,可以通过k近邻(kNN)方法把它们揪出来。这个方法对无关步骤确实有一定效果,但对重复步骤完全失效——因为重复步骤在语义上与有效步骤高度相似,它们在地图上的坐标非常接近,用距离方法根本无法区分"旧版本"和"新版本"的同一条线索。

两种方案都失败了,这让研究团队意识到:要解决这个问题,必须找到一种更深层、更能反映"对最终答案贡献大小"的信号。

三、AI自己的注意力就是最好的线索

研究团队转向了一个更有趣的思路:与其从外部评判每个推理步骤是否有用,不如直接问AI自己——当你在给出最终答案时,你的注意力集中在哪里?

这里涉及到一个AI模型内部的核心机制,叫做"注意力"(attention)。在理解这个机制时,可以把它类比为人类在阅读时的眼球运动:当你在做一道数学题并写出最终答案时,你的眼睛会频繁扫回到哪些关键计算步骤上?那些被你频繁注视的步骤,就是真正支撑了你的答案的关键信息。AI模型的注意力机制与此类似:在生成最终答案的最后一个词(token)时,模型会对推理链中所有之前出现过的词分配不同的注意力权重,权重越高,说明那段推理对生成这个答案越重要。

研究团队将这种"最终答案对每个推理步骤的注意力分数"定义为步骤分数(step score),数学上的计算方式是把最终答案词的查询向量(query vector)与推理链中每个词的键向量(key vector)做内积运算,然后归一化。直觉上的解释很清晰:如果一个推理步骤对答案毫无贡献,那么答案词在生成时就不会去"参考"它,其注意力分数就会很低;如果一个步骤的内容已经被后面的步骤覆盖,注意力也会集中在更晚出现的那个版本上,早期的重复版本同样会得到低分。

在AIME 2024数据集上的验证完全支持了这一假设。对所有被标注的步骤取平均,有效步骤的平均注意力分数为0.0065,而无关步骤只有0.0021,重复步骤为0.0033。这个差距虽然在绝对值上不大,但方向上非常一致,说明最终答案的注意力分数确实能够区分不同类型的步骤。研究团队还通过一个聚类实验进一步验证了另一个发现:在一组语义相似(即重复)的步骤中,保留最后出现的那个步骤比保留最早的那个步骤,能给幻觉检测带来更高的准确率(AUROC从70.91%提升到82.37%)。这证实了"越晚出现的步骤信息越完整、越关键"这一规律。

四、REDE框架:让地图重新画一张

发现了注意力分数这把"钥匙"之后,研究团队面临下一个挑战:直接用注意力分数来过滤步骤的效果并不稳定。这是因为不同推理链的长度各异,每条链内部的注意力分数分布也千变万化,难以设置一个统一的阈值。而且,在推理时重新计算每条链的注意力分数,计算成本也不低。

于是研究团队设计了REDE的核心思路:不直接用注意力分数过滤,而是用注意力分数作为"老师"来训练一个轻量级的小模型,让这个小模型学会"重新绘制地图"——把原本混乱的步骤嵌入空间改造成一张新地图,在新地图上,有效步骤紧紧聚集在一起,噪音步骤则被孤立地散落在外围。

REDE框架分为三个核心组件,整个过程像是一套精心设计的培训流程。

第一步是提取每个步骤的向量表示。为了让每个步骤的向量表示尽量准确,研究团队没有简单地取该步骤所有词的平均,而是采用了一种叫"困惑度加权平均"的方法。困惑度(perplexity)衡量的是模型对某个词感到"意外"的程度——越意外的词,往往携带越多关键信息(就像在一个平淡的句子中,突然出现一个意想不到的关键词,那个词往往是重点)。因此,困惑度高的词会获得更大的权重,从而让步骤向量更能反映真正的语义核心。

第二步是构建"代理集合"并训练投影网络。对于训练集中的每一条推理链,研究团队用注意力分数对所有步骤排序,取分数最高的前ρ%作为"有效步骤代理"(informative proxy),取分数最低的后ρ%作为"噪音步骤代理"(noisy proxy)。默认的ρ值为20到25左右。然后,研究团队训练一个两层的MLP神经网络(可以理解为一个非常小的AI模型,只有两层结构),这个网络的任务就是把步骤的原始向量映射到新的向量空间。训练目标由三个损失函数(loss function)组成,这三个损失函数像三条军规,共同塑造新地图的形状。第一条军规(Lcompact,紧凑损失)要求所有有效步骤在新地图上尽量靠近彼此,形成一个紧密的集群。第二条军规(Ldisperse,分散损失)要求所有噪音步骤彼此之间不要聚集,而是保持分散,让每个噪音步骤都成为地图上的孤立点。第三条军规(Lseparate,分离损失)要求有效步骤集群与噪音步骤之间保持尽量大的距离。这三条军规协同作用,就像在地图上同时执行"把好人聚集到城市中心"、"让坏人互相保持距离"和"让城市与荒野隔绝"三个命令。

第三步是推理时的高效过滤。一旦这个小型投影网络训练完毕,在面对新的测试案例时,REDE就不再需要重新计算注意力分数了。它只需要把每个步骤的向量通过这个投影网络变换到新空间,然后用k近邻距离来衡量每个步骤的"孤立程度":在新地图上邻居很多、距离很近的步骤被认定为有效步骤;邻居稀少、孤立散落的步骤被认定为噪音步骤。随后,距离最大的前ζ%的步骤被删除,默认的ζ值为70%。也就是说,平均来说,REDE会删掉推理链中70%的步骤,只保留最核心的30%。过滤后的推理链再传给下游的幻觉检测工具,进行最终判断。

五、实验结果:四面出击,全线告捷

为了充分验证REDE的效果,研究团队在四个完全不同类型的推理任务数据集上进行了测试。TruthfulQA是一个包含817道常识性问答题的数据集,专门用来测试模型是否会信口开河。MATH是由MATH500、AIME 2024和AIME 2025三个数据集合并而成的数学推理数据集,共560道题。CodeElo是包含408道Codeforces竞赛编程题的代码生成数据集。MULTIHOPQA则是一个多跳问答数据集,需要把来自多个文档的信息串联起来才能回答。这四个数据集涵盖了从常识到数学到编程到逻辑推理的广泛场景。

测试所用的AI模型包括Qwen3-8B和Qwen3-32B(阿里巴巴的千问系列),以及DeepSeek-R1-Distill-Llama-8B和DeepSeek-R1-Distill-Qwen-32B(深度求索的推理系列)。幻觉检测的质量用AUROC(曲线下面积)来衡量,这个指标的取值范围是0到100,数字越大越好,50意味着随机猜测,100意味着完美检测。

首先,研究团队验证了REDE过滤是否真的能帮助各类下游检测工具。他们测试了四种代表性的检测方法:监督式探针(Supervised Probing)、对比一致性搜索(CCS)、困惑度检测(Perplexity)和语言化确定性(Verbalized Certainty)。结果显示,在所有数据集和所有检测方法的组合下,使用REDE过滤后的推理链,都比使用原始推理链的检测效果更好。以Qwen3-8B在TruthfulQA上为例,CCS方法的AUROC从68.63%大幅跃升至87.32%,监督式探针从80.42%提升至86.44%,困惑度方法从58.17%提升至63.46%,语言化确定性从50.37%提升至61.10%。对于DeepSeek-R1-Distill-Llama-8B,同样的趋势在所有数据集上得到了复现。这证明REDE带来的提升是普遍性的,不依赖于特定的检测工具。

其次,研究团队将REDE与大量竞争基线进行了正面比较,包括基于嵌入的方法(TSV、HaloScope、CED、HaMI)、基于一致性的方法(语义熵、SelfCheckGPT、特征值分数)、基于语言输出的方法(P(True)),以及专为推理模型设计的LRM专用方法(RACE、RHD、HalluGuard、ARS)。REDE在几乎所有数据集和模型的组合下都达到了最好的成绩。特别是与最相关的竞争对手ARS(Answer-agreement Representation Shaping,答案一致性表示塑造)相比,REDE在MATH上实现了81.33% vs. 77.03%的超越。ARS的思路是把推理链当作一个整体上下文来调整答案的表示,而没有去关注链内部的噪音步骤,REDE的优势正是来自于对步骤粒度噪音的精细处理。

研究团队还系统地检验了REDE的迁移能力:把在一个数据集上训练好的投影网络直接用于另一个数据集,效果如何?实验结果非常理想。以在MULTIHOPQA上训练、在CodeElo上测试为例,AUROC达到了88.04%,甚至略微超过了在CodeElo上直接训练的87.19%。这说明REDE学到的去噪信号具有相当强的通用性,不局限于特定的题型或领域。

在模型规模上,研究团队把测试范围扩展到了更大的32B参数量模型。在Qwen3-32B上,REDE达到了90.87%的AUROC(TruthfulQA),比最强基线RACE高出5.73%;在DeepSeek-R1-Distill-Qwen-32B上,REDE达到78.95%,比RACE高出13.11%。这证明随着模型越来越大,REDE的去噪效果依然稳健有效。

六、消融实验:拆开每个零件看看少了哪个会坏

为了确认REDE的每个设计选择都是必要的,研究团队进行了大量的"零件拆除实验"(即消融实验),一项一项地检验不同选择的贡献。

在损失函数设计上,研究团队分别去掉三个损失函数中的任意一个,观察性能变化。去掉分散损失(Ldisperse)导致了最大的性能下滑,AUROC从86.44%骤降至80.06%,这印证了"让噪音步骤互相保持分散"是最关键的设计:如果噪音步骤聚集在一起,k近邻方法就会误以为它们也是紧密集群,从而错误保留它们。去掉紧凑损失(Lcompact)会让有效步骤分散开来,与噪音步骤混在一起。去掉分离损失(Lseparate)则会减小两组之间的整体距离。三个损失函数缺一不可,共同构成了地图重塑的完整力量。

在过滤比例上,研究团队系统地测试了不同的ζ值(即删除多少比例的步骤)。从ζ=0(不过滤)开始,性能随ζ增大而稳步上升,在ζ=70%时达到峰值,此后性能开始下降。这个结果有两层含义:首先,推理链中确实有大量步骤是噪音(70%这个比例与人工标注的73%噪音比例高度吻合);其次,过滤的边界也不能无限超越,删得太多会把真正有用的步骤也误伤。

在步骤嵌入方式上,研究团队比较了三种方案:只取步骤最后一个词的向量、对步骤内所有词均匀平均、以及论文采用的困惑度加权平均。实验证明困惑度加权平均在所有检测方法下都表现最优,这验证了"让重要词获得更大权重"的直觉。

研究团队还对比了REDE与六种其他步骤筛选策略:随机选择、STEP(用隐藏状态探针评估步骤贡献)、SPIRIT(基于困惑度变化衡量步骤重要性)、ASAP(基于首词惊讶度识别逻辑关键点)、Step Entropy(基于步骤熵压缩推理链)、以及用大型语言模型Qwen3-32B充当评判者。所有这些方法都无法稳定地超越原始推理链的检测效果,甚至部分方法会让效果变差。原因在于,这些方法的设计目标是提升生成质量或效率,而不是识别哪些步骤对幻觉检测有用。REDE专门针对幻觉检测这个目标来塑造表示空间,因此具有明显优势。

值得一提的是,研究团队还测试了直接用注意力分数过滤与REDE的对比。直接过滤在TruthfulQA上的CCS方法能达到80.51%,而REDE能达到87.32%。这证明了"把注意力分数转化为学习的投影"比"直接用注意力分数切阈值"更稳健、更有效。

七、理论保证:为什么这样做在数学上是合理的

研究团队不满足于仅仅展示实验效果,还为REDE的有效性提供了严格的数学证明。整个理论分析形成了一条完整的逻辑链条,环环相扣。

第一环(命题E.3)证明了噪音步骤确实会降低幻觉检测的质量。在一个合理的假设下(即噪音步骤大致上不携带与答案正确性相关的标签信息),包含噪音步骤的完整推理链的"Fisher判别度"(衡量两类样本可分性的经典指标)不会高于只含有效步骤的推理链,偏差由噪音步骤与有效步骤的相关程度来控制。这在数学上精确地说明了"噪音步骤降低可分性"这一直觉。

第二环(命题E.5)证明了在REDE学到的新地图上,有效步骤和噪音步骤的k近邻距离确实能够被统计地区分开来。具体而言,如果有效步骤在新地图上形成了足够紧密的区域(平均邻居数≥2κ),噪音步骤足够稀疏(平均邻居数≤κ/2),那么有效步骤的k近邻距离小于某阈值的概率至少为1-exp(-κ/4),噪音步骤的k近邻距离大于另一阈值的概率至少为1-exp(-κ/6)。随着k(近邻数)增大,这两个概率都趋向1,分离越来越可靠。

第三环(命题E.6与推论E.7)分析了基于排名删除前ζ%步骤这一实际操作的过滤错误率。过滤错误分两部分:一是实际噪音步骤数量与被删除步骤数量之间的偏差(计数不匹配),二是有效步骤和噪音步骤的分数重叠(通过前两环的结论可知随k增大而指数衰减)。

第四环(定理E.11)将过滤质量与检测风险直接联系起来:如果过滤错误率趋近于零,那么在过滤后推理链上的幻觉检测风险也趋近于在纯净有效步骤上的检测风险。这就在数学上保证了:只要REDE的过滤足够准确,检测性能就一定能得到改善。

整套理论分析还明确了训练目标(三个损失函数)是如何逐步创造出满足这些数学条件的几何结构的,形成了从训练目标到几何结构到过滤准确率到检测性能的完整闭环。

八、人工智能在"黑盒"场景中的应用潜力

研究团队还考虑了一个实际场景:如果你想检测的AI是一个不对外开放内部结构的黑盒系统(就像你无法看到某个AI服务的内部参数),REDE还能用吗?

研究团队的解决方案是使用一个代理白盒模型(Qwen3-32B),把目标黑盒模型生成的问题和推理链输入到这个代理模型中,用代理模型的注意力和嵌入来替代目标模型进行REDE的过滤操作,过滤后的推理链再回传给目标模型的外部输出接口进行最终检测。

实验结果显示,这种代理方式在所有测试场景下都能比不过滤的原始推理链获得更好的检测效果,与白盒场景的完整REDE相比,性能差距也相对较小(例如,在DeepSeek-R1-Distill-Llama-8B的TruthfulQA上,代理方式达到59.85%,白盒方式达到61.94%,原始推理链仅56.61%)。这说明REDE的去噪能力在一定程度上可以跨模型迁移,具有更广泛的实际应用价值。

归根结底,这项研究揭示了一个看似反直觉却经过严谨验证的规律:AI想得越多,不代表越可靠;关键在于它想的那些到底有多少是真正有用的。REDE提供的解决思路清晰而优雅——不是让AI少思考,而是帮它把真正关键的思考步骤筛选出来,丢掉那些干扰性的噪音。这就像一位经验丰富的编辑帮作者精简文章:不是简单地删减篇幅,而是精准地保留每一句真正推动叙事的内容。

对于研究者和工程师而言,REDE还有一个实用优势:它是一个可以"插拔"的模块,无论你已经在使用哪种幻觉检测工具,都可以在前端加上REDE的过滤步骤,几乎不需要修改现有系统,就能获得稳定的性能提升。从更长远的视角来看,如何让AI不仅能正确推理,还能自我感知哪些推理是噪音、哪些是真正有价值的,或许将成为未来AI可靠性研究的一个重要方向。有兴趣深入探究技术细节的读者,可以通过arXiv编号2607.22098查阅完整论文。

Q&A

Q1:REDE框架是什么,它解决了什么问题?

A:REDE(推理去噪器)是南洋理工大学等机构提出的一种AI幻觉检测工具。它解决的核心问题是:大型推理模型生成的长推理链中混杂了大量无用的"废话步骤",这些噪音步骤会干扰判断AI答案是否可信。REDE通过学习一种新的向量表示空间,把有用步骤和噪音步骤分离开来,从而让幻觉检测更准确。

Q2:推理链中的无关步骤和重复步骤有什么区别?

A:无关步骤是完全与问题无关、对最终答案没有任何贡献的推理内容;重复步骤则是虽然与问题相关,但其信息已经在推理链的后续步骤中被更完整地表达了,早期的版本因此变得冗余。研究发现,这两类噪音合计占推理步骤总数的约73%,远超真正有用的步骤比例。

Q3:REDE过滤推理链后会不会影响AI解题的准确率?

A:研究团队专门测试了这个问题。在数学题(MATH数据集)上,过滤掉约70%的推理步骤后,AI的解题正确率为80.00%,而使用完整推理链的正确率为81.43%,差距非常小。这说明被删掉的大多数步骤对解题本身也没有实质贡献,REDE的过滤不会明显损害AI的推理能力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
彻底失控!怀特塞德药检风波持续蔓延,上海男篮陷入多赛季泥潭

彻底失控!怀特塞德药检风波持续蔓延,上海男篮陷入多赛季泥潭

黄小仙的搞笑视频
2026-08-07 19:46:56
得知陈赓被评开国大将,战俘在狱中感慨:若没意外,我也会是大将

得知陈赓被评开国大将,战俘在狱中感慨:若没意外,我也会是大将

兴趣知识
2026-08-08 15:17:29
世体:坎塞洛即将重返巴萨,转会费约为800万至1000万欧元

世体:坎塞洛即将重返巴萨,转会费约为800万至1000万欧元

懂球帝
2026-08-08 07:40:21
水均益外孙女周岁宴,女儿家里冰箱又脏又乱,换六个保姆被疑人品

水均益外孙女周岁宴,女儿家里冰箱又脏又乱,换六个保姆被疑人品

可爱的巴比龙
2026-08-08 15:25:07
撒贝宁问龙洋想嫁谁?她的回答太绝,世上怕没这男人

撒贝宁问龙洋想嫁谁?她的回答太绝,世上怕没这男人

乡野小珥
2026-08-07 13:39:23
中超辽宁德比即将打响!辽宁铁人申请换裁判 称其存在误判

中超辽宁德比即将打响!辽宁铁人申请换裁判 称其存在误判

半岛晨报
2026-08-08 10:04:22
最绝望的球队!底薪签人都要1900万,顶级3D留不住,骑士趁机挖角

最绝望的球队!底薪签人都要1900万,顶级3D留不住,骑士趁机挖角

你的篮球频道
2026-08-08 10:06:26
查尔斯若亮出阿奇莉莉贝特近照,哈里梅根隐身育儿算盘落空

查尔斯若亮出阿奇莉莉贝特近照,哈里梅根隐身育儿算盘落空

老吴教育课堂
2026-08-08 01:42:43
这6种病倾家荡产也不能治愈,说能根治的,都是忽悠你!

这6种病倾家荡产也不能治愈,说能根治的,都是忽悠你!

橘子约定
2026-08-08 11:12:15
papi酱的智慧学不完

papi酱的智慧学不完

快刀财经
2026-08-08 00:27:33
关之琳前夫再婚,女方穿百万行头长相普通膀大腰粗,更多内幕被曝

关之琳前夫再婚,女方穿百万行头长相普通膀大腰粗,更多内幕被曝

白面书誏
2026-07-30 17:21:29
“这才是政审的意义!”女子考公上岸后,被高中欺负过的同学举报

“这才是政审的意义!”女子考公上岸后,被高中欺负过的同学举报

妍妍教育日记
2026-07-17 08:25:14
韩国想借道朝鲜连通中国,平壤直接炸路表态:咱们是敌人

韩国想借道朝鲜连通中国,平壤直接炸路表态:咱们是敌人

趣文说娱
2026-08-08 15:02:18
中国福登!张稀哲曾牵小球童入场:昨晚球童成为他队友太传奇

中国福登!张稀哲曾牵小球童入场:昨晚球童成为他队友太传奇

邱泽云
2026-08-08 14:52:52
139万辆车、多起起火、一句“零燃烧”:余承东的数学是跟谁学的

139万辆车、多起起火、一句“零燃烧”:余承东的数学是跟谁学的

民间胡扯老哥
2026-08-07 06:38:45
失望至极!女版唐正东6中1,2次空篮不中,怪不得多次被宫鲁鸣抛弃

失望至极!女版唐正东6中1,2次空篮不中,怪不得多次被宫鲁鸣抛弃

南海浪花
2026-08-07 22:09:17
100多位情妇,包养费上亿元,9女同床却沦落个凄凉下场、人财两空

100多位情妇,包养费上亿元,9女同床却沦落个凄凉下场、人财两空

妙娱连珠
2026-06-18 15:12:38
人伦大乱正在毁掉无数中国家庭:3种乱象就在日常,拖垮一家人

人伦大乱正在毁掉无数中国家庭:3种乱象就在日常,拖垮一家人

阿凯销售场
2026-07-04 15:35:28
水均益外孙女周岁宴,6位阿姨全跑光,水亦诗的生活一地鸡毛

水均益外孙女周岁宴,6位阿姨全跑光,水亦诗的生活一地鸡毛

老吴教育课堂
2026-08-08 14:57:39
单身男人想捡漏大龄剩女?可能比登天还难

单身男人想捡漏大龄剩女?可能比登天还难

加油丁小文
2026-08-07 07:30:08
2026-08-08 16:16:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9454文章数 567关注度
往期回顾 全部

科技要闻

SpaceX最快下周完成600亿美元收购Cursor

头条要闻

以媒:伊朗最高领袖穆杰塔巴被紧急送医 或随时会死去

头条要闻

以媒:伊朗最高领袖穆杰塔巴被紧急送医 或随时会死去

体育要闻

29岁克拉克死因公布:吸食海洛因与可卡因

娱乐要闻

歌手2026决赛胡彦斌获歌王

财经要闻

一枚“回旋镖”,击中王思聪

汽车要闻

越7全球首秀 传祺开始进攻方盒子越野

态度原创

教育
亲子
旅游
公开课
军事航空

教育要闻

班主任提醒:暑假已过半,这5件事要提早做起来!

亲子要闻

一大早又去硚口吃黄恒记牛肉粉了。 杨雪呀

旅游要闻

夏日经济乘“热”而上 消费市场向“新”而行

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

伊朗公布“被击落的美以战机残骸”

无障碍浏览 进入关怀版