网易首页 > 网易号 > 正文 申请入驻

贵57.1倍的Claude Opus 4.8五项全输,赢它的不是模型,是Harness

0
分享至

来源:市场资讯

(来源:机器之心)

机器之心发布

在很多人的印象里,AOE Tech Labs 是一家以产品创新见长的公司。

2026 年 1 月,Floatboat 客户端把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境,开创了 Agent 桌面工作台这一形态;4 月,FloatIM 把人与 Agent、Agent 与 Agent 接成一张办公网络,任务可以跨人、跨 Agent 交接而上下文不断;5 月,FloatSchedule 让 Agent 不必等人下指令,按日程自己开工。三次发布,三个此前市面上没有的东西,全部围绕真实办公场景。

但这三件事没有一件是界面创新。外界看到的是产品形态,每一次底下动的都是 Harness。

8 月 7 日,他们把这层底座直接摆上了榜单 ——Floatboat Harness 在五项第三方基准上的完整评测数据。底座用的是市面上可能最便宜的模型 DeepSeek V4 Flash,成绩超过了一众海外顶尖模型。前面三次,这层技术是以产品形态交付的;这一次,它自己上场接受计量。

  • 完整报告链接:https://floatboat.ai/news/harness-benchmark

这件事之所以值得单独看,是因为它填的是行业里一块公认重要、却长期没人报数的空白。

大家早就承认那个等式:

Model + Harness = Agent。

加号左半边被反复计量,每次模型发布都附一张榜单。加号右半边 —— 模型之外的那半个系统,包括模型能碰到什么、每一轮循环怎么收敛、工具返回什么、状态存在哪里 —— 从来没有一把尺子。

这份数据要回答的,就是右半边到底值多少分。而它给出的答案,可以用四个字概括:多快好省。

一、先看「好」:

$0.175 打 $10,五项全部超越

Floatboat 这次的测试底座是 DeepSeek-V4-Flash,官方 API 谁都能调,输入 $0.14 / 百万 token、输出 $0.28。按 Agent 场景典型的 3:1 输入输出比折算,混合价 $0.175/M。

对面是 Claude Opus 4.8,$5 / $25,混合价 $10/M—— 贵 57.1 倍。


图 1|$0.175 的底座,五项全部超过 $10 的旗舰 左:混合单价对比,DeepSeek-V4-Flash $0.175/M 对 Claude Opus 4.8 $10/M,贵 57.1 倍(线性轴,不作对数压缩)。右:零线即 Opus 4.8 的位置,五项全部落在其右侧,条长为相对领先幅度,小字为两套系统原始得分(Floatboat : Opus 4.8)。这些领先幅度要和左图一起读 —— 又好,又便宜,成本只有对手的 1/57。

五项全部超越。

「好」在 Agent 这件事上是硬门槛 —— 一个工作台如果交付不了真实任务,再便宜也不会有人每天打开它。而过去这道门槛只能用钱换:能干活的太贵,敢放开用的干不动活。

这份数据要说的是,这个交换可以被取消。而取消它的不是模型。

二、这不是一次「便宜模型真香」

这种价格反差的第一反应通常是低价模型追上旗舰的老故事。但这次的数据自己把这个读法否掉了。

同一个 DeepSeek-V4-Flash,跑在 DeepSeek 官方自己的 Harness 上,DeepSWE 只有 54.4,低于 Opus 4.8 的 58.0。放到 Floatboat 上,它跑到了 67.25。

更完整的一组对照更能说明问题:在 Terminal Bench 2.1 上,DeepSeek 官方 Harness 与 Opus 4.8 打成平手(82.7 : 82.7),其余四项全部落后。

也就是说,同一个模型在模型厂自己的系统里,对 Opus 4.8 一项没赢;接入 Floatboat 之后,五项全胜。

模型权重没变,单位成本没变。变量只有一个。

三、一次刻意用

最便宜模型做的单变量实验

值得先把方法学摆完整,因为整个结论的合法性都压在「单一变量」这四个字上。

Floatboat 公布的对照配置是:

  • 双方统一使用 DeepSeek-V4-Flash 0731 模型底座;

  • DeepSeek 官方公开基准中的 Code Agent 任务使用 DeepSeek Harness(即将发布)的极简模式,配置为 max 档位、top_p=0.95、temperature=1.0;

  • Floatboat 侧统一在 Floatboat Evaluation Harness 下执行,大部分基准的模型推理由 DeepSeek 官方 API 提供;

  • 所有任务在完全隔离、开箱即用的物理沙盒环境中独立运行,输入参数完全一致。

这里有一个容易被读漏的细节:对照组不是「裸模型 API」,而是模型厂自己的 Harness。54.4、73.2、82.7、25.1、70.7 这五个数字是 DeepSeek 官方系统的成绩,模型厂的工程能力也在场。

这让对照比「产品对裸 API」严格得多,也让差值更难被解释成「对手没认真配」。

还有一个刻意保守的选择:对照取 0731 正式版,而不是更早的 Preview checkpoint。如果用 Preview,DeepSWE 一项就是 7.3 → 67.25,涨幅 821%—— 一个漂亮得多的数字。但那里面混进了模型自身后训练的迭代,不能归给 Harness。这一行数据在官方总表里也在,Floatboat 没有拿它做宣传口径。

至于为什么选最便宜的模型,理由是反过来的:用顶级模型跑榜会得到「高分 + 归因不清」,没人能判断分数来自模型还是 Harness。锁死同一个最便宜的底座,一边接官方 Harness,一边接 Floatboat Harness,差值就只能落在 Harness 上。这是更严苛的证明条件,不是更容易的那个。

产品本身模型中立,支持接入各家主流模型,本次单一底座只是评测方法论的要求。

四、真正的信息在排列顺序里

如果只看「五项都赢了」,这还只是一次跑分。有信息量的是增益的分布。

把同底座的 Harness 增量单独拉出来:


图 2|模型不变,只换 Harness:任务越长程,Harness 增益越大 左:同一个 DeepSeek-V4-Flash 0731 底座,两端分别为模型厂官方 Harness 与 Floatboat Harness。右:按程长从短到长排列,1.9%(短)→ 9.6%(中)→ 12.6%(中长)→ 19.9%(中长)→ 23.6%(长),五项全部具备官方 Harness 对照,程长分档非递减、增益单调递增,无例外项。Toolathlon 与 BrowseComp 同属中长程档,同档内按增益排序。

1.9% → 9.6% → 12.6% → 19.9% → 23.6%。

五项全部有官方 Harness 对照,按任务程长从短到长排下来,程长分档非递减、增益单调递增,没有例外项。任务越长程,Harness 的增益越大,一路涨到 23.6%。

五项里只有 BrowseComp 官方未披露平均步数,它的「中长程」是依任务设计判断的结论 —— 多跳检索、搜索引擎首屏无法直接回答,检索链长度事前不可知,需跨源证据交叉验证,单次任务的检索与核验轮次与 Toolathlon 同量级。它与 Toolathlon 同属中长程档,同档内按增益排序,两者先后不代表程长差异。

任务链条越长、环节越多、越依赖跨步骤的状态维持与自我修正,Harness 的增益越大;任务越短、越单点、越接近一次性问答,增益越小。

而真实工作恰好是长程的那一类。用户日常要处理的不是一条命令,是跨文件、跨应用、跨很多步、中途还要改主意的活儿。这条规律指向的,正是 Harness 在真实工作里的作用域。

五、五套题都不是自己出的

上面所有数字的分量,取决于题目是谁出的。


图 3|五项基准的出品方与关键设计 没有一项是自家出的题,其中 BrowseComp 出自 OpenAI 官方。

在这张 OpenAI 自己出的榜上,Floatboat 的 87.80 超过了 GPT-5.6 Terra(87.5,贵 25.7×)、Claude Sonnet 5(84.7,贵 22.9×)、Opus 4.8(84.3,贵 57.1×)和 GPT-5.6 Luna(83.3)。

「113 个完全未泄漏的代码库,平均改 7 个文件、新增 668 行」「47 个 SaaS、近 500 个 API 端点,还混着陈旧数据」—— 这类任务过不去提示词技巧那一关。它要求真实的文件存取、多步排错、跨应用状态维持,以及在错了之后自己发现并纠正。

这也解释了增益为什么集中在长程任务上:短程任务考模型的单次输出质量,长程任务考的是整个执行系统。

六、HLR:给 Harness 装一把尺子

Floatboat 给 Harness 划的边界是这么一句:

「Floatboat 正在把前沿模型能力,转化为领先的 Agent 产品。这其中除模型本身以外的所有工作,都属于 Harness 的范畴。」

配套提出的指标叫 HLR(Harness Leverage Ratio,Harness 杠杆率)。它问的其实是一个很朴素的问题:同一笔预算,花在换模型上,还是花在换执行系统上,哪边更值?(价格只用来决定拿哪个模型当参照,不进入公式本身 —— 分子分母都是同一项基准上的分数差。)

写成一个人人能看懂的分式:

HLR = 换 Harness 的收益/换模型的收益

分子是模型不动、只把 Harness 换掉,成绩涨了多少;分母是 Harness 不动、把模型升级到一个更强的参照系统,公开成绩涨了多少。

所以 HLR > 1 的含义很直接:只换 Harness 拿到的增量,已经超过升级到那个参照模型所代表的整段公开性能跨度。

以 DeepSWE 代入:

  • DeepSeek 官方系统:54.4

  • Claude Opus 4.8 公布成绩:58.0,两个公开系统之间只差 3.6 分

  • 同一个 DeepSeek 模型放到 Floatboat 上:67.25,多拿 12.85 分

不换模型、只换 Harness,拿到了 3.6 倍于「升级到贵 57.1 倍的 Opus 4.8」所代表的公开性能跨度。

(给需要精确定义的读者,完整形式为:B 为同一项 Benchmark,SB (M,H) 为模型 M 与 Harness H 组合后的系统成绩,M 是保持不变的底座模型,H0、H1 分别为基线 Harness 与待测 Harness,(Mr,Hr) 是用来标定模型跃迁幅度的参照模型系统。要求所有成绩来自同一评价口径,按 Benchmark 分别计算,不跨基准求平均。)

参照系统的选法有一条先声明的规则,这点决定了指标能不能被采信:主参照统一用 Claude Opus 4.8;如果它在某一项上不比基线系统更高,那一项就没有发生模型跃迁,改取该项最便宜的有效参照;取最便宜的而不是分数最高的,是因为分母要衡量的是一次真实的、代价最小的模型升级 —— 理性用户真会选的那条路。规则先定,再取数。


图 4|HLR:换 Harness 的收益 ÷ 换模型的收益 柱内为分子(Harness 增量)与分母(基线到参照系统的公开差距)。虚线为 HLR = 1,此线以上意味着只换 Harness 的增量已超过升级到参照模型所代表的整段公开性能跨度。Terminal Bench 一项的参照按规则兜底为 GPT-5.6 Luna,该项全部候选参照的 HLR 区间为 0.26×~1.42×。

0.78× → 1.14× → 1.32× → 1.62× → 3.57×。序列与程长规律一致,按程长从短到长排列,分档非递减、HLR 单调递增,没有例外项:越长程,Harness 的杠杆越高。

† 这一项换了参照系统,而换参照的原因本身就是个结论:Opus 4.8 在 Terminal Bench 上是 82.7,与 DeepSeek 官方 Harness 一模一样。把模型换成贵 57.1 倍的旗舰,这一项公开成绩一分没涨;模型不变、只换 Harness,涨了 1.56 分。既然没有发生模型跃迁,它在这一项就不能当参照。按规则改取最便宜的有效参照 GPT-5.6 Luna(84.7,贵 2.6×),得 1.56 / 2.00 = 0.78×。若改取 Claude Opus 5(83.8)可以算出 1.42×,Floatboat 没有采用 —— 规则事先就固定了唯一取值,不允许在候选里择优。这一项全部有效参照的 HLR 区间是 0.26×~1.42×(Sol 0.26× | Terra 0.33× | Qwen3.8-Max 0.40× | Luna 0.78× | Opus 5 1.42×),Floatboat 把整个区间也一并公开了。

HLR 是本次提出的新指标,不是行业标准,换参照系统数值会变。但它的分子分母全部是第三方基准的公开分数,参照选择规则也公开,任何人都可以自己重算,也可以反过来用它核算 Floatboat。

七、12.85 分从哪来:

长程任务到底是怎么失败的

提示词工程、上下文压缩、工具重排这类手段的增益通常在 1–3 分量级。要解释一个量级更大的差值,得先回答一个更基本的问题。

Floatboat 的答案是:长程任务的失败,通常不是「某一步答错了」,而是循环没有收敛 —— 它与真正的交付标准越走越远。

走远有两个成因,一个在人这一侧,一个在模型这一侧。

一是交付标准在任务开始时并没有被完整说出来。真实工作不是标准答案题:人的意图往往随着中间产物逐渐清晰,许多关键标准 —— 语气是否准确、方案能否落地、结构是否符合真实决策流程、结果是否足以直接交付 —— 在第一句话里根本不存在。

二是模型自身的偏移,在长程任务里会被逐轮放大。这是概率生成的固有属性:每一轮的输出都带一点点偏差,而下一轮又要把上一轮的产物当作前提。短程任务里这点偏差看不见,二十步之后它会累积成方向性的错误 —— 上下文里最初那句要求被逐渐挤出、稀释、改写,模型带着一个已经变形的目标继续往前跑,而且跑得很自信。偏移不需要出错就能致命:每一步看起来都合理,合起来却不是要交付的那个东西。

这两件事叠在一起,就是长程任务的真实处境:目标本身是模糊的、会变的,而承接目标的模型又在持续漂移。没有一个系统层持续把它拽回来,跑得越久,离交付标准越远。

这是他们对「Proactive」的定义所指向的地方。

今天不少产品把定时唤醒、自动执行预设动作称为「Proactive Agent」。按 Floatboat 的说法,那只是触发器的主动,不是 Agent 的主动。真正的 Proactive Agent OS,不在于系统能否在没人点按钮时开始工作,而在于:当用户只说出一个模糊目标、甚至自己也还不完全知道什么才算好时,Agent 能否在长程任务中不断探索、执行、观察、修正与自我反思,主动识别结果与目标之间的差距。

用他们的原话:

主动性的高级形态,不是替用户定时执行,而是帮助用户发现自己真正要什么,并把它做到。

这条判断也解释了那组按程长排列的数字:任务越长,未被说明的标准越多,被放大的模型偏移也越多,「持续逼近」的价值就越大;任务短到只有一次问答,既没有可逼近的空间,也没有足够的步数让偏移累积起来。23.6% 与 1.9% 的差距,量的就是这件事。

为什么这要求整个栈都在自己手里

「持续逼近交付标准」听起来像设计理念,落地却需要四层能力同时成立。在行业普遍基于 Claude Agent SDK 套壳做应用、几周就能出一个 demo 的时候,AOE Tech Labs 选择自研 Runtime、Agent Loop、Tools、Infra,以及 FloatSail (Evolution System)。这条路慢得多、重得多,在当时看不到回报。

而这四层各自决定了什么,恰好对应长程任务的四种死法:

Runtime 决定 Agent 能碰到什么 —— 进程、文件系统、权限、沙盒边界。DeepSWE 要平均修改 7 个文件、新增 668 行代码,AutomationBench 要在 47 个 SaaS、近 500 个 API 端点之间穿行,这些任务的前提是真实的读写权和执行权,不是把文本递进去再取出来。

Agent Loop 决定长程任务能否收敛。它不是让模型机械地多跑几轮,而是让每一轮探索都缩短当前结果与交付标准之间的距离:从执行中获得新信息,从观察中发现偏差,从失败中修正路径,从中间产物里反推用户没明说的要求;该回退时回退,该追问时追问。

前面说的两种走远,都要在这一层被按住。对模糊目标,它负责把标准逐轮问出来、试出来;对模型偏移,它负责不让偏差过夜。这意味着每一轮的目标锚点要被重新对齐,而不是任其在上下文里被稀释 —— 什么信息必须原样留在窗口里、什么可以压缩、什么该丢,判断错了偏移就开始累积;也意味着系统要能对自己的中间产物做校验,在偏差还只是偏差的时候把它按回去,而不是等它长成方向性错误。一个只会往前跑的循环,跑得越久错得越远;一个会回头核对的循环,才可能在第 20 步还朝着最初那个目标。

上面说的那种「主动」,物理上就住在这一层。

Tools 决定模型能否正确消费结果。工具的粒度、返回结构、错误语义 —— 一个把失败包装成空字符串的工具,会让模型在第 15 步做出一个自信的错误决策。这类问题在单轮问答里看不见,在 20 步任务里是致命的。

Infra 决定失败能否被发现。状态持久化、并发、可观测性 —— 如果一次长程执行的中间状态无法回溯,那连「哪一步坏了」都不知道,优化就无从下手。

四层里任意一层是别人的,上限就是别人的上限。当 SDK 的 Agent Loop 在第 20 步丢了上下文,套壳者能做的只有换个提示词绕一绕,自研者可以直接改循环。这是「能不能修」的差别,不是「修得好不好」的差别。

FloatSail (Evolution System) 解决的是时间维度和个性化的问题:模型多、更新快,任务越来越复杂。它让 Runtime、Loop、Tools 与模型适配策略在真实任务反馈中持续演进,并在新模型出现时延续已经形成的系统能力。

「技术上,只有自己完全可控的系统,才能驾驭高度不可控的模型,实现最大化模型的智能。」 —— AOE Tech Labs 团队

回到开头那个判断 —— 为什么每一次产品形态创新,底下动的都是 Harness:这个技术判断与团队构成直接相关。创始人拥有 10 年 OS + AI 创业经历与亿级用户产品经验;两位技术合伙人中,一位拥有模型训练经验,另一位具备 OS 底层技术栈经验。模型训练、操作系统底层与亿级产品工程三类能力汇合,团队自然会把 Agent 当成系统工程问题,而不是提示词问题。

产品见长和技术见长在这里不是两件事:能把「用起来舒服」做到位的团队,本来就得先把 Runtime 和 Loop 攥在自己手里。

八、再看「多」:

榜单跑的是一个被削薄的环境

这份成绩单还有一个反直觉的注脚:它比用户真实拿到的环境弱。

评测为了可复现而剔除变量,产品为了能干活而叠加能力,两者本来不是同一个东西。

用户实际使用的 Floatboat 客户端,把文件管理器、文件编辑器、浏览器原生集成进了产品本身,并接入 3000 多个在线服务和各类多模态模型。市面上的 Agent 产品几乎千篇一律:进去就是对话框,选一个固定文件夹作项目入口,AI 生成的文档要去别处打开编辑,AI 要用浏览器还得装插件或征用你正在用的浏览器。Floatboat 的绝大部分工作在一个窗口里完成,不需要打开文件选择器上传,不需要决定下载到哪里,拖拽即可。

对 Agent 而言,这些不是界面,是可调用的工具面:更多可用工具、更短的环境往返、更完整的执行闭环。AOE Tech Labs 确认,完整客户端环境下运行同一批基准,成绩高于本文公布的数字,具体分数后续披露。

「产品设计上,只有让人用的舒服,才能最大化人的潜力。」 —— AOE Tech Labs 团队

顺着那条程长规律看,这件事是自洽的:工具面越宽,人用得越舒服,隐性知识越多,长程任务的增益越大。而真实工作全是长程任务。所以榜单上的数字是保守下限。

那个待披露的差值,可能比榜单本身更有意思。如果 HLR 回答了「Harness 值多少分」,这个差值将回答下一个问题:优秀的人机交互设计值多少分。

九、「快」和「省」:

便宜到不需要掂量,

Agent 才会被真的用起来

最后回到成本这一侧,它的意义不只是省钱。

这五项基准全部是任务完成质量,材料中没有延迟或耗时数据,因此这里不对推理速度作任何数据声称。

「省」是明账。混合价 $0.175/M 对 $10/M,五项全胜的对手贵 57.1 倍。往上看整张价目表,更贵却分数更低的参评系统在 AutomationBench 上是 9/9、Toolathlon 4/4、BrowseComp 6/8、DeepSWE 5/8、Terminal Bench 5/9。

而「快」指的是这个价格带来的使用方式改变。一个长程任务的成本可以忽略,跑歪了重跑一次,代价同样可以忽略。Opus 4.8 贵 57.1 倍,很多团队用它时要先掂量这一趟值不值。当成本低到不需要掂量,Agent 才会被真的用起来,而不是被珍惜着用。

「快」的另一半在人这一侧:客户端省掉的那些找文件、上传、下载、切应用的往返。所谓总周转时间,从来不只是首 token 延迟 —— 找到文件要多久,Agent 能不能直接读写保存,浏览器和在线服务是否在同一个执行环境里,中途失败能不能回退而不是从头再来,用户改了要求能不能沿用已有上下文继续。这几件事合起来,才是「快」在这份材料里的确切含义。

多、快、好、省,四件事在这份数据里第一次同时落地:提升任务种类更多,环境往返更快,五项基准更好,成本还便宜 57.1 倍。

又快又好,AI Agent 工作台才能真正进入日常工作。能干活的太贵、敢放开用的干不动活 ——Agent 长期卡在演示阶段,卡的就是这里。这份数据要说明的是,这个交换可以被取消,而取消它的不是模型,是 Harness。

十、现在就能自己跑一遍

上面所有数字都可以复算。

验证路径很短:用同一个模型,对比它在别处和在 Floatboat 里的表现差距。同模型、不同 Harness,差值就是答案。

建议直接拿长程任务试,因为那是杠杆最大的一段,也是日常真正在干的活:让它改一个跑得起来的仓库、把一份真实资料做成可交付的报告,或者把一个模糊的想法交给它,看它能不能帮你把标准先想清楚。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
练肌肉=存寿命,多练这5个自重动作,覆盖全身肌肉

练肌肉=存寿命,多练这5个自重动作,覆盖全身肌肉

增肌减脂
2026-08-04 16:20:08
印度敢对中国开战吗?真相是:不但敢,甚至蠢蠢欲动。高达72%的民众坚信能打赢,65%的人认为战争可以在两周之内结束

印度敢对中国开战吗?真相是:不但敢,甚至蠢蠢欲动。高达72%的民众坚信能打赢,65%的人认为战争可以在两周之内结束

人生录
2026-08-07 00:05:18
1998年数万华人遭屠杀,中国为何没出兵?26年后答案让人沉默

1998年数万华人遭屠杀,中国为何没出兵?26年后答案让人沉默

哄动一时啊
2026-02-17 22:21:25
立秋大型灾难现场!万千茶饮师的噩梦,秋天第一杯奶茶干到爆单!

立秋大型灾难现场!万千茶饮师的噩梦,秋天第一杯奶茶干到爆单!

大稻网络科技
2026-08-07 15:53:09
给富家少爷做家教有多扎心?网友:正常吃饭,他都以为是在省钱!

给富家少爷做家教有多扎心?网友:正常吃饭,他都以为是在省钱!

夜深爱杂谈
2026-08-01 21:20:03
菲律宾国会两院拟查马科斯,盟友与姐姐态度转向

菲律宾国会两院拟查马科斯,盟友与姐姐态度转向

小影的娱乐
2026-08-08 07:35:51
西藏解放前有多黑暗?老照片令人触目惊心!农民甚至不如牦牛

西藏解放前有多黑暗?老照片令人触目惊心!农民甚至不如牦牛

云霄纪史观
2026-07-30 19:32:21
巴基斯坦与发展部部长伊克巴尔就喀喇昆仑公路改线项目向中方摊牌

巴基斯坦与发展部部长伊克巴尔就喀喇昆仑公路改线项目向中方摊牌

空想之喵
2026-08-08 03:39:10
朱芳雨卸任宏远总经理,豪掷八百万送16岁儿子赴美追梦

朱芳雨卸任宏远总经理,豪掷八百万送16岁儿子赴美追梦

天光破云来
2026-08-08 14:20:51
陈道明没说错,不拍戏就消失的欧豪,早已走上男演员的另一条大道

陈道明没说错,不拍戏就消失的欧豪,早已走上男演员的另一条大道

冰语历史
2026-08-08 11:14:03
从明年开始,超过70岁以上的冠心病患者,一定要做好这5个准备

从明年开始,超过70岁以上的冠心病患者,一定要做好这5个准备

读懂世界历史
2026-08-08 11:22:44
郑丽文会见在台窜访的日本反华议员并发表争议言论,国民党立场岂能如此模糊?

郑丽文会见在台窜访的日本反华议员并发表争议言论,国民党立场岂能如此模糊?

梁察天下
2026-08-08 12:25:12
上一场贸易战中国打赢了吗?说难听点,两场都输了

上一场贸易战中国打赢了吗?说难听点,两场都输了

小马姨
2026-08-04 10:22:29
“悲剧英雄”泽连斯基:用百万血肉试错,让中国拿到了新的入场券

“悲剧英雄”泽连斯基:用百万血肉试错,让中国拿到了新的入场券

比利
2026-08-07 03:35:23
40分钟高铁,40℃到23℃:重庆人的‘清凉飞地’桐梓能复制吗?

40分钟高铁,40℃到23℃:重庆人的‘清凉飞地’桐梓能复制吗?

椰青美食分享
2026-08-08 12:13:07
中央5台直播乒乓时间表:8月8日CCTV5转播国乒!王艺迪 陈幸同将出战

中央5台直播乒乓时间表:8月8日CCTV5转播国乒!王艺迪 陈幸同将出战

云隐南山
2026-08-08 06:48:35
U17国足遭遇主场哨!河床压哨进球被吹,媒体人不满:毫无必要

U17国足遭遇主场哨!河床压哨进球被吹,媒体人不满:毫无必要

奥拜尔
2026-08-07 20:38:18
痛心!四川帅哥李顺强救老婆意外去世,仅25岁,儿子5岁家庭美满

痛心!四川帅哥李顺强救老婆意外去世,仅25岁,儿子5岁家庭美满

水泥土的搞笑
2026-08-08 05:50:20
塔利班在阿富汗执政整整五年,经济萎缩超两成,包括中国在内全球无一国承认,如今急了眼直接向联合国叫板摊牌,到底谁更理亏

塔利班在阿富汗执政整整五年,经济萎缩超两成,包括中国在内全球无一国承认,如今急了眼直接向联合国叫板摊牌,到底谁更理亏

林杰论事
2026-08-06 21:49:44
战友卷走我200万,3年后我去注销银行卡,银行经理突然叫住我

战友卷走我200万,3年后我去注销银行卡,银行经理突然叫住我

千秋文化
2026-07-25 19:50:42
2026-08-08 16:48:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4367009文章数 9210关注度
往期回顾 全部

科技要闻

SpaceX最快下周完成600亿美元收购Cursor

头条要闻

以媒:伊朗最高领袖穆杰塔巴被紧急送医 或随时会死去

头条要闻

以媒:伊朗最高领袖穆杰塔巴被紧急送医 或随时会死去

体育要闻

29岁克拉克死因公布:吸食海洛因与可卡因

娱乐要闻

歌手2026决赛胡彦斌获歌王

财经要闻

一枚“回旋镖”,击中王思聪

汽车要闻

越7全球首秀 传祺开始进攻方盒子越野

态度原创

家居
游戏
旅游
房产
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

时隔近十年 《幽灵行动:荒野》解决玩家最大诟病之一

旅游要闻

海南三亚:多元业态焕新暑期消费

房产要闻

单日狂卖35亿!两大央企重仓,三亚土拍又爆了!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版