网易首页 > 网易号 > 正文 申请入驻

当AI智能体学会"越狠越省":一种不用反向传播的训练新思路

0
分享至


你可能没想过这样一个问题:训练一个AI智能体,究竟需要多少张显卡?

如果这个智能体只需要回答一个问题,那答案可能是几张。但如果它要连续操作浏览器完成一整套任务,中间要点击、输入、翻页、判断,走上十几步甚至几十步才能拿到最终结果,那答案可能是几十张显卡都不够用。

这不是夸张。本文要讲的这篇论文里提到,一个270亿参数的模型,用传统的强化学习方法去训练,需要将近89GB的显存。而同样的模型,如果换一种训练思路,只需要8.4GB,连普通的推理都用不了这么多。差了十倍。

这篇论文的名字叫《Agentic ESOpt》,来自新加坡国立大学、南方科技大学和牛津大学的研究者们。他们提出的核心观点很直接:当AI智能体要执行的任务变得又长又复杂的时候,传统的强化学习训练方法可能根本不是最优选择,甚至可能是错误的选择。取而代之的,是一种几十年前就存在、却一直被认为"不如强化学习"的老方法:进化策略。

长任务把强化学习逼到了死角

先说清楚问题出在哪。

现在的大语言模型已经不只是聊天工具了。它们可以像人一样操作网页、调用工具、写代码、玩数独。这类任务被称为智能体任务

**智能体任务**:需要AI模型和外部环境反复交互多轮才能完成的任务,比如浏览网页找信息、连续调用计算器解题,而不是一次问答就结束。

要让模型在这类任务上表现更好,业界的主流做法是用强化学习去微调它。你大概听过GRPO、PPO这些名字

**强化学习微调**:让模型自己尝试完成任务,根据任务完成得好不好给它打分,再根据分数调整模型内部参数的训练方式。GRPO和PPO都是具体的调整算法,前者靠一组样本互相比较打分,后者靠一个额外的"评委模型"打分。

这套方法在单轮任务上效果很好,比如做一道数学题,模型思考完给出答案,一步到位。但一旦任务变成"连续走十几步才能拿到结果",麻烦就来了,而且是两个层面的麻烦。

第一个麻烦是显存。强化学习微调需要做反向传播

**反向传播**:神经网络学习时用来计算"每个参数该往哪个方向调整多少"的核心算法,计算过程中需要把前向计算的中间结果全部存下来,占用大量显存。

要做反向传播,就得存激活值、存优化器状态,轨迹越长,存的东西越多。论文里给出的具体数字是,在数独任务上,微调一个40亿参数的模型,GRPO需要58.88GB显存,PPO更夸张,要89.4GB。而同样的模型只做推理,只需要8.41GB。这中间差了十倍,全都花在了"为了算出该往哪调整"这件事上。

第二个麻烦更本质,叫做信度分配问题

**信度分配问题**:当一个任务需要连续做十几个动作才能知道成功还是失败时,系统很难判断这十几个动作里到底哪一步做对了、哪一步做错了,只能凭最后那一个结果反推,推得越远越不准。

想象一下这个场景。你带着导航走一条从来没走过的路,导航只会在你到达终点或者彻底迷路的时候告诉你"到了"或者"错了",中间十五个转弯路口它一言不发。如果最后你没到,你能确定是哪个路口转错了吗?可能是第三个路口,也可能是第十二个,也可能每一个都没错,只是运气不好。这就是长任务里的信度分配困境,动作越多,回头找错误的难度呈指数级上升。如果放弃精确定位,只用一个粗糙的整体分数去反推每一步的对错,得到的信号必然是模糊而混乱的。

强化学习的数学结构恰好会放大这个问题。论文用一个简化模型说明,如果一条轨迹有H个动作,策略梯度类方法(也就是GRPO、PPO这类方法背后的数学原理)的方差会随着H近似线性增长。轨迹越长,估计出来的调整方向越不可靠。

这就是这篇论文想解决的核心矛盾:任务越长,越需要精细调参,可强化学习偏偏在长任务上越不稳定,还越贵。

换一种思路:不算梯度,靠"撒网试错"

研究者们的答案是回到一种更老的技术:进化策略

**进化策略**:不通过计算梯度来更新参数,而是在当前参数附近随机撒一堆"扰动方向",让每个扰动版本的模型都去跑一遍任务拿到一个分数,再根据这些分数的好坏,把参数朝着"表现好的扰动"那个方向挪一点。这种方法在2017年就被OpenAI提出过,曾经被认为是强化学习的一种"可扩展替代品"。

这套方法的关键区别在于,它完全不需要反向传播

它是这么运作的。假设当前模型参数是θ,系统会生成一批随机噪声方向,比如32个,分别加到θ上,得到32个"参数稍微不同"的模型版本。每个版本各自去跑一遍任务,拿到一个最终的成绩单,比如任务成功还是失败、答案对不对。然后系统把这32个成绩做一次标准化打分,成绩好的那个扰动方向获得正权重,成绩差的获得负权重,加权平均之后就得到了参数该往哪个方向挪。

整个过程里,模型只做了前向计算,就是正常跑一遍任务而已,没有任何反向传播的痕迹。也正因为这样,显存需求和纯推理是一样的。

这里有个细节值得琢磨。进化策略只需要存一个随机数种子,就能复现出当时加的那个扰动,不用真的把每个扰动模型都单独存一份。这就是为什么270亿参数的模型也能塞进4张H100显卡里训练:根本不需要额外空间去存那些中间状态。

这套逻辑用一个生活场景来理解会更直观。假设你在教一个刚学做菜的人炒一道复杂的菜,这道菜要经过洗菜、切菜、下锅、调味十几个步骤才能出锅。传统强化学习式的教法,是站在旁边一步步纠正他的刀法、火候、下料顺序,试图告诉他每一步该怎么调整,可你自己也说不清楚到底哪一步导致了最后咸了还是淡了。进化策略式的教法完全不同,你让他同时找来三十个朋友,每人按略微不同的手法炒同一道菜,炒完之后只看谁的菜最好吃,然后告诉这三十个人"往那个好吃的方向靠"。你不需要精确诊断每个动作的对错,只需要知道整体哪个方向更好。代价是你要同时炒三十份菜,消耗的食材更多,但你省下了逐步纠错所需要的精确诊断能力,而这种诊断能力恰恰是长流程里最难获得的东西。

论文把这套方法命名为**Agentic ESOpt**,意思是面向智能体场景的进化策略优化框架。

为什么进化策略反而更适合长任务

这里要解释一个反直觉的地方。

进化策略在过去被认为是强化学习的"廉价替代品",性能通常打折,只是更省资源。但这篇论文的核心论点是,在长任务场景下,进化策略不是打折的替代品,反而可能是更合适的那个选择。

原因藏在数学结构里。强化学习的策略梯度方法,要把最终的奖励拆分到轨迹里的每一个动作上,数学上表现为对H个动作的得分项求和,前面说过这个求和会让方差随H线性增长。

进化策略完全不这么干。它只针对整条轨迹采样一个扰动方向ε,评估结果之后,更新公式里只有这一个ε,不会随着轨迹变长而对每一步单独求和。用论文里的话说,进化策略执行的是"轨迹级别的参数归因",而不是"逐回合的动作打分累加"。

这也解释了为什么Agentic ESOpt不是任何情况下都最强。当任务很短,比如只需要走五步就能完成,强化学习的动作打分累加也不会积累太多噪声,这时候PPO反而领先。可一旦任务拉长到十五步、二十步,强化学习的累积噪声开始压垮它的判断力,进化策略的优势才慢慢显现出来。

论文用一个精心设计的数独实验来验证这个假设。

用数独测出一条清晰的分界线

要验证"任务越长,进化策略越占优"这个假设,研究者设计了一个很巧妙的实验环境:可控最短成功步数的数独。

普通数独没法精确控制难度,但研究者想出了一个办法:如果在数独盘上遮住5个格子,那么完成这个数独理论上最少需要填5步;遮住10个格子最少需要10步;遮住15个格子最少需要15步。这个最少步数被记为H*,环境只在整个数独完全解开的那一刻才给一个奖励,中间过程一律没有反馈,这就是标准的稀疏奖励场景。

在40亿参数的Qwen3.5-4B模型上,研究者对比了PPO、两种不同采样配置的GRPO,以及本文提出的Agentic ESOpt。结果呈现出一条清晰的规律。

| 最短步数H* | PPO | GRPO(强配置) | Agentic ESOpt |

| 5 | **90.63%** | 85.42% | 89.58% |

| 10 | 56.25% | **67.71%** | 62.50% |

| 15 | 0.00% | 40.63% | **53.13%** |

看这张表,你会发现一个排名反转的现象。步数最短的时候,PPO领先;中等步数的时候,GRPO反超;但到了最长的15步,PPO直接崩溃到0%,GRPO也被Agentic ESOpt甩开了12.5个百分点。

PPO为什么会崩到0%?论文给出的解释是,PPO依赖一个额外的评委模型(critic)来给每一步打分,但在只有终点才有奖励的情况下,这个评委模型压根学不到有用的判断标准,它给出的每一步分数都是噬无意义的猜测,反而误导了训练方向。

这个排名反转比单纯的"谁赢了"更有信息量。它说明这不是某个算法整体更强,而是不同算法各自有各自的"舒适区",区分点就在于任务的长度。

研究者还画了训练曲线图来观察这个过程是怎么发生的。在15步的场景下,GRPO类方法在训练早期几乎不进步,直到训练进行到第60步左右才开始明显改善;而Agentic ESOpt从头开始就保持着相对稳定的提升。更有意思的是一个执行步数的统计:环境给了45步的操作预算,GRPO训练到第60步的时候,平均执行步数涨到了接近18步,说明模型在瞎兜圈子;而Agentic ESOpt始终保持在15.41步左右,几乎贴着理论最短路径走。这说明它没有学会"绕远路碰运气",而是真的学会了直奔目标。

顺带一提,Agentic ESOpt里有个叫做**余弦衰减调度**的设计,指的是训练过程中随机扰动的幅度σ会像余弦曲线一样,从一个较大的值慢慢降到一个较小值,前期扰动大方便探索,后期扰动小方便精细调整。

去掉这个衰减机制之后,15步场景的成绩从53.13%掉到42.71%,说明这个"先粗调再细调"的节奏确实起了作用。这个逻辑也很好理解。就像你学骑自行车,刚开始故意让教练松开手让你多摔几次找感觉,等你大致掌握平衡之后,再收紧辅助轮慢慢微调姿势。如果一开始就用最小的容错空间练习,你可能永远学不会真正的平衡感,只会在教练规定的窄路径里打转。

计算成本方面也有个值得说的数字。Agentic ESOpt虽然用了32个扰动方向,比GRPO的8个采样多了四倍,但因为它省掉了反向传播和参考模型的计算,实测的模型算力消耗和实际训练时间反而比GRPO更低。在15步场景里,GRPO花了19小时训练,Agentic ESOpt只用了9.4小时,几乎减半。

不止数独:数学解题、文档问答和网页操作

光在数独这种人工设计的环境里表现好,说服力还不够。研究者接着把这套方法搬到了更接地气的场景里:用Python工具做数学解题、用OCR工具做文档图片问答、以及真正的网页操作智能体。

在数学推理和文档问答任务上,研究者采用了ReAct式的交互模式

**ReAct**:让模型交替进行"思考"和"行动",行动可以是调用外部工具(比如运行一段Python代码),工具返回结果之后模型继续思考下一步,直到给出最终答案。这种模式常见于需要借助外部计算或检索能力的智能体任务。

结果显示,在没有任何额外技巧辅助的情况下,Agentic ESOpt相比原始基座模型平均提升了13.7个百分点,相比GRPO微调结果平均提升了8.3个百分点。具体到细分数据集,在AIME 2026这个高难度数学竞赛测试集上,提升幅度达到15个百分点;在DocVQA文档问答任务上提升12.3个百分点。

更值得注意的是,这些提升没有牺牲多样性

**Pass@K**:衡量模型给K次机会里至少答对一次的概率,K越大代表容错次数越多。如果一个方法只在平均分上好看,但Pass@K表现下降,说明它可能是把答案压缩到了一个很窄的范围里,牺牲了探索空间。

研究者发现,Agentic ESOpt在所有报告的Pass@K指标上都超过了对应的GRPO配置,说明它找到的不是一条更窄但更准的路,而是真正拓宽了模型能够成功解题的覆盖范围。

真正体现这套方法"能打大模型"的实验,是网页操作智能体WebArena-Lite。

这个测试集包含165个真实网站操作任务,涵盖Reddit、GitLab、内容管理系统、地图应用等六大类场景。研究者把Agentic ESOpt用在了270亿参数的Qwen3.5-27B模型上,在四张H100显卡上完成了全参数训练。

论文里明确提到,在这个模型规模下,全参数的强化学习训练已经不再实际可行,因为显存需求会远超四张H100显卡的承载能力。但Agentic ESOpt因为只需要推理级别的显存,反而让这次全参数微调变得可行。

结果是,基础模型的成功率是29.47%,经过Agentic ESOpt微调之后提升到36.16%,提升了6.69个百分点。

这里还有个有意思的延伸实验。研究者同时试了一种叫Trace2Skill的方法

**Trace2Skill**:一种不改变模型参数,而是从大量试跑轨迹里总结出一份"操作技巧文档"(类似工作手册)插入到系统提示词里的方法,属于提示词层面的优化。

单独用Trace2Skill,成绩是33.94%;把Trace2Skill和Agentic ESOpt结合起来使用,成绩进一步提升到36.36%。这说明这两种优化手段可以叠加,一个改模型内部,一个改外部指导手册,互不冲突还能互相加成。

这背后有个更深的设计考量。传统的提示词优化方法有个天生的局限,它只能在冻结的模型能力范围内"重新组合已有的行为",如果任务需要模型学会一种它压根不会做的新技能,光靠改提示词是无解的。而Agentic ESOpt的黑箱式反馈接口极其轻量,可以随时插入到提示词优化的循环里做参数上的实时调整,两者可以边跑边配合,论文称之为"提示词与参数的协同进化"。

这就像一个员工同时接受两种培训。一种是给他一本更新过的操作手册(提示词优化),另一种是真正提升他的基本功、改变他大脑里的习惯反应(参数优化)。手册能帮他少犯已知的错,但如果任务需要他掌握一种全新的判断力,手册再厚也没用,只有真正的能力提升才能补上这个缺口。如果只依赖手册而不做能力训练,遇到手册没写到的新状况,员工照样会卡壳。

测试时也能用:自动算法设计的例子

前面说的都是训练阶段的应用,论文还探索了另一个方向:在推理阶段(也就是不改变模型参数的常规使用过程中)结合进化策略。

这里选用的测试场景是自动启发式设计

**自动启发式设计(AHD)**:让大语言模型给一个NP难的组合优化问题(比如旅行商问题、背包问题)写一段决策代码,这段代码本身不是答案,而是一个能反复被求解器调用的规则。系统运行这段代码求解一批题目,拿到分数之后再让模型改进代码。

已有的代表性框架叫做EoH

**EoH(Evolution of Heuristics)**:维持一个启发式代码的种群,通过交叉、变异等操作不断进化出更好的代码版本,来源于本文之前的另一项工作。

Agentic ESOpt在这里的用法很巧妙:它不改变EoH原有的外层搜索流程,只是往变异操作里插入了一层参数扰动,让每次变异不仅改变代码内容,也同时轻微改变生成代码的那个模型参数。

结果是,在旅行商问题、背包问题、可行集问题等一系列测试上,Agentic ESOpt结合EoH在全部六个测试集上都取得了改善;结合纯采样方法在十二项对比里改善了九项。综合两类搜索场景的三十六项对比,Agentic ESOpt在其中二十八项里超过了原本的基线方法。

这说明进化策略的价值不只局限在"训练阶段的替代方案",它作为一种轻量级的黑箱优化工具,可以嵌入到几乎任何已有的搜索流程里,只需要一个能返回分数的接口就够了。

一个悬而未决但很有意思的现象:模型越强,越不需要"广撒网"

论文末尾提到了一个初步但值得深挖的观察。

研究者对比了40亿参数和90亿参数模型在同一个数独任务上的表现,专门测试了"扰动种群数量"这个超参数的影响。种群数量从8提高到16的时候,40亿参数模型的最终测试成绩从2.95%飙升到22.92%,提升幅度高达677%;而90亿参数模型的成绩几乎没变化,还是30.21%,提升幅度是0%。

也就是说,更强的基座模型好像不需要撒那么大的网,就能找到有用的更新方向。

论文给出的一种猜测是,一个能力更强的预训练模型所处的参数邻域本身就更"靠谱",随便往周围撒几个扰动,大概率都能碰到有用的方向;而能力偏弱的模型所处的区域可能到处是坑,得撒更多的网才能碰到一个真正管用的方向。

这个现象让我想到找工作实习。一个已经具备扎实基础能力的人,随便投几份简历、尝试几个方向,大概率都能撞进一个合适的岗位,因为他本身的能力半径足够广;而一个基础还没打牢的人,可能得海投几十份、尝试各种可能性,才能撞中一个愿意包容他成长的机会。不是运气不同,是起点的能力密度不同。

这也意味着,如果未来把这套方法用到更强的前沿模型上,可能反而可以用更小的种群规模就完成有效训练,进一步压缩整体的计算开销。不过论文也坦诚承认,这只是初步证据,还没有形成一个可靠的规律曲线,需要更多规模的实验来验证。

这套方法也有它没解决的问题

论文没有回避自己的局限性。

首先是新增了超参数。进化策略引入了扰动幅度σ这个新的需要调的量,虽然论文说他们在五个不同实验里用的参数其实相当一致,σ大概在0.001量级,更新步长在0.0005量级,但这终究是额外的调参负担。

其次是评估成本敏感的场景可能不划算。Agentic ESOpt用更多的独立轨迹评估换掉了反向传播,前提是每条轨迹的评估成本不能太贵。如果环境本身跑一次代价极高(比如真实的物理实验或者昂贵的API调用),那么"多跑几次换取免去反向传播"这笔账可能就不划算了。

第三个更本质的疑问是持续学习。有其他研究者提出过担心,进化策略的更新在参数空间里更像是一次"随机游走",而不像GRPO那样带有明确的稀疏方向性,这会不会让模型在长期连续学习中逐渐"游走"到不可控的状态?论文用一个统计数据回应了这个担忧:在WebArena实验里,96.26%的最终参数更新幅度都落在扰动尺度σ以内,99.42%小于σ的1.33倍。也就是说尽管理论上更新是稠密的,实际观测到的更新幅度非常集中,没有出现失控的漂移。但这个问题终究还没有被彻底盖章。

写在后面

读完这篇论文,最让我意外的不是它的实验数据,而是那张数独结果表里的排名反转。同一个任务家族,只是把最短所需步数从5改成10再改成15,冠军就从PPO换成GRPO再换成进化策略,三次交接,像接力赛一样清晰。这种用一个可控变量精确切出分界线的设计,比堆一堆"我们更好"的对比表格更有说服力,它证明的不是"哪个方法总是更强",而是"每个方法各自的适用边界在哪里"。

论文里那个90亿模型不需要更大种群就能训好的现象也一直在我脑子里转。如果这个趋势能在更大规模的模型上得到验证,意味着算力最紧张的前沿大模型训练,反而可能是最不需要"大力出奇迹"撒种群的场景,这和直觉里"越大越贵越难训"正好相反。

这篇论文没有讲的一件事,是量化压缩之后这套方法还能不能用。给参数加随机扰动这个动作,在浮点数上很简单,但在低精度的量化权重上做这件事,需要重新设计噪声的生成方式,不然扰动可能直接被量化误差吞掉。这算是留给后续研究的一个具体的坑。

Q&A

Q1:Agentic ESOpt和传统强化学习相比最大的区别是什么?

A:最大的区别是Agentic ESOpt完全不做反向传播,它只需要对模型参数施加随机扰动,跑一遍任务拿到分数,再根据分数加权更新参数,整个过程只需要和推理一样的显存,而传统强化学习需要存储激活值和优化器状态,显存消耗大很多。

Q2:Agentic ESOpt是不是在所有任务上都比强化学习强?

A:不是。论文的数独实验清楚显示,在任务步数较短时PPO领先,中等步数时GRPO领先,只有当任务步数拉长到15步这类长任务场景,Agentic ESOpt才展现出明显优势,这是一个和任务长度相关的分界现象。

Q3:Agentic ESOpt能用在多大的模型上?

A:论文实测了从40亿到270亿参数的模型,270亿参数的Qwen3.5-27B模型用Agentic ESOpt在四张H100显卡上就完成了全参数训练,而同等规模用传统强化学习方法在同样硬件条件下已经不现实。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
随着盖伊梅开二度+比利亚雷亚尔3-1迎首胜,西甲最新积分榜出炉

随着盖伊梅开二度+比利亚雷亚尔3-1迎首胜,西甲最新积分榜出炉

侧身凌空斩
2026-09-18 05:28:53
月饼“顶流”来了!门店大排长队,一天卖出4万个→

月饼“顶流”来了!门店大排长队,一天卖出4万个→

环球网资讯
2026-09-14 08:33:06
杨毅:中国男篮参加亚运会不能派二队或青年队打 必须要全力争冠

杨毅:中国男篮参加亚运会不能派二队或青年队打 必须要全力争冠

狼叔评论
2026-09-17 16:48:03
亚运会乱成一锅粥!韩国队发视频“求救”,日本主办方没回应?

亚运会乱成一锅粥!韩国队发视频“求救”,日本主办方没回应?

相思赋予谁a
2026-09-18 07:58:42
“凭什么输给她们?”男子崩溃了!与妻子新婚蜜月爆发争吵:15万婚前开销,竟是一场她和闺蜜的攀比赛

“凭什么输给她们?”男子崩溃了!与妻子新婚蜜月爆发争吵:15万婚前开销,竟是一场她和闺蜜的攀比赛

火山詩话
2026-09-18 07:35:58
床笫之欢,别读成了“床dì之欢”,太丢人!

床笫之欢,别读成了“床dì之欢”,太丢人!

语丝纪
2026-09-17 11:37:39
图片报:克洛普征召埃布努塔利布,摩洛哥对此非常不满

图片报:克洛普征召埃布努塔利布,摩洛哥对此非常不满

懂球帝
2026-09-17 21:01:30
敬一丹追悼会,哭的最痛的不是丈夫不是女儿,而是很少人知道的她

敬一丹追悼会,哭的最痛的不是丈夫不是女儿,而是很少人知道的她

青砖鉴本尊
2026-09-17 20:19:11
敬一丹丈夫王梓木近况曝光!9月3日参加环宇中学开学典礼,肉眼可见的消瘦

敬一丹丈夫王梓木近况曝光!9月3日参加环宇中学开学典礼,肉眼可见的消瘦

小徐讲八卦
2026-09-17 14:29:18
时隔12年重返亚运会 中国女子板球队未赛被判负

时隔12年重返亚运会 中国女子板球队未赛被判负

新京报
2026-09-17 18:47:20
好惨!汽车龙头暴降256%,理想赛力斯小鹏全都亏损,汽车集体暴雷

好惨!汽车龙头暴降256%,理想赛力斯小鹏全都亏损,汽车集体暴雷

周哥一影视
2026-09-16 05:08:14
51岁港姐佛山开餐厅,开业当天敲锣打鼓生意火爆,半年连开两家店

51岁港姐佛山开餐厅,开业当天敲锣打鼓生意火爆,半年连开两家店

史料布籍
2026-09-17 18:02:13
高金素梅核心幕僚逃亡链条全曝光,8名共犯落网,竹联帮要角主动投案

高金素梅核心幕僚逃亡链条全曝光,8名共犯落网,竹联帮要角主动投案

何蕥室内设计
2026-09-18 05:59:30
祝贺南科大校长,薛其坤!今年全球仅有22人

祝贺南科大校长,薛其坤!今年全球仅有22人

南方都市报
2026-09-17 19:20:00
场均17+5!鹈鹕交易普尔的添头,现在比普尔还强,5500万续约超值

场均17+5!鹈鹕交易普尔的添头,现在比普尔还强,5500万续约超值

你的篮球频道
2026-09-18 07:19:21
快讯(9/18)| 江西地质局副局长赖晓军任职仅3个月落马;鄱阳湖流域发现全球新物种!

快讯(9/18)| 江西地质局副局长赖晓军任职仅3个月落马;鄱阳湖流域发现全球新物种!

矿材网
2026-09-18 01:06:35
英国主席:美国像“疯了”一样研究华为芯片,这是对中国技术的可悲误解。你封锁芯片,只会激励中国人更快造出芯片

英国主席:美国像“疯了”一样研究华为芯片,这是对中国技术的可悲误解。你封锁芯片,只会激励中国人更快造出芯片

逍遥漠
2026-09-17 12:12:19
甲钴胺单吃太浪费,记好这3种巧妙搭配,调理全身多种疼痛

甲钴胺单吃太浪费,记好这3种巧妙搭配,调理全身多种疼痛

薛医生课堂
2026-09-17 19:21:06
太聪明了!平陆运河挖出来的渣土,直接出万亩良田

太聪明了!平陆运河挖出来的渣土,直接出万亩良田

小虎新车推荐员
2026-09-16 05:52:14
不及字节二十分之一?李彦宏要重写百度

不及字节二十分之一?李彦宏要重写百度

新浪财经
2026-09-17 22:05:51
2026-09-18 10:11:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9879文章数 568关注度
往期回顾 全部

科技要闻

何小鹏:9系旗舰新车23.18万起

头条要闻

2岁幼童18楼坠亡:仅孩子母亲可向丈夫追究民事责任

头条要闻

2岁幼童18楼坠亡:仅孩子母亲可向丈夫追究民事责任

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

郭麒麟瘦到全网认不出,为新剧塑形

财经要闻

中国汽车:尾大不掉,必须出清

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

艺术
健康
手机
公开课
军事航空

艺术要闻

一到秋天,南京的秋色就藏不住了

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

手机要闻

苹果向iPhone 18 Pro/Max、Apple Watch Series 12推送发售首日更新

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

中方反对在安理会强推恢复对伊朗制裁

无障碍浏览 进入关怀版