网易首页 > 网易号 > 正文 申请入驻

追问daily | Cell:揭秘吃货神经元;为什么挠自己不会笑?无需外部奖励的自我推理方法

0
分享至

脑科学动态

Cell:瘦素敏感神经细胞决定你是不是吃货

光遗传学刺激下丘逆转帕金森病运动障碍

碱基编辑技术成功阻断亨廷顿舞蹈症基因突变

为什么挠自己不会笑?神经科学家发现小脑的防痒开关

人类昼夜节律仍受季节影响:现代生活难改生物本能

为儿童设计的fMRI方法意外揭示老年女性大脑健康改善

胎儿大脑连接决定了基因活动的终身性别差异

AI行业动态

Claude 4创纪录破解"白鲸bug"

AI驱动科学

人类为何对AI的安乐死决定更苛刻

柔性无线植入物实现个性化慢性疼痛管理

AI助力婴儿脑龄评估:深度学习实现分钟级精准检测

GPT-4在反事实类比推理任务中达到人类水平表现

ChatGPT社交实验:为何我们更难信任AI?

AI模型为7,000例癌症患者绘制样本特异性图谱

无需外部奖励的自我推理方法

伪奖励黑魔法:错误信号竟让LLM推理能力飙升24.6%

脑科学动态

Cell:瘦素敏感神经细胞决定你是不是吃货

肥胖治疗需要更精准的神经调控靶点。马克斯普朗克学会的Marie H. Solheim团队发现,下丘脑中一类特殊的PNOC/NPY神经元通过瘦素受体(Lepr)调控食欲,这类细胞仅占神经元总数的10%,却能显著影响进食行为和体重。

Credit: Cell (2025).

研究团队首先利用单细胞RNA测序技术,将小鼠下丘脑弓状核(ARC)的PNOC神经元分为不同亚群。通过基因编辑选择性敲除瘦素受体后,小鼠出现暴食和肥胖症状,而受体恢复实验则使体重显著下降。进一步分析发现,受体缺失会特异性增加神经肽Y(NPY)在非AgRP神经元中的表达。化学遗传学激活PNOC/NPY神经元可模拟暴食行为,其效果与激活全部PNOC神经元相当。值得注意的是,这类神经元在人类脑组织中也得到验证。研究为开发靶向特定神经回路的抗肥胖药物提供了新方向,但作者Jens Brüning强调“距离临床应用仍有很长的路要走”。研究发表在 Cell 上。

#疾病与健康 #神经机制与脑功能解析 #肥胖治疗 #瘦素信号 #下丘脑神经环路

阅读更多:

Solheim, Marie H., et al. “Hypothalamic PNOC/NPY Neurons Constitute Mediators of Leptin-Controlled Energy Homeostasis.” Cell, vol. 0, no. 0, Apr. 2025. www.cell.com, https://doi.org/10.1016/j.cell.2025.04.001

光遗传学刺激下丘逆转帕金森病运动障碍

帕金森病的运动症状治疗长期依赖基底神经节深部脑刺激,但疗效机制不明。波鸿鲁尔大学Wolfgang Kruse、Stefan Herlitze团队与马尔堡菲利普大学Liana Melo-Thomas、Rainer Schwarting团队合作,首次证实听觉中枢下丘(IC)通过激活中脑运动区(MLR)可改善运动功能,为治疗开辟新路径。

研究采用光遗传学技术,在转基因大鼠IC区植入光纤进行精准刺激。通过马尔堡大学开发的多电极系统同步记录发现,IC刺激后MLR区67%神经元活动增强,平均突触传递延迟4.7毫秒,证实两脑区存在直接功能连接。值得注意的是,24%的MLR神经元反而被抑制,显示通路调控的复杂性。在行为层面,IC光刺激显著改善氟哌啶醇诱导的强直状态(帕金森病动物模型),且不引发情绪或基础活动异常。这种精准调控相比传统电刺激优势明显——电刺激会同时激活周围无关细胞,而光遗传学仅影响目标神经元。研究为开发避开退化基底神经节的新型脑刺激疗法奠定基础,未来或可通过非听觉通路改善患者步态障碍。研究发表在 Scientific Reports 上。

#疾病与健康 #神经调控 #跨学科整合 #光遗传学 #帕金森病

阅读更多:

Pochapski, José A., et al. “Optogenetic Stimulation of Inferior Colliculus Neurons Elicits Mesencephalic Locomotor Region Activity and Reverses Haloperidol-Induced Catalepsy in Rats.” Scientific Reports, vol. 15, no. 1, Apr. 2025, p. 12649. www.nature.com, https://doi.org/10.1038/s41598-025-96995-4

碱基编辑技术成功阻断亨廷顿舞蹈症基因突变

如何阻止导致神经系统疾病的基因突变扩增?麻省理工学院和哈佛大学博德研究所的David R. Liu团队与波士顿儿童医院的Mandana Arbab等合作,开发出新型碱基编辑方法,成功在小鼠和患者细胞中稳定了致病DNA重复序列。

研究团队采用两种碱基编辑工具——胞嘧啶碱基编辑器(CBE,可将C•G变为T•A)和腺嘌呤碱基编辑器(ABE,可将A•T变为G•C),在亨廷顿舞蹈症的CAG重复序列和弗里德赖希共济失调的GAA重复序列中引入单碱基改变。这些改变模拟了自然发生的稳定突变,打断了重复序列的连续性。在患者来源的细胞实验中,经过编辑的细胞其重复序列长度保持稳定甚至缩短,而未经编辑的对照组细胞则持续扩增。

为验证体内效果,研究人员使用双AAV9载体(一种可靶向神经元的腺相关病毒)将编辑器递送至小鼠模型。结果显示,编辑后的重复序列在神经系统保持稳定,有效阻止了致病扩增。虽然碱基编辑可能在其他基因组区域产生脱靶效应,但研究发现大多数脱靶编辑发生在非编码区域,降低了潜在副作用风险。这项技术为研究40多种由类似机制引起的疾病提供了通用工具,有望加速相关治疗方法的开发。研究发表在 Nature Genetics 上。

#疾病与健康 #个性化医疗 #基因编辑 #神经科学 #跨学科整合

阅读更多:

Matuszek, Zaneta, et al. “Base Editing of Trinucleotide Repeats That Cause Huntington’s Disease and Friedreich’s Ataxia Reduces Somatic Repeat Expansions in Patient Cells and in Mice.” Nature Genetics, May 2025, pp. 1–15. www.nature.com, https://doi.org/10.1038/s41588-025-02172-8

为什么挠自己不会笑?小脑的防痒开关

为什么挠痒痒(gargalesis)能引发大笑却无法自我触发?奈梅亨拉德堡大学唐德斯研究所的Konstantina Kilteni团队通过建立首个标准化挠痒实验室,揭示了这一现象背后复杂的神经机制,发现大脑通过预测自我动作提前抑制痒觉反射,并证实孤独症患者的异常反应模式。

研究团队设计了一套精密的机械挠痒系统:受试者将脚伸入带孔座椅,由机械棒以标准化力度刺激脚底,同时记录脑活动(fMRI)和生理指标(心率、出汗等)。实验证实,当他人实施挠痒时,大脑感觉皮层和社交认知脑区(如前额叶皮层)协同激活;而自我挠痒时,小脑会提前发送抑制信号阻断痒觉通路。在孤独症患者中,这种抑制机制减弱,导致其对轻触刺激过度敏感。跨物种比较显示,从大鼠到倭黑猩猩都存在类似反应,暗示挠痒可能具有促进亲子情感联结的进化意义。研究还发现,6个月大婴儿已能对母亲挠痒产生规律性笑声,表明该行为在神经发育早期即起作用。研究发表在 Science Advances 上。

#神经科学 #神经机制与脑功能解析 #孤独症 #进化生物学 #感知觉

阅读更多:

Kilteni, Konstantina. “The Extraordinary Enigma of Ordinary Tickle Behavior: Why Gargalesis Still Puzzles Neuroscience.” Science Advances, May 2025. world, www.science.org, https://www.science.org/doi/10.1126/sciadv.adt0350

人类昼夜节律仍受季节影响:现代生活难改生物本能

现代生活是否真让我们摆脱了自然光照的影响?密歇根大学的Ruby Kim、Daniel B. Forger团队通过分析数千名轮班医护人员的可穿戴设备数据,发现人类昼夜节律仍保留着对季节变化的敏感性,这种"野生"特性可能影响从情绪障碍到代谢疾病等多种健康问题。

研究团队利用"实习生健康研究"项目中3000多名美国住院医师的Fitbit数据(包括步数、睡眠和心率),结合数学模型分析发现:人类实际上拥有两个生物钟系统——一个追踪黎明,另一个追踪黄昏,二者通过神经递质(如VIP和AVP)相互协调。数据分析显示,夏季到冬季的日照变化会使轮班工作者平均增加63.7%的昼夜节律失调(circadian misalignment),这种失调与季节性情感障碍(SAD)症状高度相关。

通过唾液DNA检测,团队还发现SLC20A2基因(编码磷酸盐转运蛋白PiT2)的特定变异会影响个体适应能力:携带这些变异的医护人员在季节转换时表现出更严重的节律紊乱。数学建模进一步预测,这种季节性编码机制可能导致某些人更快适应新作息,但在频繁轮班环境下反而产生更多健康风险。研究为理解轮班工作对健康的差异化影响提供了新视角,并可能指导个性化排班方案。研究发表在 npj Digital Medicine 上。

#疾病与健康 #个性化医疗 #心理健康与精神疾病 #神经调控

阅读更多:

Kim, Ruby, et al. “Seasonal Timing and Interindividual Differences in Shiftwork Adaptation.” Npj Digital Medicine, vol. 8, no. 1, May 2025, pp. 1–12. www.nature.com, https://doi.org/10.1038/s41746-025-01678-z

为儿童设计的fMRI方法意外揭示老年女性大脑健康改善

脑血管健康评估需要更精准的方法,洛杉矶儿童医院Borzage实验室的Bethany L. Sussman团队测试新型fMRI技术时,发现绝经后女性大脑血管反应性(CVR)出现反常增强,这一发现可能改变对女性神经血管老化的认知。

男性和女性受试者大脑反应性地图对比了女性大脑中亮黄色(高反应性,健康)区域与男性大脑中更常见的低反应性区域(绿色和蓝色)。Credit: Borzage Laboratory, Children's Hospital Los Angeles

研究采用血氧水平依赖性脑血管反应性(BOLD-CVR)技术,通过精确调控受试者呼气末二氧化碳浓度,测量51-83岁53名成年人6个脑区的血管反应能力。结果显示,女性绝经后皮层下灰质、白质及双侧海马区的血管反应性随年龄增长显著提升(P≤0.058),而男性这些区域未见变化。特别在皮层下灰质和右侧海马,女性CVR值比男性平均高出15-20%(P≤0.048)。研究排除了血压、药物等混杂因素影响,推测可能与激素变化或月经相关贫血终止有关。该发现首次证实女性大脑存在独特的神经血管适应机制,为开发性别特异性中风预防策略提供依据。研究团队计划将这一原为儿童设计的技术应用于糖尿病、脑瘤等导致儿童血管加速老化疾病的研究。研究发表在 Stroke 上。

#疾病与健康 #神经机制与脑功能解析 #个性化医疗 #性别差异 #脑血管老化

阅读更多:

Sussman, Bethany L., et al. “Sex Differences in the Neurovascular Health of Aging Adults.” Stroke, Feb. 2025. Hagerstown, MD, www.ahajournals.org, https://www.ahajournals.org/doi/10.1161/STROKEAHA.125.051026

胎儿大脑连接决定了基因活动的终身性别差异

男性和女性大脑差异何时形成?赫尔辛基大学芬兰分子医学研究所的Clara Benoit-Pilven、Juho V. Asteljoki等团队通过大规模RNA测序发现,大脑基因表达的性别差异在怀孕前三个月就已形成,并持续终身。

Credit: Cell Genomics (2025).

研究团队分析了1,899个人类前脑样本的RNA序列数据,包括受孕后5-17周的产前样本和20-79岁的成人样本。结果显示,胎儿大脑中存在3,000多个性别差异表达基因(sex-DE),远多于成人(约1,000个)。统计模型显示,近三分之二的性别差异仅在早期发育阶段出现,不到1%仅在成年期出现,其余则持续存在但效应减弱。进一步分析发现,产前性别差异富含雄激素和雌激素受体的结合位点,表明早期性激素影响显著。研究还发现,逃脱X失活的X染色体基因在整个生命过程中保持女性偏向表达。虽然性别差异基因本身不直接导致神经系统疾病,但它们在与精神分裂症和多发性硬化症等疾病相关的基因调控网络中过度表达,暗示其可能调节疾病风险。这些发现强调了研究发育过程中基因表达动态的重要性。研究发表在 Cell Genomics 上。

#疾病与健康 #神经机制与脑功能解析 #性别差异 #基因表达 #发育生物学

阅读更多:

Benoit-Pilven, Clara, et al. “Early Establishment and Life Course Stability of Sex Biases in the Human Brain Transcriptome.” Cell Genomics, vol. 0, no. 0, May 2025. www.cell.com, https://doi.org/10.1016/j.xgen.2025.100890

AI 行业动态

Claude 4创纪录破解"白鲸bug":30年老程序员4年未解难题被AI几小时攻破

一位拥有30年C++开发经验的资深程序员ShelZuuz,近日在Reddit上分享了一个令人震撼的故事。他所在团队在4年前进行6万行代码重构后,系统出现了一个被称为"白鲸bug"的顽固问题——特定着色器在特殊使用条件下会出现渲染错误。这位曾在FAANG(硅谷五大科技巨头:Meta、亚马逊、苹果、奈飞、谷歌)工作过的"技术支援"专家,累计花费200小时都未能解决这个难题,甚至连GPT-4.1、Gemini 2.5和Claude 3.7等AI模型也束手无策。

令人惊讶的是,最新发布的Claude Opus 4配合Claude Code模式,仅用33个提示词和几个小时就成功定位并解决了这个bug。AI不仅提供了重构前后的完整代码对比,还精准指出这是架构层面的兼容性问题——旧系统只是"巧合"支持了这种用法,而新架构没有考虑到这种"非设计性行为"。Anthropic的开发者关系主管表示,这类AI解决人类难题的案例未来会越来越常见。

Claude 4系列近期发布的旗舰款Opus 4展现了惊人的编程能力,其配套的Claude Code智能助手可以理解、浏览和修改整个代码库,完成修复bug、实现新功能等复杂工程任务。这次突破不仅证明了AI在复杂问题解决上的潜力,也引发开发者社区热议——价值2.5万美元的人类工程师工时,被200美元订阅费的AI在几小时内超越。随着AI编码能力持续突破,软件开发范式正在被重新定义。

#Claude4 #AI编程 #代码调试 #技术突破 #Anthropic

阅读更多:

https://www.reddit.com/r/ClaudeAI/comments/1kvgg7s/claude_opus_solved_my_white_whale_bug_today_that/?share_id=-Y9J9Hna8rIemyMsG8Jp9&utm_content=1&utm_medium=ios_app&utm_name=ioscss&utm_source=share&utm_term=1

AI 驱动科学

人类为何对AI的安乐死决定更苛刻

图尔库大学Michael Laakasuo团队联合多国研究者发现,在安乐死决策中存在显著的人机道德判断不对称——相同决定由AI提出时接受度更低,这种差异与患者自主权和技术可信度密切相关。

在“决定关闭生命支持系统”的研究中,存在明显的线性趋势,道德认可度在高级人工智能组(医疗机器人组)中最低,在人机协作组中最高。Credit: Cognition (2025).

研究团队在芬兰、捷克和英国开展8项实验,向5837名参与者呈现不同医疗情景。通过对比人类医生、AI顾问和AI决策者三种条件发现:当决定撤除昏迷患者生命支持时,AI组的道德认可度比人类组低15-22%,且该差异不受AI角色影响(无论建议或决策)。但存在两个例外:当决定维持生命支持时无差异;当患者清醒并自主要求安乐死(如注射致死药物)时差异消失。进一步分析揭示,这种"人机道德鸿沟"源于双重认知偏差——参与者普遍认为AI的决策能力不足,且其决策过程缺乏可解释性。值得注意的是,研究提出了"自主权阈值"理论:当患者能明确表达意愿时,技术偏见可被克服。这些发现为AI医疗系统设计提供了关键启示:增强决策透明度和重点应用于高自主权场景可能提升接受度。研究发表在 Cognition 上。

#认知科学 #意图与决策 #心理健康与精神疾病 #AI驱动科学

阅读更多:

“Moral Psychological Exploration of the Asymmetry Effect in AI-Assisted Euthanasia Decisions.” Cognition, vol. 262, Sept. 2025, p. 106177. www.sciencedirect.com, https://doi.org/10.1016/j.cognition.2025.106177

柔性无线植入物实现个性化慢性疼痛管理

慢性疼痛困扰全球20%成年人,而阿片类药物成瘾性和传统植入设备的手术风险制约治疗效果。南加州大学Yushun Zeng、Chen Gong等23人团队开发出全球首款超声波供能、AI调控的柔性植入系统,在动物实验中实现精准镇痛。

UIWI 刺激器。Credit: Nature Electronics (2025).

研究团队将复合压电接收器(piezoelectric energy harvester)与微型电路集成于柔性基底,通过外部可穿戴超声发射器无线供能。设备搭载的机器学习算法能实时解析脑电信号,将疼痛分为4个等级并自动匹配刺激强度。在自由活动啮齿类实验中,系统对机械性疼痛(mechanical allodynia)的抑制效果达82%,且刺激参数可随动物行为状态动态调整。值得注意的是,植入物厚度仅0.3毫米,弯曲半径达5毫米,完美贴合脊髓曲面。持续6个月的测试显示,设备未引发炎症或组织纤维化。这项技术突破为3000万药物难治性疼痛患者带来新希望。研究发表在 Nature Electronics 上。

#疾病与健康 #神经调控 #个性化医疗 #AI驱动科学 #疼痛管理

阅读更多:

Zeng, Yushun, et al. “A Programmable and Self-Adaptive Ultrasonic Wireless Implant for Personalized Chronic Pain Management.” Nature Electronics, May 2025, pp. 1–13. www.nature.com, https://doi.org/10.1038/s41928-025-01374-6

AI助力婴儿脑龄评估:深度学习实现分钟级精准检测

蒙特利尔大学心理学系的Sarah Lippé团队联合多国研究人员,开发出基于深度学习的脑电图(EEG)分析系统,可在几分钟内精准预测婴儿脑龄,误差仅1个月。该系统已成功识别出大头畸形患儿的发育延迟。

机器学习方法的总体示意图。Credit: NeuroImage (2025).

研究团队采集了272名3-14月龄婴儿的静息态EEG数据,其中包含53名大头畸形(macrocephaly)患儿。通过对比传统机器学习与深度学习模型发现:传统方法需人工提取328个特征(包括delta/theta/alpha频段功率、信号非线性特征等),而端到端的深度学习模型直接分析原始EEG信号,自动捕捉发育相关的脑电模式。结果显示,深度学习模型预测脑龄的平均绝对误差(MAE)仅1个月(95%CI:0.88-1.15),相关系数r=0.82。关键发现包括:α波(6-9Hz,与注意功能相关)随月龄增长而增强,δ波(0.5-2.5Hz,深度睡眠标志)占比下降。临床验证表明,大头畸形患儿的脑龄差(BAG)平均延迟2.3个月,且BAG与18月龄时的适应性行为量表(ABAS-II)评分显著负相关。该系统仅需2分钟EEG记录即可完成评估,为发育障碍的早期筛查提供了高效工具。研究发表在 NeuroImage 上。

#疾病与健康 #预测模型构建 #个性化医疗 #神经调控 #早期干预

阅读更多:

“Electroencephalography Estimates Brain Age in Infants with High Precision: Leveraging Advanced Machine Learning in Healthcare.” NeuroImage, vol. 312, May 2025, p. 121200. www.sciencedirect.com, https://doi.org/10.1016/j.neuroimage.2025.121200

GPT-4在反事实类比推理任务中达到人类水平表现

加州大学洛杉矶分校的Taylor W. Webb、Keith J. Holyoak和Hongjing Lu团队通过反事实字母串类比实验发现,当赋予代码执行能力后,GPT-4能解决需要精确计数的复杂类比问题,表现与人类相当。

字母表打乱后的字母串类比结果。Credit: PNAS Nexus (2025).

研究采用特殊设计的字母串类比任务,要求模型基于虚构字母表(如[xylkwbfztnjrqahvgmuopdics])识别字母位置关系。标准GPT-4因计数困难准确率仅21.7%,但具备代码执行(code execution)能力的变体可自主编写计数程序,将字母转换为序列索引,准确率跃升至人类水平(约80%)。控制实验显示,禁用代码执行功能后模型性能立即回落,证实计数能力是关键瓶颈。有趣的是,模型能像人类一样为正确答案提供合理解释,且38%的错误源于应用其他有效规则(如间隔2而非1),表明其真正理解而非简单模仿类比关系。研究还发现思维链(chain-of-thought)提示能部分提升性能,但效果不及代码执行。这些结果支持LLM通过结构化操作和涌现的关系表征实现类比推理的观点。研究发表在 PNAS Nexus 上。

#大模型技术 #计算模型与人工智能模拟 #认知科学 #类比推理 #代码增强

阅读更多:

Webb, Taylor W., et al. “Evidence from Counterfactual Tasks Supports Emergent Analogical Reasoning in Large Language Models.” PNAS Nexus, vol. 4, no. 5, May 2025, p. pgaf135. Silverchair, https://doi.org/10.1093/pnasnexus/pgaf135

ChatGPT社交实验:为何我们更难信任AI?

大型语言模型正在重塑人类社交方式,但其介入人际互动会引发何种心理反应?Fabian Dvorak团队通过大规模实验发现,当人们明确知晓社交对象是AI时,会表现出显著的信任与合作意愿下降,这种"算法厌恶"现象在3,552人的博弈实验中得到验证。

研究团队设计了包含最后通牒游戏(Ultimatum Game)、囚徒困境(Prisoner's Dilemma)等五种经典博弈的在线实验平台。参与者被随机分配与人类或ChatGPT代理对战,其中AI代理代表真实人类做出决策。实验设置六种处理条件:透明随机(50%概率AI介入)、透明委托(自主选择AI代理)和不透明委托(隐藏代理状态),每种条件又分为个性化定制组和非定制组。

结果显示,知晓对手为AI的组别在所有博弈中均表现出行为改变——最后通牒游戏的出价减少19%,信任游戏的资金返还率降低27%,囚徒困境的合作率下降34%。有趣的是,68%参与者在可选条件下仍选择委托AI决策,尤其在非透明情境下委托率更高。后续的图灵测试证实,纯行为数据中人类与AI决策难以区分(准确率接近随机),但结合文字解释后识别率显著提升。研究发表在 PNAS Nexus 上。

#认知科学 #意图与决策 #大模型技术 #社会行为学

阅读更多:

Dvorak, Fabian, et al. “Adverse Reactions to the Use of Large Language Models in Social Interactions.” PNAS Nexus, vol. 4, no. 4, Apr. 2025, p. pgaf112. Silverchair, https://doi.org/10.1093/pnasnexus/pgaf112

AI模型为7,000例癌症患者绘制样本特异性图谱

卡内基梅隆大学的Caleb N. Ellington、Benjamin J. Lengerich团队开发出"情境化网络推断"框架,首次实现对7,997例肿瘤样本的基因调控网络(GRN)个性化建模,为精准医疗提供新工具。

研究突破传统GRN分析需要大样本量的限制,创新性地采用多任务学习范式。通过整合临床表型(patient demographics)、分子特征(somatic mutations)和肿瘤微环境(tumor microenvironment)等12类上下文数据,系统构建了样本特异性网络模型。技术核心是将三种经典网络模型(相关性网络Correlation、马尔可夫网络Markov、邻域选择网络Neighborhood Selection)统一为可微分目标,利用深度神经网络动态生成网络参数。在TCGA数据库验证中,模型不仅准确预测25种癌症类型的调控网络,还能泛化至未见肿瘤类型(准确率提升37%)。

关键发现包括:识别出11个新型预后亚型,其中三阴性乳腺癌的"网络脆弱性"特征使患者5年生存率预测精度提高至82%;揭示EGFR突变通过重构转录因子(transcription factors)互作网络而非单一通路驱动肿瘤进展。团队同步开源了SKLearn风格Python工具包和交互式可视化平台。研究发表在 PNAS 上。

#AI驱动科学 #个性化医疗 #肿瘤异质性 #基因调控网络

阅读更多:

Ellington, Caleb N., et al. “Learning to Estimate Sample-Specific Transcriptional Networks for 7,000 Tumors.” Proceedings of the National Academy of Sciences, vol. 122, no. 21, May 2025, p. e2411930122. world, www.pnas.org, https://doi.org/10.1073/pnas.2411930122

无需外部奖励的自我推理方法

如何让大语言模型不依赖外部监督实现自我提升?加州大学伯克利分校的Xuandong Zhao、Zhewei Kang、Sergey Levine、Dawn Song与耶鲁大学的Aosong Feng团队开发了INTUITOR方法,通过模型自身置信度作为奖励信号,在数学和代码生成任务中展现出卓越性能。

研究提出的INTUITOR方法创新性地利用大语言模型自我置信度(self-certainty,即模型输出分布与均匀分布的KL散度)作为内在奖励信号。该方法改造了现有的Group Relative Policy Optimization(GRPO)框架,完全摒弃了传统方法依赖的外部验证奖励。实验使用Qwen2.5系列模型,在MATH数学数据集训练后,INTUITOR在GSM8K和MATH500等数学推理任务上达到与GRPO相当水平,且无需任何标准答案监督。更引人注目的是其跨领域表现:在LiveCodeBench代码生成任务中相对提升65%(GRPO无提升),在CRUXEval评估中提升76%(GRPO仅44%)。特别值得注意的是,一个原本在代码生成上得分为0%的Qwen2.5-1.5B小模型,经过INTUITOR训练后准确率提升至9.9%,展现出该方法强大的泛化能力。这些结果表明,预训练语言模型蕴含的潜在行为先验比先前认知更为丰富。

#大模型技术 #自动化科研 #跨学科整合 #无监督学习 #AI推理

阅读更多:

Zhao, Xuandong, et al. Learning to Reason without External Rewards. arXiv:2505.19590, arXiv, 26 May 2025. arXiv.org, https://doi.org/10.48550/arXiv.2505.19590

伪奖励黑魔法:错误信号竟让LLM推理能力飙升24.6%

强化学习(RL)必须依赖高质量奖励信号?华盛顿大学、AI2研究所和加州大学伯克利分校的联合研究团队挑战了这一传统认知。他们发现,对特定大语言模型(如Qwen-Math)使用完全随机甚至错误的奖励信号,竟能使其数学推理性能最高提升24.6%,代码推理准确率从66.7%跃升至90%。

研究设计了三种伪奖励(Spurious Rewards)方案:格式奖励(仅检测\boxed{}数学格式)、随机奖励(random.random()生成)、错误奖励(故意提供错误答案)。在MATH-500等基准测试中,Qwen2.5-Math-7B模型展现出惊人适应性——错误奖励提升24.6%,随机奖励提升21.4%。进一步分析发现,这种"黑魔法"源于GRPO算法中的裁剪(clipping)机制,它能触发模型集中发挥预训练获得的优势策略(如代码推理)。但效果具有强烈模型特异性:Llama3仅提升1.3%,OLMo2性能反而下降。研究颠覆了RLVR领域对奖励质量的固有认知,提示模型预训练特性可能比奖励信号质量更重要。

#大模型技术 #预测模型构建 #强化学习 #数学推理 #模型特异性

阅读更多:

https://rethink-rlvr.notion.site/Spurious-Rewards-Rethinking-Training-Signals-in-RLVR-1f4df34dac1880948858f95aeb88872f

整理|ChatGPT

编辑|丹雀、存源

关于追问nextquestion

天桥脑科学研究院旗下科学媒体,旨在以科学追问为纽带,深入探究人工智能与人类智能相互融合与促进,不断探索科学的边界。如果您有进一步想要讨论的内容,欢迎评论区留言,或后台留言“社群”即可加入社群与我们互动。

关于天桥脑科学研究院

天桥脑科学研究院(Tianqiao and Chrissy Chen Institute)是由陈天桥、雒芊芊夫妇出资10亿美元创建的世界最大私人脑科学研究机构之一,围绕全球化、跨学科和青年科学家三大重点,支持脑科学研究,造福人类。

Chen Institute与华山医院、上海市精神卫生中心设立了应用神经技术前沿实验室、人工智能与精神健康前沿实验室;与加州理工学院合作成立了加州理工天桥神经科学研究院。

Chen Institute建成了支持脑科学和人工智能领域研究的生态系统,项目遍布欧美、亚洲和大洋洲,包括、、、科研型临床医生奖励计划、、等。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
Here we go!罗马诺:切尔西签下拉明-卡马拉,转会费5500万欧

Here we go!罗马诺:切尔西签下拉明-卡马拉,转会费5500万欧

懂球帝
2026-09-02 04:53:16
窦唯前妻高原过57岁生日,比王菲老很多,女儿窦佳嫄胳膊都是刀疤

窦唯前妻高原过57岁生日,比王菲老很多,女儿窦佳嫄胳膊都是刀疤

静若梨花
2026-09-01 15:23:57
夜宿吉隆口岸一线 守候通道打通的曙光

夜宿吉隆口岸一线 守候通道打通的曙光

新华社
2026-09-01 15:41:46
星宇股份事件的本质在于,中国员工的拒绝成本远大于老外

星宇股份事件的本质在于,中国员工的拒绝成本远大于老外

普通人ThePeople
2026-09-01 12:06:29
皇马逃过亿元巨坑!穆里尼奥心心念念爱将!佛爷硬刚坚决不要

皇马逃过亿元巨坑!穆里尼奥心心念念爱将!佛爷硬刚坚决不要

澜归序
2026-09-02 07:54:17
缺人、缺枪、缺钱!这样的盟友不好吗?朝鲜从俄罗斯挣了145亿美元

缺人、缺枪、缺钱!这样的盟友不好吗?朝鲜从俄罗斯挣了145亿美元

鹰眼Defence
2026-08-31 16:56:48
德国总理默茨:以色列是中东唯一民主国家,只要我还担任公职,就始终会对以色列的生存权予以军事支持,在捍卫以色列方面绝不会退让分毫

德国总理默茨:以色列是中东唯一民主国家,只要我还担任公职,就始终会对以色列的生存权予以军事支持,在捍卫以色列方面绝不会退让分毫

扬子晚报
2026-08-31 19:41:30
俄罗斯财长意外亮相美国G20会议,欧洲国家“感到不安”

俄罗斯财长意外亮相美国G20会议,欧洲国家“感到不安”

财联社
2026-09-01 05:26:11
上海东站不是给全上海建的,先想清楚谁省时间

上海东站不是给全上海建的,先想清楚谁省时间

糖逗在娱乐
2026-09-02 01:14:41
情侣连住酒店145天拒绝保洁打扫,离店后客房清出20袋垃圾,酒店:头回遇到,将深度消毒

情侣连住酒店145天拒绝保洁打扫,离店后客房清出20袋垃圾,酒店:头回遇到,将深度消毒

封面新闻
2026-09-01 11:49:07
现场视频!普京与伊朗总统会晤:俄罗斯与伊朗人民团结一致,共同对抗美国和以色列,仍将维持经济和贸易关系

现场视频!普京与伊朗总统会晤:俄罗斯与伊朗人民团结一致,共同对抗美国和以色列,仍将维持经济和贸易关系

每日经济新闻
2026-09-01 21:50:00
黄景瑜海报出现“三只耳”?网友:设计师又捅娄子了!

黄景瑜海报出现“三只耳”?网友:设计师又捅娄子了!

阿废冷眼观察所
2026-09-02 04:32:48
游戏结束,荷兰安世收到裁决,中方冻结资产,跟美国站队没好下场

游戏结束,荷兰安世收到裁决,中方冻结资产,跟美国站队没好下场

军机Nova
2026-09-02 00:26:54
波涛汹涌的32H罩杯配24寸蚂蚁腰!台湾模特的极致身材杀!

波涛汹涌的32H罩杯配24寸蚂蚁腰!台湾模特的极致身材杀!

云端小院
2026-09-02 05:51:56
媒体人:国家不欠刘翔的!他自己非要留在体制内 享受最顶级待遇

媒体人:国家不欠刘翔的!他自己非要留在体制内 享受最顶级待遇

念洲
2026-08-30 09:09:35
一个被窝睡不出两种人!王鸥多年隐秘被扒,难怪何九华急着要跑

一个被窝睡不出两种人!王鸥多年隐秘被扒,难怪何九华急着要跑

陈意小可爱
2026-09-02 00:55:28
直播间一锤砸出500万?武汉洪山警方通报:出动百余名警力,打掉特大直播诈骗团伙刑拘81人

直播间一锤砸出500万?武汉洪山警方通报:出动百余名警力,打掉特大直播诈骗团伙刑拘81人

极目新闻
2026-09-01 19:09:03
紫牛头条|走遍全球233个国家!浙江诸暨男子花33年兑现年少全球旅行梦

紫牛头条|走遍全球233个国家!浙江诸暨男子花33年兑现年少全球旅行梦

扬子晚报
2026-09-01 09:48:09
昙花一现?吴宜泽又输了:惨败囧哥,奥沙利文说的话正在应验中!

昙花一现?吴宜泽又输了:惨败囧哥,奥沙利文说的话正在应验中!

大秦壁虎白话体育
2026-09-01 23:34:15
哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

哈兰德与女友长相出众,女友长得像洋娃娃,十分登对,浪漫幸福

娱你同欢
2026-08-30 18:30:43
2026-09-02 08:48:49
追问Nextquestion incentive-icons
追问Nextquestion
科研就是不断探索问题的边界
827文章数 42关注度
往期回顾 全部

科技要闻

抖音突发推荐算法大面积错乱!

头条要闻

美国力邀俄重返G20 俄财长亲自参加峰会令欧盟"愤怒"

头条要闻

美国力邀俄重返G20 俄财长亲自参加峰会令欧盟"愤怒"

体育要闻

大爹杨瀚森,让中国男篮有了容错空间

娱乐要闻

孙宇晨破防,他无法接受孙割这个名字

财经要闻

全球粮价冲高,会影响国内市场吗

汽车要闻

山城试驾启源Q06 不光是智驾好用还有700km的续航

态度原创

数码
旅游
本地
家居
公开课

数码要闻

雷蛇灵猫Razer Prio可折叠游戏手柄发布:支持7英寸内手机,799元

旅游要闻

渝见好“村”光|北碚牛皇村:藏在浅丘田园里的农耕治愈秘境

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版