网易首页 > 网易号 > 正文 申请入驻

AI学会隐藏思维暗中推理!不依赖人类经验解决复杂任务,更黑箱了

0
分享至

梦晨 发自 凹非寺
量子位 | 公众号 QbitAI

AI做数学题,真正的思考居然是暗中“心算”的?

纽约大学团队新研究发现,即使不让AI写步骤,全用无意义的“……”代替,在一些复杂任务上的表现也能大幅提升!

一作Jacab Pfau表示:只要花费算力生成额外token就能带来优势,具体选择了什么token无关紧要



举例来说,让Llama 34M回答一个简单问题:自然常数e的前6位数字中,有几个大于5的?

AI直接回答约等于瞎捣乱,只统计前6位数字居然统计出7个来。

让AI把验证每一数字的步骤写出来,便可以得到正确答案。

让AI把步骤隐藏,替换成大量的“……”,依然能得到正确答案!



这篇论文一经发布便掀起大量讨论,被评价为“我见过的最玄学的AI论文”



那么,年轻人喜欢说更多的“嗯……”、“like……”等无意义口癖,难道也可以加强推理能力?



从“一步一步”想,到“一点一点”想

实际上,纽约大学团队的研究正是从思维链(Chain-of-Thought,CoT)出发的。

也就是那句著名提示词“让我们一步一步地想”(Let‘s think step by step)。



过去人们发现,使用CoT推理可以显著提升大模型在各种基准测试中的表现。

目前尚不清楚的是,这种性能提升到底源于模仿人类把任务分解成更容易解决的步骤,还是额外的计算量带来的副产物。

为了验证这个问题,团队设计了两个特殊任务和对应的合成数据集:3SUM和2SUM-Transform。

3SUM要求从一组给定的数字序列中找出三个数,使得这三个数的和满足特定条件,比如除以10余0。



这个任务的计算复杂度是O(n3),而标准的Transformer在上一层的输入和下一层的激活之间只能产生二次依赖关系。

也就是说,当n足够大序列足够长时,3SUM任务超出了Transformer的表达能力

在训练数据集中,把与人类推理步骤相同长度的“...”填充到问题和答案之间,也就是AI在训练中没有见过人类是怎么拆解问题的。



在实验中,不输出填充token“…...”的Llama 34M表现随着序列长度增加而下降,而输出填充token时一直到长度14还能保证100%准确率



2SUM-Transform仅需判断两个数字之和是否满足要求,这在 Transformer 的表达能力范围内。

但问题的最后增加了一步“对输入序列的每个数字进行随机置换”,以防止模型在输入token上直接计算。

结果表明,使用填充token可以将准确率从 78.7%提高到93.6%



除了最终准确率,作者还研究了填充token的隐藏层表示。实验表明,冻结前面层的参数,只微调最后一个Attention层,随着可用的填充token数量增多,预测的准确率递增

证实了填充token的隐藏层表示确实包含了与下游任务相关的隐性计算



AI学会隐藏想法了?

有网友怀疑,这篇论文难道在说“思维链”方法其实是假的吗?研究这么久的提示词工程,都白玩了。



团队表示,从理论上讲填充token的作用仅限于TC0复杂度的问题范围内

TC0也就是可以通过一个固定深度的电路解决的计算问题,其中电路的每一层都可以并行处理,可以通过少数几层逻辑门(如AND、OR和NOT门)快速解决,也是Transformer在单此前向传播中能处理的计算复杂度上限。

足够长的思维链,能将Transformer的表达能力扩展到TC0之外

而且让大模型学习利用填充token并不容易,需要提供特定的密集监督才能收敛。

也就是说,现有的大模型不太可能直接从填充token方法中获益

但这并不是当前架构的内在局限性,如果在训练数据中提供足够的示范,它们应该也能从填充符号中获得类似的好处。

这项研究还引发了一个令人担心的问题:大模型有能力进行无法监控的暗中计算,对AI的可解释性和可控性提出了新的挑战。

换句话说,AI可以不依赖人类经验,以人们看不见的形式自行推理

这既刺激又可怕。



最后有网友开玩笑提议,让Llama 3首先生成1千万亿点点点,就能得到AGI的权重了(狗头)。



论文:
https://arxiv.org/abs/2404.15758

参考链接:
[1]https://x.com/jacob_pfau/status/1783951795238441449
[2]https://x.com/johnjnay/status/1784261779163349110

— 完 —

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
辽篮抵达新疆!经停兰州长途跋涉,球迷接机,有望客场连胜夺冠

辽篮抵达新疆!经停兰州长途跋涉,球迷接机,有望客场连胜夺冠

天涯沦落人
2024-05-18 17:27:59
8人倒下,首发快凑不齐了!NBA最可怜球队,你们还想争夺总冠军?

8人倒下,首发快凑不齐了!NBA最可怜球队,你们还想争夺总冠军?

老梁体育漫谈
2024-05-18 22:49:08
性感比基尼美女,活力四射,魅力无限!

性感比基尼美女,活力四射,魅力无限!

娱乐圈酸柠檬
2024-05-15 23:38:53
长期有“性”生活的女性,都有3个明显特征,很准!

长期有“性”生活的女性,都有3个明显特征,很准!

闻心品阁
2024-05-15 09:12:37
画不如话5,加代带队砸了老林的公司

画不如话5,加代带队砸了老林的公司

金昔说故事
2024-05-18 20:24:15
大快人心!农业农村部部长唐仁健被查,评论区一片叫好

大快人心!农业农村部部长唐仁健被查,评论区一片叫好

看晓天下事
2024-05-18 18:55:44
河南64岁大爷五年间染指55名女性,只因太了解女性心理

河南64岁大爷五年间染指55名女性,只因太了解女性心理

真实故事汇
2024-05-06 13:31:30
嫦娥六号抵达月球!英媒:中国意不在采样,还有更大目标,在火星

嫦娥六号抵达月球!英媒:中国意不在采样,还有更大目标,在火星

悟空科学
2024-05-18 11:03:47
专家:对俄战争已然失败

专家:对俄战争已然失败

俄罗斯卫星通讯社
2024-01-22 15:13:11
刘涛走光事件引起热议,公众期待明星保持形象和尺度平衡!

刘涛走光事件引起热议,公众期待明星保持形象和尺度平衡!

娱乐的小灶
2024-05-18 20:26:21
0-4到1-3!曼联迎来一场“面子战”:已是4连败,再输将创4大耻辱

0-4到1-3!曼联迎来一场“面子战”:已是4连败,再输将创4大耻辱

叁炮体育
2024-05-18 08:58:50
股价月涨60%!南都物业称存量房收购后,物管如公开招投标会有利好

股价月涨60%!南都物业称存量房收购后,物管如公开招投标会有利好

华夏时报
2024-05-17 22:25:05
鲜为人知的正厅级单位,下属二级和三级机构都是正厅级,了解一下

鲜为人知的正厅级单位,下属二级和三级机构都是正厅级,了解一下

喜欢农家生活的阿律
2024-05-18 07:38:17
突然不打了!决定退出CBA总决赛第一人!辽宁“真核”想要离队?

突然不打了!决定退出CBA总决赛第一人!辽宁“真核”想要离队?

绯雨儿
2024-05-18 10:42:54
英皇家医生爆料:凯特生病可能是骗局。哈里与威廉要和好,要齐心

英皇家医生爆料:凯特生病可能是骗局。哈里与威廉要和好,要齐心

亦纯杂谈
2024-05-18 10:56:58
收官战不同命!药厂不败夺冠,多特送别罗伊斯,拜仁遭逆转排第3

收官战不同命!药厂不败夺冠,多特送别罗伊斯,拜仁遭逆转排第3

奥拜尔
2024-05-18 23:43:00
港媒曝梁朝伟东京电影节采访:曾对日本文化及人民的爱不断滋长

港媒曝梁朝伟东京电影节采访:曾对日本文化及人民的爱不断滋长

山野下
2024-05-18 09:51:46
“中国已经进入一个最缺德的时代”这是危言耸听?还是故意抹黑?

“中国已经进入一个最缺德的时代”这是危言耸听?还是故意抹黑?

影孖看世界
2024-05-05 15:21:40
正式离队!广东宏远两边缘球员搬行李离开宿舍无人送行十分凄凉

正式离队!广东宏远两边缘球员搬行李离开宿舍无人送行十分凄凉

小马哥谈体育
2024-05-18 20:35:47
汪小菲女友马筱梅异常行为,网友唏嘘:小梅的心态已经有了大变化

汪小菲女友马筱梅异常行为,网友唏嘘:小梅的心态已经有了大变化

小咪侃娱圈
2024-05-18 11:41:59
2024-05-19 01:04:49
量子位
量子位
追踪人工智能动态
9409文章数 175284关注度
往期回顾 全部

科技要闻

高合复活!

头条要闻

雷军直播开车遭遇恶意别车 直呼"真的想举报他"

头条要闻

雷军直播开车遭遇恶意别车 直呼"真的想举报他"

体育要闻

天赋最差的人,成为NBA最强替补控卫

娱乐要闻

《庆余年2》首播口碑出炉!有好有坏

财经要闻

史诗级利好,房地产这次有救了吗?

汽车要闻

智驾升级/月底上市 问界新M7 MAX焕新版

态度原创

家居
游戏
亲子
时尚
公开课

家居要闻

遇见交响 音乐流动在设计之中

《小飞船大冒险》评测:塞尔达船说"/> 主站 商城 论坛 自运营 登录 注册 《小飞船大冒险》评测:塞尔达船说 泥头车 2024-05-18 返回专栏首...

亲子要闻

和萌娃一起学习如何使用AED,关键时候可以救命!

除了连衣裙,这几件单品让你轻松美出圈!

公开课

父亲年龄越大孩子越不聪明?

无障碍浏览 进入关怀版