研究者找了3132名参与者,做了五组实验,想搞清楚一件事:当AI随时可以问,人还愿不愿意承认自己不知道。答案很干脆——几乎不愿意了。
实验里用的模型是Step 3.5 Flash,研究者专门挑了一批它几乎必错的题目。这些题问的是电影里的视觉细节,比如某部片子里球队队服是什么颜色。按作者的说法,这类细节很少出现在网络文本里,正好是模型最容易编造的内容。研究者还提到,GPT-5.5、Claude 4.6 Sonnet和Gemini 3.5 Flash答对了其他大部分题目,但偶尔也会在更难的题上失手。
![]()
换句话说,AI给的建议大部分是错的。这样一来,参与者放弃作答就不能解释成"把活交给靠谱工具",因为工具本身不靠谱。研究者仍然看到人们倾向于听从AI答案,但这一现象在电影冷知识之外是否同样强烈,仍是一个未解的问题。
答案变多了,对的变少了
前两组实验(1a和1b)里,参与者可以自己决定要不要问AI。没有AI可用的对照组,分别有36%和44%的题目选择不作判断。一旦能问AI,这两个数字掉到6%和3%。
第二组实验还测了信心。没有金钱激励时,能用AI的人信心打到75.9分(满分100),没有AI的只有29.6分,差了大约两倍半。同一时间,答对的比例从27.6%跌到10.0%。人变得更自信,也错得更多。
把所有实验合起来看,没有激励、能用AI的参与者答对了9.2%的题目,没有AI的是27.5%。他们回答了更多题,正确率却只有大约三分之一。
给钱有用,但补不上这个洞
第二到第四组实验加了金钱激励:答对拿10美分,答错扣10美分,说"我不知道"什么也拿不到。研究者事先登记了假设——激励会让人更愿意弃权,但AI的存在会削弱这个效果。三组实验里,这个交互效应都没有达到统计显著。
按研究者的说法,AI可用性和金钱激励基本是各自独立起作用的。激励让人更少去问AI,第三组实验里从六次机会中的5.27次降到4.53次;有AI时也答得更准。弃权比例随激励略有上升,但仍远低于没有AI的对照组。
研究者自己也承认,激励有效,但幅度有限。换成更大的金额或者跟声誉挂钩的激励能不能进一步缩小差距,目前还不知道。
第四组实验换了个玩法:AI答案直接弹给参与者,不用他们主动去问。研究者说这更贴近现实——搜索引擎直接展示AI摘要,写作助手主动给建议。结果几乎没变。没有激励时,弃权比例从没有AI的35%掉到自动显示AI答案时的1%;有激励时,从大约39%降到7%。
人可能比信人更信AI
研究者把结果放在"Epistemia"这个概念下讨论——因为AI答案听起来有说服力就接受它,而不是真的去核实。语言模型永远得给出一个答案,它从不停顿,哪怕它并不知道。当用户把判断权交给这样一个系统,可能也一并继承了它这种"不肯留白"的习性。
这个效果跟"建议采纳"领域的既有研究正好相反。人通常会低估外部建议,只会朝顾问的立场移动大约三分之一。而这项研究里的参与者做的恰恰相反。
研究者甚至从数据里得出结论:AI的可用性把一些本来会答对的题变成了错误。在没有激励的条件下,AI组回答了更多题,但产出的正确答案更少。
随着AI答案无处不在、越来越多地主动出现,愿意说"我不知道"这件事,可能会成为人机交互中最早的牺牲品之一。人类判断力能不能扛住AI系统的扩散,或许不取决于把模型做得更准,而取决于人是否还认得并尊重自己知识的边界。
关于AI如何改变人的思考,已有其他研究
越来越多的研究指向同一个方向:使用AI会影响人的判断和认知能力。瑞士商学院一项666人的研究显示,AI使用与批判性思维之间存在强负相关。人越信任AI,就越把认知任务交出去,形成一个进一步削弱批判性思维的循环。
实验证据还显示,跟AI助手一起工作短短10到15分钟,就能在后续没有AI的任务中可测量地降低解决问题的能力和坚持性。只用AI获取解释、或者忽略AI的参与者,则没有出现这种下降。
微软的一项研究得出了类似结论。在另一篇论文中,微软指出AI使用对元认知——监控和引导自身思考的能力——提出了很高的要求。较高的教育水平则是一个保护因素。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.