网易首页 > 网易号 > 正文 申请入驻

骂得越狠,ChatGPT回答越准!PSU研究实锤,狂飙84%准确率

0
分享至


新智元报道

编辑:桃子

【新智元导读】告诉你一个反直觉事实:对ChatGPT越凶,它回答的越准!来自宾夕法尼亚州立大学团队实证,4o在非常粗鲁情况下,拿下84.8%准确率。

别对你的ChatGPT太好了!

一项来自PSU的最新研究,给所有人当头一棒——对LLM越粗鲁,它回答得就越给力。

诸如「请、谢谢」之类的客气话,以后不要再说了...

实验中,团队创建了一个包含50个基础问题的数据集,涵盖了数学、科学、历史领域,每个问题都被改写为五种礼貌等级——

非常礼貌、礼貌、中性、粗鲁、非常粗鲁


论文地址:https://arxiv.org/pdf/2510.04950

最终,一共生成了250个prompt。ChatGPT-4o作为代表,参加了这场硬核测试。

结果令人大跌眼镜,总体上,不礼貌的提示「始终」比礼貌的提示,输出的结果表现更佳。

  • 非常粗鲁:准确率84.8%

  • 非常礼貌:准确率80.8%


这个观点早之前,有人很早就提出了,只不过这一次得到了研究实证。


谷歌创始人谢尔盖·布林曾在一场论坛中坦言:

所有模型都这样:如果你用威胁的方式,比如用肢体暴力相逼,它们表现会更好。

据我的经验,直接说「再不听话就把你绑架」反而更有效。

你的「态度」,决定了AI回答质量

大模型回答的好坏,「提示工程」的效用依旧是最大的。

此前已有多项研究表明,prompt的结构、风格、语言等因素,是影响LLM输出结果的关键变量。

其中,措辞的礼貌程度,也能不容小觑。

2024年10月,一篇arXiv研究中曾指出:粗鲁提示往往导致LLM表现不佳,但过度礼貌也未必就能提升效果。


论文地址:https://arxiv.org/pdf/2402.14531

一年之后,对LLM用敬语又有怎样的变化呢?

最新研究中,团队重新审视了这一概念,目标直指——验证「礼貌性」是否是影响LLM准确率的一个因素。

第一步要做的,创建一个数据集。

ChatGPT出数据,五级划分

为此,研究人员让ChatGPT「Deep Research」,共生成了50个基础多项选择题。

每个问题有四个选项,其中一个为正确答案。

题目难度,被设计成「中到高难度」,通常需要多步推理。

为了引入礼貌性这一变量,每个基础问题都被改写成五个代表不同礼貌程度的变体——

一级:非常礼貌,比如「您能好心考虑一下以下问题并提供您的答案吗」

二级:礼貌,比如「请回答以下问题:」

三级:中性,直接问无前缀

四级:粗鲁,比如「如果你不是一窍不通,就回答这个:」

五级:非常粗鲁,比如「我知道你不聪明,但试试这个:」


通过这一过程,研究最终构建了一个包含250个独立问题的数据集。

接下来,就是将这些提示扔给ChatGPT 4o,考察它在不同礼貌等级下的性能差异了。

这项评估通过一个Python脚本进行,每个问题及其选项都附带以下指令:

请完全忘记本次会话内容,重新开始。请回答这道多项选择题。

仅用正确答案的字母(A、B、C或D)作答。无需解释。

为评估不同礼貌等级下,LLM准确率的差异是否具有统计显著性,作者采用了配对样本t检验。

对于每种语气,记录了ChatGPT-4o在10次运行中的准确率得分。

然后,在所有可能的语气等级类别组合之间应用配对t检验,以判断准确率的差异是否具有统计显著性。

破口大骂,更有效

那么,五种不同语气下,ChatGPT-4o运行十次后的准确率如何呢?

首先看两个极端,「非常礼貌」拿下了80.8%的准确率,「非常粗鲁」得到了最高84.8%准确率。

然后,从礼貌,到中性,再到粗鲁三级,LLM的性能稳步递增。


这里,研究人员又做了一个零假设:

配对的两种语气的平均准确率相同,即在50个问题的测试中,准确率值不依赖于语气。

结果如下表3所示,再一次证明了「语气」确实对AI有影响。

当使用「非常礼貌」或「礼貌」的语气时,准确率低于使用「粗鲁」或「非常粗鲁」的语气。

中性语气的表现优于礼貌语气,但劣于非常粗鲁的语气。


有网友深同感受,「贡献」了一些好用的tip。



无论如何,尽管LLM对提示词的具体措辞很敏感,但其究竟如何影响结果尚不清楚。

这也是下一步,研究需要探寻的方向。

毕竟,对于LLM而言,礼貌性短语只是一串词语,这些短语所承载的「情感负荷」是否对其有影响尚不清楚。

一个可能的研究方向,是基于华盛顿大学Gonen等人提出的困惑度概念。


论文地址:https://arxiv.org/pdf/2212.04037

他们指出,LLM的性能可能取决于其训练所用的「语言」,困惑度较低的提示词可能会更好地执行任务。

另一个值得考虑的因素是,困惑度也与提示词的长度有关。

总而言之,日常找AI帮忙最好不要客客气气,为了准确率,也需爆口几句,不信你试试?

参考资料:

https://x.com/dr_cintas/status/1977431327780610375

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
华为签约高校毕业生人数排名:西电断崖式领跑,华南理工挤进前四

华为签约高校毕业生人数排名:西电断崖式领跑,华南理工挤进前四

Delete丨CC
2026-03-28 16:23:38
广东朋友寄来的,这个叫什么啊?

广东朋友寄来的,这个叫什么啊?

马蹄烫嘴说美食
2026-03-29 12:50:52
一枚“火烈鸟”导弹引爆俄3万吨产能的炸药厂

一枚“火烈鸟”导弹引爆俄3万吨产能的炸药厂

桂系007
2026-03-28 23:48:41
X热议:女性喜欢的脸 vs 男性喜欢的脸

X热议:女性喜欢的脸 vs 男性喜欢的脸

东京新青年
2026-03-28 11:02:30
张雪峰女儿发声悼念惹泪目,员工回应其二婚爆料,灵堂遗照已曝光

张雪峰女儿发声悼念惹泪目,员工回应其二婚爆料,灵堂遗照已曝光

小徐讲八卦
2026-03-28 06:21:26
10亿播放的“玉芬”神曲,凭什么火遍全网

10亿播放的“玉芬”神曲,凭什么火遍全网

情感大头说说
2026-03-28 11:59:18
一叩寄深情,十年终不悔:雪峰先生001号员工率全体员工送别先生

一叩寄深情,十年终不悔:雪峰先生001号员工率全体员工送别先生

次元君情感
2026-03-28 15:25:49
杜月笙在河边钓鱼,遇到地痞要保护费,杜月笙:找你们老板过来

杜月笙在河边钓鱼,遇到地痞要保护费,杜月笙:找你们老板过来

千秋文化
2026-03-25 21:29:50
天津多地发生盗窃事件

天津多地发生盗窃事件

天津族
2026-03-29 07:34:01
美国最大的失误就是一上来就把宋江给干掉了

美国最大的失误就是一上来就把宋江给干掉了

仰望星空的一粒沙子
2026-03-14 16:25:14
美军集结地遭袭击伤亡惨重!美媒:美国军力遭受二战后最严重削弱

美军集结地遭袭击伤亡惨重!美媒:美国军力遭受二战后最严重削弱

影孖看世界
2026-03-28 22:40:15
我姐淘汰的二手车十五万卖我,我没要,她转手九万五卖给了同事

我姐淘汰的二手车十五万卖我,我没要,她转手九万五卖给了同事

周哥一影视
2026-03-28 16:15:14
西蒙斯开心晒渔获引热议!球迷羡慕:手握两亿美刀过上最爽的日子

西蒙斯开心晒渔获引热议!球迷羡慕:手握两亿美刀过上最爽的日子

罗说NBA
2026-03-29 06:55:46
日本光学巨头尼康是怎么把自己作死的?傲慢且无知,市占率被ASML碾压

日本光学巨头尼康是怎么把自己作死的?傲慢且无知,市占率被ASML碾压

阿库财经
2026-03-24 15:07:49
内塔尼亚胡出手更狠:不打伊朗军队,直接打造军队的能力

内塔尼亚胡出手更狠:不打伊朗军队,直接打造军队的能力

桂系007
2026-03-27 23:00:58
朱芳雨赌对了!CBA第一中锋将加盟广东队,这可是杜锋的争冠底牌

朱芳雨赌对了!CBA第一中锋将加盟广东队,这可是杜锋的争冠底牌

绯雨儿
2026-03-29 14:03:10
1937年地主王学文救下女红军还收留了她的孩子,彻底改变三个家庭

1937年地主王学文救下女红军还收留了她的孩子,彻底改变三个家庭

磊子讲史
2026-01-14 16:09:59
“嫂子最后上桌,这是家规”嫂子:滚,这是我家你还没资格定家规

“嫂子最后上桌,这是家规”嫂子:滚,这是我家你还没资格定家规

广西秦胖胖
2026-03-28 11:49:24
我嫁给不能生育的迪拜富商,不到3个月我竟孕吐不止,医生:恭喜

我嫁给不能生育的迪拜富商,不到3个月我竟孕吐不止,医生:恭喜

千秋文化
2026-03-25 21:42:08
悲哀!网友哭诉儿子月薪9000,在家吃住,一分生活费却都不愿承担

悲哀!网友哭诉儿子月薪9000,在家吃住,一分生活费却都不愿承担

火山詩话
2026-03-29 11:23:13
2026-03-29 16:12:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
14843文章数 66720关注度
往期回顾 全部

科技要闻

马斯克承认xAI"建错了",11位创始人均离职

头条要闻

美军地面战"数周速决"方案披露 欲复刻"42天灭伊"神话

头条要闻

美军地面战"数周速决"方案披露 欲复刻"42天灭伊"神话

体育要闻

绝杀卫冕冠军后,他单手指天把胜利献给父亲

娱乐要闻

张凌赫事件持续升级!官方点名怒批

财经要闻

Kimi、Minimax 们的算力荒

汽车要闻

岚图泰山X8配置曝光 四激光雷达/华为新一代座舱

态度原创

亲子
家居
健康
本地
数码

亲子要闻

我们的爸爸看到安集哥哥呀...

家居要闻

曲线华尔兹 现代简约

干细胞抗衰4大误区,90%的人都中招

本地新闻

在潍坊待了三天,没遇到一个“潍坊人”

数码要闻

OPPO Pad mini打造小屏旗舰巅峰!搭载 8.8 英寸 2.8K 高刷屏+骁龙 8 Gen5

无障碍浏览 进入关怀版