网易首页 > 网易号 > 正文 申请入驻

LLM首次达到人类语言专家水平!OpenAI o1拿下拆解句法、识别歧义、推理音律

0
分享至

新智元报道

编辑:peter东

【新智元导读】LLM再下一城!伯克利研究证明:OpenAI的o1被证明也具有匹敌人类语言学家的元分析能力。

在人类诸多才能之中,哪些才是人类所独有的?

自古希腊哲人亚里士多德以来,语言便被视为最能彰显人之本性的标志。他曾言:人类乃「具有语言的动物」。

即使当今的大语言模型如ChatGPT已能在表层上模拟人类的日常言谈,学者们依然追问:

在人类语言的深处,是否蕴藏着某些独特的结构与特质,是任何其他生物的沟通方式,乃至AI的运算体系,皆无法真正企及的?

加州大学伯克利分校语言学家、罗格斯大学的携手,让多个大语言模型经受一系列语言学测试——其中包括要求模型归纳虚构语言的规则。

虽然大多数大语言模型未能像人类那样解析语言学规则,但有一个模型展现出远超预期的惊人能力。它能像语言学研究生那样分析语言——划分句子成分、解析多重歧义,并能运用递归等复杂语言学特征。

研究者Gašper Beguš表示,这一发现「挑战了我们对人工智能能力的认知」。

AI会说话不稀奇,会解释才稀奇——

如果语言是让我们成为人类的关键,那么如今大语言模型获得了「元语言」能力,这又意味着什么呢?

LLM构建无穷递归

想象一下:你在搭一座一层套一层、像俄罗斯套娃一样的「句子塔」。

每套进一层,理解难度就指数级上升。

这种结构,在语言学里叫「中心嵌入」(center embedding),曾被知名语言学家乔姆斯基称为能定义人类语言与思维的决定性特征。

比如这句话:

The worldview that the prose Nietzsche wrote expressed was unprecedented.

(大意为:尼采所写的那篇散文所表达的世界观是前所未有的。)

表面上看平平无奇,但如果你拆开它的「语言洋葱」:

最外层:The worldview [...] was unprecedented(这个「世界观」前所未有);

套进去一层:that the prose [...] expressed(是「那篇散文所表达的」);

再往里一层:Nietzsche wrote(而这篇散文是「尼采写的」)。

这就像在一个句子中间,又塞进一个完整的句子,再在那个句子里塞进另一个句子——三层套娃,层层递归。

人类能理解这样的句子,但之前,人们认为这样的能力大模型不具备。

上述句子在真实对话中几乎从未出现过——因为大家会觉得它「太绕了!」

所以,任何语言模型如果只是靠「背书」,根本不可能见过,自然也无法识别出这种例子。

语言学家们认为,人类语言从有限词汇和有限规则中生成无限可能句子,这种能力归因于无限递归。

迄今为止,还没有令人信服的证据表明其他动物能够以复杂的方式使用递归。

图1:不同大模型识别多重递归,绘制正确语法树的比例

然而,该研究指出在众多大模型中,唯有OpenAI o1模型不仅看懂包含多重递归的句子(图1)。

o1不仅能如同语言学家那样,以接近100%的正确率画出正确的树状结构,还能将本就复杂的句子变得更多一层。

图2:该句子对应的正确语法树

当它被问:「能不能再加一层递归?」o1回复:

The worldview that the prose that the philosopher Nietzsche admired wrote expressed was unprecedented.

「那位尼采所敬仰的哲学家所撰写的散文所表达的世界观是前所未有的。」

这说明o1不仅能够使用语言,还能够思考语言,具备语言能力(metalinguistic capacity )。

由于语言模型只是在预测句子中的下一个单词,人对语言的深层理解在质上有所不同。因此,一些语言学家表示,大模型实际上并没有在处理语言

这项研究的结论看起来是对上述观点的否定

大模型能区分歧义

也能深入理解句子

想象一下,你听到下面的话:「Eliza wanted her cast out.」

乍一听,好像就是「Eliza想把她的cast赶出去」?

但「cast」这个词既可以是动词(「驱逐」),也可以是名词(「石膏」)!

于是这句话就有两种不同的含义,分别是

Eliza想要她的石膏被拿出去,

Eliza想把她赶出去。

这样识别包含多义性句子的能力,之前同样被认为大模型不具备。

人类拥有很多常识知识,使我们能够排除歧义。但大模型很难具有这样的常识知识水平。

然而该研究表明,o1可正确识别两种结构,并为每种生成了符合语言学规划的句法树。其他模型(如 GPT-4、Llama 3.1)只会生成不合语法的结构,还会对语义产生误解。

该研究还考察了大模型在音韵学相关任务上的表现——

音韵学是研究声音模式以及最小的声音单位,即音素的组织方式。

例如,在英语中,给以「g」结尾的词加上「s」会发出「z」的音,就像「dogs」一样。但给以「t」结尾的词加上「s」听起来更像标准的「s」音,就像「cats」一样。

该研究一口气创建了30种新的迷你语言,以了解大模型是否能够在面对新生成的虚拟语言时,在没有任何先验知识的情况下能不能正确推断语音规则。

结果出人意料,即使是在这些虚构的语言上,o1在音韵相关的任务上表现依旧出色

大模型比人类更好地理解语言吗?

从上述三个例子可以看出,曾经那些被认为仅仅人类能够拥有的语言理解能力,大模型如今也具备了。

2023 年著名语言学家乔姆斯基在《纽约时报》上写道:「语言的正确解释很复杂,不能仅仅通过浸泡在大数据中就能学会。」

该文认为尽管 AI 模型在运用语言方面可能很擅长,但它们并不具备以复杂方式分析语言的能力。

在此思潮影响下,即使ChatGPT在各方面上复制了自然语言,公众仍想知道大模型是否有人类语言的特定特征能不能由大模型复现。

这当然很有必要,随着社会越来越依赖大模型,了解它在哪些方面能成功以及哪些方面会失败变得越来越重要。

语言分析是评估语言模型推理能力与人类相似程度的理想测试平台

而o1能够以与语言学家相似的方式分析语言,例如绘制句子图、解决多个歧义含义,并利用递归等复杂的语言特征

但我们发现这一现象后,人们不禁会问下面两个问题:

第一个问题是为何只有o1可行,其它大模型表现都差一大截。

回答是相比其它模型,o1 的优势很可能源于思维链(类似Deepseek的深度思考),使其能像人类语言学家一样逐步推理、验证假设、构建抽象规则。

第二个问题是当模型的性能随着规模变大而变大时,大模型是否有一天会比我们更能准确的理解语言吗?

对于这个问题的回答,目前还没有定论。

一方面,任何的大模型在语言学上还没有提出过原创性的观点,也没有教给我们关于语言的新知识。

另一方面,增加计算能力和训练数据,语言模型最终会在语言技能上超越我们,看不出有什么理由阻止语言模型展现出比我们更好的语言理解能力。

研究尚不足以宣称「机器理解语言胜于人类」,但足以改变评价口径:对模型的考察,应从「任务产出」转向「结构解释」。

当可解释性成为首要指标,AI研究、教育与应用治理将迎来同一套标准——把「为什么对」放在「对不对」之前。

参考资料:

https://ieeexplore.ieee.org/document/11022724

https://www.quantamagazine.org/in-a-first-ai-models-analyze-language-as-well-as-a-human-expert-20251031/

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
罗永浩和黄斌在线对喷!一个骂上蹿下跳小流氓,一个回网络黑社会

罗永浩和黄斌在线对喷!一个骂上蹿下跳小流氓,一个回网络黑社会

柴狗夫斯基
2026-09-17 08:31:07
3年5550万美元!萨迪克・贝成功续约鹈鹕:曾单场51分+10记三分

3年5550万美元!萨迪克・贝成功续约鹈鹕:曾单场51分+10记三分

罗说NBA
2026-09-18 06:39:05
邮报:恩佐离队内幕相关报道关窗后才出现,曼城对此感到困惑

邮报:恩佐离队内幕相关报道关窗后才出现,曼城对此感到困惑

懂球帝
2026-09-17 21:53:25
钟薛高已重启!三款经典雪糕亮相展会,价格降至6.9元

钟薛高已重启!三款经典雪糕亮相展会,价格降至6.9元

南方都市报
2026-09-16 16:02:14
何音也没想到,前夫黄志忠和柯蓝在一起15年,赢家竟是24岁的儿子

何音也没想到,前夫黄志忠和柯蓝在一起15年,赢家竟是24岁的儿子

阿讯说天下
2026-09-17 14:27:01
中国人口下滑:被严重低估的慢变量

中国人口下滑:被严重低估的慢变量

亿通电子游戏
2026-09-17 01:54:32
几万人涌入赖文峰直播间刷屏杨钰莹,他一句“我和岗岗没有任何问题”

几万人涌入赖文峰直播间刷屏杨钰莹,他一句“我和岗岗没有任何问题”

喜欢历史的阿繁
2026-09-16 14:22:02
婚服29.9元网购,婚车是自家车、没有司仪、朋友兼职摄像……山西一小伙儿办极简婚礼火了!当事人:妻子提出的,加酒席共花费1.6万多元

婚服29.9元网购,婚车是自家车、没有司仪、朋友兼职摄像……山西一小伙儿办极简婚礼火了!当事人:妻子提出的,加酒席共花费1.6万多元

大风新闻
2026-09-17 20:30:09
日本喊话中方!
2026年9月17日,田母神俊雄说中国要求高市早苗收回"涉台言论"是"干涉日本内政",还放话绝不妥协

日本喊话中方! 2026年9月17日,田母神俊雄说中国要求高市早苗收回"涉台言论"是"干涉日本内政",还放话绝不妥协

扶苏聊历史
2026-09-17 18:32:27
奥运冠军杨扬现状:51岁依然很美,嫁美国人,儿女双全定居上海

奥运冠军杨扬现状:51岁依然很美,嫁美国人,儿女双全定居上海

大西体育
2026-09-17 09:54:59
被低估的几种运动!医生:过了60岁,能坚持一个也好

被低估的几种运动!医生:过了60岁,能坚持一个也好

小方说跑步
2026-09-16 17:35:54
国内严控,海外严查,华人的钱流动难

国内严控,海外严查,华人的钱流动难

以希腊之名
2026-09-17 16:51:51
67岁大妈相亲当晚劝大爷留宿,第二天一早大爷乐得合不拢嘴

67岁大妈相亲当晚劝大爷留宿,第二天一早大爷乐得合不拢嘴

风起见你
2026-09-18 01:08:02
“2.3万元的LV新包,扫不出内置芯片信息了”上海买家直呼太委屈:直接跌价、心里郁闷……不少消费者有同款遭遇

“2.3万元的LV新包,扫不出内置芯片信息了”上海买家直呼太委屈:直接跌价、心里郁闷……不少消费者有同款遭遇

大风新闻
2026-09-17 17:43:03
英国专家看透了:中国至少相当于100个伊朗,美国迟早要滚出亚太

英国专家看透了:中国至少相当于100个伊朗,美国迟早要滚出亚太

蜉蝣说
2026-09-17 10:59:39
油价突然下跌!9月17日调价后92,95号汽油价格,蛋价“起飞”,风向大变?

油价突然下跌!9月17日调价后92,95号汽油价格,蛋价“起飞”,风向大变?

猪友巴巴
2026-09-17 15:00:03
这样的校服,真恐怖!谁定的啊?

这样的校服,真恐怖!谁定的啊?

南山学脉
2026-09-17 22:11:54
深度:日本战争獠牙已露出,中国怎么办?

深度:日本战争獠牙已露出,中国怎么办?

华山穹剑
2026-09-17 22:59:19
三队全胜斩获亚冠积分5.33,中超首轮亚冠积分为所有联赛最高

三队全胜斩获亚冠积分5.33,中超首轮亚冠积分为所有联赛最高

懂球帝
2026-09-18 02:33:08
马竞迎战皇马,阿尔瓦雷斯因伤病出战马德里德比,存在重大疑问

马竞迎战皇马,阿尔瓦雷斯因伤病出战马德里德比,存在重大疑问

福酱的小时光
2026-09-18 06:08:52
2026-09-18 07:12:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16209文章数 67073关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

时尚
游戏
家居
数码
军事航空

潮流之向,自有回响——浪潮音乐大赏特别企划

TGS 2026:《电锯甜心2 Back2Back》8分钟实机游玩

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

苹果Apple Watch Series 12与Ultra 4今日开售,2999/6499元起

军事要闻

韩国外长表态:尚未决定是否向霍尔木兹海峡派兵

无障碍浏览 进入关怀版