网易首页 > 网易号 > 正文 申请入驻

吴恩达ChatGPT课爆火:AI放弃了倒写单词,但理解了整个世界

0
分享至

明敏 杨净 发自 凹非寺
量子位 | 公众号 QbitAI

没想到时至今日,ChatGPT竟还会犯低级错误?

吴恩达大神最新开课就指出来了:

ChatGPT不会反转单词!

比如让它反转下lollipop这个词,输出是pilollol,完全混乱。

哦豁,这确实有点大跌眼镜啊。

以至于听课网友在Reddit上发帖后,立马引来大量围观,帖子热度火速冲到6k

而且这不是偶然bug,网友们发现ChatGPT确实无法完成这个任务,我们亲测结果也同样如此。

△实测ChatGPT(GPT-3.5)

甚至包括Bard、Bing、文心一言在内等一众产品都不行。

△实测Bard

△实测文心一言

还有人紧跟着吐槽, ChatGPT在处理这些简单的单词就是很糟糕。

比如玩此前曾爆火的文字游戏Wordle简直就是一场灾难,从来没有做对过。

诶?这到底是为啥?

关键在于token

之所以有这样的现象,关键在于token。token是文本中最常见的字符序列,而大模型都是用token来处理文本。

它可以是整个单词,也可以是单词一个片段。大模型了解这些token之间的统计关系,并且擅长生成下一个token。

因此在处理单词反转这个小任务时,它可能只是将每个token翻转过来,而不是字母。

这点放在中文语境下体现就更为明显:一个词是一个token,也可能是一个字是一个token。

针对开头的例子,有人尝试理解了下ChatGPT的推理过程。

为了更直观的了解,OpenAI甚至还出了个GPT-3的Tokenizer

比如像lollipop这个词,GPT-3会将其理解成I、oll、ipop这三个部分。

根据经验总结,也就诞生出这样一些不成文法则。

  • 1个token≈4个英文字符≈四分之三个词;
  • 100个token≈75个单词;
  • 1-2句话≈30个token;
  • 一段话≈100个token,1500个单词≈2048个token;

单词如何划分还取决于语言。此前有人统计过,中文要用的token数是英文数量的1.2到2.7倍

token-to-char(token单词)比例越高,处理成本也就越高。因此处理中文tokenize要比英文更贵

可以这样理解,token是大模型认识理解人类现实世界的方式。它非常简单,还能大大降低内存和时间复杂度。

但将单词token化存在一个问题,就会使模型很难学习到有意义的输入表示,最直观的表示就是不能理解单词的含义。

当时Transformers有做过相应优化,比如一个复杂、不常见的单词分为一个有意义的token和一个独立token。

就像annoyingly就被分成“annoying”和“ly”,前者保留了其语义,后者则是频繁出现。

这也成就了如今ChatGPT及其他大模型产品的惊艳效果,能很好地理解人类的语言。

至于无法处理单词反转这样一个小任务,自然也有解决之道。

最简单直接的,就是你先自己把单词给分开喽~

或者也可以让ChatGPT一步一步来,先tokenize每个字母。

又或者让它写一个反转字母的程序,然后程序的结果对了。(狗头)

不过也可以使用GPT-4,实测没有这样的问题。

△实测GPT-4

总之,token就是AI理解自然语言的基石。

而作为AI理解人类自然语言的桥梁,token的重要性也越来越明显。

它已经成为AI模型性能优劣的关键决定因素,还是大模型的计费标准。

甚至有了token文学

正如前文所言,token能方便模型捕捉到更细粒度的语义信息,如词义、词序、语法结构等。其顺序、位置在序列建模任务(如语言建模、机器翻译、文本生成等)中至关重要。

模型只有在准确了解每个token在序列中的位置和上下文情况,才能更好正确预测内容,给出合理输出。

因此,token的质量、数量对模型效果有直接影响

今年开始,越来越多大模型发布时,都会着重强调token数量,比如谷歌PaLM 2曝光细节中提到,它训练用到了3.6万亿个token。

以及很多行业内大佬也纷纷表示,token真的很关键!

今年从特斯拉跳槽到OpenAI的AI科学家安德烈·卡帕斯(Andrej Karpathy)就曾在演讲中表示:

更多token能让模型更好思考。

而且他强调,模型的性能并不只由参数规模来决定。

比如LLaMA的参数规模远小于GPT-3(65B vs 175B),但由于它用更多token进行训练(1.4T vs 300B),所以LLaMA更强大。

而凭借着对模型性能的直接影响,token还是AI模型的计费标准

以OpenAI的定价标准为例,他们以1K个token为单位进行计费,不同模型、不同类型的token价格不同。

总之,踏进AI大模型领域的大门后,就会发现token是绕不开的知识点。

嗯,甚至衍生出了token文学……

不过值得一提的是,token在中文世界里到底该翻译成啥,现在还没有完全定下来。

直译“令牌”总是有点怪怪的。

GPT-4觉得叫“词元”或“标记”比较好,你觉得呢?

参考链接:
[1]https://www.reddit.com/r/ChatGPT/comments/13xxehx/chatgpt_is_unable_to_reverse_words/
[2]https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them
[3]https://openai.com/pricing

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
突发特讯!国际奥委会主席为何来看全运会,引发高度关注

突发特讯!国际奥委会主席为何来看全运会,引发高度关注

在新加坡生活
2025-11-10 01:23:09
31岁女子为嫁高富帅与母亲互殴,女主鞠躬道歉:他出轨了,卖房钱都给他了

31岁女子为嫁高富帅与母亲互殴,女主鞠躬道歉:他出轨了,卖房钱都给他了

潇湘晨报
2025-11-10 11:00:20
全运会吉祥物痛失本名 "大湾鸡"到哪都是显眼包

全运会吉祥物痛失本名 "大湾鸡"到哪都是显眼包

看看新闻Knews
2025-11-09 22:40:08
李连杰脱衣辟谣“换心脏”传闻;近期其发布多条视频精神饱满、头发乌黑,与年初憔悴状态对比鲜明引猜测

李连杰脱衣辟谣“换心脏”传闻;近期其发布多条视频精神饱满、头发乌黑,与年初憔悴状态对比鲜明引猜测

极目新闻
2025-11-09 17:58:38
经济学家刘元春:中国居民消费率过低,本质上是分配问题

经济学家刘元春:中国居民消费率过低,本质上是分配问题

回旋镖
2025-11-08 16:31:29
曼城3-0利物浦!距英超榜首差4分,哈兰德失点+破门,多库世界波

曼城3-0利物浦!距英超榜首差4分,哈兰德失点+破门,多库世界波

侃球熊弟
2025-11-10 01:38:43
全运会男单大爆冷!种子选手1:4不敌省队,遭遇一轮游,无缘16强

全运会男单大爆冷!种子选手1:4不敌省队,遭遇一轮游,无缘16强

国乒二三事
2025-11-10 13:40:20
美国贸易代表办公室:11月10日起,暂停对华海事、物流和造船行业301调查限制措施

美国贸易代表办公室:11月10日起,暂停对华海事、物流和造船行业301调查限制措施

界面新闻
2025-11-10 11:48:56
中纪委连打三虎!杨小伟、刘宽忍、李春良,被处分

中纪委连打三虎!杨小伟、刘宽忍、李春良,被处分

扬子晚报
2025-11-10 11:24:34
妻子举报南科大教授出轨,公开丈夫与小三约会照,资产高达2千万

妻子举报南科大教授出轨,公开丈夫与小三约会照,资产高达2千万

180视角
2025-11-10 14:06:59
十五运会开幕式收视出炉!最高破3.9%,刘德华上场涨出小高峰

十五运会开幕式收视出炉!最高破3.9%,刘德华上场涨出小高峰

萌神木木
2025-11-09 21:54:10
利物浦血亏?1.36亿水货加盟16场仍0球!跑出空门又遭萨拉赫无视

利物浦血亏?1.36亿水货加盟16场仍0球!跑出空门又遭萨拉赫无视

我爱英超
2025-11-10 04:02:33
朱元璋为啥不愿传位给朱棣?史学家:其实谁都可以,唯独朱棣不行

朱元璋为啥不愿传位给朱棣?史学家:其实谁都可以,唯独朱棣不行

掠影后有感
2025-11-10 08:02:51
事发上海机场,他一个姿势引发全网热议!网友:果然压轴的都是重量级的

事发上海机场,他一个姿势引发全网热议!网友:果然压轴的都是重量级的

极目新闻
2025-11-10 14:03:21
李连杰最近逆生长,容颜从老到年轻给普通人哪些启示,放松很重要

李连杰最近逆生长,容颜从老到年轻给普通人哪些启示,放松很重要

呼吸科大夫胡洋
2025-11-09 13:10:15
美女医生曾琦因作风问题被停职!她选错了对象,追悔莫及痛一生

美女医生曾琦因作风问题被停职!她选错了对象,追悔莫及痛一生

鋭娱之乐
2025-11-08 00:05:13
国家广电总局关于撤销机顶盒的重要消息

国家广电总局关于撤销机顶盒的重要消息

小柱解说游戏
2025-11-09 14:50:37
太惨了!烟台渣土车压扁宝马车,死亡司机身份曝光,是年轻女教师

太惨了!烟台渣土车压扁宝马车,死亡司机身份曝光,是年轻女教师

火山诗话
2025-11-09 16:09:29
1换4,再见开拓者!杨瀚森交易大获成功,灰熊这次真捡到宝了

1换4,再见开拓者!杨瀚森交易大获成功,灰熊这次真捡到宝了

陈秣爱钓鱼
2025-11-09 23:21:30
祖院长原配护士长高颜值照流出,气质不输曾医生,发声原谅丈夫

祖院长原配护士长高颜值照流出,气质不输曾医生,发声原谅丈夫

老猫观点
2025-11-09 09:05:45
2025-11-10 15:39:00
量子位 incentive-icons
量子位
追踪人工智能动态
11647文章数 176329关注度
往期回顾 全部

科技要闻

存储芯片大厂涨价50%!华强北一天一个价

头条要闻

尹锡悦被控同军方合谋试图“诱使朝鲜发动进攻”

头条要闻

尹锡悦被控同军方合谋试图“诱使朝鲜发动进攻”

体育要闻

战绩崩盘!东契奇交易余震撕裂独行侠

娱乐要闻

郝蕾风波升级?

财经要闻

俄罗斯大幅加税 中国汽车出口骤降58%

汽车要闻

智能又务实 奇瑞瑞虎9X不只有性价比

态度原创

时尚
家居
手机
健康
艺术

上新|| 秋冬也可以穿的漂亮小裙子,美到心动

家居要闻

现代自由 功能美学居所

手机要闻

5499元!真我GT8 Pro阿斯顿马丁F1限量版正式开售

超声探头会加重受伤情况吗?

艺术要闻

“隶书之冠”刘炳森:楷书艺术之美惊艳四座

无障碍浏览 进入关怀版