网易首页 > 网易号 > 正文 申请入驻

用过GPT-4 Turbo以后,我们再也回不去了

0
分享至

机器之心报道

编辑:泽南、陈萍

GPT 变得好用了,但真的更聪明了吗?

昨天,很多人彻夜未眠 —— 全球科技圈都把目光聚焦在了美国旧金山。

短短 45 分钟时间里,OpenAI CEO 山姆・奥特曼向我们介绍了迄今为止最强的大模型,和基于它的一系列应用,一切似乎就像当初 ChatGPT 一样令人震撼。

OpenAI 在本周一的首个开发者日上推出了 GPT-4 Turbo,新的大模型更聪明,文本处理上限更高,价格也更便宜,应用商店也开了起来。现在,用户还可以根据需求构建自己的 GPT。

根据官方说法,这一波 GPT 的升级包括:

  • 更长的上下文长度:128k,相当于 300 页文本。
  • 更高的智能程度,更好的 JSON / 函数调用。
  • 更高的速度:每分钟两倍 token。
  • 知识更新:目前的截止日期为 2023 年 4 月。
  • 定制化:GPT3 16k、GPT4 微调、定制模型服务。
  • 多模态:Dall-E 3、GPT4-V 和 TTS 模型现已在 API 中。
  • Whisper V3 开源(即将推出 API)。
  • 与开发者分享收益的 Agent 商店。
  • GPT4 Turbo 的价格约是 GPT4 的 1/3。

发布会一开完,人们蜂拥而入开始尝试。GPT4 Turbo 的体验果然不同凡响。首先是快,快到和以前所有大模型拉开了代差:

然后是功能增多,画画的时候,你一有灵感就可以直接说话让 AI 负责实现:

设计个 UI,几个小时的工作变成几分钟:

我直接不装了,截个图复制粘贴别人的网站,生成自己的,只用 40 秒:

利用 ChatGPT 与 Bing 的浏览功能以及与 DALL-E 3 图像生成器的集成,沃顿商学院教授 Ethan Mollick 分享了一段视频,展示了他的名为「趋势分析器」的 GPT 工具,其可查找市场特定细分市场的趋势,然后创建新产品的原型图像。

Octane AI 首席执行官 Matt Schlicht 的 Simponize Me GPT 会自动应用提示来转换用户上传的个人资料照片,生成《辛普森一家》的风格,做这个小应用只用了不到十分钟。

GPT-4 Turbo 具有创纪录的准确率,在 PyLLM 基准上,GPT-4 Turbo 的准确率是 87%,而 GPT-4 的准确率是 52%,这是在速度几乎快了四倍多的情况下(每秒 48 token)实现的。

至此,生成式 AI 的竞争似乎进入了新的阶段。很多人认为,当竞争对手们依然在追求更快、能力更强的大模型时,OpenAI 其实早就已经把所有方向都试过了一遍,这一波更新会让一大批创业公司作古。

也有人表示,既然 Agent 是大模型重要的方向,OpenAI 也开出了 Agent 应用商店,接下来在智能体领域,我们会有很多机会。

竞争者们真的无路可走了吗?价格降低,速度变快以后,大模型的性能还能同时变得更好?这必须要看实践,在 OpenAI 的博客中,其实说法是这样的:在某些格式的输出下,GPT-4 Turbo 会比 GPT-4 结果更好。那么总体情况会如何?

在新模型发布的 24 小时内,就有研究者在 Aider 上进行了 AI 生成代码的能力测试。

在 gpt-4-1106-preview 模型上,仅使用 diff 编辑方法对 GPT-4 模型进行基准测试得出的结论是:

  • 新的 gpt-4-1106-preview 模型似乎比早期的 GPT-4 模型快得多;
  • 第一次尝试时似乎更能生成正确的代码,能正确完成大约 57% 的练习,以前的模型在第一次尝试时只能正确完成 46-47% 的练习;
  • 在通过检查测试套件错误输出获得第二次纠正错误的机会后,新模型的表现 (~66%) 似乎与旧模型 (63-64%) 相似 。

接下来是使用 whole 和 diff 编辑格式对 GPT-3.5 模型进行的基准测试。结果表明,似乎没有一个 gpt-3.5 模型能够有效地使用 diff 编辑格式,包括最新的 11 月出现的新模型( 简称 1106)。下面是一些 whole 编辑格式结果:

  • 新的 gpt-3.5-turbo-1106 型号完成基准测试的速度比早期的 GPT-3.5 型号快 3-4 倍;
  • 首次尝试后的成功率为 42%,与之前的 6 月 (0613) 型号相当。1106 模型和 0613 模型都比原来的 0301 第一次尝试的结果更差,为 50%;
  • 新模型在第二次尝试后的成功率为 56%,似乎与 3 月的模型相当,但比 6 月的模型要好一些,6 月的模型为 50% 得分。

这项测试是如何进行的呢,具体而言,研究者让 Aider 尝试完成 133 个 Exercism Python 编码练习。对于每个练习,Exercism 都提供了一个起始 Python 文件,文件包含所要解决问题的自然语言描述以及用于评估编码器是否正确解决问题的测试套件。

基准测试分为两步:

  1. 第一次尝试时,Aider 向 GPT 提供要编辑的桩代码文件以及描述问题的自然语言指令。这些指令反映了用户如何使用 Aider 进行编码。用户将源代码文件添加到聊天中并请求更改,这些更改会被自动应用。
  2. 如果测试套件在第一次尝试后失败,Aider 会将测试错误输出提供给 GPT,并要求其修复代码。Aider 的这种交互式方式非常便捷,用户使用 /run pytest 之类的命令来运行 pytest 并在与 GPT 的聊天中共享结果。

然后就有了上述结果。至于 Aider ,对于那些不了解的小伙伴,接下来我们简单介绍一下。

Aider 是一个命令行工具,可以让用户将程序与 GPT-3.5/GPT-4 配对,以编辑本地 git 存储库中存储的代码。用户既可以启动新项目,也可以使用现有存储库。Aider 能够确保 GPT 中编辑的内容通过合理的提交消息提交到 git。Aider 的独特之处在于它可以很好地与现有的更大的代码库配合使用。

简单总结就是,借助该工具,用户可以使用 OpenAI 的 GPT 编写和编辑代码,轻松地进行 git commit、diff 和撤销 GPT 提出的更改,而无需复制 / 粘贴,它还具有帮助 GPT-4 理解和修改更大代码库的功能。

为了达到上述功能,Aider 需要能够准确地识别 GPT 何时想要编辑用户源代码,还需要确定 GPT 想要修改哪些文件并对 GPT 做出的修改进行准确的应用。然而,做好这项「代码编辑」任务并不简单,需要功能较强的 LLM、准确的提示以及与 LLM 交互的良好工具。

操作过程中,当有修改发生时,Aider 会依靠代码编辑基准(code editing benchmark)来定量评估修改后的性能。例如,当用户更改 Aider 的提示或驱动 LLM 对话的后端时,可以通过运行基准测试以确定这些更改产生多少改进。

此外还有人使用 GPT-4 Turbo 简单和其他模型对比了一下美国高考 SAT 的成绩:

同样,看起来聪明的程度并没有拉开代差,甚至还有点退步。不过必须要指出的是,实验的样本数量很小。

综上所述,GPT-4 Turbo 的这一波更新更重要的是完善了功能,增加了速度,准确性是否提高仍然存疑。这或许与整个大模型业界目前的潮流一致:重视优化,面向应用。业务落地速度慢的公司要小心了。

另一方面,从这次开发者日的发布内容来看,OpenAI 也从一个极度追求前沿技术的创业公司,变得开始关注起用户体验和生态构建,更像大型科技公司了。

再次颠覆 AI 领域的 GPT-5,我们还得再等一等。

参考内容:

https://venturebeat.com/ai/what-can-you-make-with-openais-gpt-builder-5-early-examples/

https://aider.chat/docs/benchmarks-1106.html

https://weibo.com/2194035935/N8pSZCdxH

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
现世报应!重庆王先生转战西藏旅游,当地酒店餐馆集体预警,全城拒绝接待

现世报应!重庆王先生转战西藏旅游,当地酒店餐馆集体预警,全城拒绝接待

老猫观点
2026-08-12 17:36:09
乌克兰一军官称前线补给危机请求撤军:有士兵12天没吃没喝只能喝尿为生,还有人因缺水少食昏迷好几天

乌克兰一军官称前线补给危机请求撤军:有士兵12天没吃没喝只能喝尿为生,还有人因缺水少食昏迷好几天

极目新闻
2026-08-12 11:23:21
这就是赤裸裸的现实!工商银行已经到了最危险的时候?

这就是赤裸裸的现实!工商银行已经到了最危险的时候?

奇思妙想生活家
2026-08-12 00:55:47
日媒直白评论:日本在“汇率战争”中“战败”,让人联想“麦克阿瑟踏上日本”

日媒直白评论:日本在“汇率战争”中“战败”,让人联想“麦克阿瑟踏上日本”

环球网资讯
2026-08-12 14:10:11
台海观澜 | “台独”“不独而独”,大陆“不统而统”

台海观澜 | “台独”“不独而独”,大陆“不统而统”

经济观察报
2026-08-12 15:06:27
吊梢眉、眯眯眼,一个个精神萎靡,清华博士丑化红军战士,引起全网怒火:必须严查重罚!

吊梢眉、眯眯眼,一个个精神萎靡,清华博士丑化红军战士,引起全网怒火:必须严查重罚!

谭谈社会
2026-08-11 21:36:52
轰动一时的关于“新冠”死亡人数的文章,被下架

轰动一时的关于“新冠”死亡人数的文章,被下架

压舌说
2026-08-12 13:36:32
22岁程梦圆搜救细节曝光:仅90斤,多名壮汉竟无法抬下山!

22岁程梦圆搜救细节曝光:仅90斤,多名壮汉竟无法抬下山!

小许论事
2026-08-12 14:53:16
8月12日俄乌最新:5支乌军作战部队集体倒戈?

8月12日俄乌最新:5支乌军作战部队集体倒戈?

西楼饮月
2026-08-12 21:04:57
媒体报道,谁在装死

媒体报道,谁在装死

任易
2026-08-12 19:50:34
浙江一家公司,收到美国政府2.62亿元关税退税

浙江一家公司,收到美国政府2.62亿元关税退税

每日经济新闻
2026-08-12 16:54:11
国产笔记本造假再被抓现行!宣传100% sRGB实测仅59%

国产笔记本造假再被抓现行!宣传100% sRGB实测仅59%

快科技
2026-08-12 11:17:05
曝俄罗斯核潜艇套上无人机防护网!靠近俄远东第四大城市

曝俄罗斯核潜艇套上无人机防护网!靠近俄远东第四大城市

项鹏飞
2026-08-10 21:06:31
西安男子12楼装空调坠亡,家属:免费帮朋友,朋友在室内未拉牢安全绳,事后对方却推诿;当事人:早已包工付全款,事发次日还借给对方5万

西安男子12楼装空调坠亡,家属:免费帮朋友,朋友在室内未拉牢安全绳,事后对方却推诿;当事人:早已包工付全款,事发次日还借给对方5万

极目新闻
2026-08-12 13:17:21
砸观音像、给死人打电话、把生辰八字钉古树,因车祸去世的24岁网红姜小柔,她的死被网友猜疑与不敬重迷信有关!

砸观音像、给死人打电话、把生辰八字钉古树,因车祸去世的24岁网红姜小柔,她的死被网友猜疑与不敬重迷信有关!

谭谈社会
2026-08-12 08:17:56
随着肖国栋2-6出局,斯诺克中国公开赛八强已经诞生4席:暂时仅1名中国选手晋级

随着肖国栋2-6出局,斯诺克中国公开赛八强已经诞生4席:暂时仅1名中国选手晋级

侧身凌空斩
2026-08-12 22:41:42
重磅!湖人以120亿美元天价再次被出售,ESPN已证实!

重磅!湖人以120亿美元天价再次被出售,ESPN已证实!

爱体育
2026-08-12 22:38:05
No!不打了!宣布离队!中国男篮第一玻璃前锋

No!不打了!宣布离队!中国男篮第一玻璃前锋

篮球实战宝典
2026-08-12 17:59:44
刘德华携12岁女儿逛故宫,同框照刷屏全网:这就是文化自信

刘德华携12岁女儿逛故宫,同框照刷屏全网:这就是文化自信

东方不败然多多
2026-08-12 09:48:28
选择“领克900”=拥有一辆豪华SUV+获得自驾游全套解决方案!

选择“领克900”=拥有一辆豪华SUV+获得自驾游全套解决方案!

大侠上车
2026-08-12 13:22:59
2026-08-13 00:28:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13742文章数 142718关注度
往期回顾 全部

科技要闻

Manus第二季,浪子回头

头条要闻

外卖小哥称"我人生最后一天啦" 女顾客收信息果断报警

头条要闻

外卖小哥称"我人生最后一天啦" 女顾客收信息果断报警

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

华尔街把AI算力炒成下一个房地产?

汽车要闻

这台大众不一般 上汽大众ID.ERA.5S综合续航约2000公里

态度原创

艺术
本地
游戏
旅游
军事航空

艺术要闻

高2600米!日本的海上“四面体城市”,可住百万人

本地新闻

黄州一夜,苏轼写给普通人的月光

《GTA6》PS5 Pro或也难跑60帧 被CPU性能拖后腿

旅游要闻

浙江舟山:台风过后景区恢复开放

军事要闻

通过“毕业大考” 湖北舰“持证上岗”

无障碍浏览 进入关怀版