网易首页 > 网易科技 > 网易科技 > 正文

业内:测试越来越难以评估AI水平,普通人更难感受AI进步

0
分享至

1月13日消息,2024年底,OpenAI前员工凯尔西·派珀(Kelsey Piper)撰文探讨人工智能的“规模定律”是否已遇到技术瓶颈。她认为,这个问题并不像许多人认为的那样重要:现有的人工智能系统已经足够强大,能够深刻改变我们的世界。无论规模定律是否成立,未来几年都将由人工智能的进步主导。

文章发布不到一周后,OpenAI推出了年终更新,其中包括最新的大语言模型o3。虽然o3未能完全证明“规模定律”在未来是否仍是推动人工智能进步的核心规律,但它无疑粉碎了“人工智能发展已陷入瓶颈”的说法。

o3的表现极其令人惊叹。为了更好地理解它的非凡之处,我们需要先探讨如何科学地评估人工智能系统。

人工智能标准化测试

如果想比较两个语言模型的表现,需要用一组它们以前从未接触过的问题进行测试。然而,这远比听起来要困难得多,因为这些模型在训练过程中已经接触了大量文本,早已覆盖了绝大多数测试内容。

因此,机器学习研究员通常会设计基准测试,来评估人工智能系统在数学、编程、阅读与理解文本等多个任务上的表现,并将这些结果与人类进行比较。曾经,人们用美国数学奥林匹克竞赛的题目以及物理、生物和化学问题测试人工智能。

问题在于,人工智能发展得太快,不断打破基准测试的限制。一旦人工智能在某个基准测试中表现优异,人们便认为该测试已经“饱和”,无法再有效区分模型的能力,因为几乎所有模型都能取得接近满分的成绩。

2024年堪称“基准测试如太平洋般饱和”的一年。过去,人们用名为GPQA的基准测试人工智能。这种测试涵盖物理、生物和化学领域,难度高到即使是相关领域的博士生也很难得分超过70%。但如今,人工智能的表现已超过了相关领域的博士,因此该基准已失去评估意义。

人工智能模型在数学奥林匹克预选赛中的表现也不输顶尖人类选手。一个名为MMLU的基准测试用于评估模型的语言理解能力,涵盖多个领域。现在,最好的模型已经“攻克”了这个基准。另一个名为ARC-AGI的测试原本被设计为极其困难,旨在衡量通用的人类智能水平,但经过调优后,o3在这一测试中取得了令人瞩目的88%得分。

我们仍然可以设计更多的基准测试。然而,以人工智能的进步速度来看,每个新基准的有效期可能只有短短几年。更重要的是,新的基准测试越来越需要衡量人工智能在超出人类能力范围的任务上的表现,才能准确描述其能力和局限性。

当然,人工智能仍可能犯一些低级且令人恼火的错误。但如果你最近六个月没有关注人工智能的最新发展,或者只体验过免费版的语言模型,那么你可能高估了它们犯错的频率,也低估了它们在高难度、智力密集型任务上的能力。

隐而不见的进步

《时代》杂志最近的一篇文章指出,人工智能的发展并非“触及瓶颈”,而是变得愈发隐蔽,其主要进展以一种难以察觉的方式快速推进。

每个人都能明显区分出5岁孩子学算术和高中生学微积分之间的差别,因此这类进步显得直观且清晰。但多数人无法分辨一名数学专业大一新生与世界顶级数学家之间的差距,因此人工智能在这些高阶领域的进步往往不被感知。

然而,这种进步的意义非凡。人工智能将通过自动化处理大量曾由人类完成的智力工作来深刻改变世界,而这一变革主要受以下三大因素驱动:

  • 1. 成本的持续下降
  • o3模型虽然取得了令人惊叹的成果,但处理复杂问题的成本可能高达1000美元。然而,2024年底中国推出的DeepSeek表明,以较低成本实现高质量表现是可能的。
  • 2. 人机交互方式的不断优化
  • 人类与人工智能的互动方式仍有巨大的创新空间。如何更高效地与人工智能互动、如何让人工智能自检,以及如何选择最适合特定任务的人工智能模型,都是未来改进的方向。例如,一个系统可以默认由中等性能的聊天机器人处理大多数任务,但当遇到复杂问题时,内部调用更昂贵的高端模型。这些改进更多属于产品开发而非技术突破,即便人工智能技术进步停止,这些改进仍将推动世界发生深远变化。
  • 3. 人工智能系统的日益智能化
  • 尽管有许多关于人工智能“发展停滞”的言论,但事实证明,人工智能仍在快速进步。最新的系统不仅在推理和问题解决方面表现更佳,而且越来越接近成为多领域的专家。在某种程度上,我们甚至尚未完全了解它们的智能水平,因为当人工智能的能力超越人类专家的评估范围后,现有测试方法已无法准确衡量其表现。

这三大驱动因素将塑造未来数年的人工智能发展,也充分展现了其重要性。不论你是否喜欢人工智能的崛起(就我个人而言,我并不认为这一世界性转型正在以负责任的方式推进),这三个领域都未遇到“瓶颈”,而且其中任何一个都足以持续改变我们的世界。(辰辰)

延伸阅读
相关推荐
热点推荐
柯洁发文悼念聂卫平!他生前收入有4个来源 恐给子女留下丰厚遗产

柯洁发文悼念聂卫平!他生前收入有4个来源 恐给子女留下丰厚遗产

乡野小珥
2026-01-17 03:37:49
19年湖北儿媳住院公公陪,她趁护士换药塞纸条,护士看后直接报警

19年湖北儿媳住院公公陪,她趁护士换药塞纸条,护士看后直接报警

罪案洞察者
2025-02-26 13:47:06
裤衩都亏没了!江苏美女盲目跟风,办了上百桌刨猪宴无人赴约!

裤衩都亏没了!江苏美女盲目跟风,办了上百桌刨猪宴无人赴约!

今朝牛马
2026-01-16 18:05:15
克林顿不是男人!要用雪茄助兴?莱温斯基:他把我当成“自助餐”

克林顿不是男人!要用雪茄助兴?莱温斯基:他把我当成“自助餐”

老蝣说体育
2026-01-05 14:59:04
退休人员好消息!2026年2月养老金或提前发放,过春节更加充实!

退休人员好消息!2026年2月养老金或提前发放,过春节更加充实!

社保小达人
2026-01-17 09:55:11
猪肚炖得对,药铺关门睡!学会炖一锅,胃病、湿气都怕它!别不懂

猪肚炖得对,药铺关门睡!学会炖一锅,胃病、湿气都怕它!别不懂

江江食研社
2026-01-15 07:30:08
朱元璋出巡时,遇到当年的地主:当年到你家要饭,为何给我馊饭?

朱元璋出巡时,遇到当年的地主:当年到你家要饭,为何给我馊饭?

五元讲堂
2025-11-06 10:41:50
昆明一小区新老物业交替发生冲突,多人受伤!业主:心理上造成很大恐慌;相关部门已介入处置

昆明一小区新老物业交替发生冲突,多人受伤!业主:心理上造成很大恐慌;相关部门已介入处置

大风新闻
2026-01-16 17:00:18
脸疼不疼?人民网彻查后,闫学晶首现身再传噩耗,这回真洗不白了

脸疼不疼?人民网彻查后,闫学晶首现身再传噩耗,这回真洗不白了

观察鉴娱
2026-01-17 09:22:34
演技差就别演!看完《小城大事》谭光明,才知什么是剧抛脸

演技差就别演!看完《小城大事》谭光明,才知什么是剧抛脸

草莓解说体育
2026-01-17 08:34:12
试过贾府一半男子的多姑娘,为何在试贾宝玉时,成了“灯姑娘”?

试过贾府一半男子的多姑娘,为何在试贾宝玉时,成了“灯姑娘”?

铭记历史呀
2026-01-15 14:24:03
“姐是律师,也是硕士”,名牌大学律师硬核擦边!

“姐是律师,也是硕士”,名牌大学律师硬核擦边!

画生笔记
2026-01-16 09:15:55
高中大学出现退学潮:这代孩子比起学历,更怕错过“一辈子就1次”的机会

高中大学出现退学潮:这代孩子比起学历,更怕错过“一辈子就1次”的机会

新东方
2026-01-12 11:59:06
从承诺归还抢走的土地,到提出出海权,俄国时隔100年又服软了?

从承诺归还抢走的土地,到提出出海权,俄国时隔100年又服软了?

近史博览
2025-12-20 10:50:02
刘翔回应“移民美国”

刘翔回应“移民美国”

澎湃新闻
2026-01-17 00:22:04
U23国足踢乌兹别克首发预测!两位久违强援携手复出,王钰栋领衔

U23国足踢乌兹别克首发预测!两位久违强援携手复出,王钰栋领衔

张麻子讲电影
2026-01-16 21:03:50
王自如喊冤:锤子手机不是我黑倒闭的,你们高估了我的能量……

王自如喊冤:锤子手机不是我黑倒闭的,你们高估了我的能量……

柴狗夫斯基
2026-01-15 08:33:54
别听公关的!我给贾国龙支一个翻盘的大招

别听公关的!我给贾国龙支一个翻盘的大招

深水财经社
2026-01-16 23:36:07
上海老伯凌晨3点多就出门去排队!只为买到这个“沪上顶流”!20分钟光速售罄!

上海老伯凌晨3点多就出门去排队!只为买到这个“沪上顶流”!20分钟光速售罄!

新民晚报
2026-01-15 17:06:56
里子面子都丢了!孙俪给53岁口无遮拦的闫学晶,早早就上了一课

里子面子都丢了!孙俪给53岁口无遮拦的闫学晶,早早就上了一课

文史旺旺旺
2026-01-15 20:04:05
2026-01-17 10:24:49

科技要闻

8亿周活扛不住烧钱 ChatGPT终向广告"低头"

头条要闻

最后一刻紧急叫停打伊朗 特朗普:已收到伊朗保证

头条要闻

最后一刻紧急叫停打伊朗 特朗普:已收到伊朗保证

体育要闻

全队身价=登贝莱,他们凭什么领跑法甲?

娱乐要闻

李湘翻车,早就有迹可循!

财经要闻

贾国龙、罗永浩均被禁言,微博CEO回应

汽车要闻

方程豹品牌销量突破30万辆 2026年还将推出轿跑系列

态度原创

艺术
房产
本地
公开课
军事航空

艺术要闻

齐白石画头毛驴当马卖,卖了1300万,网友:笑喷了!

房产要闻

喜封金顶 臻境初呈丨中粮·铂悦壹号3#楼封顶大吉!

本地新闻

云游内蒙|黄沙与碧波撞色,乌海天生会“混搭”

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

欧洲多国向格陵兰岛派遣军事人员 白宫回应

无障碍浏览 进入关怀版
×