过去一段时间,有一种声音认为,大语言模型只是在数学或编程这类答案可验证的领域突飞猛进。但最新数据显示,这种说法并不准确。
实际情况是,当模型在可验证任务上表现越来越好时,它们在其他类型的问题解决上也在同步变强。尽管原文没有点明具体的是哪些非可验证任务,但数据透露出一个清晰的信号:模型能力的提升并非被锁死在固定题型里。
![]()
这一发现直接冲击了业界此前对模型“偏科”的悲观想象。如果进步是跨领域的,那么AI的上限或许比普遍预期更高。我们可能需要重新评估模型在创作、复杂推理等开放性任务上的潜力。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.