网易首页 > 网易号 > 正文 申请入驻

泛化性涨47%!首个意图检测奖励范式,AI工具时代意图识别新解法

0
分享至


随着大模型(LLMs)的快速发展和可集成工具的爆炸增长,AI 智能助手在日常生活中可提供的便利越来越多,不仅包括传统任务型对话中订机票、查询天气等助理能力,还增加了无以计数的 AI 能力,如 AI 画图、解数学题、游戏攻略等。而 AI 智能助手准确理解用户的意图(Intent Detection)并路由至下游工具链是实现这些功能的第一步,其重要性不言而喻。

然而,工具的快速迭代、多样化、工具之间关系的复杂化也给意图识别带来新的挑战,即模型在应对新意图时普遍存在性能衰减问题。如何在开源的轻量级 LLMs 上训练泛化性更好、鲁棒性更强的意图识别模型,使得模型能够更准确理解未见场景的意图至关重要。

近日,腾讯 PCG 社交线的研究团队针对这一问题,采用强化学习(RL)训练方法,通过分组相对策略优化(Group Relative Policy Optimization, GRPO)算法,结合基于奖励的课程采样策略(Reward-based Curriculum Sampling, RCS),将其创新性地应用在意图识别任务上,显著提升模型在未知意图上的泛化能力,攻克了工具爆炸引发的意图泛化难题,推动大模型在意图识别任务上达到新高度。

  • 论文标题:Improving Generalization in Intent Detection: GRPO with Reward-Based Curriculum Sampling
  • 论文链接:https://www.arxiv.org/abs/2504.13592

基于强化学习的意图识别

该团队进行了大量实验,从不同维度深入剖析了 GRPO 算法在这一任务上的优势。该工作的贡献主要为以下四个方面:

1. 该团队证明了在意图检测问题上,通过强化学习(RL)训练的模型在泛化能力上显著优于通过监督微调(SFT)训练的模型,具体体现在对未见意图和跨语言能力的泛化性能大幅提升。值得一提的是除了完全新的未见意图,该工作还比较了对已知意图进行拆分、合并等实际产品场景会遇到的真实问题。

2. 该团队通过基于奖励的课程采样策略进一步增强了 GRPO 的训练效果,有效引导模型在训练过程中聚焦于更具挑战性的样例。

3. 在强化学习过程中引入思考(Thought),显著提升了模型在复杂意图检测任务中的泛化能力。这一发现表明,在更具挑战性的场景中,Thought 对于提升模型的泛化能力至关重要。

4. 该团队发现,在意图识别任务中,无论选择预训练模型(Pretrain)还是指令微(Instruct)调模型作为基础,经过相同轮次的 GRPO 训练后,两者性能相近。这一结果与传统训练经验有所不同。

训练方法

奖励函数

基于奖励的课程采样

该团队采用课程学习的思路分两步对模型进行训练。

离线数据分类该团队通过离线的方法对所有数据的难度进行了分类。具体过程中先进行一遍完整的 GRPO 方法,记录每条数据的 reward,根据每条数据的 reward 作为难度得分,如下公式所示:

其中 G 为采样总数。

课程采样在课程学习过程中,第一阶段在所有数据上进行训练直到模型基本收敛;第二阶段筛选保留的数据作为难样例进行训练。这一采样方法帮助模型在第二阶段更好的关注容易出错的难数据。

实验:RL 能够帮助模型理解任务而不是模仿任务识别

实验设置:

  • 数据集:该团队在 TODAssistant(自建中文数据集)和 MultiWOZ2.2(公开英文数据集)两个基准上开展评测。MultiWOZ2.2 数据集是公开的 TOD 任务数据集,该研究团队在该数据集上提取出了意图分类这个任务。
  • 模型选取:该团队选取 Qwen2.5-7B-Instruct 模型作为基座模型,分别对于 SFT 方法和 GRPO 方法训练相同 epoch 来对比模型性能。
  • 评测指标:用正确率评测意图分类的准确性。

GRPO 方法与 SFT 方法的对比:研究团队首先对比了 SFT 方法和 GRPO 方法。直接使用原始的 GRPO 方法,在意图识别任务上,模型可以达到与 SFT 相近的性能,在英文的 MultiWOZ2.2 数据集上做到了与 SFT 模型相同的表现,证明了 GRPO 方法在该任务上的有效性。

为了进一步探究 GRPO 的优势,研究团队针对模型的泛化性进行了评测。具体来说,在 MultiWOZ 数据集上,在训练过程中分别去掉测试集中的每个类别;在 TODAssistant 数据集上对原有的类别进行组合和细分操作,获得新的类别,来验证模型在该新类别上的准确性;该团队还测试了模型的跨语言能力(在英文数据集上训练后的模型在中文测试集上的结果)。实验结果表明,GRPO 方法相较于 SFT 方法,有着更好的泛化性能。

RCS 方法实验结果:在此基础上,研究团队进一步应用 RCS 方法进行实验。结果表明,在课程学习的第一阶段,模型收敛到与原始 GRPO 方法相近的准确率;在第二阶段难样例筛选过程后,模型的准确率进一步提升。

该团队在课程学习第二阶段的采样过程中,对于难样例与正常训练数据的比例进行了实验,随机在其他训练数据中采样与难样例混合共同训练。结果表明,单独训练难样例取得了最好的效果。

Thought 对于训练过程的影响:研究团队还探究了在意图识别这种逻辑较为简单的任务上 Thought 对于结果的影响。该团队发现,在这类任务上 Thought 同样有着关键的作用:在 TODAssistant 数据上,Thought 对于泛化能力的提升尤为重要;在 MultiWOZ2.2 数据集上,去掉 Thought 后模型的性能出现了大幅下降。

Pretrain 模型和 Instruct 模型在该任务上的区别:研究团队发现,在意图识别任务上,选取 Pretrain 模型或者 Instruct 模型作为底座,在经过相同的 epoch 进行 GRPO 训练后,可以收敛到相近的性能,这与传统的训练经验有所不同。

同时该团队还发现,instruct 模型在宽松格式和严格格式奖励函数下的生成长度均保持稳定。然而,Pretrain 模型在宽松格式奖励下生成长度先下降后上升,而严格格式奖励下则无此趋势。值得注意的是,这种长度增加并未提供有效信息。这一对比表明,类似 R1 的强化学习训练会诱导模型通过增加输出长度来获取更高奖励,但在相对简单的意图检测任务中,真正的 「顿悟时刻」 难以出现。

未来展望

1.在线数据筛选方法:现如今该团队的 RCS 数据筛选方法仍然是离线的,在后续的工作中将探索更高效的在线筛选方法。

2.多意图识别:该研究团队针对意图识别的实验目前主要针对单意图场景,在后续工作中将继续探索多意图的识别。

3.任务型对话相关任务扩展:目前该团队的实验都是在意图识别任务上进行,在未来的工作中将继续在更复杂的任务型对话相关任务上进行尝试。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
谈好了!埃及和中国签约了!

谈好了!埃及和中国签约了!

故事终将光明磊落
2026-09-03 10:31:03
42岁冉莹颖最新生图曝光:这腰臀比,20岁姑娘都输了!

42岁冉莹颖最新生图曝光:这腰臀比,20岁姑娘都输了!

健身S叔
2026-09-03 22:55:23
又是第一!蔚来收入暴涨86%,李斌这次真扬眉吐气了

又是第一!蔚来收入暴涨86%,李斌这次真扬眉吐气了

财通社
2026-09-02 21:08:02
库里三分训练82连中!美媒预测场均23.4分 38岁再拿1.37亿不算贵

库里三分训练82连中!美媒预测场均23.4分 38岁再拿1.37亿不算贵

颜小白的篮球梦
2026-09-03 15:01:20
人性能有多坏?网友:有路灯的地方,牲口无处不在

人性能有多坏?网友:有路灯的地方,牲口无处不在

带你感受人间冷暖
2026-08-31 00:05:16
刚刚,OpenAI新Transformer火了!Astra架构首次曝光

刚刚,OpenAI新Transformer火了!Astra架构首次曝光

新智元
2026-09-03 11:43:18
商务部:中欧各层级磋商不能单方面提要价、谈条件

商务部:中欧各层级磋商不能单方面提要价、谈条件

新京报
2026-09-03 15:56:07
福建一男子深夜入室行窃,女子跪地求饶:我不想死,求你放过我

福建一男子深夜入室行窃,女子跪地求饶:我不想死,求你放过我

天梦见证
2025-03-17 12:29:51
故意不带李月汝?旧账被翻出,她曾公开批评宫鲁鸣,名记连发三问

故意不带李月汝?旧账被翻出,她曾公开批评宫鲁鸣,名记连发三问

萌兰聊个球
2026-09-03 09:47:08
2026年最强反腐来了!中纪委:害群之马将清除到底!

2026年最强反腐来了!中纪委:害群之马将清除到底!

职场资深秘书
2026-09-03 13:09:08
“这就是消毒水用多了的下场!”医学博士妈妈晒自闭症儿子,评论区让人大开眼界!

“这就是消毒水用多了的下场!”医学博士妈妈晒自闭症儿子,评论区让人大开眼界!

林林先生
2026-08-20 07:40:06
华侨城退出,招商蛇口超5亿接下深圳国际会展中心全盘运营权

华侨城退出,招商蛇口超5亿接下深圳国际会展中心全盘运营权

南方都市报
2026-09-03 14:17:19
阿里花1000亿搞AI,美图花不到5个亿

阿里花1000亿搞AI,美图花不到5个亿

略大参考
2026-09-02 22:26:27
斯诺克第9席16强出炉!小特4-0横扫,张安达2-0到2-3,世界冠军暂平!

斯诺克第9席16强出炉!小特4-0横扫,张安达2-0到2-3,世界冠军暂平!

刘姚尧的文字城堡
2026-09-03 21:52:43
广东一考生放弃深圳大学后续:已前往贵州复读,每天17小时全排满,网友:985未必会更好

广东一考生放弃深圳大学后续:已前往贵州复读,每天17小时全排满,网友:985未必会更好

育学笔谈
2026-09-02 21:43:27
27款大众帕萨特上市,价格低到离谱!

27款大众帕萨特上市,价格低到离谱!

米粒说车唯一呀
2026-09-02 16:51:59
AI色情短剧平台化!50元包月,现未成年人内容与脱衣教程

AI色情短剧平台化!50元包月,现未成年人内容与脱衣教程

南方都市报
2026-09-01 09:48:15
1.57亿豪购6人!米兰夏窗净投7000万却留2大废柴,压哨翻车意难平!

1.57亿豪购6人!米兰夏窗净投7000万却留2大废柴,压哨翻车意难平!

舌尖小游记
2026-09-02 16:32:55
返回美国!杨瀚森透露对方中锋找自己换球衣 已悟出激怒对手的套路

返回美国!杨瀚森透露对方中锋找自己换球衣 已悟出激怒对手的套路

追球者
2026-09-03 10:39:51
基恩:像曼联这样的俱乐部,不应该夏窗仅剩两小时才慌不择路

基恩:像曼联这样的俱乐部,不应该夏窗仅剩两小时才慌不择路

懂球帝
2026-09-03 17:30:05
2026-09-04 00:00:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13913文章数 142729关注度
往期回顾 全部

科技要闻

英伟达129亿美元拿下Hugging Face

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

头条要闻

男子逛夜市遭按摩摊大妈拉住 被5个大妈服务按到发红

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

章子怡套现3亿 上美拿什么补韩束的缺?

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

手机
数码
亲子
公开课
军事航空

手机要闻

iOS 微信适配液态玻璃了?别高兴太早,其实是iOS 27的功劳

数码要闻

HTC推出AI智能眼镜VIVE Eagle:主打隐私保护,499美元起

亲子要闻

带孙子半年暴瘦40斤!医院确诊后这幕看哭无数人:隔代带娃,为什么成了老人的身心重灾区?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

乌特工内战街头对射 互认对方为"俄特工"

无障碍浏览 进入关怀版