网易首页 > 网易号 > 正文 申请入驻

基于人工验证的智能定责系统错误模式发现与根因分析研究

0
分享至

通信世界网消息(CWW)移动互联网、物联网和增值业务的持续融合,使电信运营体系演变为多业态并存的复杂系统。工业和信息化部统计数据显示,在2025年第四季度全国电信用户申诉中,服务争议占40.2%、资费争议占35.2%、营销争议占9.6%[1],业务复杂度的上升增大了申诉研判和处置的难度。现阶段,国内电信申诉定责仍以人工审核为主,工作人员需要综合比对合同文本、语音录音、账单流水、业务日志等多类材料,判定标准难以统一,人力成本居高不下。目前,基于多模态智能体协同的电信用户申诉智能定责系统已进入行业试点阶段,在生产环境实测中,单案处理时间从以往的约50分钟压缩至4分钟。然而,处置效率的大幅提升也引出了一个现实问题:AI判断准不准?如果效率的提升以牺牲准确性为代价,那么智能化转型的实际效果就需要重新评估。

在国际电信业投诉研究中,Thayumanavan使用BERT(‌Bidirectional Encoder Representations from Transformers‌,基于变换器的双向编码器表征量)模型对AT&T(American Telephone&Telegraph Company‌,美国电话电报公司)用户投诉进行自动分类,六类任务的准确率达92.5%。Güllü等人比较了GPT-2、Llama3.1-8B等大语言模型与BERT、RoBERTa(Robustly Optimized BERT Pretraining Approach,鲁棒性优化的BERT预训练方法)等传统方法,发现大语言模型在投诉分类上显著优于传统深度学习模型。国内方面,广州电信客服中心利用自然语言处理技术构建了三层智能定责系统,从海量投诉中提取关键词和内容,提高了投诉处理的及时性和有效性。李征仁进一步将Linked-RAG架构与大语言模型结合,探索了面向电信客户投诉的智能判责方法。然而,上述研究主要关注分类性能的横向比较和效率提升,没有深入分析错误发生的具体位置、表现形态和根本原因,也缺少对系统错误模式的条理化归类。Han等人2025年采用CRISP-DM数据挖掘标准流程对4500件电信投诉数据进行结构化分析,识别了用户满意度的关键影响因素,这种方法带来的启示是:智能定责系统的问题同样可以通过结构化框架进行系统性归纳。本研究在真实生产环境中对多模态智能体协同定责系统开展实证评估,聚焦以下三个问题:系统在实际运行中的主要错误类型及其表现形态;不同类型错误的分布规律与频率特征;确定错误的深层成因,为后续优化提供实证方向。

1 系统架构与评估方法

1.1 智能定责系统

本研究依托的智能定责系统采用多层架构。通用模型层整合了Qwen3(通用语言理解)、Qwen2.5-VL(多模态信息处理)和DeepSeek-R1(逻辑推理)三类基础模型;原子能力层将底层模型封装为条款审核、多模态理解、规则核验、OCR(Optical Character Recognition,光学字符识别‌)引擎、ASR(automatic speech recognition,语音识别)引擎和NLP(natural language processing,自然语言处理)理解六大可复用模块;专业场景层在此基础上构建覆盖16类典型场景的完整定责流程;智能体协同层通过感知解析、逻辑路由、深度推理和结果生成四个智能体实现多智能体协同决策,并与携号转网业务平台、资费报送库、短信告知平台等外部系统进行数据联动,形成端到端的定责能力。

1.2 数据来源

本文数据来自2026年1月4—5日智能定责系统处理的全量申诉工单,共计330件工单、4989个检测节点(平均每件工单约15.1个节点),覆盖16类定责场景。以检测节点为基本分析单元,可使错误分类精度远高于粗粒度的工单级评估。

1.3 人工验证流程

人工验证由27名电信用户申诉受理中心的专业复核员完成,平均从业年限为8年。验证采用“独立预审+集体仲裁”双层流程:第一层是独立预审,每位复核员逐项比对AI判定结果与自身专业判断,一致的直接通过,不一致的标记为“待仲裁”并记录分歧内容;第二层是集体仲裁,所有待仲裁节点均被提交至上级仲裁会议进行集体讨论,经充分讨论达成一致后形成最终标注。该方法参考了德尔菲法的结构化集体判断思路,通过多轮讨论逐步收敛分歧,最终标注代表集体共识而非个人意见。本研究的全部4989个判定节点均按此流程完成标注。

错误分类框架采用自下而上的归纳方法构建。复核员逐条审查所有判定节点,对判定为错误的节点记录详细原因。研究团队收集所有错误描述文本后,按根因同质性进行聚类合并,最终形成六大类、15个子类的错误分类体系。

2 错误模式分类与分布特征

2.1 总体表现

在330件工单中,存在问题的工单有230件(占比69.7%),涉及356个问题节点(占全部节点的7.1%),累计识别271件次问题情形。问题工单比例远高于问题节点比例,说明错误分布稀疏但波及面广——大多数工单仅少数节点出错,但超过三分之二的工单至少有一个节点存在问题,这意味着系统优化应聚焦错误集中的节点而非整体重构。

2.2 六大类错误分类

经归纳编码,271件次问题情形归为六大类、15个子类,详见表1。


第一大类“凭证处理”共143件次,占比52.8%,是错误最集中的区域。其中,凭证未识别(74件次)是指系统未能有效识别企业已提交的业务办理协议、服务提醒等关键材料,例如用户就销户违约金提出申诉时,企业已提供含明确违约条款的协议,AI仍判为“未提供限制用户销户的凭证”;凭证内容解析有误(58件次)是指系统虽检测到凭证,但对内容的理解存在偏差,常见情形包括误判账单未覆盖争议月份、错误关联用户号码、对业务到期时间等关键信息解析不准确;凭证内容判断有误(10件次)和凭证匹配错误(1件次)虽数量较少,但同样影响判断准确性。

第二大类“逻辑执行”共46件次(占比17.0%),集中体现为检测冗余、逻辑路由的意图匹配精度不足、与用户实际争议无关的检测节点被错误纳入执行范围。例如,用户仅投诉套餐变更,AI却运行了“无在网期限业务”检测节点,既浪费计算资源,又用无关信息干扰了后续推理。逻辑执行遗漏(26件次)、完整性判断有误(11件次)和场景判断有误(9件次)构成主要子类。

第三大类“流程控制”共33件次(占比12.2%),其核心问题是系统对“认责边界”把握不准。认责范围内的事项未触发定责流程(16件次),说明场景路由存在漏判;认责范围外的事项未按规则输出“无对应有责情形”的明确结论(15件次),暴露了边界处理逻辑的缺陷。

第四大类“跨系统协同”共17件次(占比6.3%),问题大多集中在解析端,返回结果解析错误(15件次)远多于调用遗漏(2件次)。例如,资费报送库中已有相关业务公示信息,AI仍判定为“未公示宣传”,反映出系统对外部数据返回结果的语义理解存在明显短板。

第五大类“非AI系统因素”共22件次(占比8.1%),主要包括:业务规则更新滞后(18件次),如2025年7月1日实施的新规要求验证码短信须包含必要信息,但系统未据此更新检测逻辑;企业回函命名和格式不规范(4件次),在一定程度上干扰了AI对凭证内容的识别与提取;另有10件次(3.7%)为无法归入已有分类的异常情形,故归入“其他”。

2.3 集中度特征

错误分布呈现显著的帕累托集中特征,详见表2。Top 3错误类型为凭证未识别(27.3%)、凭证内容解析有误(21.4%)、逻辑执行多余或遗漏(9.6%),合计占58.3%,超过总量的一半;而Top 6合计占81.8%。这一集中度意味着:优先解决凭证处理类问题即可消除超过半数的错误,优化边际收益高度集中。


3 错误根因分析

为追溯问题根源,本文从“感知—认知—逻辑—规则”四个层次对错误进行系统归因,自下而上逐层分析错误在数据表征、模型推断、策略执行和业务规则层面的传导关系。该分析框架借鉴了Han等人的CRISP-DM结构化溯源思路,将系统表现归因至数据特征、模型能力和流程协同等维度,并结合电信申诉定责场景的特殊性,将归因体系进一步扩展到业务语义理解偏差和跨系统协同失效等。各层次根因与错误类型的映射关系见表3。


3.1 感知层:凭证认知的“语义鸿沟”

凭证未识别与凭证解析错误合计占比48.7%,是系统误判的主要来源。问题的根源不在OCR识别精度,而在于AI对于有效凭证语义理解与电信业务逻辑多样性的错配。在实际业务中,具备法律效力的凭证形态多样,如业务受理单、办理协议、用户签字确认函等,其文本结构和命名方式各不相同,但本质上都指向“用户知情同意”这一核心事实。AI在将异构业务文档统一映射到“业务限制条款凭证”这一抽象概念时,推理机制尚不完善,难以像人工那样穿透字面直达实质,其判断高度依赖训练数据中凭证形态的覆盖范围。此外,在主副卡、共享套餐等多号码关联场景中,系统对号码间逻辑关系的识别能力不足,进一步放大了凭证认知偏差。

3.2 认知层:推理路径的策略偏差

逻辑执行遗漏和场景判断错误反映了系统在认知层面的推理短板,核心在于逻辑路由模块的意图匹配精度不够,缺乏对用户申诉核心诉求的准确聚焦,导致策略冗余和意图失配同时出现。当用户申诉涉及多重问题或语义模糊时,系统频繁出现场景归类偏差——将“无法办理业务”误判为“营销宣传问题”、将“宽带移机”错误关联到“流量提醒检测”流程,使整体分析路径偏离正确方向。

3.3 逻辑层:判责边界的识别缺陷

流程控制类错误的根源在于系统判责边界不够清晰。系统运行中同时存在两类问题:应判未判的漏判,即责任范围内未触发相应流程;以及不应判而判且处置不当的误判,即责任范围外错误触发流程并引发异常。这与朱禹臣[7]关于AI裁量权的研究结论一致:人工智能的确定性特征可以约束裁量权滥用,但也可能因锁定裁量规则而丧失必要弹性,在边界模糊的场景中陷入机械执行,引发新的系统性风险。换句话说,智能定责系统不仅要判断什么是对的,还要知道什么该判、什么不该判。

3.4 规则层:知识维护的时滞效应

业务规则更新问题虽然仅占6.6%,但揭示的系统性问题值得重视:判责准确性不是靠一次性技术部署就能保证的,而是依赖一套能随政策法规和定责标准动态演进的持续维护机制。新规生效后如果系统仍沿用旧标准,决策依据必然失效。问题的关键不在模型能力上,而在于缺乏高效的规则同步机制,业务知识的更新难以及时传导到系统运行层面,整个更新流程仍然高度依赖人工操作,没有建立起从政策感知到规则执行的动态响应链路。

4 优化策略建议

Kulkarni指出,AI系统性能的提升更多依赖高质量、高场景适配度的训练数据及其合成策略。这一观点支撑了本研究以业务语料驱动感知优化的思路。对照上述四层根因框架,下文提出对应的优化路径,推动智能定责系统从试点测试向生产辅助过渡。

在感知层面,需要缩小AI对凭证理解的“语义鸿沟”。优化方向不是继续提升OCR精度,而是建立面向电信业务场景的凭证形态知识库,增强AI对业务受理单、办理协议、用户签字确认等异构文档的语义映射能力,使其能够透过文档表层的文字信息,准确捕捉“用户知情同意”这一核心实质。

在认知层面,重点提升推理的精准度和抗干扰能力,尤其是优化逻辑路由的意图匹配精度,让检测节点精准对应用户的实际争议焦点,从源头减少策略冗余和场景误判。同时,建立案例驱动的学习机制,增强系统对历史判例的上下文感知和参照能力。建议引入“初检+终审”的双层推理流程——通用模型完成初步筛查,对于低置信度或边界模糊的案件由推理模型进行二次研判,从而在效率与准确性之间取得更好的平衡。

在逻辑层面,将判责边界显式化。建议在系统架构中增设边界判定前置模块,进入具体定责流程前,先判断申诉事项是否属于认责范围,并对判定结果及其依据做可追溯记录。这一设计借鉴了朱禹臣关于AI裁量权中“锁定裁量规则”风险的讨论:边界显式化不是限制灵活性,而是为裁量判断提供一个清晰的规则参照框架,在约束与弹性之间寻求平衡。

在规则层面,实现从政策感知到系统响应的一体化自动联动。通过连接政策更新、规则库同步和系统验证三个环节,用动态更新替代当前的人工维护模式,消除信息传递的时滞。同时,利用全流程留痕数据识别高频异常场景,自动生成定向训练样本,让系统优化优先级的确定由数据驱动而非凭经验判断,保障系统在业务持续演进中的适应性和鲁棒性。

5 结语

本研究对330件真实工单中的4989个判定节点进行了全量人工验证,归纳出多模态智能定责系统的六大类、15个子类错误模式,建立了面向电信申诉场景的AI错误分类框架,将系统输出错误从孤立个案细化为可统计、可比较、可归因的类别体系,为智能定责系统的效果评估提供了可操作的方法工具。在此基础上,构建“感知—认知—逻辑—规则”四层根因分析模型,厘清从“语义鸿沟”到策略偏差、边界缺陷和时滞效应的层层传导关系,实证数据同时为系统优化确立了基于证据的优先顺序。后续随着智能定责系统的优化,将持续开展错误模式的跟踪及研究,推动人工验证驱动的错误发现方法标准化,并逐步构建常态化评估机制。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
“牡丹花下死,做鬼也风流”!这一次,75岁的张纪中彻底成了笑话

“牡丹花下死,做鬼也风流”!这一次,75岁的张纪中彻底成了笑话

小鱼爱鱼乐
2026-07-15 12:14:00
涉嫌严重违纪违法,吴启仁被查

涉嫌严重违纪违法,吴启仁被查

中国基金报
2026-07-21 10:17:18
现在,终于轮到印度怕苹果跑路了,但苹果是真怕了

现在,终于轮到印度怕苹果跑路了,但苹果是真怕了

飘逸语人
2026-07-21 11:37:18
时代落幕?曝39岁梅西告知队友:世界杯决赛是他在阿根廷队最后1战

时代落幕?曝39岁梅西告知队友:世界杯决赛是他在阿根廷队最后1战

我爱英超
2026-07-21 16:06:28
别再用这种器械!居家锻炼,45岁男子摔倒头部着地,医生紧急提醒

别再用这种器械!居家锻炼,45岁男子摔倒头部着地,医生紧急提醒

潇湘晨报
2026-07-21 17:54:40
无缘大满贯!足协杯爆冷:中超第1被淘汰,韦世豪被护送回替补席

无缘大满贯!足协杯爆冷:中超第1被淘汰,韦世豪被护送回替补席

足球大腕
2026-07-21 23:38:47
中共中央组织部决定:孙洪均、温少祺职务调整

中共中央组织部决定:孙洪均、温少祺职务调整

新京报政事儿
2026-07-21 18:10:02
车贷还没还完,车先趴窝了——20余万辆埃安的账到底该谁算?

车贷还没还完,车先趴窝了——20余万辆埃安的账到底该谁算?

斗子侃车
2026-07-20 11:38:55
召见大使表达强烈不满,人道安排彰显大国责任,中方敦促菲律宾停止挑衅

召见大使表达强烈不满,人道安排彰显大国责任,中方敦促菲律宾停止挑衅

环球网资讯
2026-07-22 06:34:35
英国变天,新首相上台就掀桌子,直接废除前任计划,对华态度曝光

英国变天,新首相上台就掀桌子,直接废除前任计划,对华态度曝光

牛锅巴小钒
2026-07-22 04:41:19
上海一反虐猫志愿者遭开盒后轻生,父亲及时送医,称“有网友对她造黄谣,发布不实信息”,已多次报警

上海一反虐猫志愿者遭开盒后轻生,父亲及时送医,称“有网友对她造黄谣,发布不实信息”,已多次报警

都市快报橙柿互动
2026-07-22 01:37:07
求此图出处!感谢万能的网友

求此图出处!感谢万能的网友

正经的米饭
2026-07-21 23:45:29
70万打水漂了!丈夫掏空全部积蓄未能救回患癌妻子,发现妻子手机里写给初恋:当初要是嫁给你就好了

70万打水漂了!丈夫掏空全部积蓄未能救回患癌妻子,发现妻子手机里写给初恋:当初要是嫁给你就好了

火山詩话
2026-07-21 17:21:28
血赚1400亿,总统说还想要,美国办世界杯为什么不亏钱?

血赚1400亿,总统说还想要,美国办世界杯为什么不亏钱?

木蹊说
2026-07-21 18:24:48
ESPN本届世界杯最佳阵:西班牙4人入选,沃齐尼亚、布阿迪在列

ESPN本届世界杯最佳阵:西班牙4人入选,沃齐尼亚、布阿迪在列

懂球帝
2026-07-21 19:43:09
蛇鼠一窝!恒大二把手夏海钧在美国的邻居,竟然是另一个逃跑富豪

蛇鼠一窝!恒大二把手夏海钧在美国的邻居,竟然是另一个逃跑富豪

阿晭评论哥
2026-07-18 22:00:09
中菲冲突第2天!菲律宾增兵,美国发声力挺,日本发现大事不妙

中菲冲突第2天!菲律宾增兵,美国发声力挺,日本发现大事不妙

影孖看世界
2026-07-21 16:10:23
为什么年轻人都觉得自己拿不到退休金?真相太现实!

为什么年轻人都觉得自己拿不到退休金?真相太现实!

大稻网络科技
2026-07-21 14:42:32
尺素金声|5年追回医保基金近1182亿元,“看病钱”“救命钱”守得更牢

尺素金声|5年追回医保基金近1182亿元,“看病钱”“救命钱”守得更牢

海外网
2026-07-21 14:45:02
1.2亿天价保单!中国人寿不认账,还是彻底丢脸?

1.2亿天价保单!中国人寿不认账,还是彻底丢脸?

李云飞Afey
2026-07-21 21:53:51
2026-07-22 08:32:52
通信世界 incentive-icons
通信世界
多维度 全媒体 整合传播
12721文章数 30461关注度
往期回顾 全部

科技要闻

OpenAI高管:Kimi K3强到没法用"蒸馏"解释

头条要闻

小伙旅途中改道救灾去世 好友泪崩透露其最后一条消息

头条要闻

小伙旅途中改道救灾去世 好友泪崩透露其最后一条消息

体育要闻

“不会进球”的前锋,在世界杯决赛进球了

娱乐要闻

谢贤被曝已火葬,狄波拉携儿女送别

财经要闻

百虾竞速上车:4条路线争夺车载AI话语权

汽车要闻

WAIC专访|易启未来余志勇:网易孵化按摩机器人 能识穴会“手法”

态度原创

健康
房产
数码
艺术
军事航空

我这么年轻,也会中风吗?

房产要闻

最高奖励15万!免学费!海南民办高中,疯狂抢人!

数码要闻

飞利浦推出Evnia 32M2N6901A显示器,699英镑

艺术要闻

陈子庄:齐白石本事那样大,但画兰、竹还未过关

军事要闻

美伊再开打 战局出现新变化

无障碍浏览 进入关怀版