当前国内金融业数字化转型进入深度攻坚阶段,数据作为关键生产要素,深度渗透银行经营决策、风险管控、普惠营销、监管报送全流程。各大银行集中推进新一代核心系统、数据湖仓、指标集市建设,数据规模呈爆发式增长,但长期遗留的数据治理短板持续制约数据价值释放:内部多业务系统独立建设形成数据孤岛,字段命名、统计口径、业务释义不统一;海量异构数据人工梳理成本高昂,数据质量校验、标准对标、资产盘点高度依赖业技复合型专家;区域农商行体系下多法人机构并存,各行“三农”、小微业务场景分化,跨机构数据融合标准化难度倍增。与此同时,国产大语言模型、智能体Agent、检索增强生成(RAG)、知识图谱等AI技术快速落地金融细分场景,为破解传统数据治理“人工依赖重、标准不统一、响应效率低、合规追溯难”等痛点提供全新解决方案。依靠人工逐表核对、线下文档对标、线下规则维护的传统模式,已经无法适配海量多源异构数据、动态更新监管制度、全域数据资产统筹管理的现实需求,以大模型为核心底座的自动化、智能化数据治理体系,成为区域性农商行完成数据资源化、资产化、要素化转型的核心抓手。
![]()
江苏农村商业联合银行数据标准负责人温鲜阳
近日,2026金融科技创新发展论坛暨第九届金融科技管理人年会顺利举办,江苏农村商业联合银行数据标准负责人温鲜阳发表“基于大模型技术的金融数据智能对标与治理创新实践”的主题分享,结合江苏农商全辖60家法人、两千余套业务系统的真实落地场景,围绕项目建设背景痛点、一体化智能解决方案、全维度落地成效三大板块完整拆解落地路径,为全国区域性中小银行智能化数据治理提供可落地、可复制的实践范本。
一、多重现实痛点倒逼智能化数据治理体系落地
智能对标与数据治理是银行推进数据要素化的两大核心支撑:智能对标聚焦“数据不通”,搭建全行统一的数据业务语言;数据治理解决“数据不可信”,筑牢数据质量底线,二者协同破除数据流通壁垒。该行于2024年启动本项目,叠加新核心重构、全省多法人数据汇聚、全域数据湖仓建设三重业务背景,面临行业共性与区域特色叠加的多重治理难题。
1.新一代核心业务重构,源头数据标准化管控能力不足
全行新一代核心系统全面重构,同步搭建客户、产品、交易、计价、账务五大企业级能力中心,要求从系统设计、SIT测试、UAT验收全流程落地统一企业级数据标准,从源头把控数据质量。传统人工治理模式下,字段映射、标准核对、口径校验全靠人工操作,不同人员对业务标准理解存在偏差,极易出现漏标、错标、口径冲突等问题,无法实现源头数据统一管控,后期数据清洗整改成本大幅抬升。
2.全辖多法人机构并存,跨机构数据融合标准化复杂度极高
江苏农商体系下辖60家独立农商行,全省累计上线2000余套业务系统,区域业务差异化特征显著:部分机构深耕县域三农信贷业务,部分机构聚焦小微企业普惠金融,同一业务指标如农户信用评分、企业授信额度,字段采集维度、统计规则、业务定义存在根本性差异。针对省内8家网外农商行数据上收融合工作,若采用传统人工标准化模式,需要逐行、逐系统梳理字段、统一口径,人力投入、项目周期都难以承受,人工梳理也无法保障跨机构标准一致性。
3.全域海量系统形成数据孤岛,传统湖仓治理效率低下
2025年该行启动全行统一数据湖仓建设,覆盖全行120余套核心业务系统,涉及4000余张业务数据表。原始数据普遍存在脏数据、格式混乱、字段语义缺失、拼音简写命名、特殊字符字段等问题。传统治理流程依靠人工逐表完成清洗、转换、整合,数据资产盘点、元数据补全、指标口径统一工作消耗大量高端业技人才,重复性工作挤占核心建模、数据分析资源;同时人工治理成果受人员专业水平影响,全行标准难以统一落地。
4.传统人工治理模式存在四大底层短板
线下人工治理流程存在无法规避的固有缺陷:第一,全行数据体量庞大,字段对标、资产盘点、安全分级分类工作人力投入成本极高;第二,从业人员专业能力参差不齐,人工判定结果准确率波动明显;第三,多团队、多法人同步作业,业务口径、标准释义理解不统一,治理成果碎片化,无法形成全行统一资产底座;第四,监管政策、数据安全规范持续更新,人工梳理规则存在滞后性,难以快速完成监管指标映射、合规追溯材料整理。
二、大模型驱动的金融数据智能对标与治理一体化解决方案
整套方案以国产大语言模型为核心引擎,深度融合元数据分析、智能体Agent、RAG检索增强、知识图谱、深度神经网络技术,搭建“高质量数据资产知识库+智能化治理工具箱+岗位化智能体应用场景”三层技术架构,构建人机协同、全流程自动化的数据治理闭环,同步打造四大专属智能体,落地四项差异化技术创新点。
1.三层整体架构,搭建人机协同智能治理底层底座
高质量数据资产知识库:整合全行结构化、半结构化、非结构化全域文档资源,涵盖业务需求说明书、数据库设计文档、Excel标准字典、代码脚本、监管政策文件,沉淀一万余条金融专属业务术语库。依托向量数据库、BERT、大模型完成文本语义识别、自动分类、智能标签标注,形成AI训练与语义检索的高质量语料底座,支撑意图识别、实体匹配、语义对标、监管规则解读全场景能力,为智能体提供统一知识依据。
一体化数据治理工具箱:覆盖数据治理全生命周期工具能力,划分为四大功能模块,文档智能编写模块自动生成管理办法、制度细则;元数据与标准模块完成元数据智能补全、标准智能校验、字段对标匹配;数据建模模块提供实体模型智能设计、转换脚本自动生成;数据安全模块实现分级分类智能判定、安全风险预警。全套工具嵌入数据管理、建模、安全岗位日常工作流程,将标准化、自动化能力下沉至一线业务操作。
岗位化智能体应用场景:针对数据管理岗、元数据管理员、数据建模人员、数据安全专员四类核心岗位定制专属AI能力:数据管理岗依托AI完成标准文档撰写、知识库快速检索;元数据管理员自动补全缺失字段释义、批量识别脏数据;建模人员自动解析表关联关系、生成业务主题宽表;安全专员批量完成全系统数据安全分级标注。所有治理成果实时回流知识库,在业务使用过程中持续迭代优化模型判定精度。
2.三大专属智能体,覆盖数据治理全流程核心作业
依托底层大模型与元数据分析能力,打造三类智能体,实现数据盘点、标准对标、安全分级全流程自动化作业。
数据资源盘点Agent:解决全域数据资产人工盘点效率低下的行业痛点,支持数据库、文件、多格式文档多源数据自动接入,通过语义识别自动划分系统、业务主题、资产类型,批量生成标准化数据资源目录。针对老旧系统拼音简写、特殊字符字段,依托RAG检索知识库自动补全中文名称、业务释义,大幅减少研发人员查阅代码、对接厂商调取文档的重复性工作。
智能对标Agent:创新搭建“自上而下+自下而上”双路径协同对标机制,自上而下依托业务主题分层匹配标准字典,匹配精准度更高;自下而上基于字段语义相似度完成字段映射,落地门槛更低,系统默认两套思路结合使用,保障对标效果最优。整套对标形成完整自动化闭环:源数据进入中台自动校验是否完成对标,未对标字段由大模型自动填充基础信息、推荐匹配标准字典,经模型初审、人工复核校正后,系统自动判断是否新增企业级标准,新增标准经业务专家确认后纳入全行统一数据字典,目前已辅助新增企业级数据字典3万+项。
数据安全分级分类Agent:采用“规则引擎+人工智能+血缘引擎”复合技术架构落地数据分级分类工作。规则引擎通过正则、关键词、内容识别完成基础判定;大模型依托监管分级分类经验库完成文本分类、安全标签智能推荐;血缘引擎追踪全链路数据流转,实现标签自动扩散。方案适配2026年新版数据安全分级分类指南,全面替代原有人民银行0297标准,分级分类整体判定准确率达95%,完成全行2000余套系统全覆盖标注工作。
3.四大核心技术创新点,深度挖掘元数据内在逻辑价值
方案核心突破在于将深度元数据分析与大模型深度融合,从字段特征、函数依赖、主外键关联、业务维度四大维度解析数据内在关系,弥补纯语义匹配缺乏数据逻辑支撑的短板。
元数据多维度特征分析:系统定期批量扫描全量表字段,自动提取字段全量特征指标,存储类型、字段长度、空值率、极值、是否自增、是否包含中文、重复值占比等,自动识别各类数据质量缺陷:字段定义长度远超实际业务使用长度、全空无意义字段、数据类型与业务场景不匹配等,自动生成数据质量整改清单,实现脏数据、不合理字段定义自动识别、批量预警。
函数依赖与主键智能识别:通过数学算法自动解析表内字段函数依赖关系,例如客户号唯一决定客户姓名、年龄、性别,身份证号同样具备独立业务标识能力。系统自动计算最小函数依赖集,识别业务候选键,区分业务主键与技术主键。针对行业普遍不物理创建主外键的业务系统,仅依靠原始数据样本即可梳理字段业务关联关系,为客户、机构、产品主数据中心建设提供底层逻辑支撑。
主外键挖掘与双层知识图谱构建:对比全量数据表字段数据覆盖度,若主键数据完整覆盖另一表同名字段,系统自动判定表间外键关联;基于字段函数依赖、表间主外键搭建双层知识图谱:表级图谱以数据表为节点、外键为关联,用于数据建模链路规划;字段级图谱以字段为节点,用于业务维度划分。当字段匹配率达到95%但未完全重合时,系统自动标记疑似脏数据,同时为数据开发人员提供最优表关联路径,降低多表联查建模难度。
跨系统维度自动聚合,生成统一主题宽表:基于元数据关联分析成果,自动识别多系统同源业务维度,例如ECIF、信贷、收单系统分散存储客户基础信息,系统自动聚合客户号、姓名、证件、联系方式、工作单位、学历等分散属性,一键生成客户主题统一宽表,打通跨系统数据孤岛,实现全域同一业务主体数据统一汇聚,大幅降低业务分析师取数、整合数据的工作量。
4.三层递进式数据标准体系,打通标准落地全链路
搭建分层递进的数据标准架构,实现标准统一、落地可追溯:顶层为企业级业务数据标准,定义全行统一业务术语、指标统计口径;中层为企业级数据字典,提供标准化中英文字段名、码值、业务释义,适配系统开发落地;底层为各业务系统原生元数据字典。依托大模型自动完成三层标准映射,新建系统在设计、SIT、UAT阶段自动落标,存量系统在数据湖仓标准层完成全量字段一对一转换,保障全行行长驾驶舱、监管报表、自主分析、专项集市全部使用同源统一指标,简化取数流程,释放科技人员重复报表开发生产力。
三、项目落地成效:兼顾经济、治理、合规三重核心价值
整套智能化治理体系已在新核心建设、全行数据湖仓、8家网外农商行数据汇聚三大重点项目全面落地,形成可量化、可复制的实践成果,同步达成降本增效、统一治理、合规可控三大核心目标。
1.量化落地成果,降本增效成效突出
一是标准建设成果显著,大模型辅助新增企业级数据字典3万+项,完成20余套新建系统设计、SIT、UAT全流程标准落标,新一代核心系统全阶段标准落标率超95%;二是全域资产盘点全覆盖,完成全行120套核心系统、全辖2000余套系统数据资产自动化盘点,资产盘点覆盖率提升至95%以上;三是数据安全治理标准化,数据安全分级分类判定准确率稳定维持95%,实现全行所有业务系统全覆盖标注;四是人力成本大幅缩减,对比传统纯人工治理模式,自动化能力替代60%-70%重复性工作,无需资深业技融合专家全程介入,基础治理工作AI自动判定准确率稳定90%以上。
2.经济目标:降低人力投入,缓解高端专业人才依赖
传统数据标准制定、资产盘点、字段对标工作高度稀缺业技复合型人才,人工梳理、文档核对、字段映射消耗大量工时。智能化体系落地后,大量重复、标准化工作由四大智能体自主完成,仅需业务骨干、标准专家完成最终审核确认,大幅降低人力投入成本;同时标准化AI能力下沉,基层行、普通开发人员可独立完成基础数据治理工作,打破高端专家资源不足的发展瓶颈。
3.治理目标:统一全行数据口径,消除人为治理偏差
依托沉淀统一的金融知识库、标准化规则、大模型语义匹配能力,构建具备专家级分析能力的智能治理系统,全行所有系统、跨机构数据对标、指标定义、字段释义遵循同一套底层逻辑,彻底解决多团队、多法人机构人员认知差异带来的标准不统一、口径冲突问题。全行指标数据标准统一落地后,全行各类报表、经营分析、风险监测均使用同源指标,大幅简化取数与用数流程,将科技生产力从重复报表开发工作中释放。
4.合规目标:动态适配监管更新,构建完整合规追溯证据链
大模型可自动学习解读各类监管文件,提取监管指标、数据报送规则,自动完成监管要求与行内数据资产的映射匹配;当监管政策、数据安全分级分类指南更新迭代时,系统通过增量学习快速更新治理规则,动态适配合规要求。面对监管现场检查,平台可一键生成全流程数据治理追溯报告,完整记录字段对标、数据清洗、分级分类全流程操作记录,形成透明、可审计的数据合规证据链,高效支撑监管报送与现场检查工作。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.