![]()
作者 | 谭培祥,招商银行 AI Infra 架构师
2026 年 9 月,招商银行训推一体云原生平台获得 CNCF 参考架构奖,并成为 CNCF 最终用户案例大赛获奖案例。平台将近万张异构算力卡纳入统一训推一体架构,99% 的加速算力资源实现统一管理,平均算力利用率由 35% 提升至 60% 以上;每百万输入与输出 Token 的推理成本下降 60% 以上。
近万张异构算力卡带来的资源治理挑战
招商银行的大模型应用已经进入风险控制、智能客服和研发提效等生产场景。随着负载规模增长,平台的核心问题从算力供给转向利用效率:异构设备能否在不同负载之间得到持续、有效利用。训练任务运行时间长且强调吞吐,分布式作业往往需要数十到数百张卡同时到位。在线推理对时延敏感,容量必须随业务流量快速变化。
如果为训练和推理分别按峰值建设资源池,一侧闲置时,另一侧也难以使用这部分容量。如果再按硬件厂商的软件栈拆分集群,还会带来更多资源碎片,并增加运维和适配成本。招商银行因此选择建设统一底座:训练和推理共享资源治理、调度、数据通道和监控体系,同时采用符合各自负载特征的运行策略。
招商银行 AI 基础设施架构师谭培祥在采访中强调,平台在 Kubernetes 上统一资源治理、调度、数据通道和监控,训练与推理则分别采用符合负载特征的运行方式。这也明确了后续架构选型的范围。
平台技术选型的四项原则
第一,统一资源池。Kubernetes 提供统一控制面和标准资源接口,将 NVIDIA GPU 与多种国产加速卡纳入同一治理体系。第二,底座共享、策略分化。训练使用队列、配额和整批准入,在线推理依据实时流量与排队情况弹性伸缩。第三,优先采用开放、可替换且经过生产验证的技术,降低对单一硬件和封闭软件栈的依赖。第四,自研只补充开源生态尚未覆盖的业务和算法能力,不重复建设通用基础设施。
基于上述原则,Kubernetes、KEDA、Prometheus、HAMi 和 Fluid 提供 CNCF 托管的基础能力。Kueue 作为 Kubernetes SIG Scheduling 项目负责批作业准入,Ray 提供分布式执行,RBG 负责多角色推理编排,vLLM 和 SGLang 提供推理引擎。招商银行自研训练框架 Twinkle,并发起开源项目 verl-SpeCo,分别解决训练工程化、基础模型复用和强化学习 Rollout 加速问题。各组件在统一控制面下分工,并可按需要替换。
![]()
图 1 Kubernetes 原生训推一体平台架构
训练侧算力资源批调度
训练作业首先经过 Kueue 的配额准入。Ray Head 和全部 Worker 被视为一个 Workload,只有整批 PodSet 的配额能够同时预留,作业才会进入调度;条件不足时继续排队,避免部分 Worker 已经占卡、其余 Worker 长期 Pending。ClusterQueue 和 Cohort 还允许不同队列按规则借用空闲配额,使训练与推理能够错峰复用资源。
通过准入后,Kubernetes Scheduler 与 HAMi 负责 Pod 放置、设备选择和资源分配。HAMi 将异构加速卡纳入统一资源描述,可按显存和计算比例进行细粒度分配,并结合设备模组和网络拓扑改善分布式任务的放置。其职责与 Kueue 不重叠:Kueue 判断作业何时具备完整配额,Scheduler 与 HAMi 负责配额获批后的物理放置和设备隔离。
完成设备分配后,任务还需要等待数据就绪。Fluid 通过 Dataset 与 Runtime 抽象,把数据集、模型权重和 checkpoint 交付到计算侧缓存。训练 Worker 可就近读取热数据,在线推理也能在扩容前预热模型权重。数百个实例并发启动时,分布式缓存优先承接高并发、小块读取,减轻底层对象存储的访问压力。因此,作业启动依次受配额、设备和数据就绪状态约束。
训练底座高效复用
资源交付之外,训练侧还需要复用执行流程。Ray 提供跨节点执行能力。Twinkle 在其上组织训练,将 Dataset、Template、Sampler、Reward、Loss、Kernel 等环节拆分为 25 个以上可替换的原子组件。全量训练、LoRA 微调和强化学习可以复用作业提交、资源分配、数据访问和 checkpoint 管理机制,算法团队只需替换发生变化的环节。
在 LoRA 微调中,Twinkle 让多个租户共享同一个基础模型实例,适配器、配置和训练状态则分别保存。CNCF 公布的生产结果显示,默认五个 LoRA 租户共享一个基础模型实例后,该配置下的加速卡资源使用量下降 80%,训练密度提升五倍。
一站式草稿模型训练
在强化学习训练中,Rollout 往往占据大量时间。PPO、GRPO 等算法持续更新目标模型,离线训练的静态草稿模型会逐渐偏离新的目标分布,投机解码的平均接受长度和加速收益随之下降。招商银行研发团队因此发起开源项目 verl-SpeCo,把草稿模型训练纳入强化学习闭环。vLLM 或 SGLang 在 Rollout 中采集目标模型的隐藏特征与 Top-K 概率,训练侧持续更新草稿模型,再通过热更新把新权重送回推理引擎。
verl-SpeCo 将特征采集、草稿模型训练、词表适配和权重发布与底层调度解耦,支持 EAGLE3、DFlash 等投机解码算法。公开性能预览显示,Qwen3-8B 使用 EAGLE3 和 vLLM-Ascend/NPU 运行 100 步时,Rollout 比基线快约 20%,端到端训练快约 11%,未观察到精度回退。
推理服务秒级弹性扩缩
推理弹性由业务指标驱动。Prometheus 采集等待请求数、队列深度、QPS 和时延,KEDA 根据 vLLM 或 SGLang 的实际负载计算期望副本数。扩容请求随后进入 Kubernetes 调度与 HAMi 设备分配,Fluid 提供已经缓存的模型权重。只有角色、设备和模型数据全部就绪,新实例才接入业务流量。
在 Prefill 与 Decode 分离及大规模 Expert Parallelism 场景中,扩容对象不再是等价副本,而是 Router、Prefill、Decode 等相互依赖的角色组。这一侧的架构选型参考了阿里云 ACK 参与开源的 AI Serving Stack 参考架构与生产实践。平台在扩容链中使用 RBG,以 RoleBasedGroup 对象表达角色、实例和 Pod 的关系。角色依赖决定启动顺序,ScalingAdapter 将角色状态接入外部弹性控制,CoordinatedPolicy 协调多角色扩缩容和滚动升级,避免角色比例失衡或留下不完整实例组。
在 hostNetwork 和 RDMA 环境中,RBG 还通过动态端口分配、拓扑配置注入和组件级服务发现处理端口冲突与跨角色寻址,使扩容后的角色实例具备调度、发现和流量接入条件。
生产级实践指标
统一控制面提高资源纳管覆盖,配额治理、错峰弹性和细粒度分配改善算力利用率,数据预热与按需扩缩容降低推理单位成本,Twinkle 的基础模型复用提高训练密度。每项结果都对应一组技术机制,而非某个组件的单独贡献。
![]()
CNCF 最终用户案例大赛关注云原生技术在生产环境中的实际成效,参考架构评选则强调技术决策、组件边界和方法的可复用性。两项认可分别对应这套方案的生产结果与架构方法:平台在近万张异构加速卡的规模上完成验证,相关设计也可供其他大型企业建设训推一体平台时参考。
同时运行训练和推理,并承担数据合规要求的企业,可以分阶段实施这一路径。先建立统一资源治理和训练准入,再改善设备分配与数据等待,随后建设由业务指标驱动的弹性推理;强化学习规模扩大后,再将投机解码协同训练纳入执行闭环。各组件可按实际瓶颈逐步引入,但共享底座和职责边界需要在设计初期明确。
下一阶段,招商银行将基于该参考架构持续演进,进一步提升异构算力资源的利用率和整体运行效率。围绕训练、推理及多租户混部等场景,平台将完善更加精细、灵活和智能的调度策略。通过加强算力、数据、模型与运行时之间的协同,持续提升平台对不同模型规模和业务负载的适配能力。在实践积累的基础上,进一步沉淀可复用的设计原则、组件组合和实施经验,形成具有行业通用性的训推一体架构模板。未来也将与 CNCF 社区及产业伙伴共同完善相关方案,为更多企业的大模型平台建设提供参考。
会议推荐
QCon 全球软件开发大会·2026(上海站)将于10 月 22 日—24 日举办。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。查看更多详情可扫码或联系票务经理 18514549229 进行咨询。
今日荐文
你也「在看」吗?
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.