联邦学习让模型在客户端本地训练,数据不出设备。但到了语音识别这里,麻烦来了:客户端上大多是没有标注的语音,服务器手里只有一小撮带标注的种子数据。半监督联邦学习(SSFL)的做法是让一个"老师"模型给未标注数据打伪标签,再拿去训练。问题在于,语音识别的伪标签错误会沿着输出序列累积,再跨训练轮次滚雪球,最后直接发散。和全监督联邦学习之间,始终横着一道大沟。
这项研究把这道沟拆成了两个耦合的设计轴:老师和锚点。老师,指的是由哪个模型来生成伪标签;锚点,指的是服务器端在带标注数据上持续做的更新,用来稳住训练。两条轴不是各管各的,而是绑在一起起作用。
![]()
老师这条轴:在线老师能赢,但前提是先稳住
先看老师。一种选择是"广播式全局老师"——服务器出一个模型,在一轮之内固定不变,发给所有客户端用。另一种是"每客户端在线老师"——每个客户端用自己正在演化的模型给自己打标签。
直觉上,在线老师更贴合本地数据,应该更强。但研究显示,它单独跑会发散。一旦被稳住,它的表现就能追平甚至超过广播式全局老师:在同域场景下优势明确,在域偏移场景下也有竞争力。
种子数据变强之后,在线老师的优势会收窄。这时候第三种方案登场——"过渡式老师",在第 r 轮从全局老师切换到在线老师,结果能追平或超过前两者。
换句话说,老师不是越激进越好,而是要和训练稳定性匹配。研究给出的判断很直接:激进的老師选择,只有在锚点把训练稳住之后才会兑现收益。
锚点这条轴:服务器不能停,停了在线老师就漂
锚点的要求只有一条,但很硬:服务器必须在轮次之间继续在带标注数据上训练。否则在线老师会漂移。
研究里一个反直觉的结论是:这种交替训练的安排,比种子模型本身更能决定收敛。也就是说,大家习惯性盯着"种子数据够不够好",但真正管住收敛的是服务器有没有持续锚定。
锚点对什么最敏感?数据增强和批大小。这两个设置决定了服务器往训练里注入多少输入噪声和梯度噪声。噪声注入多少,直接决定需要多强的稳定化。
而"需要多少稳定化"并不是一个固定值,它取决于域:种子数据的离散程度,以及它和客户端数据的重叠程度,共同决定了这个量。
两条轴拆不开,这才是关键
把老师和锚点分开看,容易得出"选个更强的老师就行"的结论。但研究强调的是两者不可分割:激进老师带来的收益,只有在锚点稳住训练之后才会出现。
这也解释了为什么单纯调老师这一端很难奏效——锚点没跟上,在线老师自己就先发散了。
从结果看,这套配方在 11 组配对中的 9 组上超过了此前最强的方法,同域平均提升 20.8%,跨域平均提升 10.0%,把和全监督联邦学习之间的差距进一步收窄。
对做端侧语音的人来说,这项工作的价值不在于某个单点技巧,而在于把"老师怎么选"和"服务器怎么锚"这两件事绑成一个整体来调。种子数据、数据增强、批大小、域重叠度,这些原本分散的参数,被放进了同一张决策图里。
至于具体怎么落地,研究给出的是一组指导原则,而不是一套万能参数——因为需要多少稳定化,本来就取决于你的数据在哪个域。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.