近日,我院常姗教授课题组在纵向联邦学习领域取得重要进展。相关研究成果《Nunchaku: Promoting Vertical Federated Learning by Semi-aligned Samples》被国际期刊IEEE Transactions on Knowledge and Data Engineering(TKDE)正式接收录用。论文由团队硕士生赵皓亮与博士生牛海乾担任共同第一作者。该成果是团队在联邦学习与隐私计算方向取得的系列重要进展之一,为拓展对齐样本规模受限场景下的数据利用方式、充分挖掘多方未对齐数据的潜在价值提供了新的研究思路。
随着跨机构数据协同需求不断增长,如何在保护数据隐私的同时充分挖掘分散数据的价值,已成为联邦学习研究的重要问题。联邦学习能够使多个数据持有方在不共享原始数据的情况下协同训练模型。其中,纵向联邦学习面向“样本标识空间存在重叠、特征空间不同”的多方协作场景:各参与方先通过样本标识求交获得对齐样本,再分别提取本地特征表示,由持有标签的主动方联合各方完成模型训练。该范式可将不同来源的互补特征用于同一学习任务,但模型性能高度依赖对齐样本规模。现实中,参与方之间能够按标识完全匹配的数据通常有限,且参与方越多,可用交集往往越小,大量未对齐样本因而无法直接进入协同训练,制约了纵向联邦学习的性能潜力。

图1 典型纵向联邦学习场景
针对上述问题,课题组提出Nunchaku框架,将“半对齐样本”引入纵向联邦训练,以改善传统方法仅依赖样本交集、难以充分利用未对齐数据的不足。该框架首先利用有限的对齐样本学习任务方与辅助方特征表示之间的内在关联,并增强不同类别样本在特征空间中的可区分性;在此基础上,任务方为本地未对齐样本生成能够表征其潜在辅助特征的代理嵌入,辅助方则借助对齐样本提供的类别信息,为本地未对齐样本赋予伪标签。随后,Nunchaku在类别一致的候选样本中,根据特征表示的相似程度寻找与目标样本最为匹配的辅助样本,并通过统计筛选机制剔除可能存在语义偏差的异常配对,最终构建可靠的半对齐样本用于协同训练。通过将跨参与方的特征关联转化为有效训练信号,该框架使原本无法直接参与联合建模的未对齐数据得到利用,在不共享原始数据的前提下拓展了有效训练样本的范围,从而缓解对齐样本不足对纵向联邦学习性能的限制。

图2 Nunchaku总体流程
在实验评估方面,课题组在多个公开数据集上进行了系统评估,覆盖手写数字识别、目标识别和广告点击率预测等任务。实验同时考察了不同对齐样本规模、长尾数据分布、未对齐样本比例和多参与方场景等设置。实验结果显示,在不同对齐样本规模下,Nunchaku均取得性能提升。

图3 不同对齐样本规模下Nunchaku与基线方法的性能比较
IEEE Transactions on Knowledge and Data Engineering(TKDE)是由IEEE Computer Society出版的知识与数据工程领域顶级国际期刊,被中国计算机学会(CCF)列为"数据库/数据挖掘/内容检索"方向A类期刊,主要刊载数据管理、知识发现、数据库系统架构、相关算法及系统应用等核心与新兴方向的研究成果。