摘要:联邦学习是目前安全多方机器学习领域最为先进的技术, 其因为解决了数据不离开本地的多节点联合模型训练问题而得到了广泛的关注. 然而, 现实中客户端数据的非独立同分布(Non-IID)会显著降低全局模型的性能. 现有的主流方法一类聚焦于在训练时校正模型的参数偏差, 但其在数据分布越极端的情况下效果越差. 另一类方法旨在本地训练前校正数据分布的偏差, 但其会有隐私泄露的风险. 提出一种框架, 遵循严格的联邦学习隐私保护要求, 利用差分隐私、安全多方计算等技术, 在客户端数据分布保持黑盒的前提下, 选择出对全局模型性能提升最有益的若干标签, 针对这些标签生成高质量合成数据并分发, 使补齐这些数据后的客户端本地数据分布趋向于IID, 从而大大提高全局模型的表现. 具体来说, 首先设计一个隐私安全的算法, 对标签在客户端上的分布进行捕获, 并依据该标签分布特征对所有客户端进行组别的划分. 随后挑选出最值得生成的标签, 在标签对应的组内协调客户端合作训练高质量全局生成模型存放于服务器. 最后在任务模型的训练阶段, 基于标签分布特征利用这些生成模型有选择地合成样本并分发, 来使本地数据分布更加均匀, 进而缩小本地模型差距, 在聚合后得到高质量的全局模型. 实验表明, 所提方法能够有效提高全局模型在测试集上的准确率, 且能减少全局模型收敛前所需要的联邦学习通信轮次, 其有效性超越了各基线方法, 在不同的数据集上得到了验证.