联邦学习

  • 显示方式:
  • 简洁模式
  • 摘要模式
  • 1  基于安全多方计算的隐私保护异构联邦学习参与方选择
    刘腾飞,杨安家,翁健,陈泯融,刘逸,曾璜
    :1-18. DOI: 10.13328/j.cnki.jos.007622
    [摘要](439) [HTML](0) [PDF 1.82 M](179)
    摘要:
    联邦学习允许众多客户端利用其本地数据联合训练模型而不暴露各方的真实数据, 与传统机器学习方法相比, 避免了数据迁移导致的数据泄露和滥用问题. 然而, 在实际应用中, 客户端可能具有异构的数据分布和系统功能, 这会导致模型性能和训练效率下降. 通过选择一个“良好的”客户端子集作为联邦学习参与方可以有效提高全局模型的性能和收敛速度. 而一些研究者发现, 恶意敌手可以利用客户端的本地训练损失或梯度等一些相关信息来推断其隐私数据, 目前的异构联邦学习参与方选择方案并没有应对这种隐私泄露风险的解决方法. 为此, 设计了一种基于安全多方计算的隐私保护异构联邦学习参与方选择协议, 利用3PC秘密共享技术来保证训练过程的数据隐私以及联合模型的准确度, 同时还提出了一个安全top-k搜索协议来避免参与方选择过程中泄露任何隐私信息. 对协议的安全性进行分析, 证明了该协议可以满足安全需求, 并且开展相关实验, 实验结果表明相比于未使用隐私保护的异构联邦学习方案, 所提出方案的各方的平均计算与通信时间开销仅增加了2.09%.
    2  基于块级多输出和知识自蒸馏的高效联邦学习框架
    刘建春,梁文艺,徐宏力,马千飘,黄刘生
    2026, 37(3):1357-1373. DOI: 10.13328/j.cnki.jos.007466
    [摘要](767) [HTML](581) [PDF 2.96 M](2046)
    摘要:
    联邦学习 (federated learning, FL)是一种分布式模型训练框架, 允许多个客户端在边缘计算(edge computing, EC)环境中协同训练全局模型, 同时保护客户端的本地数据隐私. 然而, 在边缘网络中进行联邦学习训练时, 常常面临资源受限和数据异构(或称非独立同分布数据)的问题, 这会导致模型训练性能显著下降. 为了应对这些挑战, 提出了一种高效的联邦学习框架——FedAlt, 以提升边缘网络中模型训练的性能 (如测试精度)和减少资源开销. FedAlt 在经典联邦学习算法FedAvg 的基础上引入了块级多输出和知识自蒸馏技术, 使客户端在本地训练时能够更有效地吸收模型表征层信息, 从而缓解非独立同分布数据对模型训练的负面影响. 具体而言, 将模型划分为多个连续的模型块, 服务器在每个全局训练轮次开始时仅向客户端发送前部分的全局模型块, 从而减少通信开销. 然后, 客户端将全局模型和本地模型进行组合, 并利用知识自蒸馏技术吸收模型表征层的信息, 以应对数据异构带来的挑战. 此外, 考虑到通信开销随传输的模型块数量增加而增加, 分别在服务器和客户端设计了自适应算法, 即服务器分发模型块算法和客户端块级多输出正则化算法, 根据客户端的数据分布、计算能力和通信能力来动态地调整服务器分发的模型块数量. 大量实验结果表明, 与现有方法相比, FedAlt 在有限的通信带宽条件下, 可以提升约 2.64%的平均测试精度.
    3  基于个性化联邦学习的跨项目软件缺陷预测方法
    刘子扬,祝义,周湘,李建豪,袁春鸿,郝国生
    2026, 37(7):2911-2935. DOI: 10.13328/j.cnki.jos.007582
    [摘要](1237) [HTML](154) [PDF 4.20 M](866)
    摘要:
    针对跨项目软件缺陷预测中数据隐私与项目异构性的双重挑战, 提出一个名为PRIDE-SDP的框架. 该框架的核心贡献在于深度融合了3种关键技术: 采用个性化联邦学习范式为每个异构项目定制专属预测模型, 集成提供严格数学保障的 (ε, δ)-差分隐私机制保护数据不出本地, 并设计了一个专用的时间-上下文融合网络 (temporal-contextual fusion network, TCFN)以高效地捕捉软件度量特征. 在覆盖27个开源项目和3个企业项目的6个数据集组上的实验结果验证了该框架的有效性: 与先进的跨项目缺陷预测基线相比, PRIDE-SDP平均AUC提升10.7%, F1-score提升7.3%; 在企业数据集上表现更加突出, 相较于所有先进的基线方法, MCC平均提升45.2%, Effort@20%平均提升29.5%, F1-score平均提升35.4%. 同时, 框架在提供较强隐私保障时, 其平均性能保持率仍能达到最佳性能的98%以上, 并且在成员推理攻击实验中能将攻击者的攻击准确率平均降低超过36%. 实验结果表明, PRIDE-SDP在保持高性能的同时, 有效兼顾了隐私保护与个性化适应能力.
    4  面向欺诈检测的风险感知动态聚合图联邦学习
    杨家震,邱天,陈可嘉,段明江,蒋健,胡泽远,宋明黎,冯尊磊
    2026, 37(4):1511-1530. DOI: 10.13328/j.cnki.jos.007524
    [摘要](2151) [HTML](1416) [PDF 3.40 M](1466)
    摘要:
    随着信息技术的迅猛发展, 欺诈行为在金融交易、社交网络与评论系统等多个领域呈现出日益复杂化和多样化的趋势, 给传统欺诈检测技术带来了严峻挑战. 当前主流的基于图神经网络的方法虽然在单机构数据环境中表现出色, 但由于涉及用户敏感信息, 难以实现跨机构间的数据共享与协作, 进而限制了模型的训练效果与泛化性能. 联邦学习作为一种新兴的隐私保护分布式学习范式, 为跨机构协作训练提供了可行途径, 但现有图联邦学习方法多针对通用图任务设计, 难以适应欺诈检测中普遍存在的类别分布不平衡和数据异构性问题, 导致在欺诈样本识别方面表现不佳. 为应对上述挑战, 提出一种面向欺诈检测的风险感知动态聚合图联邦学习方法(FedRPDA), 旨在有效应对跨机构的复杂欺诈风险事件识别. FedRPDA包括两项关键策略: 典型风险动态聚合策略通过衡量客户端图中欺诈节点的结构性风险强度, 并结合具有时间衰减特性的动态权重映射机制来自适应地调整客户端的聚合权重, 从而在数据异构条件下增强全局模型对正常样本与典型欺诈样本的判别能力; 多样化风险平均聚合策略结合基于变分扰动的欺诈样本特征增强机制与全局原型引导的对比学习机制, 有效提升模型对结构多样、数量稀少的非典型欺诈样本的表征能力, 促进其在特征空间中向共性异常靠拢, 进一步提升模型在复杂欺诈风险场景下的识别鲁棒性. 在多个真实欺诈检测数据集上的实验结果表明, FedRPDA 在检测性能与训练收敛效率方面显著优于现有图联邦学习基线方法, 展现出良好的泛化能力与实际应用潜力.
    5  数据要素流通全流程隐私关键技术: 现状、挑战与展望
    刘立伟,傅超豪,孙泽堃,周耘,阮娜,蒋昌俊
    2026, 37(1):301-325. DOI: 10.13328/j.cnki.jos.007478
    [摘要](1485) [HTML](2659) [PDF 5.14 M](1682)
    摘要:
    近年来以大语言模型为代表的一系列数据驱动型 AIGC 应用深刻地改变了人们的生活范式, 引起国家对数据流通、数据隐私等问题的高度重视. 健全数据市场规范, 完善数据要素流通机制成为数字经济时代下又一重大研究课题. 但是现有数据隐私研究普遍聚焦于数据流通中的单一环节, 并未展现数据流通的全貌, 技术研究相对孤立, 存在不兼容性等问题. 因此数据服务提供商在实际生产活动中往往需要投入额外人力成本以进行全方位的数据隐私保护. 聚焦数据流通问题, 依据数据生命周期将流通全过程划分为3个阶段, 对各阶段的隐私关键技术建立系统的分类体系, 并对各领域的最新进展、未来挑战等问题进行深入剖析. 以数据流通为载体, 隐私技术为目标, 涵盖数据流通全过程, 有助于研究者快速建立对数据流通全流程隐私技术的系统认识, 为后续研究建立完备的全流程数据流通隐私保护范式奠定基础.
    6  联邦原型学习的特征图中毒攻击和双重防御机制
    王瑞锦,王金波,张凤荔,李经纬,李增鹏,陈厅
    2025, 36(3):1355-1374. DOI: 10.13328/j.cnki.jos.007183
    [摘要](1723) [HTML](1323) [PDF 8.77 M](2706)
    摘要:
    联邦学习是一种无需用户共享私有数据、以分布式迭代协作训练全局机器学习模型的框架. 目前流行的联邦学习方法FedProto采用抽象类原型(称为特征图)聚合, 优化模型收敛速度和泛化能力. 然而, 该方法未考虑所聚合的特征图的正确性, 而错误的特征图可能导致模型训练失效. 为此, 首先探索针对FedProto的特征图中毒攻击, 论证攻击者只需通过置乱训练数据的标签, 便可将模型的推测准确率至多降低81.72%. 为了抵御上述攻击, 进一步提出双重防御机制, 分别通过全知识蒸馏和特征图甄别排除错误的特征图. 基于真实数据集的实验表明, 防御机制可将受攻击模型的推测准确率提升1–5倍, 且仅增加2%系统运行时间.
    7  基于注意力机制的联邦无线流量预测模型
    柴宝宝,董安明,王桂娟,韩玉冰,李浩,禹继国
    2025, 36(2):715-731. DOI: 10.13328/j.cnki.jos.007153
    [摘要](1347) [HTML](1743) [PDF 10.19 M](3077)
    摘要:
    移动数据每天都在不断增长, 如何精准预测无线流量对高效、合理的配置通信和网络资源至关重要. 现有的流量预测方法多采用集中式训练架构, 涉及大规模的流量数据传输, 会导致用户隐私泄露等安全问题. 联邦学习可以在数据本地存储的前提下训练一个全局模型, 保护用户隐私, 有效减轻数据频繁传输负担. 但是在无线流量预测中, 单个基站数据量有限, 且不同基站流量数据模式异构, 流量模式难以捕捉, 导致训练得到的全局模型泛化能力较差. 此外, 传统联邦学习方法在进行模型聚合时采用简单平均, 忽略了客体贡献差异, 进一步导致全局模型性能下降. 针对上述问题, 提出一种基于注意力的“类内平均, 类间注意力”联邦无线流量预测模型, 该模型根据基站的流量数据进行聚类, 更好地捕捉具有相似流量模式基站的流量变化特性; 同时, 设计一个预热模型, 利用少量基站数据缓解数据异构, 提高全局模型的泛化能力; 在模型聚合阶段引入注意力机制, 量化不同客体对全局模型的贡献, 并在模型迭代过程中融入预热模型, 大幅提升模型的预测精度. 在两个真实数据集(Milano和Trento)上进行大量实验, 结果表明该方法优于所有基线方法. 并且与目前最先进的方法相比, 在两个数据集上的平均绝对误差性能增益最高分别达到10.1%和9.6%.
    8  基于联邦学习的BERT模型高效训练框架
    王鑫澳,陈珂,寿黎但,骆歆远,陈刚
    2025, 36(9):4110-4133. DOI: 10.13328/j.cnki.jos.007259
    [摘要](1486) [HTML](1520) [PDF 6.74 K](1763)
    摘要:
    高质量的训练数据对于预训练语言模型(PLM)至关重要, 但许多专业领域的数据因隐私问题而无法集中收集用于模型训练. 借助联邦学习, 可以在保护数据隐私的前提下完成模型训练. 然而, 联邦学习的客户端通常资源有限, 无法完成预训练语言模型的训练. 针对这一问题进行深入研究. 首先, 明确定义在资源有限前提下完成模型训练的问题, 通过调整计算开销与通信开销来优化模型的训练效果. 其次, 介绍一种适用于联邦学习环境下的BERT模型高效训练框架——FedBT. 该框架旨在实现BERT模型在联邦学习客户端上的训练, 涵盖进一步预训练和下游任务微调两种场景. FedBT适应不同的应用场景, 在客户端针对BERT模型的关键参数进行训练, 并仅将更新的参数上传至服务器进行聚合. 这种方法显著减少模型训练过程中的计算和通信成本. 最后, 在多个专业领域的数据集上进行充分的实验对比, 进一步预训练场景下, FedBT框架可以降低客户端的训练开销与通信开销至原来的34.31%和7.04%, 下游任务微调场景下, FedBT框架可以降低客户端的训练开销与通信开销至原来的48.26%和20.19%, 并且均实现同传统联邦学习训练完整模型接近的精确度.
    9  云边联邦学习系统下抗投毒攻击的防御方法
    赵亚茹,张建标,曹益皓,黄浩翔
    2025, 36(9):4250-4270. DOI: 10.13328/j.cnki.jos.007266
    [摘要](1677) [HTML](1815) [PDF 6.70 K](2153)
    摘要:
    随着海量数据的涌现和智能应用需求的日益增长, 保障数据安全成为提高数据质量、实现数据价值的重要举措. 其中, 云边端架构是高效处理和优化数据的新兴技术, 联邦学习(federated learning, FL)作为一个高效的去中心化的机器学习范式, 能够为数据提供隐私保护, 近年来引起了学术界及工业界的广泛关注. 然而, 联邦学习展示出了固有的脆弱性使其易于遭受投毒攻击. 现有绝大多数抵抗投毒攻击的防御方法依赖于连续更新空间, 但在实际场景中面向灵活的攻击方式和攻击场景可能是欠鲁棒的. 鉴于此, 提出一种面向云边联邦学习系统(cloud-edge FL, CEFL)抵抗投毒攻击的防御方法FedDiscrete. 其关键思想是在客户端利用网络模型边的分数计算本地排名, 实现离散更新空间的创建. 进一步地, 为了兼顾参与FL任务的客户端之间的公平性, 引入贡献度指标, 这样, FedDiscrete能够通过分配更新后的全局排名对可能的攻击者实施惩罚. 广泛的实验结果表明所提方法在抵抗投毒攻击方面表现出显著的优势和鲁棒性, 且适用于独立同分布(IID)和非独立同分布(non-IID)场景, 能够为CEFL系统提供保护.
    10  FBO: 基于联邦学习的云数据库旋钮调优技术
    燕钰,戴志宇,吕泽楷,王宏志
    2025, 36(3):962-980. DOI: 10.13328/j.cnki.jos.007278
    [摘要](2636) [HTML](2026) [PDF 4.33 M](3458)
    摘要:
    近年来, 随着软硬件的发展, 数据库上云已经成为了新兴发展趋势, 能够降低中小型企业和个人用户的数据库运维成本. 进一步地, 云数据库的发展带来了庞大的运维市场需求, 研究者们提出了诸多数据库自调优技术来支持数据库旋钮自动优化. 为了提高调优效率, 现有技术从仅关注调优问题本身, 到开始关注如何复用历史经验来为当前数据库实例找到最佳参数配置. 然而, 随着云数据库的发展, 用户逐渐提高了对隐私保护的要求, 期望在拥有高效数据存取效率的同时避免隐私泄露. 现有方法并未考虑到保护用户的历史调优经验隐私, 可能会使得用户负载特征被感知, 带来经济损失. 详细分析了云数据库调优任务的特点, 有机结合服务端和用户端, 提出了一种基于联邦学习的云数据库旋钮调优技术. 首先, 为了解决联邦学习中数据异构的问题, 提出了基于元特征匹配的经验筛选方法提前将数据分布差异较大的历史经验剔除, 以提高联邦学习的效率. 为了实现保护用户隐私, 结合云数据库服务特性, 提出了以节点端为训练中心的联邦贝叶斯调优算法, 通过随机傅里叶特征来完成保证调优经验不失真的前提下保护用户隐私. 在多个公开 benchmark 上的结果表明, 方法可以达到与现有调优方法相当的调优结果, 并且由于复用了历史经验, 可以大大提高调优效率.
    11  基于梯度放大的联邦学习激励欺诈攻击与防御
    乐紫莹,陈珂,寿黎但,骆歆远,陈刚
    2025, 36(5):2254-2269. DOI: 10.13328/j.cnki.jos.007186
    [摘要](1513) [HTML](1312) [PDF 6.73 K](2769)
    摘要:
    在联邦学习领域, 激励机制是吸引高质量数据持有者参与联邦学习并获得更优模型的重要工具. 然而, 现有的联邦学习研究鲜有考虑到参与者可能滥用激励机制的情况, 也就是他们可能会通过操纵上传的本地模型信息来获取更多的奖励. 针对这一问题进行了深入研究. 首先, 明确定义联邦学习中的参与者激励欺诈攻击问题, 并引入激励成本比来评估不同激励欺诈攻击方法的效果以及防御方法的有效性. 其次, 提出一种名为“梯度放大攻击(gradient scale-up attack)”的攻击方法, 专注于对模型梯度进行激励欺诈. 这种攻击方法计算出相应的放大因子, 并利用这些因子来提高本地模型梯度的贡献, 以获取更多奖励. 最后, 提出一种高效的防御方法, 通过检验模型梯度的二范数值来识别欺诈者, 从而有效地防止梯度放大攻击. 通过对MNIST等数据集进行详尽地分析和实验验证, 研究结果表明, 所提出的攻击方法能够显著提高奖励, 而相应的防御方法能够有效地抵制欺诈参与者的攻击行为.
    12  跨设备联邦学习中的客户端选择算法
    张瑞麟,杜晋华,尹浩
    2024, 35(12):5725-5740. DOI: 10.13328/j.cnki.jos.007085
    [摘要](2439) [HTML](1847) [PDF 1.65 K](4212)
    摘要:
    联邦学习是一种新型的分布式机器学习范式, 它在满足用户隐私和数据保密性要求的前提下, 充分利用众多分散客户端的计算能力及其本地数据联合训练机器学习模型. 在跨设备联邦学习场景下, 客户端通常由数千甚至万级别的移动设备或端侧设备组成, 由于通信和计算成本的限制, 聚合服务器在每个训练轮次中仅选择少量客户端加入训练. 几种被广泛应用的联邦优化算法均采用完全随机的客户端选择算法, 但这被证明有着很大的优化空间. 近年来, 如何高效可靠地从海量异构客户端中选择合适的集合参与训练, 以优化联邦学习协议的资源消耗和模型性能被广泛研究, 但仍没有文献对这一关键问题进行综合调研. 需要对跨设备联邦学习的客户端选择算法研究进行全面调研. 具体地, 形式化描述客户端选择问题, 然后给出对选择算法的分类并逐一深入讨论分析. 最后, 讨论客户端选择算法的一些未来研究方向.
    13  基于Bregman散度和差分隐私的个性化联邦学习方法
    张少波,张激勇,朱更明,龙赛琴,李哲涛
    2024, 35(11):5249-5262. DOI: 10.13328/j.cnki.jos.007032
    [摘要](2489) [HTML](2494) [PDF 7.10 M](5546)
    摘要:
    联邦学习因能解决数据孤岛问题而被广泛关注, 但也存在用户隐私泄露风险和非独立同分布数据下模型异构导致性能下降的问题. 针对该问题, 提出基于Bregman散度和差分隐私的个性化联邦学习方法(FedBDP). 所提方法采用Bregman散度衡量本地参数与全局参数的差异, 并将其作为正则化项更新损失函数, 以减小模型差异来提升模型准确率. 同时, 采用自适应差分隐私技术对本地模型参数进行扰动, 通过定义衰减系数动态调整每轮差分隐私噪声的大小, 以合理分配隐私噪声大小并提升模型可用性. 理论分析表明FedBDP在强凸和非凸光滑函数下满足收敛条件. 实验结果验证该方法在满足差分隐私的前提下, FedBDP模型在MNIST和CIFAR10数据集下能够保证模型准确率.
    14  基于强化联邦GNN的个性化公共安全突发事件检测
    管泽礼,杜军平,薛哲,王沛文,潘圳辉,王晓阳
    2024, 35(4):1774-1789. DOI: 10.13328/j.cnki.jos.007019
    [摘要](2307) [HTML](3484) [PDF 2.35 M](5268)
    摘要:
    近年来, 将公共安全数据转换为图的形式, 通过图神经网络(GNN)构造节点表示应用于下游任务的方法, 充分利用了公共安全数据的实体与关联信息, 取得了较好的效果. 为了提高模型的有效性, 需要大量的高质量数据, 但是高质量的数据通常归属于政府、公司和组织, 很难通过数据集中的方式使模型学习到有效的事件检测模型.由于各数据拥有方的关注主题与收集时间不同, 数据之间存在Non-IID的问题. 传统的假设一个全局模型可以适合所有客户端的方法难以解决此类问题. 提出了基于强化联邦图神经网络的个性化公共安全突发事件检测方法PPSED, 各客户端采用多方协作的方式训练个性化的模型来解决本地的突发事件检测任务. 设计了联邦公共安全突发事件检测模型的本地训练与梯度量化模块,采用基于图采样的minibatch机制的GraphSage构造公共安全突发事件检测本地模型, 以减小数据Non-IID的影响, 采用梯度量化方法减小梯度通信的消耗. 设计了基于随机图嵌入的客户端状态感知模块, 在保护隐私的同时, 更好地保留客户端模型有价值的梯度信息. 设计了强化联邦图神经网络的个性化梯度聚合与量化策略, 采用DDPG拟合个性化联邦学习梯度聚合加权策略, 并根据权重决定是否对梯度进行量化, 对模型的性能与通信压力进行平衡. 通过在微博平台收集的公共安全数据集和3个公开的图数据集进行了大量的实验, 实验结果表明了所提方法的有效性.
    15  基于模型后门的联邦学习水印
    李璇,邓天鹏,熊金波,金彪,林劼
    2024, 35(7):3454-3468. DOI: 10.13328/j.cnki.jos.006914
    [摘要](2261) [HTML](1851) [PDF 7.70 M](4190)
    摘要:
    高精度联邦学习模型的训练需要消耗大量的用户本地资源, 参与训练的用户能够通过私自出售联合训练的模型获得非法收益. 为实现联邦学习模型的产权保护, 利用深度学习后门技术不影响主任务精度而仅对少量触发集样本造成误分类的特征, 构建一种基于模型后门的联邦学习水印(federated learning watermark based on backdoor, FLWB)方案, 能够允许各参与训练的用户在其本地模型中分别嵌入私有水印, 再通过云端的模型聚合操作将私有后门水印映射到全局模型作为联邦学习的全局水印. 之后提出分步训练方法增强各私有后门水印在全局模型的表达效果, 使得FLWB方案能够在不影响全局模型精度的前提下容纳各参与用户的私有水印. 理论分析证明了FLWB方案的安全性, 实验验证分步训练方法能够让全局模型在仅造成1%主任务精度损失的情况下有效容纳参与训练用户的私有水印. 最后, 采用模型压缩攻击和模型微调攻击对FLWB方案进行攻击测试, 其结果表明FLWB方案在模型压缩到30%时仍能保留80%以上的水印, 在4种不同的微调攻击下能保留90%以上的水印, 具有很好的鲁棒性.
    16  理性与可验证的联邦学习框架
    吴柿红,田有亮
    2024, 35(3):1418-1439. DOI: 10.13328/j.cnki.jos.006819
    [摘要](2119) [HTML](2350) [PDF 5.51 M](3535)
    摘要:
    联邦学习作为解决数据孤岛问题的有效方法,在服务器计算全部梯度的过程中,由于服务器的惰性和自利性会存在全局梯度不正确计算问题,因此需要验证全局梯度的完整性.现有的基于密码算法的方案验证开销过大.针对这些问题,提出一种理性与可验证的联邦学习框架.首先,结合博弈论,设计囚徒合约与背叛合约迫使服务器诚实.其次,所提方案使用基于复制的验证方案实现全局梯度的完整性验证,且支持客户端离线.最后,经分析证明所提方案的正确性,并经实验表明,该方案与已有的验证算法相比,客户端的计算开销降为0,一次迭代的通信轮数由原来的3轮优化到2轮,且训练开销与客户端的离线率成反比.
    17  面向异质性医学图像处理的深度学习算法综述
    马梓博,米悦,张波,张征,吴静云,黄海文,王文东
    2023, 34(10):4870-4915. DOI: 10.13328/j.cnki.jos.006680
    [摘要](4064) [HTML](5743) [PDF 20.57 M](8928)
    摘要:
    近年来深度学习技术在诸多计算机视觉任务上取得了令人瞩目的进步, 也让越来越多的研究者尝试将其应用于医学图像处理领域, 如面向高通量医学图像(CT、MRI)的解剖结构分割等, 旨在为医生提供诊断辅助, 提高其阅片效率. 由于训练医学图像处理的深度学习模型同样需要大量的标注数据, 同一医疗机构的数据往往不能满足需求, 而受设备和采集协议的差异的影响, 不同医疗机构的数据具有很大的异质性, 这导致通过某些医疗机构的数据训练得到模型很难在其他医疗机构的数据上取得可靠的结果. 此外, 不同的医疗数据在患者个体病情阶段的分布上也往往是十分不均匀的, 这同样会降低模型的可靠性. 为了减少数据异质性的影响, 提高模型的泛化能力, 域适应、多站点学习等技术应运而生. 其中域适应技术作为迁移学习中的研究热点, 旨在将源域上学习的知识迁移到未标记的目标域数据上; 多站点学习和数据非独立同分布的联邦学习技术则旨在在多个数据集上学习一个共同的表示, 以提高模型的鲁棒性. 从域适应、多站点学习和数据非独立同分布的联邦学习技术入手, 对近年来的相关方法和相关数据集进行了综述、分类和总结, 为相关研究提供参考.
    18  联邦学习贡献评估综述
    王勇,李国良,李开宇
    2023, 34(3):1168-1192. DOI: 10.13328/j.cnki.jos.006786
    [摘要](5626) [HTML](8935) [PDF 2.68 M](9820)
    摘要:
    数据不动的联邦学习框架是多个数据持有方合作训练机器学习模型的新范式.多个数据持有方参与联邦学习时的贡献评估是联邦学习的核心问题之一.参与方贡献评估需要兼顾有效性、公平性和合理性等要素,在理论方法与实际应用中均面临多项挑战.贡献评估首先需要明确如何度量数据价值,然而数据估值存在主观性与依赖于实际任务场景的特点,如何设计有效、可靠并对恶意数据鲁棒的数据估值指标是第一大挑战.其次,联邦学习合作中的参与方贡献评估是经典的合作博弈问题,如何制定公平合理的参与方贡献评估方案,实现参与方一致认可的博弈平衡是第二大挑战.最后,参与方贡献评估往往计算复杂度高,同时,联邦学习中围绕模型的数据估值时间开销大,因此,在实践中如何设计高效且准确的近似算法是第三大挑战.近年来,为了有效地解决上述挑战,学术界对联邦学习中的贡献评估问题展开了广泛的研究.首先,简要介绍联邦学习与参与方贡献评估的背景知识;然后,综述数据估值指标、参与方贡献评估方案和相关优化技术;最后,讨论了联邦学习贡献评估仍面临的挑战并展望未来研究的发展方向.
    19  基于贡献度证明共识机制的去中心化联邦学习框架
    乔少杰,林羽丰,韩楠,杨国平,李贺,袁冠,毛睿,元昌安,Louis Alberto GUTIERREZ
    2023, 34(3):1148-1167. DOI: 10.13328/j.cnki.jos.006784
    [摘要](3235) [HTML](4871) [PDF 2.77 M](6176)
    摘要:
    在大数据背景下,保证数据可信共享是数据联邦的基本要求.区块链技术代替传统的主从架构,可以提高联邦学习(federated learning,FL)的安全性.然而,现有工作中,模型参数验证与数据持久化所产生的巨大通信成本和存储消耗,已经成为数据联邦中亟待解决的问题.针对上述问题,设计了一种高效的去中心化联邦学习框架(efficient decentralized federated learning framework,EDFL),能够降低存储开销,并显著提升FL的学习效率.首先,提出了一种基于贡献度证明(proof-of-contribution)的共识机制,使得区块生成者的选举基于历史贡献度而不采用竞争机制,从而有效发避免了挖矿过程产生的区块生成延迟,并以异步方式缓解模型参数验证中的阻塞问题;其次,提出了一种角色自适应激励算法,因为该算法基于节点的工作强度和EDFL所分配的角色,所以能够激励合法节点更积极地进行模型训练,并有效地识别出恶意节点;再者,提出一种区块链分区存储策略,使得多重局部修复编码块(local reconstruction code)可被均匀地分布到网络的各个节点上,进而降低节点的本地存储代价,并实现了较高的数据恢复效率;最后,在真实的FEMNIST数据集上,对EDFL的学习效率、存储可扩展性和安全性进行了评估.实验结果表明,EDFL在以上3个方面均优于主流的基于区块链的FL框架.
    20  基于联邦学习的跨源数据错误检测方法
    陈璐,郭宇翔,葛丛丛,郑白桦,高云君
    2023, 34(3):1126-1147. DOI: 10.13328/j.cnki.jos.006781
    [摘要](2971) [HTML](5217) [PDF 2.58 M](5918)
    摘要:
    随着海量数据的涌现和不断积累,数据治理成为提高数据质量、最大化数据价值的重要手段.其中,数据错误检测是提高数据质量的关键步骤,近年来引起了学术界及工业界的广泛关注.目前,绝大多数错误检测方法只适用于单数据源场景.然而在现实场景中,数据往往不集中存储与管理.不同来源且高度相关的数据能够提升错误检测的精度.但由于数据隐私安全问题,跨源数据往往不允许集中共享.鉴于此,提出了一种基于联邦学习的跨源数据错误检测方法FeLeDetect,以在数据隐私保证的前提下,利用跨源数据信息提高错误检测精度.为了充分捕获每一个数据源的数据特征,首先提出一种基于图的错误检测模型GEDM,并在此基础上设计了一种联邦协同训练算法FCTA,以支持在各方数据不出本地的前提下,利用跨源数据协同训练GEDM.此外,为了降低联邦训练的通信开销和人工标注成本,还提出了一系列优化方法.最后,在3个真实数据集上进行了大量的实验.实验结果表明:(1)相较于5种现有最先进的错误检测方法,GEDM在本地场景和集中场景下,错误检测结果的F1分数平均提高了10.3%和25.2%;(2) FeLeDetect错误检测结果的F1分数较本地场景下GEDM的结果平均提升了23.2%.
    21  联邦学习模型安全与隐私研究进展
    顾育豪,白跃彬
    2023, 34(6):2833-2864. DOI: 10.13328/j.cnki.jos.006658
    [摘要](5018) [HTML](10032) [PDF 5.60 M](12819)
    摘要:
    随着数据孤岛现象的出现和个人隐私保护的重视,集中学习的应用模式受到制约,而联邦学习作为一个分布式机器学习框架,可以在不泄露用户数据的前提下完成模型训练,从诞生之初就备受关注.伴随着联邦学习应用的推广,其安全性和隐私保护能力也开始受到质疑.对近年来国内外学者在联邦学习模型安全与隐私的研究成果进行了系统总结与分析.首先,介绍联邦学习的背景知识,明确其定义和工作流程,并分析存在的脆弱点.其次,分别对联邦学习存在的安全威胁和隐私风险进行系统分析和对比,并归纳总结现有的防护手段.最后,展望未来的研究挑战和方向.
    22  联邦学习中的隐私问题研究进展
    汤凌韬,陈左宁,张鲁飞,吴东
    2023, 34(1):197-229. DOI: 10.13328/j.cnki.jos.006411
    [摘要](6104) [HTML](9377) [PDF 7.89 M](12806)
    摘要:
    随着大数据、云计算等领域的蓬勃发展, 重视数据安全与隐私已经成为世界性的趋势, 不同团体为保护自身利益和隐私不愿贡献数据, 形成了数据孤岛. 联邦学习使数据不出本地就可被多方利用, 为解决数据碎片化和数据隔离等问题提供了解决思路. 然而越来越多研究表明, 由谷歌首先提出的联邦学习算法不足以抵抗精心设计的隐私攻击, 因此如何进一步加强隐私防护, 保护联邦学习场景下的用户数据隐私成为一个重要问题. 对近些年来联邦学习隐私攻击与防护领域取得的成果进行了系统总结. 首先介绍了联邦学习的定义、特点和分类; 然后分析了联邦学习场景下隐私威胁的敌手模型, 并根据敌手攻击目标对隐私攻击方法进行了分类和梳理; 介绍了联邦学习中的主流隐私防护技术, 并比较了各技术在实际应用中的优缺点; 分析并总结了6类目前联邦学习的隐私保护方案; 最后指出目前联邦学习隐私保护面临的挑战, 展望了未来可能的研究方向.
    23  联邦学习中的隐私保护技术
    刘艺璇,陈红,刘宇涵,李翠平
    2022, 33(3):1057-1092. DOI: 10.13328/j.cnki.jos.006446
    [摘要](7607) [HTML](9881) [PDF 3.36 M](17893)
    摘要:
    联邦学习是顺应大数据时代和人工智能技术发展而兴起的一种协调多个参与方共同训练模型的机制.它允许各个参与方将数据保留在本地,在打破数据孤岛的同时保证参与方对数据的控制权.然而联邦学习引入了大量参数交换过程,不仅和集中式训练一样受到模型使用者的威胁,还可能受到来自不可信的参与设备的攻击,因此亟需更强的隐私手段保护各方持有的数据.分析并展望了联邦学习中的隐私保护技术的研究进展和趋势.简要介绍联邦学习的架构和类型,分析联邦学习过程中面临的隐私风险,总结重建、推断两种攻击策略,然后依据联邦学习中的隐私保护机制归纳隐私保护技术,并深入调研应用上述技术的隐私保护算法,从中心、本地、中心与本地结合这3个层面总结现有的保护策略.最后讨论联邦学习隐私保护面临的挑战并展望未来的发展方向.
    24  面向企业数据孤岛的联邦排序学习
    史鼎元,王晏晟,郑鹏飞,童咏昕
    2021, 32(3):669-688. DOI: 10.13328/j.cnki.jos.006174
    [摘要](3515) [HTML](5437) [PDF 2.09 M](8639)
    摘要:
    排序学习(learning-to-rank,简称LTR)模型在信息检索领域取得了显著成果,而该模型的传统训练方法需要收集大规模文本数据.然而,随着数据隐私保护日渐受到人们重视,从多个数据拥有者(如企业)手中收集数据训练排序学习模型的方式变得不可行.各企业之间数据被迫独立存储,形成了数据孤岛.由于排序模型训练需要使用查询记录、文档等诸多隐私信息,数据孤岛难以融合打通,这制约了排序学习模型的训练.联邦学习能够让多数据拥有方在隐私保护的前提下联合训练模型,是一种打通数据孤岛的新方法.在其启发下,提出了一种新的框架,即面向企业数据孤岛的联邦排序学习,它同时解决了联邦学习场景下排序学习所面临的两大挑战,即交叉特征生成与缺失标签处理.为了应对多方交叉特征的生成问题,使用了一种基于略图(sketch)数据结构与差分隐私的方法,其相比于传统加密方法具有更高的效率,同时还具有隐私性与结果精度的理论保证.为了应对缺失标签问题,提出了一种新的联邦半监督学习方法.最终,通过在公开数据集上的大量实验,验证了所提方法的有效性.
    25  一种基于注意力联邦蒸馏的推荐方法
    谌明,张蕾,马天翼
    2021, 32(12):3852-3868. DOI: 10.13328/j.cnki.jos.006128
    [摘要](1720) [HTML](4284) [PDF 1.84 M](4745)
    摘要:
    数据隐私保护问题已成为推荐系统面临的主要挑战之一.随着《中华人民共和国网络安全法》的颁布和欧盟《通用数据保护条例》的实施,数据隐私和安全成为了世界性的趋势.联邦学习可通过不交换数据训练全局模型,不会泄露用户隐私.但是联邦学习存在每台设备数据量少、模型容易过拟合、数据稀疏导致训练好的模型很难达到较高的预测精度等问题.同时,随着5G (the 5th generation mobile communication technology)时代的到来,个人设备数据量和传输速率预计比当前提高10~100倍,因此要求模型执行效率更高.针对此问题,知识蒸馏可以将教师模型中的知识迁移到更为紧凑的学生模型中去,让学生模型能尽可能逼近或是超过教师网络,从而有效解决模型参数多和通信开销大的问题.但往往蒸馏后的学生模型在精度上会低于教师模型.提出一种面向推荐系统的联邦蒸馏方法,该方法首先在联邦蒸馏的目标函数中加入Kullback-Leibler散度和正则项,减少教师网络和学生网络间的差异性影响;引入多头注意力机制丰富编码信息,提升模型精度;并提出一个改进的自适应学习率训练策略来自动切换优化算法,选择合适的学习率,提升模型的收敛速度.实验验证了该方法的有效性:相比基准算法,模型的训练时间缩短52%,模型的准确率提升了13%,平均误差减少17%,NDCG值提升了10%.

    当期目录


    文章目录

    过刊浏览

    年份

    刊期

    联系方式
    • 《软件学报 》
    • 主办单位:中国科学院软件研究所
                       中国计算机学会
    • 邮编:100190
    • 电话:010-62562563
    • 电子邮箱:jos@iscas.ac.cn
    • 网址:https://www.jos.org.cn
    • 刊号:ISSN 1000-9825
    •           CN 11-2560/TP
    • 国内定价:70元
    您是第位访问者
    版权所有:中国科学院软件研究所 京ICP备05046678号-3
    地址:北京市海淀区中关村南四街4号,邮政编码:100190
    电话:010-62562563 传真:010-62562533 Email:jos@iscas.ac.cn
    技术支持:北京勤云科技发展有限公司

    京公网安备 11040202500063号