摘要:尽管深度神经网络(deep neural network, DNN)已广泛应用于各个领域, 但其在敌对环境中表现出显著脆弱性. 近年来, 出现一种特殊的攻击形式, 称为后门攻击或木马攻击. 攻击者故意在DNN中植入后门, 带有后门的模型对正常输入做出正确的预测, 但对带有触发器的输入产生错误的预测. 为应对后门攻击的威胁, 研究人员提出各种检测方法, 然而, 这些方法依赖于严格的假设, 如白盒访问目标模型或已知触发器模式, 并且需要大量检测数据和检测时间, 这限制了在实际场景中的应用. 此外, 现有方法在后门攻击的目标类识别方面研究不足, 未能有效揭示目标类在攻击中的关键作用及其对实际任务的影响. 提出一种高效的黑盒后门检测方法 EBLD (efficient black-box backdoor detection), 在仅有少量干净数据的情况下, 结合迁移学习, 利用这些数据训练一小组良性模型和后门模型; 然后通过模型变异技术快速生成大量模型; 最后, 基于这些模型, 训练多个分类器以联合判断目标模型是否为后门模型. 在没有检测数据的情况下, 提出“特征适配”策略, 利用在其他任务上生成的良性模型和后门模型, 训练能够检测新目标模型的二元分类器. 该策略克服了对检测样本的依赖, 并且能够充分利用已有良性模型与后门模型资源, 提升检测效率. 此外, 设计基于迁移学习的二元分类器微调方法, 通过加载已有二元分类器的权重, 训练新的二元分类器, 进一步减少后门检测时间. 最后, 基于训练二元分类器时获得的最优查询集, 构建最优查询集库, 通过分析后门模型对最优查询集的输出类别分布, 快速判断后门攻击的目标类. 目标类识别不仅有助于更精确的定位攻击范围, 还能为后门防御与修复提供明确方向. 实验结果表明, 所提方法在检测精度方面显著优于现有方法, 在检测效率方面也达到较高水平.