强化学习

  • 显示方式:
  • 简洁模式
  • 摘要模式
  • 1  模糊映射熵驱动的强化学习系统安全监控方法
    杨敏,周子渊,李晓锋,刘关俊
    2026, 37(9):3557-3576. DOI: 10.13328/j.cnki.jos.007608
    [摘要](821) [HTML](0) [PDF 3.76 M](656)
    摘要:
    深度强化学习虽已在多种复杂任务中取得卓越成果, 但其策略在动态高维环境下仍缺乏实时安全保障, 因而亟需在部署阶段引入能够实时评估并纠正智能体决策的安全监控机制. 现有数据驱动的黑盒监控方法侧重离散或二元决策, 难以直接迁移到连续动作空间. 针对上述问题, 提出了模糊映射熵驱动的安全监控框架, 仅依赖状态、动作和成本数据即可构建, 无需任何环境模型. 该方法首先利用高斯混合模型(Gaussian mixture model, GMM)对离线收集的安全轨迹进行状态簇硬划分和动作簇软隶属, 并提出模糊映射熵在兼顾均衡性与模型复杂度的前提下自适应确定最优动作簇数. 随后在?Mamdani框架下构建模糊逻辑规则, 并通过残差网络与对抗判别器联合微调簇中心, 使生成动作更贴近真实的安全分布. 在线阶段, 监控器基于GMM后验概率计算每条待执行状态-动作对的簇一致性度量. 一旦该度量低于阈值, 即通过模糊推理生成平滑的安全替换动作, 从而在风险发生之前完成修正. 在?Safety-Gymnasium的3个导航任务上, 对?PPO-Lag、TRPO-Lag与?CPPO-PID策略进行了监控评估. 结果显示, 该框架在几乎不降低乃至略微提升任务回报的前提下, 显著降低累计安全成本, 并保持较高的预警覆盖率, 验证了该监控框架在连续动作场景中的有效性和实用性.
    2  隐变量因果模型视角下的策略梯度方差优化
    蔡瑞初,林富艺,陈薇,朱海鹏,郝志峰
    2026, 37(6):2564-2583. DOI: 10.13328/j.cnki.jos.007547
    [摘要](514) [HTML](177) [PDF 52.12 M](513)
    摘要:
    深度强化学习已在多个领域取得了显著突破, 其中策略梯度算法因适用于处理非线性和高维状态空间的问题而被广泛采用. 然而, 现有策略梯度算法在实际应用中仍面临高方差问题, 这会导致算法收敛速度变慢, 甚至可能陷入次优解. 针对这一挑战, 从隐变量因果模型的视角提出一种策略梯度方差优化方法. 通过引入隐变量刻画未观测随机信息, 构建并学习隐变量因果模型. 基于隐变量因果模型, 提出因果价值函数, 结合长短期记忆网络, 根据时效性区分衡量未观测随机信息对价值估计的影响作用, 提高动作优势函数预估的准确性, 降低策略梯度方差. 实验表明, 与前沿的同类算法相比, 基于隐变量因果模型的方法在多个任务中更具有优越性和稳定性.
    3  无线多媒体通信网适应带宽配置在线优化算法
    江琦 奚宏生 殷保群
    2007, 18(6):1491-1500.
    [摘要](4830) [HTML](0) [PDF 664.76 K](6633)
    摘要:
    基于强化学习的方法,提出一种无线多媒体通信网适应带宽配置在线优化算法,在满足多类业务不同QoS(quality of service)要求的同时,提高网络资源的利用率.建立事件驱动的随机切换分析模型,将无线多媒体通信网中的适应带宽配置问题转化为带约束的连续时间Markov决策问题.利用此模型的动态结构特性,结合在线学习估计梯度与随机逼近改进策略,提出适应带宽配置在线优化算法.该算法不依赖于系统参数,如呼叫到达率、呼叫持续时间等,自适应性强,计算量小,能够收敛到全局最优,适用于复杂应用环境中无线多媒体通信网适应带宽配置的在线优化.仿真实验结果验证了算法的有效性.
    4  云计算中基于SAC的多视角工作负载预测集成框架
    曾文瑄,应时,李田港,田相波,姜宇虹,刘虎杰,郝诗魁
    2026, 37(2):563-583. DOI: 10.13328/j.cnki.jos.007424
    [摘要](917) [HTML](623) [PDF 3.17 M](2170)
    摘要:
    工作负载的准确预测对于云资源管理至关重要. 然而, 现有预测模型通常使用固化结构从不同视角提取序列特征, 导致不同模型结构之间难以灵活组合以进一步提升预测性能. 提出一种基于软演员-评论家算法(soft actor-critic, SAC)的多视角工作负载预测集成框架SAC-MWF. 首先, 设计一组特征序列构建方法来生成多视角特征序列, 该方法能够以低成本从历史窗口生成特征序列, 从而引导模型关注不同视角下的云工作负载序列模式. 其次, 在历史窗口和特征序列上分别训练基础预测模型和若干特征预测模型, 以捕获不同视角下的云工作负载模式. 最后, 利用SAC算法集成基础预测模型和特征预测模型, 生成最终的云工作负载预测. 在3个数据集上的实验结果表明, SAC-MWF方法在有效性和计算效率方面表现优秀.
    5  智能查询优化算法研究综述
    何家豪,王嘉辰,王晓,张喜盈,李翠平,陈红
    2026, 37(1):279-300. DOI: 10.13328/j.cnki.jos.007449
    [摘要](1705) [HTML](1055) [PDF 2.37 M](1402)
    摘要:
    查询优化是数据库系统中至关重要的环节, 查询优化器通过找出一条查询语句对应的最佳查询计划来减少查询执行的代价. 传统优化器依赖固定规则或简单启发式算法加工并筛选候选计划. 然而随着实际应用中关系模式和查询逐渐复杂, 传统的查询优化器已经难以满足应用需求. 智能查询优化算法将机器学习技术应用到查询优化领域, 通过学习查询计划与复杂关系模式的特征来协助传统优化器完成查询优化. 此类算法在代价模型、连接优化、计划生成和查询改写等方面都提出了创新有效的解决方案. 梳理上述4类智能查询优化算法近年来的研究成果和发展脉络, 并对智能查询优化未来的研究方向进行展望, 希望研究者可以全面了解智能查询优化算法的研究现状, 以助于其后续科研工作的开展.
    6  基于音频-语言模型的端到端说话人日志系统
    韦舒羽,丘德来,刘升平,桑基韬
    2026, 37(5):1903-1918. DOI: 10.13328/j.cnki.jos.007541
    [摘要](2333) [HTML](952) [PDF 1.83 M](1295)
    摘要:
    会议纪要、客服质检等应用对多说话人语音转写与归属判断的需求正日益增长. 随着近年来多模态大语言模型的迅速发展, 音频-语言模型因其能够同时理解音频信号与自然语言提示, 并在自回归解码框架中统一处理两种模态的能力, 天然契合这种“说话人日志”任务的需求, 为端到端多说话人音频转写提供了全新的思路. 提出一种基于音频-语言模型的端到端说话人日志系统, 通过两阶段训练策略实现语音识别能力与判断说话人归属能力的协同优化, 将音频-语言模型的能力泛化到具体的下游任务上. 训练的第1阶段采用监督微调(SFT), 在标准交叉熵损失中引入“说话人损失”, 以加权的方式强化对稀疏说话人标签token的学习信号; 第2阶段使用了基于组相对策略优化(GRPO)算法的强化学习策略, 以联合指标cpCERSA-CER设计奖励函数, 突破了监督学习的性能瓶颈. 在双说话人的场景下开展实验, 对比了热门开源工具3D-Speaker、Diar Sortformer和闭源的AssemblyAI、Microsoft Azure说话人日志API, 并通过消融实验证明了训练方法的合理性, 随后将实验拓宽至四说话人场景. 结果表明, 两阶段的训练方法在双说话人环境中显著提升了模型的语音识别能力与判断说话人归属的能力, 而在四说话人场景中, 常规的监督微调已取得较大收益. 进一步讨论了大模型资源消耗、输入时长限制、跨域适应等问题, 提出了引入流式音频编码器、课程学习、拒绝采样策略等未来优化方向. 研究结果表明音频-语言模型在多说话人日志任务中具备显著潜力, 但亦需在复杂声学场景下完成更多技术突破.
    7  面向参数化动作空间的多智能体中心化策略梯度分解及其应用
    田树聪,谢愈,张远龙,周正春,高阳
    2025, 36(2):590-607. DOI: 10.13328/j.cnki.jos.007150
    [摘要](2369) [HTML](1753) [PDF 3.51 M](3463)
    摘要:
    近年来, 多智能体强化学习方法凭借AlphaStar、AlphaDogFight、AlphaMosaic等成功案例展示出卓越的决策能力以及广泛的应用前景. 在真实环境的多智能体决策系统中, 其任务的决策空间往往是同时具有离散型动作变量和连续型动作变量的参数化动作空间. 这类动作空间的复杂性结构使得传统单一针对离散型或连续型的多智能体强化学习算法不在适用, 因此研究能用于参数化动作空间的多智能体强化学习算法具有重要的现实意义. 提出一种面向参数化动作空间的多智能体中心化策略梯度分解算法, 利用中心化策略梯度分解算法保证多智能体的有效协同, 结合参数化深度确定性策略梯度算法中双头策略输出实现对参数化动作空间的有效耦合. 通过在Hybrid Predator-Prey场景中不同参数设置下的实验结果表明该算法在经典的多智能体参数化动作空间协作任务上具有良好的性能. 此外, 在多巡航导弹协同突防场景中进行算法效能验证, 实验结果表明该算法在多巡航导弹突防这类具有高动态、行为复杂化的协同任务中有效性和可行性.
    8  基于分组对比学习的序贯感知技能发现
    杨尚东,余淼盈,陈兴国,陈蕾
    2025, 36(5):2079-2093. DOI: 10.13328/j.cnki.jos.007184
    [摘要](1589) [HTML](1232) [PDF 6.74 K](2290)
    摘要:
    强化学习在智能对话系统等决策任务中取得了令人瞩目的结果, 但其在复杂的、奖励稀疏的任务中学习效率较低. 研究人员在强化学习中引入技能发现框架, 以最大化不同技能间的差异为目标构建技能策略, 提升了智能体在上述任务中的学习效率. 然而, 受到采样轨迹数据多样性的限制, 现有的技能发现方法局限于在一个强化学习回合中学习一种技能, 导致其在一回合中具有序贯技能组合的复杂任务中表现欠佳. 针对该问题, 提出一种基于分组对比学习的序贯感知技能发现方法(group-wise contrastive learning based sequence-aware skill discovery, GCSSD), 该方法将对比学习融合到技能发现框架中. 首先, 为了提升轨迹数据的多样性, 将与环境交互的完整轨迹分段并进行分组, 利用分组轨迹构建对比损失学习技能嵌入表征; 其次, 结合技能嵌入表征与强化学习进行技能策略训练; 最后, 为了提升在具有不同序贯技能组合任务上的性能, 对采样轨迹进行分段技能表征并将其嵌入策略网络, 实现对已学技能策略的序贯组合. 实验结果表明, GCSSD方法在具有序贯技能组合的稀疏奖励任务中具有较好的训练效果, 并且在具有与训练任务不同的序贯技能组合任务中, 能够利用已学技能对该任务进行快速适应.
    9  扩散模型期望最大化的离线强化学习方法
    刘全,颜洁,乌兰
    2025, 36(10):4695-4709. DOI: 10.13328/j.cnki.jos.007296
    [摘要](1787) [HTML](860) [PDF 6.74 K](1797)
    摘要:
    在连续且密集奖励的任务中, 离线强化学习取得了显著的效果. 然而由于其训练过程不与环境交互, 泛化能力降低, 在离散且稀疏奖赏的环境下性能难以得到保证. 扩散模型通过加噪结合样本数据邻域的信息, 生成贴近样本数据分布的动作, 强化智能体的学习和泛化能力. 针对以上问题, 提出一种扩散模型期望最大化的离线强化学习方法(offline reinforcement learning with diffusion models and expectation maximization, DMEM). 该方法通过极大似然对数期望最大化更新目标函数, 使策略具有更强的泛化性. 将扩散模型引入策略网络中, 利用扩散的特征, 增强策略学习数据样本的能力. 同时从高维空间的角度看期望回归更新价值函数, 引入一个惩戒项使价值函数评估更准确. 将DMEM应用于一系列离散且稀疏奖励的任务中, 实验表明, 与其他经典的离线强化学习方法相比, DMEM性能上具有较大的优势.
    10  混合博弈问题的求解与应用综述
    董绍康,李超,杨光,葛振兴,曹宏业,陈武兵,杨尚东,陈兴国,李文斌,高阳
    2025, 36(1):107-151. DOI: 10.13328/j.cnki.jos.007212
    [摘要](3377) [HTML](3460) [PDF 6.74 K](4098)
    摘要:
    近年来, 随着人工智能技术在序贯决策和博弈对抗等问题的应用方面取得了飞速发展, 围棋、游戏、德扑和麻将等领域取得了巨大的进步, 例如, AlphaGo、OpenAI Five、AlphaStar、DeepStack、Libratus、Pluribus和Suphx等系统都在这些领域中达到或超过人类专家水平. 这些应用集中在双人、两队或者多人的零和博弈问题中, 而对于混合博弈问题的研究缺乏实质性的进展与突破. 区别于零和博弈, 混合博弈需要综合考虑个体收益、集体收益和均衡收益等诸多目标, 被广泛应用于公共资源分配、任务调度和自动驾驶等现实场景. 因此, 对于混合博弈问题的研究至关重要. 通过梳理当前混合博弈领域中的重要概念和相关工作, 深入分析国内外研究现状和未来发展方向. 具体地, 首先介绍混合博弈问题的定义与分类; 其次详细阐述博弈解概念和求解目标, 包含纳什均衡、相关均衡、帕累托最优等解概念, 最大化个体收益、最大化集体收益以及兼顾公平等求解目标; 接下来根据不同的求解目标, 分别对博弈论方法、强化学习方法以及这两种方法的结合进行详细探讨和分析; 最后介绍相关的应用场景和实验仿真环境, 并对未来研究的方向进行总结与展望.
    11  历史交通数据驱动的VANET智能路由算法
    李洁,陈青,陈侃松
    2025, 36(12):5780-5800. DOI: 10.13328/j.cnki.jos.007431
    [摘要](662) [HTML](668) [PDF 6.72 K](2215)
    摘要:
    随着智能出行的推广, 车载自组织网络(vehicular ad hoc network, VANET)在数据采集上应用得到越来越多的关注. 然而, 由于车辆的高速移动和轨迹难以预测, 传统的基于位置的贪婪转发策略难以适应于高动态VANET下数据传递的需求. 为解决这一问题, 提出一种历史交通数据驱动的VANET智能路由算法. 首先, 通过离线学习方法基于网络的历史交通流信息, 获取用于最优路径选择的转发表; 其次, 在路径上, 利用基于Markov预测的在线V2V传输机制, 通过考虑车辆的运动状态等因素选择可靠的下一中继车辆. 最后, 与3种路由算法进行了对比, 实验结果表明, 该算法在数据包投递率、平均端到端时延、网络收益率、平均成功发包开销和在线计算时间复杂度这5个性能上均表现优越.
    12  多目标深度强化学习驱动的数据库系统参数优化技术
    荣垂田,田浩辉,杜方
    2025, 36(12):5512-5536. DOI: 10.13328/j.cnki.jos.007405
    [摘要](1173) [HTML](640) [PDF 6.76 K](1459)
    摘要:
    数据库系统的参数配置直接影响其性能和系统资源的利用率. 主流的关系数据库管理系统有数百个参数可供调整以获得最佳的性能和服务能力. 数据库系统性能的优化通常由经验丰富的数据库管理员(DBA)手动进行, 但是由于数据库系统配置参数众多、异构且参数之间存在复杂的相关性, 传统的人工进行参数调优的工作方法效率低、成本高、可复用性差. 为了提高数据库系统性能优化的工作效率, 数据库系统的自动化参数调优技术成为数据库领域的研究热点. 由于强化学习具有与系统运行环境交互、反馈并逐步优化的能力, 被广泛应用于复杂系统的优化过程. 相关的研究工作将强化学习及其改进方法应用于数据库系统的参数优化, 但是都采用单目标优化的方法.实际上, 数据库系统的参数优化属于多目标优化任务, 且调优工作常在资源受限的情况下进行, 因此现有的工作存在一些缺陷: (1)将数据库系统优化任务的多个目标通过简单线性转换为单目标优化问题具有一定的盲目性, 需要反复迭代尝试优化, 实现成本高; (2)无法应对数据库系统需求的动态变化, 适用性差; (3)相关工作使用的强化学习方法本身是属于单目标优化算法, 将其应用于多目标任务时, 导致难以有效对齐偏好(当前的各个目标的权重系数)和相应的最优策略, 可能产生次优解; (4)现有数据库系统参数优化的目标通常仅考虑吞吐量和延迟, 未考虑内存等资源的利用率. 针对以上问题, 设计一种基于多目标深度确定性策略梯度的强化学习算法(MODDPG). 该方法是原生多目标的强化学习方法, 不需要将数据库系统优化的多目标任务转换为单目标任务, 可以高效适应数据库系统需求的动态变化. 通过改进强化学习算法的奖励机制可以快速实现偏好与最优策略的对齐, 有效避免次优解的产生, 提高数据库系统参数优化的效率. 为了更进一步验证所提方法的普遍适用性, 将提出的多目标优化的方法进行扩展, 实现了提升数据库的性能和资源利用率的多目标协同优化. 实验部分在主流关系数据库系统上使用TPC-C 和SYSBench测试基准对所提参数优化方法的有效性和实用性进行了验证. 实验结果表明, 所提方法在模型的训练效率和数据库参数优化的作用方面具有明显优势, 并且易于根据优化需求扩展到更多目标.
    13  因果时空语义驱动的深度强化学习抽象建模方法
    田丽丽,杜德慧,聂基辉,陈逸康,李荥达
    2025, 36(8):3637-3654. DOI: 10.13328/j.cnki.jos.007354
    [摘要](2218) [HTML](1930) [PDF 6.72 K](2166)
    摘要:
    随着智能信息物理融合系统(intelligent cyber-physical system, ICPS)的快速发展, 智能技术在感知、决策、规控等方面的应用日益广泛. 其中, 深度强化学习因其在处理复杂的动态环境方面的高效性, 已被广泛用于ICPS的控制组件中. 然而, 由于运行环境的开放性和ICPS系统的复杂性, 深度强化学习在学习过程中需要对复杂多变的状态空间进行探索, 这极易导致决策生成时效率低下和泛化性不足等问题. 目前对于该问题的常见解决方法是将大规模的细粒度马尔可夫决策过程(Markov decision process, MDP)抽象为小规模的粗粒度马尔可夫决策过程, 从而简化模型的计算复杂度并提高求解效率. 但这些方法尚未考虑如何保证原状态的时空语义信息、聚类抽象的系统空间和真实系统空间之间的语义一致性问题. 针对以上问题, 提出基于因果时空语义的深度强化学习抽象建模方法. 首先, 提出反映时间和空间价值变化分布的因果时空语义, 并在此基础上对状态进行双阶段语义抽象以构建深度强化学习过程的抽象马尔可夫模型; 其次, 结合抽象优化技术对抽象模型进行调优, 以减少抽象状态与相应具体状态之间的语义误差; 最后, 结合车道保持、自适应巡航、交叉路口会车等案例进行了大量的实验, 并使用验证器PRISM对模型进行评估分析, 结果表明所提出的抽象建模技术在模型的抽象表达能力、准确性及语义等价性方面具有较好的效果.
    14  面向机器人系统的虚实迁移强化学习综述
    林谦,余超,伍夏威,董银昭,徐昕,张强,郭宪
    2024, 35(2):711-738. DOI: 10.13328/j.cnki.jos.007006
    [摘要](3122) [HTML](6373) [PDF 1.99 M](8977)
    摘要:
    近年来, 基于环境交互的强化学习方法在机器人相关应用领域取得巨大成功, 为机器人行为控制策略优化提供一个现实可行的解决方案. 但在真实世界中收集交互样本存在高成本以及低效率等问题, 因此仿真环境被广泛应用于机器人强化学习训练过程中. 通过在虚拟仿真环境中以较低成本获取大量训练样本进行策略训练, 并将学习策略迁移至真实环境, 能有效缓解真实机器人训练中存在的安全性、可靠性以及实时性等问题. 然而, 由于仿真环境与真实环境存在差异, 仿真环境中训练得到的策略直接迁移到真实机器人往往难以获得理想的性能表现. 针对这一问题, 虚实迁移强化学习方法被提出用以缩小环境差异, 进而实现有效的策略迁移. 按照迁移强化学习过程中信息的流动方向和智能化方法作用的不同对象, 提出一个虚实迁移强化学习系统的流程框架, 并基于此框架将现有相关工作分为3大类: 基于真实环境的模型优化方法、基于仿真环境的知识迁移方法、基于虚实环境的策略迭代提升方法, 并对每一分类中的代表技术与关联工作进行阐述. 最后, 讨论虚实迁移强化学习研究领域面临的机遇和挑战.
    15  基于多模态表征的移动应用GUI模糊测试框架
    张少坤,李元春,雷瀚文,蒋鹏,李锭,郭耀,陈向群
    2024, 35(7):3162-3179. DOI: 10.13328/j.cnki.jos.007106
    [摘要](2349) [HTML](2759) [PDF 2.57 M](4512)
    摘要:
    GUI模糊测试在提升移动应用可靠性和兼容性方面发挥着关键作用. 然而, 现有的GUI模糊测试方法大多效率较低, 主要原因是这些工作过于粗粒度, 仅基于单一模态的特征来整体理解GUI页面, 应用状态的过度抽象使得许多细节信息被忽略, 导致对GUI状态及小部件的理解不足. 为了解决上述问题, 提出了一种基于多模态表征的移动应用GUI模糊测试框架GUIFuzzer. 该框架通过考虑多模态特征, 如视觉特征、布局上下特征和细粒度的元属性特征, 来联合推断GUI小部件的语义; 然后, 训练一个多层次奖励驱动的深度强化学习模型来优化GUI事件选择策略, 提高模糊测试的效率. 在大量的真实应用上对所提框架进行了评估. 实验结果表明: 与现有的竞争性基线相比, GUIFuzzer显著地提升了模糊测试的覆盖率. 还对特定目标的定制化搜索即敏感API触发进行了案例研究, 进一步验证了GUIFuzzer框架的实用性.
    16  面向漏洞检测模型的强化学习式对抗攻击方法
    陈思然,吴敬征,凌祥,罗天悦,刘镓煜,武延军
    2024, 35(8):3647-3667. DOI: 10.13328/j.cnki.jos.007120
    [摘要](3592) [HTML](3173) [PDF 4.04 M](5517)
    摘要:
    基于深度学习的代码漏洞检测模型因其检测效率高和精度准的优势, 逐步成为检测软件漏洞的重要方法,并在代码托管平台GitHub的代码审计服务中发挥重要作用. 然而, 深度神经网络已被证明容易受到对抗攻击的干扰, 这导致基于深度学习的漏洞检测模型存在遭受攻击、降低检测准确率的风险. 因此, 构建针对漏洞检测模型的对抗攻击不仅可以发掘此类模型的安全缺陷, 而且有助于评估模型的鲁棒性, 进而通过相应的方法提升模型性能. 但现有的面向漏洞检测模型的对抗攻击方法依赖于通用的代码转换工具, 并未提出针对性的代码扰动操作和决策算法, 因此难以生成有效的对抗样本, 且对抗样本的合法性依赖于人工检查. 针对上述问题, 提出了一种面向漏洞检测模型的强化学习式对抗攻击方法. 该方法首先设计了一系列语义约束且漏洞保留的代码扰动操作作为扰动集合; 其次, 将具备漏洞的代码样本作为输入, 利用强化学习模型选取具体的扰动操作序列; 最后, 根据代码样本的语法树节点类型寻找扰动的潜在位置, 进行代码转换, 从而生成对抗样本. 基于SARD和NVD构建了两个实验数据集, 共14 278个代码样本, 并以此训练了4个具备不同特点的漏洞检测模型作为攻击目标. 针对每个目标模型, 训练了一个强化学习网络进行对抗攻击. 结果显示, 该攻击方法导致模型的召回率降低了74.34%, 攻击成功率达到96.71%, 相较基线方法, 攻击成功率平均提升了68.76%. 实验证明了当前的漏洞检测模型存在被攻击的风险, 需要进一步研究提升模型的鲁棒性.
    17  基于学习-推理的约束求解方法研究进展
    邹悦,赖家洋,张永刚
    2024, 35(1):220-235. DOI: 10.13328/j.cnki.jos.006844
    [摘要](1878) [HTML](5239) [PDF 5.59 M](5678)
    摘要:
    机器学习与自动推理的融合是当前人工智能研究的新趋势. 约束满足问题是人工智能研究的经典问题, 现实世界中大量的调度、规划和配置等问题均可以建模为约束满足问题, 高效的求解算法一直是研究热点. 近年来涌现出众多将机器学习应用于约束满足问题求解的新方法, 这些基于“学习-推理”的新方法为约束满足问题求解开辟了新方向并展示出巨大发展潜力, 方法的突出优点是适应性强、可在线优化并具有更强的可扩展性. 将当前的“学习-推理”方法分为基于消息传递神经网络、基于序列到序列和基于最优化等3类进行综述, 详细分析各类方法的特点和在不同的问题集上求解效果, 尤其对每类方法所涵盖的相关工作进行多角度的对比分析. 最后, 对基于“学习-推理”的约束求解方法进行总结和展望.
    18  自动化渗透测试技术研究综述
    陈可,鲁辉,方滨兴,孙彦斌,苏申,田志宏
    2024, 35(5):2268-2288. DOI: 10.13328/j.cnki.jos.007038
    [摘要](3978) [HTML](12290) [PDF 9.33 M](11082)
    摘要:
    渗透测试是发现重要网络信息系统弱点并进而保护网络安全的重要手段. 传统的渗透测试深度依赖人工, 并且对测试人员的技术要求很高, 从而限制了普及的深度和广度. 自动化渗透测试通过将人工智能技术引入渗透测试全过程, 在极大地解决对人工的重度依赖基础上降低了渗透测试技术门槛. 自动化渗透测试主要可分为基于模型和基于规则的自动渗透测试. 二者的研究各有侧重, 前者是指利用模型算法模拟黑客攻击, 研究重点是攻击场景感知和攻击决策模型; 后者则聚焦于攻击规则和攻击场景如何高效适配等方面. 主要从攻击场景建模、渗透测试建模和决策推理模型等3个环节深入分析相关自动化渗透测试实现原理, 最后从攻防对抗、漏洞组合利用等维度探讨自动化渗透的未来发展方向.
    19  基于深度强化学习的WRSN动态时空充电调度
    王艺均,冯勇,刘明,刘念伯
    2024, 35(3):1485-1501. DOI: 10.13328/j.cnki.jos.006814
    [摘要](2210) [HTML](2144) [PDF 6.64 M](3717)
    摘要:
    高效的移动充电调度是构建长生命期、可持续运行的无线可充电传感器网络(WRSN)的关键之一.现有基于强化学习的充电策略只考虑了移动充电调度问题的一个维度,即移动充电器(MC)的路径规划,而忽略了充电调度问题中的另一维度,即充电时长调整,因而仍然存在性能限制.提出一种基于深度强化学习的WRSN动态时空充电调度方法(SCSD),建立充电序列调度和充电时长动态调整的深度强化学习模型.针对移动充电调度中离散的充电序列规划和连续的充电时长调整问题,使用DQN为待充电节点优化充电序列,并基于DDPG计算并动态调整序列中待充电节点的充电时长.通过分别从空间和时间两个维度的优化,在避免节点缺电失效的同时,所提出的SCSD可实现充电性能的有效提高.大量仿真实验结果表明,SCSD与现有的几种有代表性的充电方案相比,其充电性能具有明显的优势.
    20  合作-竞争混合型多智能体系统的虚拟遗憾优势自博弈方法
    张明悦,金芝,刘坤
    2024, 35(2):739-757. DOI: 10.13328/j.cnki.jos.006832
    [摘要](2905) [HTML](2369) [PDF 4.31 M](4211)
    摘要:
    合作-竞争混合型多智能体系统由受控的目标智能体和不受控的外部智能体组成. 目标智能体之间互相合作, 同外部智能体展开竞争, 应对环境和外部智能体的动态变化, 最终完成指定的任务. 针对如何训练目标智能体使他们获得完成任务的最优策略的问题, 现有工作从两个方面展开: (1)仅关注目标智能体间的合作, 将外部智能体视为环境的一部分, 利用多智能体强化学习来训练目标智能体. 这种方法难以应对外部智能体策略未知或者动态改变的情况; (2)仅关注目标智能体和外部智能体间的竞争, 将竞争建模为双人博弈, 采用自博弈的方法训练目标智能体. 这种方法主要针对单个目标智能体和单个外部智能体的情况, 难以扩展到由多个目标智能体和多个外部智能体组成的系统中. 结合这两类研究, 提出一种基于虚拟遗憾优势的自博弈方法. 具体地, 首先以虚拟遗憾最小化和虚拟多智能体策略梯度为基础, 设计虚拟遗憾优势策略梯度方法, 使目标智能体能更准确地更新策略; 然后, 引入模仿学习, 以外部智能体的历史决策轨迹作为示教数据, 模仿外部智能体的策略, 显式地建模外部智能体的行为, 来应对自博弈过程中外部智能体策略的动态变化; 最后, 以虚拟遗憾优势策略梯度和外部智能体行为建模为基础, 设计一种自博弈训练方法, 该方法能够在外部智能体策略未知或者动态变化的情况下, 为多个目标智能体训练出最优的联合策略. 以协同电磁对抗为研究案例, 设计具有合作-竞争混合特征的3个典型任务. 实验结果表明, 同其他方法相比, 所提方法在自博弈效果方面有至少78%的提升.
    21  元强化学习研究综述
    陈奕宇,霍静,丁天雨,高阳
    2024, 35(4):1618-1650. DOI: 10.13328/j.cnki.jos.007011
    [摘要](6701) [HTML](7162) [PDF 4.71 M](13129)
    摘要:
    近年来, 深度强化学习(deep reinforcement learning, DRL)已经在诸多序贯决策任务中取得瞩目成功, 但当前, 深度强化学习的成功很大程度依赖于海量的学习数据与计算资源, 低劣的样本效率和策略通用性是制约其进一步发展的关键因素. 元强化学习(meta-reinforcement learning, Meta-RL)致力于以更小的样本量适应更广泛的任务, 其研究有望缓解上述限制从而推进强化学习领域发展. 以元强化学习工作的研究对象与适用场景为脉络, 对元强化学习领域的研究进展进行了全面梳理: 首先, 对深度强化学习、元学习背景做基本介绍; 然后, 对元强化学习作形式化定义及常见的场景设置总结, 并从元强化学习研究成果的适用范围角度展开介绍元强化学习的现有研究进展; 最后, 分析了元强化学习领域的研究挑战与发展前景.
    22  边缘计算中协作计算卸载与动态任务调度
    张斐斐,葛季栋,李忠金,黄子峰,张胜,陈兴国,骆斌
    2023, 34(12):5737-5756. DOI: 10.13328/j.cnki.jos.006797
    [摘要](2611) [HTML](2767) [PDF 9.79 M](5218)
    摘要:
    在边缘计算场景中, 通过将部分待执行任务卸载到边缘服务器执行能够达到降低移动设备的负载、提升移动应用性能和减少设备开销的目的. 对于时延敏感任务, 只有在截止期限内完成才具有实际意义. 但是边缘服务器的资源往往有限, 当同时接收来自多个设备的数据传输及处理任务时, 可能造成任务长时间的排队等待, 导致部分任务因超时而执行失败, 因此无法兼顾多个设备的性能目标. 鉴于此, 在计算卸载的基础上优化边缘服务器端的任务调度顺序. 一方面, 将时延感知的任务调度建模为一个长期优化问题, 并使用基于组合多臂赌博机的在线学习方法动态调整服务器的调度顺序. 另一方面, 由于不同的任务执行顺序会改变任务卸载性能提升程度, 因而影响任务卸载决策的有效性. 为了增加卸载策略的鲁棒性, 采用了带有扰动回报的深度Q学习方法决定任务执行位置. 仿真算例证明了该策略可在平衡多个用户目标的同时减少系统的整体开销.
    23  融合引力搜索的双延迟深度确定策略梯度方法
    徐平安,刘全,郝少璞,张立华
    2023, 34(11):5191-5204. DOI: 10.13328/j.cnki.jos.006740
    [摘要](1314) [HTML](2418) [PDF 6.13 M](3271)
    摘要:
    近年来, 深度强化学习在复杂控制任务中取得了令人瞩目的效果, 然而由于超参数的高敏感性和收敛性难以保证等原因, 严重影响了其对现实问题的适用性. 元启发式算法作为一类模拟自然界客观规律的黑盒优化方法, 虽然能够有效避免超参数的敏感性, 但仍存在无法适应待优化参数量规模巨大和样本使用效率低等问题. 针对以上问题, 提出融合引力搜索的双延迟深度确定策略梯度方法(twin delayed deep deterministic policy gradient based on gravitational search algorithm, GSA-TD3). 该方法融合两类算法的优势: 一是凭借梯度优化的方式更新策略, 获得更高的样本效率和更快的学习速度; 二是将基于万有引力定律的种群更新方法引入到策略搜索过程中, 使其具有更强的探索性和更好的稳定性. 将GSA-TD3应用于一系列复杂控制任务中, 实验表明, 与前沿的同类深度强化学习方法相比, GSA-TD3在性能上具有显著的优势.
    24  强化学习可解释性基础问题探索和方法综述
    刘潇,刘书洋,庄韫恺,高阳
    2023, 34(5):2300-2316. DOI: 10.13328/j.cnki.jos.006485
    [摘要](7720) [HTML](5403) [PDF 5.93 M](12510)
    摘要:
    强化学习是一种从试错过程中发现最优行为策略的技术,已经成为解决环境交互问题的通用方法.然而,作为一类机器学习算法,强化学习也面临着机器学习领域的公共难题,即难以被人理解.缺乏可解释性限制了强化学习在安全敏感领域中的应用,如医疗、驾驶等,并导致强化学习在环境仿真、任务泛化等问题中缺乏普遍适用的解决方案.为了克服强化学习的这一弱点,涌现了大量强化学习可解释性(explainable reinforcement learning,XRL)的研究.然而,学术界对XRL尚缺乏一致认识.因此,探索XRL的基础性问题,并对现有工作进行综述.具体而言,首先探讨父问题——人工智能可解释性,对人工智能可解释性的已有定义进行了汇总;其次,构建一套可解释性领域的理论体系,从而描述XRL与人工智能可解释性的共同问题,包括界定智能算法和机械算法、定义解释的含义、讨论影响可解释性的因素、划分解释的直观性;然后,根据强化学习本身的特征,定义XRL的3个独有问题,即环境解释、任务解释、策略解释;之后,对现有方法进行系统地归类,并对XRL的最新进展进行综述;最后,展望XRL领域的潜在研究方向.
    25  显式知识推理和深度强化学习结合的动态决策
    张昊迪,陈振浩,陈俊扬,周熠,连德富,伍楷舜,林方真
    2023, 34(8):3821-3835. DOI: 10.13328/j.cnki.jos.006593
    [摘要](2952) [HTML](3184) [PDF 9.56 M](5524)
    摘要:
    近年来, 深度强化学习在序列决策领域被广泛应用并且效果良好, 尤其在具有高维输入、大规模状态空间的应用场景中优势明显. 然而, 深度强化学习相关方法也存在一些局限, 如缺乏可解释性、初期训练低效与冷启动等问题. 针对这些问题, 提出了一种基于显式知识推理和深度强化学习的动态决策框架, 将显式的知识推理与深度强化学习结合. 该框架通过显式知识表示将人类先验知识嵌入智能体训练中, 让智能体在强化学习中获得知识推理结果的干预, 以提高智能体的训练效率, 并增加模型的可解释性. 将显式知识分为两种, 即启发式加速知识与规避式安全知识. 前者在训练初期干预智能体决策, 加快训练速度; 而后者将避免智能体作出灾难性决策, 使其训练过程更为稳定. 实验表明, 该决策框架在不同强化学习算法上、不同应用场景中明显提高了模型训练效率, 并增加了模型的可解释性.
    26  逆向强化学习研究综述
    张立华,刘全,黄志刚,朱斐
    2023, 34(10):4772-4803. DOI: 10.13328/j.cnki.jos.006671
    [摘要](6132) [HTML](9506) [PDF 7.90 M](13621)
    摘要:
    逆向强化学习(inverse reinforcement learning, IRL)也称为逆向最优控制(inverse optimal control, IOC), 是强化学习和模仿学习领域的一种重要研究方法, 该方法通过专家样本求解奖赏函数, 并根据所得奖赏函数求解最优策略, 以达到模仿专家策略的目的. 近年来, 逆向强化学习在模仿学习领域取得了丰富的研究成果, 已广泛应用于汽车导航、路径推荐和机器人最优控制等问题中. 首先介绍逆向强化学习理论基础, 然后从奖赏函数构建方式出发, 讨论分析基于线性奖赏函数和非线性奖赏函数的逆向强化学习算法, 包括最大边际逆向强化学习算法、最大熵逆向强化学习算法、最大熵深度逆向强化学习算法和生成对抗模仿学习等. 随后从逆向强化学习领域的前沿研究方向进行综述, 比较和分析该领域代表性算法, 包括状态动作信息不完全逆向强化学习、多智能体逆向强化学习、示范样本非最优逆向强化学习和指导逆向强化学习等. 最后总结分析当前存在的关键问题, 并从理论和应用方面探讨未来的发展方向.
    27  基于演化深度强化学习的符号网络影响最大化研究
    马里佳,洪华平,林秋镇,李坚强,公茂果
    2023, 34(11):5084-5112. DOI: 10.13328/j.cnki.jos.006728
    [摘要](1711) [HTML](2842) [PDF 10.34 M](3621)
    摘要:
    近年来, 随着互联网信息传播以及新型冠状病毒COVID-19传播链阻断等重大应用问题的出现, 社会网络影响最大化问题的研究受到了科学界广泛关注. 影响最大化问题旨在根据特定应用问题的传播模型, 识别出最优影响种子节点集, 最大化其信息传播影响. 现有影响最大化算法主要针对单连接影响传播模型, 将影响最大化问题模拟为离散的影响力种子节点组合选取优化问题. 然而, 这些算法具有较高的计算时间复杂度, 且无法解决具有大规模冲突关系的符号网络影响最大化问题. 针对上述问题, 首先, 构建适用于符号网络的正负影响传播模型以及影响最大化优化模型. 其次, 通过引入由神经网络构成的deep Q network来选取种子节点集, 将离散的种子节点组合选取问题转化为更易优化的网络权重连续优化问题. 最后, 提出基于演化深度强化学习的符号网络影响最大化算法SEDRL-IM. 该算法将演化算法的个体视作策略, 结合演化算法的无梯度全局搜索以及强化学习的局部搜索特性, 实现对deep Q network权重优化问题解的有效搜索, 从而找到最优影响种子节点集. 在基准符号网络以及真实社交网络数据集上的大量实验结果表明, 所提算法在影响传播范围与求解效率上都优于经典的基准算法.
    28  结构交互驱动的机器人深度强化学习控制方法
    余超,董银昭,郭宪,冯旸赫,卓汉逵,张强
    2023, 34(4):1749-1764. DOI: 10.13328/j.cnki.jos.006708
    [摘要](2310) [HTML](3750) [PDF 3.75 M](3750)
    摘要:
    针对深度强化学习在高维机器人行为控制中训练效率低下和策略不可解释等问题, 提出一种基于结构交互驱动的机器人深度强化学习方法(structure-motivated interactive deep reinforcement learning, SMILE).首先, 利用结构分解方法将高维的单机器人控制问题转化为低维的多关节控制器协同学习问题, 从而缓解连续运动控制的维度灾难难题; 其次, 通过两种协同图模型(ATTENTION和PODT)动态推理控制器之间的关联关系, 实现机器人内部关节的信息交互和协同学习; 最后, 为了平衡ATTENTION和PODT协同图模型的计算复杂度和信息冗余度, 进一步提出两种协同图模型更新方法APDODT和PATTENTION, 实现控制器之间长期关联关系和短期关联关系的动态自适应调整. 实验结果表明, 基于结构驱动的机器人强化学习方法能显著提升机器人控制策略学习效率. 此外, 基于协同图模型的关系推理及协同机制, 可为最终学习策略提供更为直观和有效的解释.
    29  基于模型的强化学习中可学习的样本加权机制
    黄文振,尹奇跃,张俊格,黄凯奇
    2023, 34(6):2765-2775. DOI: 10.13328/j.cnki.jos.006489
    [摘要](1551) [HTML](2618) [PDF 6.55 M](4161)
    摘要:
    基于模型的强化学习方法利用已收集的样本对环境进行建模并使用构建的环境模型生成虚拟样本以辅助训练,因而有望提高样本效率.但由于训练样本不足等问题,构建的环境模型往往是不精确的,其生成的样本也会因携带的预测误差而对训练过程产生干扰.针对这一问题,提出了一种可学习的样本加权机制,通过对生成样本重加权以减少它们对训练过程的负面影响.该影响的量化方法为,先使用待评估样本更新价值和策略网络,再在真实样本上计算更新前后的损失值,使用损失值的变化量来衡量待评估样本对训练过程的影响.实验结果表明,按照该加权机制设计的强化学习算法在多个任务上均优于现有的基于模型和无模型的算法.
    30  深度分层强化学习研究与发展
    黄志刚,刘全,张立华,曹家庆,朱斐
    2023, 34(2):733-760. DOI: 10.13328/j.cnki.jos.006706
    [摘要](4744) [HTML](8723) [PDF 3.14 M](8668)
    摘要:
    深度分层强化学习是深度强化学习领域的一个重要研究方向,它重点关注经典深度强化学习难以解决的稀疏奖励、顺序决策和弱迁移能力等问题.其核心思想在于:根据分层思想构建具有多层结构的强化学习策略,运用时序抽象表达方法组合时间细粒度的下层动作,学习时间粗粒度的、有语义的上层动作,将复杂问题分解为数个简单问题进行求解.近年来,随着研究的深入,深度分层强化学习方法已经取得了实质性的突破,且被应用于视觉导航、自然语言处理、推荐系统和视频描述生成等生活领域.首先介绍了分层强化学习的理论基础;然后描述了深度分层强化学习的核心技术,包括分层抽象技术和常用实验环境;详细分析了基于技能的深度分层强化学习框架和基于子目标的深度分层强化学习框架,对比了各类算法的研究现状和发展趋势;接下来介绍了深度分层强化学习在多个现实生活领域中的应用;最后,对深度分层强化学习进行了展望和总结.
    31  面向知识图谱约束问答的强化学习推理技术
    毕鑫,聂豪杰,赵相国,袁野,王国仁
    2023, 34(10):4565-4583. DOI: 10.13328/j.cnki.jos.006889
    [摘要](3259) [HTML](4814) [PDF 2.42 M](6023)
    摘要:
    知识图谱问答任务通过问题分析与知识图谱推理,将问题的精准答案返回给用户,现已被广泛应用于智能搜索、个性化推荐等智慧信息服务中.考虑到关系监督学习方法人工标注的高昂代价,学者们开始采用强化学习等弱监督学习方法设计知识图谱问答模型.然而,面对带有约束的复杂问题,现有方法面临两大挑战:(1)多跳长路径推理导致奖励稀疏与延迟;(2)难以处理约束问题推理路径分支.针对上述挑战,设计了融合约束信息的奖励函数,能够解决弱监督学习面临的奖励稀疏与延迟问题;设计了基于强化学习的约束路径推理模型COPAR,提出了基于注意力机制的动作选择策略与基于约束的实体选择策略,能够依据问题约束信息选择关系及实体,缩减推理搜索空间,解决了推理路径分支问题.此外,提出了歧义约束处理策略,有效解决了推理路径歧义问题.采用知识图谱问答基准数据集对COPAR的性能进行了验证和对比.实验结果表明:与现有先进方法相比,在多跳数据集上性能相对提升了2%-7%,在约束数据集上性能均优于对比模型,准确率提升7.8%以上.
    32  一种基于强化学习的持续集成环境中测试用例排序技术
    赵逸凡,郝丹
    2023, 34(6):2708-2726. DOI: 10.13328/j.cnki.jos.006506
    [摘要](1870) [HTML](3724) [PDF 6.11 M](4100)
    摘要:
    在软件交付越来越强调迅速、可靠的当下,持续集成成为一项备受关注的技术.开发人员不断将工作副本集成到代码主干完成软件演化,每次集成会通过自动构建测试来验证代码更新是否引入错误.但随着软件规模的增大,测试用例集包含的测试用例越来越多,测试用例的覆盖范围、检错效果等特征也随着集成周期的延长而变化,传统的测试用例排序技术难以适用.基于强化学习的测试排序技术可以根据测试反馈动态调整排序策略,但现有的相关技术不能综合考虑测试用例集中的信息进行排序,这限制了它们的性能.提出一种新的基于强化学习的持续集成环境中测试用例排序方法——指针排序方法:方法使用测试用例的历史信息等特征作为输入,在每个集成周期中,智能体利用指针注意力机制获得对所有备选测试用例的关注程度,由此得到排序结果,并从测试执行的反馈得到策略更新的方向,在“排序-运行测试-反馈”的过程中不断调整排序策略,最终达到良好的排序性能.在5个规模较大的数据集上验证了所提方法的效果,并探究了使用的历史信息长度对方法性能的影响,方法在仅含回归测试用例的数据集上的排序效果,以及方法的执行效率.最后,得到如下结论:(1)与现有方法相比,指针排序方法能够随着软件版本的演化调整排序策略,在持续集成环境下有效地提升测试序列的检错能力.(2)指针排序方法对输入的历史信息长度有较好的鲁棒性,少量的历史信息即可使其达到最优效果.(3)指针排序方法能够很好地处理回归测试用例和新增测试用例.(4)指针排序方法的时间开销不大,结合其更好、更稳定的排序性能,可以认为指针排序方法是一个非常有竞争力的方法.
    33  AlphaQO:鲁棒的学习型查询优化器
    余翔,柴成亮,张辛宁,汤南,孙佶,李国良
    2022, 33(3):814-831. DOI: 10.13328/j.cnki.jos.006452
    [摘要](2399) [HTML](5311) [PDF 2.10 M](5964)
    摘要:
    由深度学习驱动的学习型查询优化器正在越来越广泛地受到研究者的关注,这些优化器往往能够取得近似甚至超过传统商业优化器的性能.与传统优化器不同的是,一个成功的学习型优化器往往依赖于足够多的高质量的负载查询作为训练数据.低质量的训练查询会导致学习型优化器在未来的查询上失效.提出了基于强化学习的鲁棒的学习型查询优化器训练框架AlphaQO,提前找到学习型优化器做不好的查询,以提高学习型优化器的鲁棒性.AlphaQO中存在两个重要部分:查询生成器和学习型优化器.查询生成器的目标是生成“难”的查询(传统优化器做得好,但是学习型优化器反而做得不好的查询).学习型优化器利用这些生成的查询进行测试和训练,并提供反馈让查询生成器进行更新.系统迭代交替的运行上述两个部分,分别进行训练.目的在于在提供尽量少的信息和消耗足够小的时间下找到足够多“难”的并且未见的查询给优化器训练,以提高学习型优化器的鲁棒性.实验结果显示:该生成器会提供越来越难的训练查询给学习型优化器;同时,这些查询能够提升学习型优化器的性能.
    34  文本风格迁移研究综述
    陈可佳,费子阳,陈景强,杨子农
    2022, 33(12):4668-4687. DOI: 10.13328/j.cnki.jos.006544
    [摘要](3878) [HTML](8414) [PDF 17.32 M](8625)
    摘要:
    文本风格迁移是近年来自然语言处理领域的热点问题之一,旨在保留文本内容的基础上通过编辑或生成的方式更改文本的特定风格或属性(如情感、时态和性别等).旨在梳理已有的技术,以推进该方向的研究.首先,给出文本风格迁移问题的定义及其面临的挑战;然后,对已有方法进行分类综述,重点介绍基于无监督学习的文本风格迁移方法并将其进一步分为隐式和显式两类方法,对各类方法在实现机制、优势、局限性和性能等方面进行分析和比较;同时,还通过实验比较了几种代表性方法在风格迁移准确率、文本内容保留和困惑度等自动化评价指标上的性能;最后,对文本风格迁移研究进行总结和展望.
    35  安全强化学习算法及其在CPS智能控制中的应用
    赵恒军,李权忠,曾霞,刘志明
    2022, 33(7):2538-2561. DOI: 10.13328/j.cnki.jos.006588
    [摘要](2936) [HTML](4937) [PDF 2.45 M](6060)
    摘要:
    信息物理系统(cyber-physical system,CPS)的安全控制器设计是一个热门研究方向,现有基于形式化方法的安全控制器设计存在过度依赖模型、可扩展性差等问题.基于深度强化学习的智能控制可处理高维非线性复杂系统和不确定性系统,正成为非常有前景的CPS控制技术,但是缺乏对安全性的保障.针对强化学习控制在安全性方面的不足,围绕一个工业油泵控制系统典型案例,开展安全强化学习算法和智能控制应用研究.首先,形式化了工业油泵控制的安全强化学习问题,搭建了工业油泵仿真环境;随后,通过设计输出层结构和激活函数,构造了神经网络形式的油泵控制器,使得油泵开关时间的线性不等式约束得到满足;最后,为了更好地权衡安全性和最优性控制目标,基于增广拉格朗日乘子法设计实现了新型安全强化学习算法.在工业油泵案例上的对比实验表明,该算法生成的控制器在安全性和最优性上均超越了现有同类算法.在进一步评估中,所生成神经网络控制器以90%的概率通过了严格形式化验证;同时,与理论最优控制器相比实现了低至2%的最优目标值损失.所提方法有望推广至更多应用场景,实例研究的方案有望为安全智能控制和形式化验证领域其他学者提供借鉴.
    36  基于样本效率优化的深度强化学习方法综述
    张峻伟,吕帅,张正昊,于佳玉,龚晓宇
    2022, 33(11):4217-4238. DOI: 10.13328/j.cnki.jos.006391
    [摘要](3587) [HTML](7350) [PDF 2.56 M](8419)
    摘要:
    深度强化学习将深度学习的表示能力和强化学习的决策能力结合,因在复杂控制任务中效果显著而掀起研究热潮.以是否用Bellman方程为基准,将无模型深度强化学习方法分为Q值函数方法和策略梯度方法,并从模型构建方式、优化历程和方法评估等方面对两类方法分别进行了介绍.针对深度强化学习方法中样本效率低的问题进行讨论,根据两类方法的模型特性,说明了Q值函数方法过高估计问题和策略梯度方法采样无偏性约束分别是两类方法样本效率受限的主要原因.从增强探索效率和提高样本利用率两个角度,根据近年来的研究热点和趋势归纳出各类可行的优化方法,分析相关方法的优势和仍存在的问题,并对比其适用范围和优化效果.最后提出增强样本效率优化方法的通用性、探究两类方法间优化机制的迁移和提高理论完备性作为未来的研究方向.
    37  基于预测编码的样本自适应行动策略规划
    梁星星,马扬,冯旸赫,张驭龙,张龙飞,廖世江,刘忠
    2022, 33(4):1477-1500. DOI: 10.13328/j.cnki.jos.006472
    [摘要](3040) [HTML](5453) [PDF 1.31 M](10463)
    摘要:
    军事行动、反恐突击等强对抗场景中,实时信息的碎片化、不确定性对制定具有博弈优势的弹性行动方案提出了更高的要求,研究具有自学习能力的智能行动策略规划方法已成为编队级强对抗任务的核心问题.针对复杂场景下行动策略规划状态表征困难、数据效率低下等问题,提出了基于预测编码的样本自适应行动策略规划方法.利用自编码模型压缩表示任务的原始状态空间,通过任务环境的状态转移样本,在低维度状态空间中使用混合密度分布网络对任务环境的动态模型进行学习,获得了表征环境动态性的预测编码;基于预测编码展开行动策略规划研究,利用时间差分敏感的样本自适应方法对状态评估值函数进行预测,改善了数据效率,加速了算法收敛.为了验证算法的有效性,基于全国兵棋推演大赛机机挑战赛的想定,构建了包含大赛获奖选手操作策略的5种规则智能体,利用消融实验验证编码方式、样本采样策略等不同因子组合对算法的影响,并使用Elo评分机制对各个智能体进行排序;实验结果表明:基于预测编码的样本自适应算法——MDN-AF得分排序最高,对战平均胜率为71%,其中大比分获胜局占比为67.6%,而且学习到了自主波次划分、补充侦察策略、“蛇形”打击策略、轰炸机靠后突袭等4种长时行动策略.该算法框架应用于2020年全国兵棋推演大赛的智能体开发,并获得了全国一等奖.
    38  基于受限MDP的无模型安全强化学习方法
    朱斐,葛洋洋,凌兴宏,刘全
    2022, 33(8):3086-3102. DOI: 10.13328/j.cnki.jos.006318
    [摘要](1788) [HTML](2665) [PDF 1.66 M](3700)
    摘要:
    很多强化学习方法较少地考虑决策的安全性,但研究领域和工业应用领域都要求的智能体所做决策是安全的.解决智能体决策安全问题的传统方法主要有改变目标函数、改变智能体的探索过程等,然而这些方法忽略了智能体遭受的损害和成本,因此不能有效地保障决策的安全性.在受限马尔可夫决策过程的基础上,通过对动作空间添加安全约束,设计了安全Sarsa (λ)方法和安全Sarsa方法.在求解过程中,不仅要求智能体得到最大的状态-动作值,还要求其满足安全约束的限制,从而获得安全的最优策略.由于传统的强化学习求解方法不再适用于求解带约束的安全Sarsa (λ)模型和安全Sarsa模型,为在满足约束条件下得到全局最优状态-动作值函数,提出了安全强化学习的求解模型.求解模型基于线性化多维约束,采用拉格朗日乘数法,在保证状态-动作值函数和约束函数具有可微性的前提下,将安全强化学习模型转化为凸模型,避免了在求解过程中陷入局部最优解的问题,提高了算法的求解效率和精确度.同时,给出了算法的可行性证明.最后,实验验证了算法的有效性.
    39  面向类集成测试序列生成的强化学习研究
    丁艳茹,张艳梅,姜淑娟,袁冠,王荣存,钱俊彦
    2022, 33(5):1674-1698. DOI: 10.13328/j.cnki.jos.006555
    [摘要](2073) [HTML](5651) [PDF 9.80 M](6363)
    摘要:
    集成测试是软件测试过程中不可缺少的步骤, 针对在集成测试中如何对系统中的类合理排序的问题, 国内外研究者提出了多种生成类集成测试序列的方法, 然而他们大多没有将测试桩复杂度作为评估测试代价的指标. 针对该问题, 提出面向类集成测试序列生成的强化学习研究方法, 以总体测试桩复杂度为评价测试代价的指标, 生成测试代价尽可能低的类集成测试序列. 首先, 定义强化学习任务, 根据任务设定算法的追求目标; 其次, 进行程序的静态分析, 根据分析得到的结果计算测试桩复杂度; 然后, 将测试桩复杂度的计算融入奖励函数的设计中, 为选择下一步动作提供信息和依据; 最后, 通过奖励函数反馈值函数, 通过值函数的设定保证累计奖励最大化. 当智能体完成规定训练次数, 系统会选择获得最大累计奖励值的类集成测试序列进行输出, 即为我们追求的测试代价尽可能低的结果. 实验结果表明, 与现有方法相比, 在以总体测试桩复杂度为评价指标时, 提出的方法结果更优.
    40  一种基于广义异步值迭代的规划网络模型
    陈子璇,章宗长,潘致远,张琳婧
    2021, 32(11):3496-3511. DOI: 10.13328/j.cnki.jos.006077
    [摘要](1537) [HTML](3018) [PDF 1.71 M](4062)
    摘要:
    近年来,如何生成具有泛化能力的策略已成为深度强化学习领域的热点问题之一,并涌现出了许多相关的研究成果,其中的一个代表性工作为广义值迭代网络.广义值迭代网络是一种可作用于非规则图形的规划网络模型.它利用一种特殊的图形卷积算子来近似地表示状态转移矩阵,使得其在学习到非规则图形的结构信息后,可通过值迭代过程进行规划,从而在具有非规则图形结构的任务中产生具有泛化能力的策略.然而,由于没有考虑根据状态重要性来合理分配规划时间,广义值迭代网络中的每一轮迭代都需要在整个状态空间的所有状态上同步执行.当状态空间较大时,这样的同步更新会降低网络的规划性能.用异步更新的思想来进一步研究广义值迭代网络.通过在值迭代过程中定义状态优先级并执行异步值更新,提出了一种新型的异步规划网络模型——广义异步值迭代网络.在未知的非规则结构任务中,与广义值迭代网络相比,广义异步值迭代网络具有更高效且更有效的规划过程.进一步地,改进了广义值迭代网络中的强化学习算法及图形卷积算子,并通过在非规则图形和真实地图中的路径规划实验验证了改进方法的有效性.
    41  大粒度Pull Request描述自动生成
    邝砾,施如意,赵雷浩,张欢,高洪皓
    2021, 32(6):1597-1611. DOI: 10.13328/j.cnki.jos.006239
    [摘要](2675) [HTML](4451) [PDF 1.60 M](6810)
    摘要:
    在GitHub平台中,许多项目贡献者在提交Pull Request(PR)时往往会忽略提交PR描述,这使得提交的PR容易被评审者忽略或者拒绝.因此,自动生成PR描述以帮助项目贡献者提高PR通过率是很有必要的.然而,现有PR描述生成方法的表现会受到PR粒度影响,无法有效为大粒度的PR生成描述.因此,该工作专注于大粒度PR描述的自动生成.首先对PR中的文本信息进行预处理,将文本中的单词作为辅助节点构建词-句异质图,以建立PR语句间的联系;随后对异质图进行特征提取,并将提取后的特征输入至图神经网络进行图表示学习,通过节点间的消息传递,使句子节点学习到更丰富的内容信息;最后,选择带有关键信息的句子组成PR描述.此外,针对PR数据集缺少人工标注的真实标签而无法进行监督学习的问题,使用强化学习指导PR描述的生成,以最小化获得奖励的负期望为目标训练模型,该过程与标签无关,并且直接提升了生成结果的表现.在真实的数据集上进行了实验,实验结果表明,提出的大粒度PR描述生成方法在F1值和可读性上优于现有方法.
    42  面向优先车辆感知的交通灯优化控制方法
    邵明莉,曹鹗,胡铭,章玥,陈闻杰,陈铭松
    2021, 32(8):2425-2438. DOI: 10.13328/j.cnki.jos.006191
    [摘要](3379) [HTML](4554) [PDF 1.80 M](7928)
    摘要:
    智慧交通灯控制能够有效地改善道路交通的秩序和效率.在城市交通网络中,具有紧急任务的特殊车辆对于通行效率的要求更高.目前已有的智慧交通灯控制算法通常对路网中的所有车辆一视同仁,没有考虑到特殊车辆的优先性;而传统的控制特殊车辆优先通行的方法基本上都是采用信号抢占的方式,对普通车辆的通行干扰过大.为此,提出一种面向优先车辆感知的交通灯优化控制方法,通过与道路环境的不断交互来学习交通灯控制策略,在设置状态和奖励函数时增加特殊车辆的权重,并利用Double DQN和Dueling DQN来提升模型表现,最终在城市交通模拟器SUMO中进行仿真实验.在训练趋于稳定之后,与固定时长控制方法的对比实验结果显示,该方法能够将特殊车辆与普通车辆的平均等待时间分别缩短68%与22%左右;与不考虑优先级的方法相比,特殊车辆的平均等待时间也有35%左右的优化.验证了该方法能够在提高车辆通行效率的同时,体现出对特殊车辆的优先处理.同时,实验也表明该方法能够扩展应用于多路口场景中.
    43  基于强化学习的温度感知多核任务调度
    杨世贵,王媛媛,刘韦辰,姜徐,赵明雄,方卉,杨宇,刘迪
    2021, 32(8):2408-2424. DOI: 10.13328/j.cnki.jos.006190
    [摘要](4150) [HTML](5475) [PDF 1.99 M](8255)
    摘要:
    随着计算机中内核数量的增多,温度感知的多核任务调度算法成为计算机系统中的一个研究热点.近年来,机器学习在各个领域展现出巨大的潜力,很多基于机器学习的系统温度管理研究工作应运而生.其中,强化学习因其较强的自适应性,被广泛地运用于温度感知的任务调度算法中.然而,目前基于强化学习的温度感知任务调度算法系统建模不够准确,很难做到温度、性能和复杂度的较好权衡.因此,提出一种基于强化学习的多核温度感知调度算法——ReLeTA.在该算法中提出了更全面的状态建模方式和更加有效的奖励函数,从而帮助系统进一步降低温度.实验部分通过3个不同的真实计算机平台验证该方法,实验结果表明了该方法的有效性以及可扩展性,与现有方法相比,ReLeTA可以更好地控制系统温度.
    44  求解二维装箱问题的强化学习启发式算法
    阳名钢,陈梦烦,杨双远,张德富
    2021, 32(12):3684-3697. DOI: 10.13328/j.cnki.jos.006161
    [摘要](3172) [HTML](3923) [PDF 1.42 M](6916)
    摘要:
    二维带形装箱问题是一个经典的NP-hard的组合优化问题,该问题在实际的生活和工业生产中有着广泛的应用.研究该问题,对企业节约成本、节约资源以及提高生产效率有着重要的意义.提出了一个强化学习求解算法.新颖地使用强化学习为启发式算法提供一个初始的装箱序列,有效地改善启发式冷启动的问题.该强化学习模型能进行自我驱动学习,仅使用启发式计算的解决方案的目标值作为奖励信号来优化网络,使网络能学习到更好的装箱序列.使用简化版的指针网络来解码输出装箱序列,该模型由嵌入层、解码器和注意力机制组成.使用Actor-Critic算法对模型进行训练,提高了模型的效率.在714个标准问题实例和随机生成的400个问题实例上测试提出的算法,实验结果显示:提出的算法能有效地改善启发式冷启动的问题,性能超过当前最优秀的启发式求解算法.
    45  深度学习在软件定义网络研究中的应用综述
    杨洋,吕光宏,赵会,李鹏飞
    2020, 31(7):2184-2204. DOI: 10.13328/j.cnki.jos.006039
    [摘要](5470) [HTML](7817) [PDF 1.17 M](17445)
    摘要:
    数据转发与控制分离的软件定义网络(software defined networking,简称SDN)是对传统网络架构的彻底颠覆,为网络各方面的研究引入了新的机遇和挑战.随着传统网络研究方法在SDN中遭遇瓶颈,基于深度学习的方法被引入到SDN的研究中,在实现实时智能的网络管控上成果颇丰,推动了SDN研究的深入发展.调查了深度学习开发平台,训练数据集、智能SDN架构等深度学习引入SDN的促进因素;对智能路由、入侵检测、流量感知和其他应用等SDN研究领域中的深度学习应用进行系统的介绍,深入分析了现有深度学习应用的特点和不足;最后展望了SDN未来的研究方向与趋势.
    46  基于自回归预测模型的深度注意力强化学习方法
    梁星星,冯旸赫,黄金才,王琦,马扬,刘忠
    2020, 31(4):948-966. DOI: 10.13328/j.cnki.jos.005930
    [摘要](4103) [HTML](2926) [PDF 2.18 M](9127)
    摘要:
    近年来,深度强化学习在各种决策、规划问题中展示了强大的智能性和良好的普适性,出现了诸如AlphaGo、OpenAI Five、Alpha Star等成功案例.然而,传统深度强化学习对计算资源的重度依赖及低效的数据利用率严重限制了其在复杂现实任务中的应用.传统的基于模型的强化学习算法通过学习环境的潜在动态性,可充分利用样本信息,有效提升数据利用率,加快模型训练速度,但如何快速建立准确的环境模型是基于模型的强化学习面临的难题.结合基于模型和无模型两类强化学习的优势,提出了一种基于时序自回归预测模型的深度注意力强化学习方法.利用自编码模型压缩表示潜在状态空间,结合自回归模型建立环境预测模型,基于注意力机制结合预测模型估计每个决策状态的值函数,通过端到端的方式统一训练各算法模块,实现高效的训练.通过CartPole-V0等经典控制任务的实验结果表明,该模型能够高效地建立环境预测模型,并有效结合基于模型和无模型两类强化学习方法,实现样本的高效利用.最后,针对导弹突防智能规划问题进行了算法实证研究,应用结果表明,采用所提出的学习模型可在特定场景取得优于传统突防规划的效果.
    47  基于强化学习的金融交易系统研究与发展
    梁天新 杨小平 王良 韩镇远
    2019, 30(3):845-864. DOI: 10.13328/j.cnki.jos.005689
    [摘要](9486) [HTML](7894) [PDF 2.11 M](16744)
    摘要:
    近年来,强化学习在电子游戏、棋类、决策控制等领域取得了巨大进展,也带动着金融交易系统的迅速发展.金融交易问题已经成为强化学习领域的研究热点,特别是股票、外汇和期货等方面具有广泛的应用需求和学术研究意义.以金融领域常用的强化学习模型的发展为脉络,对交易系统、自适应算法、交易策略等方面的诸多研究成果进行了综述.最后讨论了强化学习在金融领域应用中存在的困难和挑战,并对今后强化学习交易系统发展趋势进行展望.
    48  面向持续集成测试优化的强化学习奖励机制
    何柳柳 杨羊 李征 赵瑞莲
    2019, 30(5):1438-1449. DOI: 10.13328/j.cnki.jos.005714
    [摘要](3830) [HTML](5043) [PDF 1.37 M](8324)
    摘要:
    持续集成环境下的测试存在测试用例集变化大、测试时间有限和快速反馈等需求,传统的测试优化方法难以适用.强化学习是机器学习的一个重要分支,其本质是解决序贯决策问题,可以用于持续集成测试优化.但现有的基于强化学习的方法中,奖励函数计算只包括测试用例在当前集成周期的执行信息.从奖励函数设计和奖励策略两个方面开展研究.在奖励函数设计方面,采用测试用例的完整历史执行信息替代当前执行信息,综合考虑测试用例历史失效总次数和历史失效分布信息,提出了两种奖励函数.在奖励策略方面,提出对当前执行序列的测试用例整体奖励和仅对失效测试用例的部分奖励两种策略.在3个工业级被测程序进行实验研究,结果表明:(1)与现有方法相比,所提出的基于完整历史执行信息奖励函数的强化学习方法可以大幅度提高持续集成测试序列的检错能力;(2)测试用例历史失效分布有助于发现潜在失效的测试用例,对强化学习奖励函数的设计更加重要;(3)整体奖励与部分奖励两种奖励策略受到被测程序的多种因素影响,需要根据实际情况具体选择;(4)包含历史信息的奖励函数会增加时间消耗,但并不影响测试效率.
    49  基于创意序列学习的艺术风格学习与绘制系统
    谢宁 赵婷婷 杨阳 魏琴 Heng Tao SHEN
    2018, 29(4):1071-1084. DOI: 10.13328/j.cnki.jos.005414
    [摘要](5059) [HTML](4750) [PDF 1.87 M](8312)
    摘要:
    在众多传统艺术绘画形式中,笔触是被现代计算机绘画工具(GIMP、Photoshop和Painter)普遍采用的形式之一.创新性地提出了服务于非真实感渲染AI辅助艺术创作系统(A4).系统能够实现自动生成特定艺术家风格的笔触效果.该系统在强化学习框架下,主要进行以下研究工作:(1)提出基于PGPE的正则化策略学习方法以提高风格学习过程的稳定性;(2)利用IRL(inverse reinforcement learning)算法实现了艺术风格行为的模型化及其数字化保护方法.实验结果表明,所提方法行之有效地实现了针对具体个性风格的照片水墨画艺术风格转化.
    50  一种基于自生成样本学习的奖赏塑形方法
    钱煜 俞扬 周志华
    2013, 24(11):2667-2675. DOI: 10.3724/SP.J.1001.2013.04471
    [摘要](6867) [HTML](0) [PDF 1.10 M](9991)
    摘要:
    强化学习通过从以往的决策反馈中学习,使Agent 做出正确的短期决策,以最大化其获得的累积奖赏值.以往研究发现,奖赏塑形方法通过提供简单、易学的奖赏替代函数(即奖赏塑性函数)来替换真实的环境奖赏,能够有效地提高强化学习性能.然而奖赏塑形函数通常是在领域知识或者最优策略示例的基础上建立的,均需要专家参与,代价高昂.研究是否可以在强化学习过程中自动地学习有效的奖赏塑形函数.通常,强化学习算法在学习过程中会采集大量样本.这些样本虽然有很多是失败的尝试,但对构造奖赏塑形函数可能提供有用信息.提出了针对奖赏塑形的新型最优策略不变条件,并在此基础上提出了RFPotential 方法,从自生成样本中学习奖赏塑形.在多个强化学习算法和问题上进行了实验,其结果表明,该方法可以加速强化学习过程.
    51  一种高斯过程的带参近似策略迭代算法
    傅启明 刘全 伏玉琛 周谊成 于俊
    2013, 24(11):2676-2686. DOI: 10.3724/SP.J.1001.2013.04466
    [摘要](7347) [HTML](0) [PDF 974.78 K](8762)
    摘要:
    在大规模状态空间或者连续状态空间中,将函数近似与强化学习相结合是当前机器学习领域的一个研究热点;同时,在学习过程中如何平衡探索和利用的问题更是强化学习领域的一个研究难点.针对大规模状态空间或者连续状态空间、确定环境问题中的探索和利用的平衡问题,提出了一种基于高斯过程的近似策略迭代算法.该算法利用高斯过程对带参值函数进行建模,结合生成模型,根据贝叶斯推理,求解值函数的后验分布.在学习过程中,根据值函数的概率分布,求解动作的信息价值增益,结合值函数的期望值,选择相应的动作.在一定程度上,该算法可以解决探索和利用的平衡问题,加快算法收敛.将该算法用于经典的Mountain Car 问题,实验结果表明,该算法收敛速度较快,收敛精度较好.
    52  基于后悔值的多Agent冲突博弈强化学习模型
    肖 正 张世永
    2008, 19(11):2957-2967.
    [摘要](5031) [HTML](1) [PDF 397.94 K](10218)
    摘要:
    对于冲突博弈,研究了一种理性保守的行为选择方法,即最小化最坏情况下Agent的后悔值.在该方法下,Agent当前的行为策略在未来可能造成的损失最小,并且在没有任何其他Agent信息的条件下,能够得到Nash均衡混合策略.基于后悔值提出了多Agent复杂环境下冲突博弈的强化学习模型以及算法实现.该模型中通过引入交叉熵距离建立信念更新过程,进一步优化了冲突博弈时的行为选择策略.基于Markov重复博弈模型验证了算法的收敛性,分析了信念与最优策略的关系.此外,与MMDP(multi-agent markov decision process)下Q学习扩展算法相比,该算法在很大程度上减少了冲突发生的次数,增强了Agent行为的协调性,并且提高了系统的性能,有利于维持系统的稳定.
    53  基于生态竞争模型的遗传强化学习
    曹先彬 高 隽 王煦法
    1999, 10(6):658-662.
    [摘要](4149) [HTML](0) [PDF 348.50 K](6149)
    摘要:
    未成熟收敛和收敛速度慢是目前遗传算法的明显缺点.借鉴生物在环境生态系统中的生长模式,文章提出一种生态竞争模型.该模型认为,竞争行为在生物的成长中占有十分重要的地位,在子群内实现了个体层次的先天遗传进化和后天竞争学习,在种群层次实现进一步的竞争强化学习.实验结果显示了该模型在解决收敛性问题时的有效性.

    当期目录


    文章目录

    过刊浏览

    年份

    刊期

    联系方式
    • 《软件学报 》
    • 主办单位:中国科学院软件研究所
                       中国计算机学会
    • 邮编:100190
    • 电话:010-62562563
    • 电子邮箱:jos@iscas.ac.cn
    • 网址:https://www.jos.org.cn
    • 刊号:ISSN 1000-9825
    •           CN 11-2560/TP
    • 国内定价:70元
    您是第位访问者
    版权所有:中国科学院软件研究所 京ICP备05046678号-3
    地址:北京市海淀区中关村南四街4号,邮政编码:100190
    电话:010-62562563 传真:010-62562533 Email:jos@iscas.ac.cn
    技术支持:北京勤云科技发展有限公司

    京公网安备 11040202500063号