知识图谱

  • 显示方式:
  • 简洁模式
  • 摘要模式
  • 1  基于领域知识图谱的框架间AI源码自动迁移
    丁嵘,刘屹洲,王雨倩,李一錡
    2026, 37(2):584-600. DOI: 10.13328/j.cnki.jos.007451
    [摘要](1014) [HTML](1066) [PDF 2.52 M](1087)
    摘要:
    作为人工智能的基础设施, 深度学习框架已经成为人工智能实现跨越发展的重要突破口. 但是由于缺乏统一标准, 不同框架的兼容水平较差. 忠实模型转换通过将源模型迁移为另一种目标框架下的等价模型, 来增强框架间的互操作性. 然而, 深度学习框架数量较多且相互间差异较大, 并且自主框架的需求逐渐增多, 互相转换成本较高. 因此, 提出基于领域知识图谱的框架间AI源码自动迁移方法. 该方法基于领域知识图谱和抽象语法树来系统地处理迁移挑战, 首先将源代码转换为特定的抽象语法树, 提取通用依赖信息和特定算子信息, 然后再利用存储在领域知识图谱中的框架间算子及参数映射关系来迁移到目标框架下, 形成目标框架下的目标模型代码, 大大降低了工程复杂度. 对比同类型的代码迁移工具, 所提方法可以在国内外流行深度学习框架如PyTorch、PaddlePaddle和MindSpore之间进行互相迁移, 达到了较好的成熟度和质量, 部分成果已经开源到百度官方迁移工具PaConvert中.
    2  多语义视图驱动的OWL知识图谱表示学习方法
    杨建喜,谢江村,李韧,杨小霞,肖桥,蒋仕新,贺丽荣
    2025, 36(12):5644-5673. DOI: 10.13328/j.cnki.jos.007402
    [摘要](904) [HTML](697) [PDF 6.79 K](2299)
    摘要:
    针对当前OWL知识表示学习方法存在的概念层和实例层复杂语义信息联合表征能力不足等问题, 提出一种概念-属性-实例多语义视图驱动的OWL图谱知识表示学习方法(MSV-KRL). 该方法采用“多语义视图划分、语义感知自监督进阶训练、多任务联合表示学习”的3阶段架构. 首先, MSV-KRL在OWL2Vec*的基础上, 优化OWL到RDF图结构的映射策略, 提出5类细粒度语义视图划分策略. 其次, 通过语义视图内随机游走和标注属性替换策略, 生成序列化进阶训练数据, 并开展预训练模型的自监督进阶训练, 以提升其面向多语义视图上下文的适配能力. 最后, 在多任务学习框架下, 通过多语义视图预测任务联合优化损失, 实现对OWL知识图谱中概念、属性和实例复杂语义有效表示学习. 实验结果表明, MSV-KRL在多个基准数据集上的表现优于现有先进的知识表示学习方法, 且能适配于多种语言模型, 有效提升OWL复杂语义的知识表示能力.
    3  知识图谱补全技术及应用
    郑修林,周鹏,李培培,张赞,黄艳香,吴信东
    2025, 36(12):5599-5628. DOI: 10.13328/j.cnki.jos.007400
    [摘要](1475) [HTML](1067) [PDF 6.75 K](1978)
    摘要:
    知识图谱以其独特的知识管理方式和表示能力被广泛运用于知识问答等知识计算领域. 但是, 现实中的知识图谱或多或少存在信息不完整的问题, 影响知识图谱的质量, 限制了下游任务的效果, 如不完整的知识图谱不能给出准确的知识问答结果. 因此, 知识图谱补全技术应运而生, 旨在通过不同的策略对知识图谱事实三元组中缺失的内容进行预测以改善知识图谱的质量. 近年来, 人们对知识图谱补全进行了大量的研究. 根据构建模型所需样本的数量将现有的知识图谱补全技术分为3大类, 即零样本知识图谱补全、少样本知识图谱补全和多样本知识图谱补全. 为了调研并作为研究人员掌握知识图谱补全研究核心思想和研究现状的第一手材料, 从理论研究、实验分析以及具体应用, 如华谱系统, 对已有的知识图谱补全技术进行全面的回顾, 总结当前知识图谱补全技术所面临的问题与挑战, 并对未来可能的研究方向进行探讨.
    4  基于嵌入模型的知识图谱准确性评估
    张明韬,杨国利,白晓颖
    2025, 36(12):5674-5694. DOI: 10.13328/j.cnki.jos.007403
    [摘要](912) [HTML](726) [PDF 6.71 K](1543)
    摘要:
    知识图谱构造常面临三元组错误或缺失等质量问题, 准确性评估是选择和优化知识图谱的基础, 对提升下游应用的可信性具有重要意义. 引入嵌入模型, 降低对人工标注数据的依赖性, 提升大规模数据处理效率. 将三元组正误判定转化为无标注的自动化阈值选择问题, 提出了3种阈值选择策略, 增强评估的鲁棒性. 提出结合三元组重要性的评估方法, 从网络结构和关系语义两方面定义重要性指标, 对关键结构、频繁访问的三元组赋予更高关注度. 从嵌入模型表征能力、知识图谱稠密度、三元组重要性计算方式等多个角度, 分析比较了对评估方法性能的影响. 实验表明, 相比现有知识图谱准确性的自动化评估方法, 在零样本条件下, 所提出的方法可有效降低评估误差, 平均降低接近30%, 在错误率较高、稠密图谱的数据集上效果尤为显著.
    5  带有差异化机制的多视角归纳式知识图谱补全框架
    童翰文,钱羽希,刘井平,梁祖杰,肖仰华,韦峰,郝正鸿,韩冰
    2025, 36(12):5629-5643. DOI: 10.13328/j.cnki.jos.007401
    [摘要](750) [HTML](692) [PDF 6.74 K](1295)
    摘要:
    知识图谱补全模型需要具备归纳能力, 才能够随着知识图谱的扩充泛化到新实体上. 然而, 现有的方法都只能通过聚合知识图谱中的邻居信息, 从一个局部的视角来理解实体的语义, 从而导致无法从不同的视角捕捉到实体之间的多种有价值的关联. 在局部视角以外, 通过非显式连接实体之间和远距离连接实体之间的交互, 从而以全局视角和序列视角来进一步理解实体是至关重要的. 更重要的是, 强调通过多个不同视角聚合到的信息应当是互补的, 而不是冗余的. 因此, 提出一个带有差异化机制的多视角知识图谱补全框架, 用于归纳式知识图谱补全任务. 它能够从多个不同视角学习到互补的、互不重叠的实体表示. 具体来说, 除了通过关系图卷积网络聚合邻居信息得到实体的局部表示外, 设计一种基于注意力的差异化机制, 用于从语义相关的实体和实体相关路径中聚合得到实体的全局和序列表示. 最终, 融合这些表示, 并基于它们给三元组打分. 实验结果证明, 所提方法在归纳式的设定下超越了当前最先进的方法. 此外, 所提方法在直推式的知识图谱补全任务中也保持着有竞争力的表现.
    6  华谱通: 基于知识推理的家谱问答大语言模型
    吴信东,卓兴锐,常永泮,吴共庆,张赞,朱毅
    2025, 36(12):5572-5598. DOI: 10.13328/j.cnki.jos.007399
    [摘要](1142) [HTML](1010) [PDF 6.72 K](2547)
    摘要:
    利用计算机技术实现家谱数据的智能化管理, 对传承和普及中华传统文化有着重要的意义. 近年来, 随着基于检索增强的大语言模型在知识问答领域被广泛应用, 通过大语言模型以对话的方式向用户展示多样的家谱文化已经成为一个备受关注的研究方向. 然而, 家谱数据的异构性、自治性、复杂性和演化性导致现有的知识检索框架难以在复杂的家谱信息中实现完备的知识推理. 针对上述问题, 提出一种基于知识图谱推理的大语言模型家谱问答系统——华谱通, 从推理逻辑完备性和信息筛选精准性两个方面, 构建适合大语言模型家谱问答的知识图谱推理框架. 在推理逻辑完备性方面, 以知识图谱作为家谱知识的载体, 并基于Jena框架提出一套完备的家谱知识推理规则, 以提升模型对家谱信息的检索召回率. 在信息筛选方面, 以家谱中的同名人物和多重亲属关系为场景, 提出基于问题-条件三元组的多条件匹配机制和基于大根堆的Dijkstra路径排序算法, 通过过滤冗余的检索信息, 达到对大语言模型精准提示的目的. 目前, 华谱通已经部署到公开的智能家谱网站——华谱网, 并通过真实的家谱数据验证了问答系统的有效性.
    7  基于异构图注意力网络的实体对齐
    孙琛琛,金钰媛,申德荣,聂铁铮,寇月
    2025, 36(11):5197-5212. DOI: 10.13328/j.cnki.jos.007371
    [摘要](1030) [HTML](718) [PDF 7.26 M](1702)
    摘要:
    实体对齐(entity alignment, EA)旨在寻找不同知识图谱(knowledge graph, KG)中等价实体. 目前, 基于嵌入的EA方法存在以下局限性. 首先, KG中的异构结构没有完全建模. 其次, 文本信息的使用受限于词嵌入. 第三, 对齐推理算法缺乏探索. 针对上述限制, 提出基于异构图注意力网络的实体对齐方法(heterogeneous graph attention network for entity alignment, HGAT-EA). HGAT-EA包括两个通道, 一个用于学习结构嵌入, 另一个用于学习字符级语义嵌入. 第1个通道采用异构图注意力网络(heterogeneous graph attention network, HGAT). HGAT充分利用了异构结构和关系三元组来学习实体嵌入. 第2个通道是利用字符级字面量来学习字符级语义嵌入. HGAT-EA通过多通道考虑多个视图, 并通过HGAT充分利用异构结构. HGAT-EA考虑了3种不同的对齐推理算法. 实验结果证明了该方法的有效性, 进一步结合实验结果对HGAT-EA的不同组件进行详细分析, 并给出相应的结论.
    8  综合实体语义和本体信息的多源中文医疗知识图谱实体对齐
    丁瑞卿,赵俊峰,王乐业
    2025, 36(11):5178-5196. DOI: 10.13328/j.cnki.jos.007370
    [摘要](1598) [HTML](1009) [PDF 5.33 M](2225)
    摘要:
    知识图谱作为结构化的知识表示形式, 在医疗领域具有广泛应用. 实体对齐, 即识别不同图谱中的等价实体, 是构建大规模知识图谱的基础步骤. 尽管已有大量研究关注此问题, 但主要集中在两个图谱的对齐任务上, 一般通过捕捉实体语义和图谱结构信息生成实体的向量表示, 之后计算向量相似度以确定等价实体. 在发现多源图谱对齐过程中存在对齐错误传递的问题的基础上, 考虑到医疗场景对实体对齐的准确性要求较高, 设计综合实体语义和本体信息的多源中文医疗知识图谱实体对齐方法(MSOI-Align). 该方法首先将多个图谱进行两两组合, 利用表示学习生成实体向量表示, 并且综合实体名称的相似度和本体一致性约束, 借助大语言模型筛选得到候选实体集合. 随后, 基于三元闭包理论结合大语言模型对候选实体集合进行自动化的对齐错误传递识别与纠正. 在4个中文医疗知识图谱上的实验结果表明, MSOI-Align方法显著提升了实体对齐任务的精确性, 与最优的基准方法相比, Hits@1指标从0.42提升至0.92. 融合后的知识图谱CMKG包含13类本体、19万实体和约70万三元组. 考虑到版权限制, 开源了受限图谱外的另外3个图谱融合的结果——OpenCMKG.
    9  基于大语言模型的事件常识知识图谱扩展方法
    黄俏娟,曹存根,王亚,王石
    2025, 36(9):4153-4186. DOI: 10.13328/j.cnki.jos.007262
    [摘要](1749) [HTML](2019) [PDF 6.72 K](2812)
    摘要:
    常识知识通常不在自然语言中明确表述, 而是隐含在人类的认知中, 为机器提供常识知识一直是人工智能领域的长期目标之一. 前期, 课题组成员手工构建了一个高精度的以事件为中心的中文种子常识知识图谱(ECKG), 包含了26 606个常识事件三元组, 覆盖了因果、时序、条件等多种常见的事件关系. 尽管种子ECKG具有一定的价值, 但规模较小, 在实际应用中发挥的作用有限, 且大规模的事件常识知识图谱在现有研究中较为稀缺. 为了应对这些挑战, 采用GPT系列的大语言模型来扩展种子ECKG中的因果、时序、条件和子事件这4种事件关系. 扩展方法包括3个主要的步骤: 首先, 将种子ECKG中的事件结合4种关系定义设计了特定的事件知识提示(ek-prompt), 并使用GPT-4-Turbo模型生成相应的事件三元组. 其次, 将种子ECKG的三元组与通过ek-prompt获取的正确三元组组合, 以构建特定的数据集, 并将GPT-3.5-Turbo模型在数据集上进行微调, 以生成更多具体的事件三元组和验证新三元组准确性. 最后, 通过分析种子ECKG事件的相似性, 并引入事件共享机制, 将相同关系下的相似事件关联的事件互相共享, 以保持相似事件的三元组一致性. 经过实验评估, 新获取的三元组具有高质量, 尤其是时序关系的三元组准确率最高, 达到了98.2%. 所提扩展方法最终为种子ECKG增补了2 433 012个常识事件三元组, 显著扩大了ECKG的规模, 可以为人工智能领域的许多应用提供了更为丰富的常识知识资源.
    10  基于相关性提示的知识图谱问答
    马杰,孙望淳,王平辉,张若非,李帅鹏,苏洲
    2025, 36(9):4056-4071. DOI: 10.13328/j.cnki.jos.007247
    [摘要](1893) [HTML](1481) [PDF 6.72 K](2610)
    摘要:
    大语言模型(large language model, LLM)随着不断发展, 在开放领域取得了出色的表现. 然而, 由于缺乏专业知识, LLM在垂直领域问答任务上效果较差. 这一问题引发了研究者的广泛关注. 现有研究通过“检索-问答”的方式, 将领域知识注入大语言模型, 以增强其性能. 然而该方式通常会检索到额外的噪声数据而导致LLM的性能损失. 为了解决该问题, 提出基于知识相关性的知识图谱问答方法. 具体而言, 将噪声数据与回答问题所需要的知识进行区分, 在“检索-相关性评估-问答”的框架下, 引导大语言模型选择合理的知识做出正确的回答. 此外, 提出一个机械领域知识图谱问答的数据集Mecha-QA, 包含传统机械制造以及增材制造两个子领域, 以推进该领域大语言模型与知识图谱问答相关的研究. 为了验证所提方法的有效性, 在Mecha-QA和航空航天领域数据集Aero-QA上进行实验. 结果表明, 该方法可以显著提升大语言模型在垂直领域知识图谱问答的性能.
    11  融合任务知识的多模态知识图谱补全
    陈强,张栋,李寿山,周国栋
    2025, 36(4):1590-1603. DOI: 10.13328/j.cnki.jos.007213
    [摘要](2974) [HTML](1538) [PDF 6.26 M](4099)
    摘要:
    知识图谱补全任务旨在根据已有的事实三元组(头实体、关系、尾实体)来挖掘知识图谱中缺失的事实三元组. 现有的研究工作主要致力于利用知识图谱中的结构信息来进行知识图谱补全任务. 然而, 这些工作忽略了知识图谱中蕴含的其他模态的信息也可能对知识图谱补全有帮助. 并且, 由于基于特定任务的知识通常没有被注入通用的预训练模型, 因而如何在抽取模态信息的过程中融合任务的相关知识变得至关重要. 此外, 因为不同模态特征对于知识图谱补全的贡献不一样, 所以如何有效地保留有用的多模态信息也是一大挑战. 为了解决上述问题, 提出一种融合任务知识的多模态知识图谱补全方法. 利用在当前任务上微调过的多模态编码器, 来获取不同模态下的实体向量表示. 并且, 通过一个基于循环神经网络的模态融合过滤模块, 去除与任务无关的多模态特征. 最后, 利用同构图网络表征并更新所有特征, 从而有效地完成多模态知识图谱补全任务. 实验结果表明, 所提出的方法能有效地抽取不同模态的信息, 并且能够通过进一步的多模态过滤融合来增强实体的表征能力, 进而提高多模态知识图谱补全任务的性能.
    12  融合大规模医学事实的跨语言双层知识图谱
    王楚童,李明达,孙孟轩,王静,杨雪冰,牛景昊,贺志阳,张文生
    2025, 36(3):1240-1253. DOI: 10.13328/j.cnki.jos.007173
    [摘要](2209) [HTML](2480) [PDF 8.22 M](4608)
    摘要:
    得益于信息化技术的快速发展和医疗信息系统的普及, 医学数据库中积淀了海量的医学事实, 如患者临床诊疗事件以及医学专家共识等. 如何从医学事实中提炼出知识, 进而对其管理和合理利用, 是推进诊疗自动化和智能化的关键. 知识图谱作为一种新型的知识表示工具, 能够有效地挖掘和组织大规模医学事实中的信息, 受到医疗领域从业人员的广泛关注. 然而, 现有医疗知识图谱普遍存在规模小、限制多、可扩展性差等问题, 面向医学事实的知识表达能力有限. 为此, 提出一种双层医疗知识图谱架构, 通过对英文患者诊疗事件和中文专家共识进行信息抽取, 构建得到一个跨语言、多模态、动态更新、可拓展性强的10亿级医疗知识图谱, 可提供更加精准的智能医疗服务.
    13  面向电子商务社交知识图谱高效增量预训练的双向模仿蒸馏
    朱渝珊,张文,王晓珂,李志宇,陈名杨,姚祯,陈辉,陈华钧
    2025, 36(3):1218-1239. DOI: 10.13328/j.cnki.jos.007170
    [摘要](1067) [HTML](1688) [PDF 10.60 M](3422)
    摘要:
    知识图谱(knowledge graph, KG)预训练模型有助于电子商务应用中各种下游任务, 然而, 对于具有高动态性的大规模电商社交知识图谱来说, 预训练模型需要及时更新以感知由用户交互引起的节点特征变化. 提出一种针对电商社交知识图谱预训练模型的高效增量学习方法, 该方法通过基于双向模仿蒸馏的训练策略充分挖掘不同样本对模型更新的作用, 并通过基于样本常规性和反常性的采样策略来减少训练数据规模, 提升模型更新效率. 此外, 还提出一种逆重放机制, 为社交知识图谱预训练模型的增量训练生成高质量的负样本. 在真实的电子商务数据集和相关下游任务上的实验结果表明, 相较于最先进的方法, 所提方法可以更有效且高效地增量更新社交知识图谱预训练模型.
    14  开源软件供应链漏洞威胁智能感知
    王丽敏,吴敬征,武延军,芮志清,罗天悦,屈晟,杨牧天
    2025, 36(2):511-536. DOI: 10.13328/j.cnki.jos.007163
    [摘要](2498) [HTML](1815) [PDF 10.94 M](2473)
    摘要:
    开源软件的繁荣推动了软件领域的蓬勃发展, 也促使以开源软件为基础的供应链开发模式的形成. 开源软件供应链本质上是个复杂的供应链拓扑网络, 由开源生态的关键元素及其关联关系构成, 其产品全球化等优势有助于提高软件行业的开发效率. 然而, 开源软件供应链也存在依赖关系复杂、传播范围广泛、攻击面暴露扩大等特点, 带来了新的安全风险. 现有的以安全漏洞、威胁情报为基础的安全管理虽然可以实现安全预警、预先防御, 但是由于漏洞威胁信息获取不及时、缺少攻击技术和缓解措施等信息, 严重影响了漏洞处理效率. 针对上述问题, 设计并实现一种针对开源软件供应链的漏洞威胁智能感知方法, 包括两部分: 1)构建CTI (网络威胁情报)知识图谱, 在其构建的过程中使用到相关技术, 可以实现安全情报的实时分析与处理, 尤其提出SecERNIE模型以及软件包命名矩阵, 分别缓解漏洞威胁关联挖掘的问题和开源软件别名的问题. 2)漏洞风险信息推送, 以软件包命名矩阵为基础, 构建软件包过滤规则, 实现开源系统漏洞实时过滤与推送. 通过实验验证所提方法的有效性和可用性. 实验结果显示, 相较于NVD等传统漏洞平台, 本方法平均感知时间最高提前90.03天; 在操作系统软件覆盖率上提升74.37%, 并利用SecERNIE模型实现63492个CVE漏洞与攻击技术实体之间的关联关系映射. 特别地, 针对openEuler操作系统, 可追踪的系统软件覆盖率达到92.76%, 并累计感知6239个安全漏洞; 同时, 还发现openEuler中891条漏洞与攻击的关联关系, 进而获取到相应的解决方案, 为漏洞处理提供了参考依据. 在真实攻击环境验证2种典型的攻击场景, 证明所提方法在漏洞威胁感知方面的良好的效果.
    15  基于扩散概率分布的时序知识图谱推理
    周光有,李鹏飞,谢鹏辉,罗昌银
    2024, 35(11):5083-5097. DOI: 10.13328/j.cnki.jos.007002
    [摘要](1805) [HTML](1961) [PDF 3.04 M](4376)
    摘要:
    时序知识图谱推理旨在补充知识图谱中缺失的链接(事实), 其中每个事实都与时间戳进行绑定. 基于变分自动编码器的动态变分框架在这项任务中显示出独特的优势. 通过将实体和关系基于高斯分布进行联合建模, 该方法不仅具备很强的可解释性, 而且解决了复杂的概率分布问题. 然而, 传统的变分自动编码器方法在训练过程中容易出现过拟合问题, 从而不能精确捕捉实体语义的演化过程. 为了解决这个问题, 提出基于扩散概率分布的时序知识图谱推理模型. 具体来讲, 建立一个双向的迭代过程, 将实体语义建模过程分为多个子模块. 其中, 每个子模块通过一个正向的加噪变换和反向的高斯采样组成, 负责建模实体语义的一个微小演变过程. 相对基于变分自动编码器的方法, 通过多个子模块联合建模显示地学习度量空间中实体语义随时间的动态表示, 能够得到更为精确的建模. 与基于变分自动编码器的方法相比, 对于评估指标 $ MRR $, 模型在Yago11k数据集和Wikidata12k数据集分别提高4.18%和1.87%, 在ICEWS14和ICEWS05-15数据集上分别提高1.63%和2.48%.
    16  时序知识图谱表示与推理的研究进展与趋势
    王俞涵,陈子阳,赵翔,谭真,肖卫东,程学旗
    2024, 35(8):3923-3951. DOI: 10.13328/j.cnki.jos.007093
    [摘要](3751) [HTML](3959) [PDF 91.23 K](7699)
    摘要:
    知识图谱作为近年来人工智能领域的一大热点研究方向, 已应用于现实中多个领域. 但是随着知识图谱应用场景日益多样化, 人们逐渐发现不随着时间改变而更新的静态知识图谱不能完全适应知识高频更新的场景. 为此, 研究者们提出时序知识图谱的概念, 一种包含时间信息的知识图谱. 对现有所有时序知识图谱表示与推理模型进行整理, 并归纳和建立一个表示与推理模型理论框架. 然后基于此对当前时序表示推理研究进展进行简要介绍分析和未来趋势预测, 以期望帮助研究者开发设计出更为优异的模型.
    17  基于知识图谱的跨项目安全缺陷报告预测方法
    郑炜,刘程远,吴潇雪,陈翔,成婧源,孙小兵,孙瑞阳
    2024, 35(3):1257-1279. DOI: 10.13328/j.cnki.jos.006812
    [摘要](2108) [HTML](3023) [PDF 9.98 M](4079)
    摘要:
    安全缺陷报告可以描述软件产品中的安全关键漏洞.为了消除软件产品的安全攻击风险,安全缺陷报告(security bug report,SBR)预测越来越受到研究人员的关注.但在实际软件开发场景中,需要进行软件安全漏洞预测的项目可能是来自新公司或属于新启动的项目,没有足够的已标记安全缺陷报告供在实践中构建此软件安全漏洞预测模型.一种简单的解决方案就是使用迁移模型,即利用其他项目已经标记过的数据来构建预测模型.受到该领域最近的两项研究工作的启发,以安全关键字过滤为思路提出一种融合知识图谱的跨项目安全缺陷报告预测方法KG-SBRP (knowledge graph of security bug report prediction).使用安全缺陷报告中的文本信息域结合CWE (common weakness enumeration)与CVE Details (common vulnerabilities and exposures)共同构建三元组规则实体,以三元组规则实体构建安全漏洞知识图谱,在图谱中结合实体及其关系识别安全缺陷报告.将数据分为训练集和测试集进行模型拟合和性能评估.所构建的模型在7个不同规模的安全缺陷报告数据集上展开实证研究,研究结果表明,所提方法与当前主流方法FARSEC和Keyword matrix相比,在跨项目安全缺陷报告预测场景下,性能指标F1-score值可以平均提高11%,除此之外,在项目内安全缺陷报告预测场景下,F1-score值同样可以平均提高30%.
    18  面向链接预测的知识图谱表示学习方法综述
    杜雪盈,刘名威,沈立炜,彭鑫
    2024, 35(1):87-117. DOI: 10.13328/j.cnki.jos.006902
    [摘要](4237) [HTML](5100) [PDF 8.85 M](7658)
    摘要:
    作为人工智能的重要基石, 知识图谱能够从互联网海量数据中抽取并表达先验知识, 极大程度解决了智能系统认知决策可解释性差的瓶颈问题, 对智能系统的构建与应用起关键作用. 随着知识图谱技术应用的不断深化, 旨在解决图谱欠完整性问题的知识图谱补全工作迫在眉睫. 链接预测是针对知识图谱中缺失的实体与关系进行预测的任务, 是知识图谱构建与补全中不可或缺的一环. 要充分挖掘知识图谱中的隐藏关系, 利用海量的实体与关系进行计算, 就需要将符号化表示的信息转换为数值形式, 即进行知识图谱表示学习. 基于此, 面向链接预测的知识图谱表示学习成为知识图谱领域的研究热点. 从链接预测与表示学习的基本概念出发, 系统性地介绍面向链接预测的知识图谱表示学习方法最新研究进展. 具体从知识表示形式、算法建模方式两种维度对研究进展进行详细论述. 以知识表示形式的发展历程为线索, 分别介绍二元关系、多元关系和超关系知识表示形式下链接预测任务的数学建模. 基于表示学习建模方式, 将现有方法细化为4类模型: 平移距离模型、张量分解模型、传统神经网络模型和图神经网络模型, 并详细描述每类模型的实现方式与解决不同关系元数链接预测任务的代表模型. 在介绍链接预测的常用的数据集与评判标准基础上, 分别对比分析二元关系、多元关系和超关系3类知识表示形式下, 4类知识表示学习模型的链接预测效果, 并从模型优化、知识表示形式和问题作用域3个方面展望未来发展趋势.
    19  基于知识图谱全局和局部特征的复杂问答方法
    陈跃鹤,贾永辉,谈川源,陈文亮,张民
    2023, 34(12):5614-5628. DOI: 10.13328/j.cnki.jos.006799
    [摘要](1461) [HTML](3505) [PDF 7.74 M](4587)
    摘要:
    近年来, 研究者已经提出多种方法来解决知识库问答(KBQA)中的复杂问题, 并取得一定成果. 然而, 由于语义构成的复杂性以及可能存在推理路径的缺失, 复杂问题的求解效果依然不佳. 为了更好地解决这类问题, 提出基于知识图谱全局和局部特征的问答方法——CGL-KBQA. 所提方法利用知识嵌入技术提取知识图谱整体的拓扑结构和语义特征作为候选实体节点的全局特征, 根据实体表示和问句表示将复杂问答建模为复合的三元组分类任务. 同时, 将图谱在搜索过程生成的核心推导路径作为局部特征, 结合问句的语义相似性来构建候选实体不同维度特征, 最终形成混合特征评分器. 由于最终推理路径可能缺失, 采用基于无监督的多重聚类方法设计了聚类器模块, 进而根据候选实体的两类特征表示直接生成最终答案簇, 这使得非完全知识图谱问答成为可能. 实验结果表明, 所提方法在两个常见KBQA数据集上均取得不错的效果, 特别是在图谱知识不完全的情况下也具备非常好的效果.
    20  面向知识图谱约束问答的强化学习推理技术
    毕鑫,聂豪杰,赵相国,袁野,王国仁
    2023, 34(10):4565-4583. DOI: 10.13328/j.cnki.jos.006889
    [摘要](3260) [HTML](4815) [PDF 2.42 M](6025)
    摘要:
    知识图谱问答任务通过问题分析与知识图谱推理,将问题的精准答案返回给用户,现已被广泛应用于智能搜索、个性化推荐等智慧信息服务中.考虑到关系监督学习方法人工标注的高昂代价,学者们开始采用强化学习等弱监督学习方法设计知识图谱问答模型.然而,面对带有约束的复杂问题,现有方法面临两大挑战:(1)多跳长路径推理导致奖励稀疏与延迟;(2)难以处理约束问题推理路径分支.针对上述挑战,设计了融合约束信息的奖励函数,能够解决弱监督学习面临的奖励稀疏与延迟问题;设计了基于强化学习的约束路径推理模型COPAR,提出了基于注意力机制的动作选择策略与基于约束的实体选择策略,能够依据问题约束信息选择关系及实体,缩减推理搜索空间,解决了推理路径分支问题.此外,提出了歧义约束处理策略,有效解决了推理路径歧义问题.采用知识图谱问答基准数据集对COPAR的性能进行了验证和对比.实验结果表明:与现有先进方法相比,在多跳数据集上性能相对提升了2%-7%,在约束数据集上性能均优于对比模型,准确率提升7.8%以上.
    21  FS-Net: 面向时序知识图谱推理的频次统计网络
    刘康正,赵峰,金海
    2023, 34(10):4518-4532. DOI: 10.13328/j.cnki.jos.006885
    [摘要](2673) [HTML](4449) [PDF 2.96 M](5900)
    摘要:
    时序知识图谱推理吸引了研究人员的极大关注.现有的时序知识图谱推理技术通过建模历史信息取得了巨大的进步.但是,时变性问题和不可见实体(关系)问题仍然是阻碍时序知识图谱推理模型性能进一步提升的两大挑战;而且由于需要对历史子图序列的结构信息和时间依赖信息进行建模,传统的基于嵌入的方法往往在训练和预测过程中具有较高的时间消耗,这极大地限制了推理模型在现实场景中的应用.针对以上困境,提出了一个用于时序知识图谱推理的频次统计网络,FS-Net.一方面,FS-Net不断基于最新的短期历史的事实频次统计,动态地为变化的时间戳上的预测生成时变的得分;另一方面,FS-Net基于当前时间戳上的事实频次统计,为预测补充历史不可见实体(关系);特别地,FS-Net不需要进行训练,而且具有极高的时间效率.在两个时序知识图谱基准数据集上的大量实验,表明了FS-Net相较于基准模型的巨大提升.
    22  基于链接实体回放的多源知识图谱终身表示学习
    孙泽群,崔员宁,胡伟
    2023, 34(10):4501-4517. DOI: 10.13328/j.cnki.jos.006887
    [摘要](2500) [HTML](4611) [PDF 2.88 M](5703)
    摘要:
    知识图谱存储大量的结构化知识和丰富的语义信息,已被广泛应用于知识驱动的智能软件.随着智能应用的不断发展,它们对知识图谱的需求也在发生变化.而单一知识图谱往往具有数据不完备等缺点,难以满足需求.因此,支持新数据来源、融合多源知识已成为迫切需求.传统的知识图谱表示学习和应用范式只考虑单一图谱,忽视了不同图谱间的知识迁移.多源知识图谱联合训练虽然可以带来性能提升,但不支持新增知识图谱的拓展表示学习.鉴于此,提出了多源知识图谱终身表示学习的新范式.给定一个知识图谱序列,终身表示学习的目标是在学习新知识图谱的同时,从已学习的知识图谱与模型中获得知识迁移.为实现这一目标,提出了一个基于链接实体回放的多源知识图谱终身表示学习框架.首先,设计了一个以Transformer为编码器的知识图谱表示学习模型作为框架核心,利用关系相关性进行实体的链接预测;其次,提出了链接子图构造方法,基于实体对齐构建并回放新增知识图谱和已有知识图谱之间的链接子图进行终身学习和知识迁移;最后,采用动态结构方法,为每个知识图谱存储相应的模型参数快照来避免灾难性遗忘.多个链接预测基准数据集上的实验结果表明:所提出的表示学习模型可以取得最先进的性能,且提出的终身表示学习框架可以实现有效的知识迁移.
    23  QA-KGNet: 一种语言模型驱动的知识图谱问答模型
    乔少杰,杨国平,于泳,韩楠,覃晓,屈露露,冉黎琼,李贺
    2023, 34(10):4584-4600. DOI: 10.13328/j.cnki.jos.006882
    [摘要](3462) [HTML](6011) [PDF 2.30 M](6199)
    摘要:
    基于知识图谱的问答系统可以解析用户问题,已成为一种检索知识、自动回答所询问题的有效途径.知识图谱问答系统通常是利用神经程序归纳模型,将自然语言问题转化为逻辑形式,在知识图谱上执行该逻辑形式能够得到答案.然而,使用预训练语言模型和知识图谱的知识问答系统包含两个挑战:(1)给定问答(question-answering,QA)上下文,需要从大型知识图谱(knowledge graph,KG)中识别相关知识;(2)对QA上下文和KG进行联合推理.基于此,提出一种语言模型驱动的知识图谱问答推理模型QA-KGNet,将QA上下文和KG连接起来形成一个工作图,使用语言模型计算给定QA上下文节点与KG节点的关联度,并使用多头图注意力网络更新节点表示.在CommonsenseQA、OpenBookQA和MedQA-USMLE真实数据集上进行实验来评估QA-KGNet的性能,实验结果表明:QA-KGNet优于现有的基准模型,表现出优越的结构化推理能力.
    24  知识赋能的新一代信息系统研究现状、发展与挑战
    朱迪,张博闻,程雅琪,刘昕悦,吴文隆,王铁鑫,文浩,李博涵
    2023, 34(10):4439-4462. DOI: 10.13328/j.cnki.jos.006884
    [摘要](3382) [HTML](6033) [PDF 3.27 M](9058)
    摘要:
    信息系统的发展目前正处于感知智能迈向认知智能的关键阶段,传统信息系统难以满足发展要求,数字化转型势在必行.数字线索(digital thread)是面向全生命周期的数据处理框架,通过连接生命周期的各阶段数据,实现物理世界与数字空间的映射与分析.知识图谱(knowledge graph)是结构化的语义知识库,以符号形式描述物理世界中的概念及其相互关系,通过知识驱动形成体系化的构建与推理流程.两者对知识赋能的信息系统研究具有重要意义.综述了知识赋能的新一代信息系统的研究现状、发展与挑战.首先,从数字线索系统出发,介绍数字线索的概念和发展,分析数字线索的六维数据构成和6个数据处理阶段;然后介绍知识图谱系统,给出普遍认同的知识图谱的定义和发展,概括知识图谱的架构与方法;最后,分析和探索数字线索与知识图谱结合的方向,列举KG4DT (knowledge graph for digital thread)和DT4KG (digital thread for knowledge graph)的受益方向,对未来知识赋能的新一代信息系统提出开放问题.
    25  面向文本描述的CPS资源能力知识图谱构建
    李正洁,沈立炜,李弋,彭鑫
    2023, 34(5):2268-2285. DOI: 10.13328/j.cnki.jos.006410
    [摘要](2259) [HTML](2958) [PDF 6.70 M](5179)
    摘要:
    信息物理融合系统(cyber-physical system,CPS)在社会生活中发挥越来越广泛的作用.CPS资源的按需编排建立在CPS资源的软件定义基础上,软件接口的定义则依赖对CPS资源能力的充分描述.目前,CPS领域内缺少一个能规范表示资源及其能力的知识库和构建该知识库的有效方法.面向CPS资源的文本描述,提出构建CPS资源能力知识图谱并设计一种自底向上的自动构建方法.给定资源,所提方法先从其代码和文档中提取资源能力的文本描述信息,并基于预定义的表示模式生成规范化表示的能力短语.然后,基于动宾结构的关键成分对能力短语进行划分、聚合与抽象,生成不同类型资源的能力层次化抽象描述.最后,构建资源能力知识图谱.面向Home Assistant平台,构建了包含32个资源类别、957个资源能力的知识图谱.图谱构建实验从不同维度对比分析了手工构建和所提方法自动构建的结果.实验表明,所提方法为CPS资源能力知识图谱的自动化构建提供可行途径,有助于减少人工构建工作量,补充CPS领域内资源服务与能力的描述,并提高图谱的知识完备性.
    26  面向关系型数据与知识图谱的数据集成技术综述
    高云君,葛丛丛,郭宇翔,陈璐
    2023, 34(5):2365-2391. DOI: 10.13328/j.cnki.jos.006808
    [摘要](3754) [HTML](8743) [PDF 7.38 M](11375)
    摘要:
    目前,各个国家和地区均已将大数据视为重要的战略资源.然而,大数据时代普遍存在数据流通困难、数据监管不足等问题,致使数据孤岛现象严重,数据质量低下,数据要素潜能难以释放.这驱使研究人员探索数据集成技术,以打破数据壁垒、实现信息共享、提升数据质量,进而激活数据要素潜能.关系型数据和知识图谱作为两种至关重要的数据组织与存储形式,在现实生活中应用广泛.为此,聚焦关系型数据和知识图谱,归纳总结并分析实体解析、数据融合、数据清洗3方面的数据集成关键技术,最后展望未来研究方向与趋势.
    27  知识图谱嵌入技术研究综述
    张天成,田雪,孙相会,于明鹤,孙艳红,于戈
    2023, 34(1):277-311. DOI: 10.13328/j.cnki.jos.006429
    [摘要](9369) [HTML](8292) [PDF 5.78 M](14894)
    摘要:
    知识图谱(KG)是一种用图模型来描述知识和建模事物之间关联关系的技术. 知识图谱嵌入(KGE)作为一种被广泛采用的知识表示方法, 其主要思想是将知识图谱中的实体和关系嵌入到连续的向量空间中, 用来简化操作, 同时保留KG的固有结构. 可以使得多种下游任务受益, 例如KG补全和关系提取等. 首先对现有的知识图谱嵌入技术进行全面回顾, 不仅包括使用KG中观察到的事实进行嵌入的技术, 还包括添加时间维度的动态KG嵌入方法, 以及融合多源信息的KG嵌入技术. 对相关模型从实体嵌入、关系嵌入、评分函数等方面进行分析、对比与总结. 然后简要介绍KG嵌入技术在下游任务中的典型应用, 包括问答系统、推荐系统和关系提取等. 最后阐述知识图谱嵌入面临的挑战, 对未来的研究方向进行展望.
    28  FactChain:一个基于区块链的众包知识融合系统
    朱向荣,吴鸿祜,胡伟
    2022, 33(10):3546-3564. DOI: 10.13328/j.cnki.jos.006627
    [摘要](3267) [HTML](5445) [PDF 2.44 M](6759)
    摘要:
    知识图谱作为诸多人工智能应用的关键,受到学术界和工业界的广泛关注.当前的知识图谱一般由特定组织构建并维护,以RDF转储文件或SPARQL查询接口的方式提供知识访问服务,这种中心化的管理方式存在不能持久化访问的弊端.具体来说,一旦服务提供者单点崩溃,用户就无法以可靠的方式获取知识.此外,知识因时效性可能需要更新,不同来源的知识之间可能存在冲突,传统的知识图谱构建维护方式难以有效地处理这些问题.区块链技术以其分布式存储与共识机制,为知识图谱的分布式构建与管理提供了新思路.FactChain是一个基于区块链的知识管理系统,具有为知识的多源共享与融合建立全新的去中心化生态的潜力.使用联盟链作为底层架构,由区块链、组织和参与人这3层结构组成.通过区块链上的智能合约编程实现融合多源冲突知识的真值验证算法,具有在组织层面实现并部署基于分布式应用的参与人管理、在本地局部本体与全局共享本体间建立映射以及结合链上与链下数据响应参与人查询请求等功能.
    29  融合知识感知与双重注意力的短文本分类模型
    李博涵,向宇轩,封顶,何志超,吴佳骏,戴天伦,李静
    2022, 33(10):3565-3581. DOI: 10.13328/j.cnki.jos.006630
    [摘要](3364) [HTML](4645) [PDF 2.26 M](6784)
    摘要:
    文本分类任务作为文本挖掘的核心问题,已成为自然语言处理领域的一个重要课题.而短文本分类由于稀疏性、实时性和不规范性等特点,已成为文本分类亟待解决的问题之一.在某些特定场景,短文本存在大量隐含语义,由此给挖掘有限文本内的隐含语义特征等任务带来挑战.已有的方法对短文本分类主要采用传统机器学习或深度学习算法,但该类算法的模型构建复杂且工作量大,效率不高.此外,短文本包含有效信息较少且口语化严重,对模型的特征学习能力要求较高.针对以上问题,提出了KAeRCNN模型,该模型在TextRCNN模型的基础上,融合了知识感知与双重注意力机制.知识感知包含了知识图谱实体链接和知识图谱嵌入,可以引入外部知识以获取语义特征,同时,双重注意力机制可以提高模型对短文本中有效信息提取的效率.实验结果表明,KAeRCNN模型在分类准确度、F1值和实际应用效果等方面显著优于传统的机器学习算法.对算法的性能和适应性进行了验证,准确率达到95.54%,F1值达到0.901,对比4种传统机器学习算法,准确率平均提高了约14%,F1值提升了约13%.与TextRCNN相比,KAeRCNN模型在准确性方面提升了约3%.此外,与深度学习算法的对比实验结果也说明,该模型在其他领域的短文本分类中也有较好的表现.理论和实验结果都证明,所提出的KAeRCNN模型对短文本分类效果更优.
    30  知识图谱可解释推理研究综述
    侯中妮,靳小龙,陈剑赟,官赛萍,王元卓,程学旗
    2022, 33(12):4644-4667. DOI: 10.13328/j.cnki.jos.006522
    [摘要](6137) [HTML](9117) [PDF 24.22 M](10728)
    摘要:
    面向知识图谱的知识推理旨在通过已有的知识图谱事实,去推断新的事实,进而实现知识库的补全.近年来,尽管基于分布式表示学习的方法在推理任务上取得了巨大的成功,但是他们的黑盒属性使得模型无法为预测出的事实做出解释.所以,如何设计用户可理解、可信赖的推理模型成为了人们关注的问题.从可解释性的基本概念出发,系统梳理了面向知识图谱的可解释知识推理的相关工作,具体介绍了事前可解释推理模型和事后可解释推理模型的研究进展;根据可解释范围的大小,将事前可解释推理模型进一步细分为全局可解释的推理和局部可解释的推理;在事后解释模型中,回顾了推理模型的代表方法,并详细介绍提供事后解释的两类解释方法.此外,还总结了可解释知识推理在医疗、金融领域的应用.随后,对可解释知识推理的现状进行概述,最后展望了可解释知识推理的未来发展方向,以期进一步推动可解释推理的发展和应用.
    31  面向知识图谱的图嵌入学习研究进展
    杨东华,何涛,王宏志,王金宝
    2022, 33(9):3370-3390. DOI: 10.13328/j.cnki.jos.006426
    [摘要](4512) [HTML](6310) [PDF 8.84 M](9295)
    摘要:
    知识图谱是一种用网络结构存储知识的知识库, 在知识图谱中, 单条知识被表示成三元组的形式, 即(头实体, 关系, 尾实体). 得力于知识图谱在各个领域的广泛应用, 面向知识图谱的图嵌入学习也得到越来越多研究人员的关注. 面向知识图谱的图嵌入学习任务旨在为图谱中的实体与关系学习低维且稠密的向量, 通过图嵌入向量表达实体与关系的语义信息以及度量实体之间、关系之间、实体与关系之间的语义联系, 已有许多研究证明图嵌入模型在下游任务中的有效性. 近年来, 越来越多研究人员开始关注知识图谱的图嵌入学习, 并取得大量的研究成果, 尝试将图嵌入算法分成了基于转移思想、基于张量分解、基于传统深度学习模型、基于图神经网络以及融入额外信息的图嵌入学习共5大类, 梳理、介绍各类图嵌入算法的设计思路、算法特征以及优缺点, 以帮助指导初步接触该领域的研究人员快速学习了解该研究领域的相关模型和算法.
    32  基于互联网群体智能的知识图谱构造方法
    蒋逸,张伟,王佩,张馨月,梅宏
    2022, 33(7):2646-2666. DOI: 10.13328/j.cnki.jos.006313
    [摘要](4206) [HTML](3706) [PDF 2.44 M](7140)
    摘要:
    知识图谱是一种基于图的结构化知识表示方式.如何构造大规模高质量的知识图谱,是研究和实践面临的一个重要问题.提出了一种基于互联网群体智能的协同式知识图谱构造方法.该方法的核心是一个持续运行的回路,其中包含自由探索、自动融合、主动反馈3个活动.在自由探索活动中,每一参与者独立进行知识图谱的构造活动.在自动融合活动中,所有参与者的个体知识图谱被实时融合在一起,形成群体知识图谱.在主动反馈活动中,支撑环境根据每一参与者的个体知识图谱和当前时刻的群体知识图谱,向该参与者推荐特定的知识图谱片段信息,以提高其构造知识图谱的效率.针对这3个活动,建立了一种层次式的个体知识图谱表示机制,提出了一种以最小化广义熵为目标的个体知识图谱融合算法,设计了情境无关和情境相关两种类型的信息反馈方式.为了验证所提方法及关键技术的可行性,设计并实施了3种类型的实验:仅包含结构信息的仿真图融合实验、大规模真实知识图谱的融合实验,以及真实知识图谱的协同式构造实验.实验结果表明,该知识图谱融合算法能够有效利用知识图谱的结构信息以及节点的语义信息,形成高质量的知识图谱融合方案;基于“探索-融合-反馈”回路的协同方法能够提升群体构造知识图谱的规模和个体构造知识图谱的效率,并展现出较好的群体规模可扩展性.
    33  基于知识协同微调的低资源知识图谱补全方法
    张宁豫,谢辛,陈想,邓淑敏,叶宏彬,陈华钧
    2022, 33(10):3531-3545. DOI: 10.13328/j.cnki.jos.006628
    [摘要](4165) [HTML](5791) [PDF 2.03 M](7570)
    摘要:
    知识图谱补全能让知识图谱变得更加完整.现有的知识图谱补全工作大多会假设知识图谱中的实体或关系有充足的三元组实例.然而,在通用领域,存在大量长尾三元组;在垂直领域,较难获得大量高质量的标注数据.针对这一问题,提出了一种基于知识协同微调的低资源知识图谱补全方法.通过已有的结构化知识来构造初始的知识图谱补全提示,并提出一种协同微调算法来学习最优的模板、标签和模型的参数.所提方法同时利用了知识图谱中的显式结构化知识和语言模型中的隐式事实知识,且可以同时应用于链接预测和关系抽取两种任务.实验结果表明,该方法在3个知识图谱推理数据集和5个关系抽取数据集上都取得了目前最优的性能.
    34  一种结合层次化类别信息的知识图谱表示学习方法
    张金斗,李京
    2022, 33(9):3331-3346. DOI: 10.13328/j.cnki.jos.006295
    [摘要](1921) [HTML](2965) [PDF 4.26 M](3858)
    摘要:
    知识图谱表示学习方法旨在将知识图谱中的实体和关系嵌入到低维连续的向量空间. 由于知识图谱本身具有数据稀疏性的问题导致学习出的向量表示性能欠缺. 实体的类别信息包含了丰富的语义, 引入它能够更好地指导向量表示的学习. 已有结合类别信息的表示学习方法要么不支持类别信息的层次化结构或者关系的类别约束, 要么对层次化结构的建模过于复杂. 提出一种结合层次化类别信息的表示学习方法. 我们将类别嵌入到不同的向量空间, 使用偏序关系建模类别的层次化结构. 同时, 将实体向量表示映射到类别向量空间中, 要求实体与其所属类别满足偏序关系, 且三元组的实体与其关系的类别约束也满足偏序关系. 最后, 在多个数据集上执行链接预测、三元组分类和实体分类任务的实验结果表明我们的方法相比其他基线方法学习出的向量表示性能更好.
    35  基于软件知识图谱的代码语义标签自动生成方法
    邢双双,刘名威,彭鑫
    2022, 33(11):4027-4045. DOI: 10.13328/j.cnki.jos.006369
    [摘要](3341) [HTML](7052) [PDF 2.93 M](5855)
    摘要:
    开源及企业软件项目和各类软件开发网站上的代码片段是重要的软件开发资源.然而,很多开发者代码搜索需求反映的代码的高层意图和主题难以通过基于代码文本的信息检索技术来实现精准的代码搜索.因此,反映代码整体意图和主题的语义标签对于改进代码搜索、辅助代码理解都具有十分重要的作用.现有的标签生成技术主要面向文本内容或依赖于历史数据,无法满足大范围代码语义标注和辅助搜索、理解的需要.针对这一问题,提出了一种基于知识图谱的代码语义标签自动生成方法KGCodeTagger.该方法通过基于API文档和软件开发问答文本的概念和关系抽取构造软件知识图谱,作为代码语义标签生成的基础.针对给定的代码,该方法识别并抽取出通用API调用或概念提及,并链接到软件知识图谱中的相关概念上.在此基础上,该方法进一步识别与所链接的概念相关的其他概念作为候选,然后按照多样性和代表性排序,产生最终的代码语义标签.通过实验对KGCodeTagger软件知识图谱构建的各个步骤进行了评估,并通过与几个已有的基准方法的比较,对所生成的代码语义标签质量进行了评估.实验结果表明,KGCodeTagger的软件知识图谱构建步骤是合理有效的,该方法所生成的代码语义标签是高质量、有意义的,能够帮助开发人员快速理解代码的意图.
    36  KGDB:统一模型和语言的知识图谱数据库管理系统
    刘宝珠,王鑫,柳鹏凯,李思卓,张小旺,杨雅君
    2021, 32(3):781-804. DOI: 10.13328/j.cnki.jos.006181
    [摘要](4514) [HTML](5230) [PDF 2.32 M](9882)
    摘要:
    知识图谱是人工智能的重要基石,其目前主要有RDF图和属性图两种数据模型,在这两种数据模型之上有数种查询语言.RDF图上的查询语言为SPARQL,属性图上的查询语言主要为Cypher.10年来,各个社区开发了分别针对RDF图和属性图的不同数据管理方法,不统一的数据模型和查询语言限制了知识图谱的更广泛应用.KGDB(knowledge graph database)是统一模型和语言的知识图谱数据库管理系统:(1)以关系模型为基础,提出了统一的存储方案,支持RDF图和属性图的高效存储,满足知识图谱数据存储和查询负载的需求;(2)使用基于特征集的聚类方法解决无类型实体的存储问题;(3)实现了SPARQL和Cypher两种不同知识图谱查询语言的互操作性,使其能够操作同一个知识图谱.在真实数据集与合成数据集上进行的大量实验表明:KGDB与已有的知识图谱数据库管理系统相比,不仅能够提供更加高效的存储管理,而且具有更高的查询效率.KGDB平均比gStore和Neo4j节省了30%的存储空间,基本图模式查询上的实验表明:在真实数据集上的查询速度普遍高于gStore和Neo4j,最快可提高2个数量级.
    37  面向操作系统可靠性保障的开源软件供应链
    梁冠宇,武延军,吴敬征,赵琛
    2020, 31(10):3056-3073. DOI: 10.13328/j.cnki.jos.006070
    [摘要](4487) [HTML](5367) [PDF 1.83 M](8489)
    摘要:
    软件可靠性是软件工程领域中的研究热点之一,故障率分析是软件可靠性的典型研究方法.然而,软件构建模式已从单体模式演进到以开源软件为代表的规模化协作模式,操作系统作为代表性产物之一,所含开源软件之间通过组合关系和依赖关系,形成了一个包含上万节点的供应关系网络.典型方法缺乏对供应关系的考量,无法准确识别和评估因此而引入的软件可靠性问题.把供应链概念体系拓展到开源软件领域,提出一种基于知识的面向开源协作模式下软件供应可靠性的管理方法:面向开源软件生态进行本体设计,构建开源软件知识图谱,实现知识的提取、存储和管理,以知识为驱动,结合传统的供应链管理方法,提出一组面向开源软件供应链的可靠性管理方法,构成一套开源软件供应链管理系统.实验以Linux操作系统发行版的构建为例,展示了开源软件供应链对操作系统可靠性的支撑能力.结果表明,开源软件供应链将有助于理清和评估大型复杂系统软件的可靠性风险.
    38  代码知识图谱构建及智能化软件开发方法研究
    王飞 刘井平 刘斌 钱铁云 肖仰华 彭智勇
    2020, 31(1):47-66. DOI: 10.13328/j.cnki.jos.005893
    [摘要](7932) [HTML](8449) [PDF 1.88 M](14156)
    摘要:
    智能化软件开发正在经历从简单的代码检索到语义赋能的代码自动生成的转变,传统的语义表达方式无法有效地支撑人、机器和代码之间的语义交互,探索机器可理解的语义表达机制迫在眉睫.首先指出了代码知识图谱是实现智能化软件开发的基础,进而分析了大数据时代智能化软件开发的新特点以及基于代码知识图谱进行智能化软件开发的新挑战;随后回顾了智能化软件开发和代码知识图谱的研究现状,指出了现有智能化软件开发的研究仍然处于较低水平,而现有知识图谱的研究主要面向开放领域知识图谱,无法直接应用于代码领域知识图谱.因此,从代码知识图谱的建模与表示、构建与精化、存储与演化管理、查询语义理解以及智能化应用这5个方面详细探讨了研究新趋势,以更好地满足基于代码知识图谱进行智能化软件开发的需要.
    39  智能家居情境感知服务的运行时建模与执行方法
    陈星 黄志明 叶心舒 马郓 陈艺燕 郭文忠
    2019, 30(11):3297-3312. DOI: 10.13328/j.cnki.jos.005802
    [摘要](2941) [HTML](2642) [PDF 2.02 M](5745)
    摘要:
    随着智能家居基础设施的不断发展,智能家居逐渐进入以智能服务为特征的新时期.大量复杂、异构的智能设备相互协同,构成海量、智能、集成的智能家居应用.其中,情境感知服务根据服务对象所处情境的变化为其提供准确的服务,是智能家居应用的典型代表.目前,情境感知服务往往面向场景进行构建,其设备多样性和服务随需性给应用开发带来极大的挑战.开发者需要熟悉设备管理接口、进行接口调用和交互,同时,理解服务功能和质量需求,进行管理逻辑的编写.为了快速定制和开发情境感知服务,将知识图谱引入开发过程,提出一种智能家居情境感知服务的运行时建模与执行方法:首先,提出智能家居情境感知服务知识图谱概念模型,定义其情境中各种概念和关系;其次,提出智能家居情境感知服务知识图谱实例模型的构造与维护机制,通过运行时概念、关系实例表示情境知识;最后,提出基于知识推理的智能家居情境感知服务执行方法,通过知识推理自动执行设备功能.面向实际场景,构建智能家居原型系统.实验结果显示,该方法能够实现情境感知服务运行时建模与执行,其代码减少量超过90%.
    40  知识图谱数据管理研究综述
    王鑫 邹磊 王朝坤 彭鹏 冯志勇
    2019, 30(7):2139-2174. DOI: 10.13328/j.cnki.jos.005841
    [摘要](9348) [HTML](7557) [PDF 3.44 M](19059)
    摘要:
    知识图谱是人工智能的重要基石.各领域大规模知识图谱的构建和发布对知识图谱数据管理提出了新的挑战.以数据模型的结构和操作要素为主线,对目前的知识图谱数据管理理论、方法、技术与系统进行研究综述.首先,介绍知识图谱数据模型,包括RDF图模型和属性图模型,介绍5种知识图谱查询语言,包括SPARQL、Cypher、Gremlin、PGQL和G-CORE;然后,介绍知识图谱存储管理方案,包括基于关系的知识图谱存储管理和原生知识图谱存储管理;其次,探讨知识图谱上的图模式匹配、导航式和分析型3种查询操作.同时,介绍主流的知识图谱数据库管理系统,包括RDF三元组库和原生图数据库,描述目前面向知识图谱的分布式系统与框架,给出知识图谱评测基准.最后,展望知识图谱数据管理的未来研究方向.
    41  融合文本概念化与网络表示的观点检索
    廖祥文 刘德元 桂林 程学旗 陈国龙
    2018, 29(10):2899-2914. DOI: 10.13328/j.cnki.jos.005548
    [摘要](6038) [HTML](5173) [PDF 1.67 M](8349)
    摘要:
    观点检索是自然语言处理领域中的一个热点研究课题.现有的观点检索模型在检索过程中往往无法根据上下文将词汇进行知识、概念层面的抽象,在语义层面忽略词汇之间的语义联系,观点层面缺乏观点泛化能力.因此,提出一种融合文本概念化与网络表示的观点检索方法.该方法首先利用知识图谱分别将用户查询和文本概念化到正确的概念空间,并利用网络表示将知识图谱中的词汇节点表示成低维向量,然后根据词向量推出查询和文本的向量,并用余弦公式计算用户查询与文本的相关度,接着引入基于统计机器学习的分类方法挖掘文本的观点.最后,利用概念空间、网络表示空间以及观点分析结果构建特征,并服务于观点检索模型.相关实验结果表明,所提出的检索模型可以有效提高多种检索模型的观点检索性能.其中,基于统一相关模型的观点检索方法在两个实验数据集上相比于基准方法,在MAP评价指标上分别提升了6.1%和9.3%,基于排序学习的观点检索方法在两个实验数据集上相比于基准方法,在MAP评价指标上分别提升了2.3%和14.6%.
    42  一种元路径下基于频繁模式的实体集扩展方法
    郑玉艳 田莹 石川
    2018, 29(10):2915-2930. DOI: 10.13328/j.cnki.jos.005549
    [摘要](5789) [HTML](4662) [PDF 1.68 M](8097)
    摘要:
    实体集扩展是指已知某个特定类别的几个种子实体,根据一定的规则得到该类别的更多实体.作为一种经典的数据挖掘任务,实体集扩展已经有很多的应用,诸如字典建立、查询建议等.现有的实体集扩展主要是基于文本或网页信息,即实体之间的关系从其在文本或者网页中的共现来推断.随着知识图谱研究的兴起,根据知识图谱中知识的共现来研究实体集扩展也成为了一种可能.主要研究知识图谱中的实体集扩展问题,即:给定几个种子实体,利用知识图谱来得到更多的同类别的实体.首先,把知识图谱建模成一个异质信息网络,即含有多种实体类型或者关系类型的网络,提出了一种新的元路径下基于频繁模式的实体集扩展方法,称为FPMP_ESE.FPMP_ESE采用异质信息网络中的元路径来捕捉种子实体之间的潜在共同特征.为了找到种子实体之间重要的元路径,设计了一种新的基于频繁模式的元路径自动产生算法FPMPG.之后,为了更好地给每条元路径分配相应的权重,设计了启发式的方法和PU learning的方法.最后,在真实数据集Yago上的实验结果表明,所提出方法较其他方法在实体集扩展任务上具有更好的性能和更高的效率.
    43  一种准确而高效的领域知识图谱构建方法
    杨玉基 许斌 胡家威 仝美涵 张鹏 郑莉
    2018, 29(10):2931-2947. DOI: 10.13328/j.cnki.jos.005552
    [摘要](9526) [HTML](11004) [PDF 2.33 M](19292)
    摘要:
    作为语义网的数据支撑,知识图谱在知识问答、语义搜索等领域起着至关重要的作用,一直以来也是研究领域和工程领域的一个热点问题,但是,构建一个质量较高、规模较大的知识图谱往往需要花费巨大的人力和时间成本.如何平衡准确率和效率、快速地构建出一个高质量的领域知识图谱,是知识工程领域的一个重要挑战.对领域知识图谱构建方法进行了系统研究,提出了一种准确、高效的领域知识图谱构建方法——"四步法",将该方法应用到中国基础教育九门学科知识图谱的构建中,在较短时间内构建出了准确率较高的学科知识图谱,证明了该方法构建领域知识图谱的有效性.以地理学科知识图谱为例,使用"四步法"共得到67万个实例、1 421万条三元组,其中,标注数据的学科知识覆盖率和知识准确率均在99%以上.
    44  面向知识图谱的知识推理研究进展
    官赛萍 靳小龙 贾岩涛 王元卓 程学旗
    2018, 29(10):2966-2994. DOI: 10.13328/j.cnki.jos.005551
    [摘要](11853) [HTML](9379) [PDF 610.06 K](31560)
    摘要:
    近年来,随着互联网技术和应用模式的迅猛发展,引发了互联网数据规模的爆炸式增长,其中包含大量有价值的知识.如何组织和表达这些知识,并对其进行深入计算和分析备受关注.知识图谱作为丰富直观的知识表达方式应运而生.面向知识图谱的知识推理是知识图谱的研究热点之一,已在垂直搜索、智能问答等应用领域发挥了重要作用.面向知识图谱的知识推理旨在根据已有的知识推理出新的知识或识别错误的知识.不同于传统的知识推理,由于知识图谱中知识表达形式的简洁直观、灵活丰富,面向知识图谱的知识推理方法也更加多样化.将从知识推理的基本概念出发,介绍近年来面向知识图谱知识推理方法的最新研究进展.具体地,根据推理类型划分,将面向知识图谱的知识推理分为单步推理和多步推理,根据方法的不同,每类又包括基于规则的推理、基于分布式表示的推理、基于神经网络的推理以及混合推理.详细总结这些方法,并探讨和展望面向知识图谱知识推理的未来研究方向和前景.
    45  本体工程与知识图谱专题前言
    漆桂林 欧阳丹彤 李涓子
    2018, 29(10):2897-2898. DOI: 10.13328/j.cnki.jos.005554
    [摘要](4063) [HTML](3683) [PDF 300.13 K](6908)
    摘要:
    46  实体搜索综述
    张香玲 陈跃国 马登豪 陈峻 杜小勇
    2017, 28(6):1584-1605. DOI: 10.13328/j.cnki.jos.005256
    [摘要](6647) [HTML](6132) [PDF 2.74 M](14119)
    摘要:
    与传统的以网页页面集合的方式呈现搜索结果不同,实体搜索的结果是实体或实体集合,其优点是无需用户在纷杂的网页里面进行二次查找,更能提升用户的搜索体验.实体搜索的任务可以分为相关实体搜索和相似实体搜索.对近年来这两类任务的实体搜索技术进行综述.首先给出了实体搜索的形式化定义,并介绍了常用的评测指标;然后,对两种不同形式的实体搜索任务在两类数据源(非结构化数据集和结构化数据集)上的主要研究方法进行了详细的阐述和对比;最后,对未来的研究内容和发展方向进行了探讨和展望.

    当期目录


    文章目录

    过刊浏览

    年份

    刊期

    联系方式
    • 《软件学报 》
    • 主办单位:中国科学院软件研究所
                       中国计算机学会
    • 邮编:100190
    • 电话:010-62562563
    • 电子邮箱:jos@iscas.ac.cn
    • 网址:https://www.jos.org.cn
    • 刊号:ISSN 1000-9825
    •           CN 11-2560/TP
    • 国内定价:70元
    您是第位访问者
    版权所有:中国科学院软件研究所 京ICP备05046678号-3
    地址:北京市海淀区中关村南四街4号,邮政编码:100190
    电话:010-62562563 传真:010-62562533 Email:jos@iscas.ac.cn
    技术支持:北京勤云科技发展有限公司

    京公网安备 11040202500063号