2026, 37(8):3049-3051. DOI: 10.13328/j.cnki.jos.007599 CSTR: 32375.14.jos.007599
摘要:
2026, 37(8):3052-3088. DOI: 10.13328/j.cnki.jos.007595 CSTR: 32375.14.jos.007595
摘要:嵌入式系统建模是基于模型的软件开发的重要组成, 体系结构分析与设计语言(architecture analysis and design language, AADL)因其形式化表达软硬件结构与交互关系的能力, 广泛用于架构设计. 大语言模型(large language model, LLM)为从自然语言需求生成架构模型提供了新路径. 然而, 现有模型在需求语义理解、AADL组件边界识别与连接关系建构等方面仍存在显著不足, 限制了其实用性与生成质量. 为解决上述问题, 提出一种面向嵌入式系统的智能建模方法——SmartGen-AADL, 整体方法基于多智能体协同机制构建, 融合语义解析、结构识别与提示增强生成等关键技术, 实现从自然语言需求到结构化AADL模型的高质量转换. 方法核心包括3个阶段: 首先, 系统通过结构化智能体完成系统架构文档中系统架构的识别与标准化需求语句的提取; 随后, 子问题智能体基于条目级分析与组件交互挖掘, 实现对需求粒度的细化与交互关系的显式建模; 最后, 构件生成智能体在语义提示中融合结构引导与基于检索增强生成(retrieval-augmented generation, RAG)的相似组件检索结果, 引导LLM生成符合AADL语法规范的组件代码. 为支撑上述流程, 构建了“条目化需求-AADL组件”知识库以及“系统架构文档-AADL架构”语义对齐数据集. 在15个嵌入式系统应用场景上的实验结果表明, 相较于仅依赖简单提示工程的方法, 所提多智能体协同建模方法在4个主流大语言模型上均展现出显著优势. 其中, 在DeepSeek-r1模型上的提升最为突出: 组件错误行占比平均降低34.37%, FBERT语义相似度平均提升6.21%, 结构匹配度提升超过20%, 人工评分整体提高约0.7分. 进一步的消融实验结果显示, 子问题识别机制增强了对建模粒度的控制能力; 系统结构树构建提供了组件组织与层级拓扑信息; 检索增强生成机制为模型提供了外部知识支撑并降低了幻觉率; 通信连接识别确保了模型的接口完备性与交互闭环, 四者协同促进了自然语言到AADL建模语言对齐与模型一致性的显著提升.
2026, 37(8):3089-3115. DOI: 10.13328/j.cnki.jos.007593 CSTR: 32375.14.jos.007593
摘要:基于大语言模型的代码生成智能体正在深刻地变革软件开发范式. 相较于之前的代码生成技术, 代码生成智能体展现出3大核心特征: 首先是自主性, 智能体能独立执行从任务分解到编码、调试的完整工作流; 其次是任务范围的广泛性, 其能力从生成代码片段扩展至覆盖软件开发的全生命周期; 最后是工程实践性的增强, 研究重心从模型算法创新转向流程管理、系统可靠性与工具集成等工程挑战. 近年来, 这一技术方向发展迅猛, 展现出巨大的应用潜力, 相关研究呈爆发式增长. 为此, 对基于大语言模型的代码生成智能体领域进行系统性的综述. 追溯该技术自诞生以来的发展脉络, 全面梳理并从方法论的视角对其核心技术(涵盖单智能体与多智能体系统)进行归纳和分类. 此外, 还总结代码生成智能体在软件开发全周期中的各项应用, 整理主流的评估基准与指标, 并盘点代表性的工具. 最后, 通过分析关键挑战, 展望该领域未来的长期核心研究方向.
2026, 37(8):3116-3143. DOI: 10.13328/j.cnki.jos.007597 CSTR: 32375.14.jos.007597
摘要:大语言模型(large language model, LLM, 也称大模型)在软件开发技术问答任务中展现出强大潜力, 为代码知识获取和理解提供了新途径. 然而, 在以Linux内核为代表的复杂系统软件领域, LLM在代码实现、关键机制理解、演化历史追溯及设计决策分析等方面的真实能力仍缺乏系统验证. 现有评测基准多针对通用任务, 存在领域深度不足、难度逐渐饱和及评测问题与工程实践存在偏差等局限, 难以保障特定领域开发知识问答的客观性、准确性和全面性. 为客观评估LLM在复杂系统软件中的知识问答能力, 研究提出一种LLM问答能力评测基准数据集构建方法, 并构建面向Linux内核的高质量问答评测基准LKQABench, 同时设计一种多裁判协同的代码知识问答评测方法MJ-CCE. LKQABench基于开发者社区的真实技术问答数据, 经过语义分析和人工审核修订, 构建202个标准问答对, 覆盖Linux内核主要模块和不同认知维度. MJ-CCE方法定义多个裁判大模型的协同评分与投票机制, 从关键知识点覆盖度、事实正确性与表达清晰度等维度对回答进行多维度评估. 在LKQABench上对主流大模型的实证研究表明, 当前大模型能较好地回答内核实现的单点知识问题, 但在涉及跨主题知识整合、深度推理及版本演化关联的问题中, 存在知识点遗漏、逻辑链条不完整等不足. 研究不仅揭示了大模型在软件开发知识问答中的能力边界, 也为其在该领域的持续优化提供了实证数据支撑.
2026, 37(8):3144-3160. DOI: 10.13328/j.cnki.jos.007596 CSTR: 32375.14.jos.007596
摘要:大语言模型(large language model, LLM)在通用任务中已展现出卓越的性能, 但其在专业领域中的可信性、鲁棒性与可用性仍缺乏系统化评估. 以软件测试教材编写为代表性应用场景, 围绕100个核心测试概念与方法精心构建了700个测试问题, 并选取5个代表性LLM, 系统评估了其在阅读理解、问答及文本生成方面的能力. 实验结果表明, LLM在大多数问题上整体表现优良, 在答案的准确性、完整性和流畅性方面均达到较高水准; 然而, 在涉及研究现状与复杂概念时, 仍存在幻觉与推理偏差等可靠性问题. 进一步分析显示, 大模型生成的内容在知识覆盖度与教育性上较传统教材具有较为明显的优势, 能够为软件测试教材的修订与教学提供有效支持. 不仅系统揭示了LLM在专业领域知识处理中的具体能力边界与典型缺陷, 也为基于问答驱动的智能化评估方法在专业教育与应用中的推广提供了实证依据与方法参考.
2026, 37(8):3161-3179. DOI: 10.13328/j.cnki.jos.007592 CSTR: 32375.14.jos.007592
摘要:软件缺陷定位是软件工程领域的重要问题. 近年来, 基于大语言模型的缺陷定位方法在缺陷定位任务中展现出较好前景. 现有方法仅为大语言模型维护单一决策路径, 导致搜索范围有限, 缺陷定位效果不够理想. 针对此问题, 提出一种基于并行探索的大模型缺陷定位增强方法PRIME. 通过设计缺陷位置的并行探索机制提高大语言模型的搜索范围, 并结合节点重要性评估方法对大语言模型预测的多个候选缺陷位置进行排序, 形成优化后的缺陷定位结果. 通过与其他缺陷定位方法的对比分析以及全面的消融实验和参数影响分析, 验证所提方法可以有效增强大语言模型的缺陷定位性能. PRIME在Top-1指标上较现有方法的提升幅度超过18%, 其在MAP和MRR指标上的性能提升分别可达15%和25%.
2026, 37(8):3180-3204. DOI: 10.13328/j.cnki.jos.007594 CSTR: 32375.14.jos.007594
摘要:在现代软件系统, 尤其是云计算和微服务系统中, 根因分析是保障系统稳定性和高效运行的关键技术. 大语言模型由于其强大的自然语言处理和数据分析能力, 为根因分析提供了新的解决方案. 基于大语言模型的智能体在大语言模型的基础上, 为根因分析带来了更高的自动化程度和更精准的问题定位能力. 然而, 尽管已有相关研究探讨了大语言模型在根因分析中的应用, 但关于大语言模型智能体在根因分析的研究仍然处于早期阶段. 聚焦于大语言模型智能体在云计算和微服务系统根因分析的研究现状进行全面的分析和总结. 主要内容包括: (1)概述基于大语言模型的智能体框架构成和根因分析中的数据使用; (2)从信息获取、根因定位和效果评估这3个主要流程系统地分析大语言模型智能体在根因分析中的应用方式; (3)探讨大语言模型智能体技术在根因分析任务中面临的主要挑战和未来的发展方向.
2026, 37(8):3205-3222. DOI: 10.13328/j.cnki.jos.007598 CSTR: 32375.14.jos.007598
摘要:文本协议交互抽取旨在从自然语言形式的说明文档中识别并提取协议有关的交互信息, 其可用于在协议代码实现前抽取模型验证协议的正确性、从协议规格描述构造测试用例等. 当前从文本中抽取协议主要采用深度学习、大语言模型等技术, 深度学习方法依赖大规模的高质量数据集, 且适用范围受限于训练数据集, 存在迁移困难的问题. 现有的大语言模型方法存在提示模板和示例构造较为简单、处理流程欠优化的局限. 针对以上问题, 提出一种增强的基于文本表达特征分析的大语言模型协议交互抽取方法. 首先, 从真实的协议描述案例出发, 总结出协议描述文本中存在的常见语言表达特征; 然后, 提取能够体现这些特征的典型协议描述案例, 提炼用于协议交互抽取的处理规则; 进一步地, 融合案例与规则, 提出一套规则回溯思维链方法; 最后, 使用多路推理和自我验证技术优化任务处理流程. 在多个协议数据集上的实验结果表明, 所提方法在协议交互的抽取精确率和召回率等方面均优于基线方法, 证实了所提方法的有效性.
2026, 37(8):3223-3228. DOI: 10.13328/j.cnki.jos.007730 CSTR: 32375.14.jos.007730
摘要:生成式大语言模型(以下简称大模型)通过建模海量语料中的统计规律, 在语言理解、内容生成和交互式问题求解中展现出突出能力, 但其能力形成机制也限定了适用范围和可靠性条件. 大模型能力受到3类机制性条件约束: 训练数据决定知识覆盖和时效范围、有限条件下Transformer架构的结构性表达边界以及概率生成目标导致的原生性幻觉. 这些能力上界的约束会进一步在应用中显现为任务范畴、风险后果和数据形态的边界: 生成式模型与判别式任务的错位、安全攸关场景对黑箱幻觉的低容忍以及序列化表征与结构化数据的不适配. 面对单体模型在知识、计算、验证和责任方面的局限, 关键突破路径在于向模型系统演进. 智能体式工作流是模型系统的重要形态, 通过引入外部记忆、检索与工具调用等构件突破单体模型的能力限制. 同时, 该系统需依托生成与符号验证闭环确立信任锚点, 落实“生成归模型, 验证归系统”; 并嵌入人在回路机制确保最终决策的责任归属. 大模型的发展需要从参数规模扩张走向系统可信建设, 转向构建可解释、可验证、可追责的模型系统, 使其真正成为辅助人类解决问题的可靠工具.
2026, 37(8):3229-3256. DOI: 10.13328/j.cnki.jos.007489 CSTR: 32375.14.jos.007489
摘要:命题可满足性问题(propositional satisfiability problem, SAT)和可满足性模理论问题(satisfiability modulo theories problem, SMT)是重要的计算机科学基础问题, 其在电路设计, 软件分析验证等领域都有着重要应用, 并且目前已有大量工作对其求解技术进行研究. 在实际应用场景中, SAT/SMT求解器通常需要求解一系列互相紧密联系的公式. 相比于每次都调用独立的求解器重新求解, 增量求解技术可以复用之前搜索得到的信息, 包括之前的求解结果以及学习子句等, 从而有效提高了求解效率. 目前, 增量SAT/SMT求解已经受到广泛重视与研究, 并成功应用于有界模型检测, 符号执行, 最大可满足性问题等领域中. 对增量SAT/SMT的求解技术进行详细综述与梳理, 涵盖了完备与非完备算法. 此外, 详细总结增量SAT/SMT求解技术在实际场景中的主要应用. 最后, 对该领域的发展方向进行总结和展望.
2026, 37(8):3257-3292. DOI: 10.13328/j.cnki.jos.007653 CSTR: 32375.14.jos.007653
摘要:数据库管理系统是支撑现代信息基础设施的核心软件, 其可靠性直接影响数据安全与业务连续性. 随着系统复杂度的不断提升, 数据库中的缺陷可能导致数据损坏、信息泄露及系统崩溃等严重后果. 近年来, 模糊测试作为一种高效的自动化缺陷检测技术, 已在数据库可靠性测试中广泛应用并取得显著成果. 然而, 传统模糊测试方法常依赖于简单的规则和模式生成测试用例, 难以生成具有更深层次语义理解的复杂场景, 因而在覆盖数据库管理系统复杂交互路径与触发深层缺陷方面仍存在不足. 与此同时, 大语言模型(large language model, LLM)的快速发展为数据库测试带来了新的机遇. 凭借其强大的语义理解、上下文推理与自我学习能力, LLM能够生成多样化、语义合理的SQL测试用例, 辅助测试结果验证与缺陷分析, 显著提升数据库管理系统可靠性测试的自动化与智能化水平, 挖掘数据库深层次缺陷. 系统梳理大语言模型在数据库可靠性测试中的研究进展, 分析基于大语言模型的测试框架在测试用例生成、结果校验、覆盖反馈与测试优化等方面的最新成果, 评估现有研究的有效性与局限, 并展望未来数据库管理系统可靠性测试的发展方向.
2026, 37(8):3293-3308. DOI: 10.13328/j.cnki.jos.007535 CSTR: 32375.14.jos.007535
摘要:社交网络链路预测旨在分析现有的网络信息来推断未来的链接情况. 这是一个极具挑战性的任务, 因为社交网络具有复杂的时空耦合特征, 表现为时间维度上的动态演化(即时间依赖性)和空间维度上的关联互耦(即空间依赖性). 现有方法主要集中在时域和空域建模上, 没有充分利用图快照序列数据的频域信息. 提出一种新的时频感知图卷积网络(time-frequency-aware graph convolutional network, TFAGCN)用于社交网络链路预测. TFAGCN的主要优点是在统一的网络框架中集成频域、时域和空域信息, 同时捕获社交网络数据中的全局时间依赖关系和局部时空依赖关系. 具体来说, TFAGCN引入频域模块与时空模块: 在频域模块中, 使用快速傅里叶变换完成图快照序列的域转换, 并在频域通过多层感知器学习频率分量的实部和虚部以捕获社交网络全局依赖关系; 在时空模块中, 联合图卷积神经网络和门控循环单元网络分别探索单个图快照的局部拓扑特征和局部时间特征. 同时, 设计先进的时频双向交叉注意力网络, 能够自适应地融合频域特征与时域特征. 此外, 为了有效应对大规模社交网络的链路预测问题, 给出TFAGCN的简化版本——TFAGS. 在6个真实社交网络数据集上进行一系列有说服力的实验验证, 结果显示所设计的时频感知图卷积网络获得了比先进的基线算法更优的链路预测表现, 证实其是一种高效的处理社交网络蕴含信息表达问题的新工具. TFAGCN的代码可在公开的软件项目托管平台中获取: https://github.com/junlonglai/TFAGCN.
2026, 37(8):3309-3336. DOI: 10.13328/j.cnki.jos.007658 CSTR: 32375.14.jos.007658
摘要:数据收益的合理分配是构建可持续数据市场的核心命题之一. 相较于传统生产要素, 数据的价值后验性、信息不对称性、零成本复制、外部性等特性, 给其收益分配策略的设计带来了多维度的挑战. 聚焦数据市场的重要分支——机器学习模型市场(以下简称模型市场), 系统梳理该领域收益分配策略的研究进展, 揭示其“从同质化走向差异化、从短期走向长期”的发展趋势. 具体而言, 首先形式化定义模型市场的收益分配问题, 厘清收益分配的主体、模式与目标. 在此基础上整理“同质化分配-差异化补偿”的分配依据: 在同质化贡献度量上, 归纳基于Shapley值等指标的数据贡献度评估体系; 在差异化补偿指标上, 解析数据成本、数据多样性等差异化指标的度量方法, 进而揭示综合两个维度的混合策略. 进一步地, 针对模型市场在长期尺度下的动态特征, 分析不同主体的策略性行为对收益分配的影响及其应对措施. 最后总结当前研究面临的主要挑战, 明晰从差异化补偿以及长期动态的视角探讨收益分配策略优化的未来研究方向.
2026, 37(8):3337-3369. DOI: 10.13328/j.cnki.jos.007497 CSTR: 32375.14.jos.007497
摘要:区块链技术的广泛应用推动了多链应用的发展, 通过跨链技术可以解决不同区块链之间信息隔离的问题. 然而, 当区块链之间存在大量并发交易时, 现有跨链技术不能并行处理跨链交易, 带来可扩展性低的问题, 区块链分片技术可以有效解决该问题. 目前, 不完善的交易分配方法和跨分片交易导致分片技术对可扩展性的提升受限. 因此, 提出面向中继链分片环境的两阶段自适应交易分配模型, 该模型在第1阶段得到交易分配方案, 以减少跨分片交易并保证分片负载与分片性能相匹配; 在第2阶段, 对中继链收集节点转发后处于不稳定队列中的交易进行微调, 以解决负载激增导致的交易处理延迟增加问题. 在第1阶段, 设计一种交易分配预测方法, 该方法利用平行链历史跨链交易信息对交易大小和数量进行预测, 根据预测结果与分片的交易吞吐量计算负载值, 同时, 基于交易依赖性设计跨分片交易分配方法, 结合负载值和该方法得到交易分配方案; 在第2阶段, 中继链根据交易分配方案和跨分片交易分配方法将交易转发至对应分片进行处理, 在此过程中用户可能短时间内生成大量交易导致分片负载与分片性能不匹配. 因此, 针对交易队列中等待的交易提出一种交易队列稳定性分析方法, 该方法通过交易队列的长度变化分析交易队列稳定性并对不稳定交易队列中的交易进行分片间动态微调. 通过交易分配预测方法和交易队列稳定性分析方法进行自适应交易分配, 减少交易等待处理的时间并提高中继链的交易吞吐量. 实验结果表明, 所提模型可以并行处理大量并发跨链交易并对交易分配方法进行完善, 相较于对比方法显著提高交易吞吐量, 降低交易的处理延迟.
2026, 37(8):3370-3385. DOI: 10.13328/j.cnki.jos.007492 CSTR: 32375.14.jos.007492
摘要:临床12导联心电图(ECG)是测试心脏活动最常用的信号源, 其自动分类及可解释性对心血管疾病的早期筛查和诊断至关重要. 现有的ECG分类研究多集中于单标记分类, 即每条心电记录仅对应一种心功能障碍, 而在临床中, 心血管疾病患者常伴有多种并发心脏疾病, 因此多标记ECG分类任务更符合现实需求. 现有基于深度网络的多标记ECG分类方法主要聚焦于标记相关性分析或神经网络架构的改进, 而忽略了多标记学习中的本质问题, 即天然存在的正负标记不平衡. 为此, 提出一种策略, 即每次仅推开一对标记, 使得正负标记在训练过程中维持平衡. 具体而言, 最大化正负标记之间的间隔并由此导出一个新的损失函数, 以缓解正负标记不平衡问题. 此外, 针对现有ECG方法可解释性不足, 难以辅助诊断的问题, 引入时域显著性重缩放方法来对提出方法的实验结果进行可视化展示, 以辅助定位并解释不同的疾病. 在PhysioNet Challenge 2021 ECG标准数据集上(包含8个子集)进行实验, 结果表明与最先进的多标记ECG分类方法相比, 所提方法取得了更优的性能.
2026, 37(8):3386-3404. DOI: 10.13328/j.cnki.jos.007551 CSTR: 32375.14.jos.007551
摘要:近年来, 深度学习发展迅速, 在计算机视觉研究中取得了巨大的成功. 在发展过程中, 模型的测试和改进方向是研究者们关注的核心. 然而, 视觉模型比较范式是在封闭数据集上训练(验证)和测试, 然后通过测试结果和真实标签的偏差来获得难样本, 用于反馈模型的问题和改进方向. 这种方式存在的问题包括: 1) 数据集中少量的数据无法真实反映模型的问题; 2)模型预训练等一些操作可能导致数据泄露, 因此展现的性能可能有偏差. 提出基于最大差异化竞争的通用视觉难样本挖掘算法, 自动挖掘真实的难样本, 用于指出模型的问题. 所提算法遵循“通过模型博弈来比较模型”的思想, 联合视觉任务内和多视觉任务间预测结果的“不相似性”优化挖掘潜在的难样本, 旨在以可控的、高效的方式为计算机视觉领域提供新的测试基准. 实验证明, 所构建的测试基准GHS-CV相较于单视觉任务的难样本挖掘(语义分割难样本集SS-C, 显著目标检测难样本集SOD-C)更能暴露出模型的缺陷. 其中, 相较于DeepLabv3+模型在SS-C数据集上的性能, DeepLabv3+在GHS-CV数据集上的mIoU 下降了约 20%; 相较于VST模型在SOD-C 数据集上的性能, VST在GHS-CV数据集上的Fβ下降了约 36%.

