7月26日至27日,以“智能测试范式变革与新型能力构建”为主题的2026软件测评与数据集建设研讨会在西南交通大学峨眉校区召开。本次会议由中国指挥与控制学会主办,中国指挥与控制学会智能测评专业委员会承办,西南交通大学协办,旨在汇聚软件测评领域的专家学者和工程技术人员,深入交流人工智能、大模型、智能体、知识图谱等新技术在软件测评中的创新应用,共同探讨智能测试技术发展、测评数据集建设和新型测评能力体系构建等主题。

会议邀请了8个来自高校、科研院所和企业的专家主题报告,围绕智能测试技术、测评数据集建设、智能算法评估与软件安全等方向,分享了最新研究成果与工程实践经验。
上海交通大学博士于海洋作了题为《从“造数据”到“建基准”:面向人工智能模型安全的后门测评数据集建设实践》的报告。围绕人工智能模型安全的后门测评数据集建设进行了深入分析,为认识AI模型安全测评的范式变革提供了重要启示。合肥工业大学副教授王垚飞作了题为《面向内容准入与数据外发管控的隐写检测数据及建设》的报告。指出隐写检测数据集建设的核心贴合内容准入与数据外发管控的真实业务场景,从现实攻击案例到系统化的建设框架,为AI安全测评数据基础设施的构建提供了清晰的方法论与实践路径。
中国船舶集团有限公司第七〇九研究所徐瑞高工作了题为《测试数据集构建与测评能力建设》的报告。从智能算法验证对高质量测试数据的现实需求出发,介绍了数据增广、仿真模拟和大模型生成等多种数据构建路径的实践经验,提出了贯穿数据接入、扩充、筛选和入库全过程的建设思路。
北京航天测控技术有限公司李茂高工作了题为《面向目标检测智能算法的测试评估技术研究》的报告。围绕目标检测智能算法“如何测、怎样评、如何验证”问题,系统介绍了测试数据集构建及验证环境等方面的研究和实践,并结合对抗样本、目标识别等应用案例展示了数据集在测试评估中所发挥的重要作用。
北京云起无垠科技有限公司技术总监陈宇轩作了题为《智能化零日漏洞的全生命周期管理验证方案》的报告。介绍了一套贯穿全生命周期的零日漏洞管理验证方案,强调零日漏洞要“管得住、用得安全、查得清楚”,报告还分享了大模型在代码审查、漏洞挖掘和动态验证中的实践应用情况。
山东臻柏信息技术有限公司首席专家项曙明作了题为《从直觉到证据:开源代码数据集如何驱动软件研发选型决策》的报告。指出一个开源项目是否值得采用,重点应综合考察其社区生命力、代码质量、安全合规以及真实业务环境下的实际表现,并把评估数据、测试结果和决策依据完整保留下来,形成系统化的证据链。
西南交通大学冯力研究员作了题为《大模型代码生成时代软件测试工程面临的挑战与机遇》的主题报告。通过典型案例分析了大模型代码生成面临的安全风险与质量挑战,提出从任务与权限控制、代码变更验证、构建发布管理和全过程证据链建设等方面强化质量保障,推动人工智能生成的软件从“可运行”走向“可信交付”,并强调软件测试将在这一过程中发挥关键作用。
北京航空航天大学计算机学院吴际副教授作了题为《测评数据集建设的需求、问题与方法讨论》的主题报告。指出高质量数据集建设的关键是抓住业务知识、领域特征和应用场景,以知识驱动和系统建模为核心,结合大模型与智能体技术,提升数据生成、标注和管理的效率,使数据中的业务信息更加可见、可解释、可推理。

大会安排了圆桌讨论环节。各参会单位围绕大会安排的主题报告进行了深入讨论,分别介绍了本单位在智能测评、数据集建设需求及相关的技术储备情况,并开展了广泛交流,达成了广泛的合作意向。大家一致认为,加快推进智能化测评能力的建设已迫在眉睫,测试数据集建设不仅要解决数据规模和场景覆盖问题,更要确保数据质量可评价、来源可追溯、过程可管理,从而为智能化装备的测评提供可信和有效的数据支撑。
最后,会议组织参观了重点实验室并进行了学术交流,增进了彼此研究思路的互鉴与启发,更为后续在新型测评体系建设中开展协同攻关、资源共享奠定了坚实基础。本次研讨会的成功举办,进一步凝聚了行业共识、拓展了合作空间。与会专家表示,将以此次研讨会为契机,共同推动高质量测评数据集的建设工作,通过联合攻关、平台互联和人才互派等方式,打造产学研用一体化的协同创新生态。以开放共享的数据集共建机制来推动数据资源的高质量整合与动态迭代,服务于国防等关键领域的重大需求。
撰稿人:吴际 审稿人:宋鹏