摘要:高质量的漏洞代码数据集对于推动软件安全研究具有重要意义, 是支撑漏洞分析、漏洞检测模型训练与评测、系统对比与攻防研究的核心资源. 不同于图像等领域, 现有漏洞数据集不仅数量有限, 且质量参差不齐, 在多样性上仍存在明显不足. 为应对这一挑战, 本文提出CodeVulnGen, 一种以漏洞特征为核心、基于大语言模型(large language model, LLM)的自动化代码漏洞数据生成框架. 该框架系统化定义了代码漏洞的数据质量属性与评估方法, 在此基础上, 提出3阶段递进式提示构造策略, 将结构化描述、少样本实例、真实漏洞特征和思维链(chain-of-thought, CoT)推理逐步融合, 以生成多样、规范且更贴近真实攻击场景的高复杂度漏洞代码. 实验结果表明, 使用该数据集进行微调的Qwen-4B模型F1指标提升7.4%, 相较于基于真实数据训练提升5.5%.