摘要:0-1背包问题(knapsack problem, KP)是组合优化领域中的一个经典NP难问题. 针对原始深度Q网络(deep Q-network, DQN)算法求解高维KP时易陷入局部最优和全局勘探能力不足的局限性, 本文提出一种基于多智能体的改进Double-DQN算法. 首先引入项目选择机制和变异机制, 进而整合多智能体协同框架与单调价值函数分解(QMIX)模块进行优化, 显著增强了寻优的多样性与全局勘探能力. 在包含500个不同规模0-1 KP算例的5个测试集、1个规模50个的多背包算例测试集和1个规模50个的分数背包算例测试集上进行性能评估, 实验结果显示0-1 KP算例中有86%的算例(429个)成功求得最优解, 多背包算例中有84%的算例 (42个) , 分数背包算例中有85%的算例 (43个). 与Gurobi求解器的对比实验结果表明, 所提算法具有较强的稳定性和有效性, 充分验证了改进策略的可行性.