摘要:以最大完工时间和总能耗为目标, 建立了考虑自动引导小车(automated guided vehicle, AGV)变速和充电的绿色作业车间调度模型. 针对工序加工排序和AGV运输任务分配的协同优化调度需求, 考虑决策空间复杂性与动态关联性, 提出了一种多策略近端策略优化(multi-strategy proximal policy optimization, MSPPO)算法. 设计基于析取图和人工状态的复合状态特征, 为智能体提供更全面的环境信息. 结合多目标优化需求, 构建融合完工时间与能耗的复合奖励函数, 引导解向Pareto前沿逼近. 设计一种双策略协同网络架构, 工序策略网络负责工序加工排序, AGV策略网络负责AGV运输任务分配, 两个网络顺序执行构成完整的调度动作, 实现加工与运输的协同优化. 为增加策略网络间的协同性与适应性, 通过共享优势估计、策略反馈机制以及联合状态更新, 使两个策略网络在训练过程中能够动态适应彼此的决策行为, 提升算法的鲁棒性与收敛性. 通过拓展算例的实验分析对比, 验证算法的有效性与优越性.