摘要:激活需求侧温控负荷、电动汽车等柔性资源并推动供需双向互动,是提升综合能源微网经济性与灵活性的关键. 然而,传统集中式优化难以兼顾隐私保护与决策自主性,多智能体强化学习在复杂多能流耦合场景中又面临信息隔离导致的协同困难及物理硬约束保障不足等问题. 为此,本文提出一种改进的多智能体深度强化学习供需协同调度方法. 首先,构建供能侧与需求侧双智能体协同决策模型,在保持各主体自主决策的同时,实现系统经济性与用户舒适性的协同优化;其次,在集中训练、分散执行框架下,引入交叉注意力机制构建集中式价值网络,增强跨主体耦合信息感知与协同学习能力;最后,提出基于物理边界的安全动作投影机制,将策略输出约束于可行域,提高策略安全性与可实施性. 算例结果表明,所提方法能够降低运行成本、改善用户舒适度,并满足物理约束,在收敛性、经济性、舒适度和约束满足度方面优于基线方法.