摘要:基于安全强化学习的机器人运动规划方法在真实物理环境中展现出巨大潜力, 但在复杂风险敏感场景下, 现有方法的稳定性和适应性有限, 难以满足安全要求. 鉴于此, 研究一种具有时序动态演化特性的安全强化学习方法具有重要意义. 首先, 构建基于时间连续常微分方程架构的策略网络, 并引入融合欧拉离散化方法, 使策略由静态映射转变为可微分的动态系统, 从而提升智能体对非均匀时间序列的建模能力, 增强其在复杂环境中的自适应性; 其次, 通过自适应约束近端策略优化算法解决安全约束求解问题, 实现灵活且安全的机器人运动控制; 最后, 在机器人安全基准测试平台Safety-Gymnasium和自主搭建的Gazebo物理场景中进行实验测试. 测试结果表明: 基于动态演化的安全强化学习运动规划方法在满足约束的前提下, 能有效提升机器人在规划任务上的表现; 在物理场景下成功率较基线模型PPO-Lag提升了53.7%; 同时, 在不同难度的物理场景中, 所提方法的平均奖励和成功率最高, 实现了泛化场景的最优规划效果.