摘要:针对强化学习路径规划中控制性能与安全性的权衡问题, 提出一种融合控制障碍函数的安全强化学习算法 RL + adpCBF. 首先, 在约束马尔可夫决策过程框架下, 引入控制障碍函数以提供安全保证, 并基于双延迟深度确定性策略梯度构建端到端的安全强化学习框架; 随后, 设计 CBFNet 网络结构, 在约束强化学习范式下加入基于控制障碍函数的安全约束, 并通过拉格朗日乘子法自适应平衡安全性与控制性能; 同时, 在满足安全约束的前提下, 将基于先验动力学与安全集构建的 CBF 约束实现为可微分的优化层, 使安全约束以显式凸优化的形式嵌入策略网络, 并通过端到端反向传播实现梯度更新; 最后, 在仿真环境中对所提出方法进行验证. 实验结果表明, RL + adpCBF 算法能够在保持较高控制性能的同时有效规避不安全动作, 对环境变化具备快速响应与实时策略调整能力, 能够显著提升移动机器人的安全性与运行效率.