摘要:有模型离线强化学习利用静态数据集学习动力学模型, 并通过模型生成样本辅助策略优化, 为真实世界中高风险、高成本的决策问题提供了可行的解决方案. 然而, 现有有模型离线强化学习方法面临双重挑战:静态数据集覆盖不足导致经验贝尔曼算子与真实贝尔曼算子之间存在认知误差; 动力学模型在多步预测中存在误差累积, 所生成的虚拟样本引入模型幻觉, 进一步加剧价值估计偏差. 针对上述问题, 本文提出一种基于双源不确定性的有模型离线Actor-Critic方法(Model-Based Offline Actor-Critic with Dual-Source Uncertainty, MDSU). 分别针对静态数据集和动力学模型构建不确定性量化器, 用以刻画两类数据源下的估计风险. 将不确定性量化器以惩罚形式引入静态贝尔曼目标与虚拟贝尔曼目标中, 并通过加权融合机制构造双源不确定性融合算子, 从而在策略评估阶段同时抑制两类误差的负面影响. 理论分析证明, 当静态数据不确定性量化器与动力学模型不确定性量化器能够有效约束相应认知误差时, MDSU的次优后悔具有显式上界. 在MuJoCo连续控制任务上的实验结果表明, MDSU在大多数任务上获得最高的归一化得分, 验证了该方法在性能提升与训练稳定性方面的有效性.