VG-ADP:基于价值引导与扩散对抗的模仿学习方法
所属分类:技术论文
上传者:wwei
标签: 扩散模型 对抗模仿学习 价值引导
所需积分:0分积分不够怎么办?
文档介绍:针对多智能体模仿学习中专家数据质量不一及动作分布复杂多峰的问题,该研究提出了一种基于价值引导与扩散对抗的多智能体模仿学习方法(VG-ADP)。该方法采用扩散概率模型作为核心生成器,结合U-Net提取环境时空特征,旨在精准刻画专家决策的多峰分布并提升动作序列的平滑度。为应对数据噪声,框架引入对抗增强模块识别并过滤次优数据;同时,在扩散过程的逆向去噪阶段注入价值梯度算子,利用协同价值先验引导智能体向高回报区域纠偏。
现在下载
VIP会员,AET专家下载不扣分;重复下载不扣分,本人上传资源不扣分。