多智能体深度强化学习中的Q值路径分解

Q-value Path Decomposition for Deep Multiagent Reinforcement Learning

作者:

杨耀东 郝建业 陈广勇 汤宏垚 陈赢峰 胡裕靖 范长杰 魏忠钰

简介:

近年来,由于许多现实世界中的问题可以建模为多智能体系统,因此多智能体深度强化学习(MARL)已成为一个非常活跃的研究领域。一类特别有趣且广泛适用的问题可以被抽象为部分可观察的合作式多智能体环境,在这种环境中,一组智能体根据自己的局部观察和共享的全局奖励信号来学习协调其行为。一种自然的解决方案是求助于集中式训练、分布式执行范式。在集中式训练期间,一项关键挑战是多智能体信度分配:如何为单个智能体的策略分配属于它自身的贡献,从而更好地协调以最大化全局奖励。在本文中,我们提出了一种称为Q值路径分解(QPD)的新方法,可以将系统的全局Q值分解为单个智能体的Q值。和以前的工作限制单个Q值和全局Q值的表示关系不同,我们将累积梯度归因技术运用到深度MARL中,沿着轨迹路径直接分解全局Q值来为智能体进行信度分配。我们在具有挑战性的《星际争霸II》微观管理任务上评估了QPD,表明其与现有的MARL算法相比,QPD在同质和异质的多智能体场景中均达到了先进的性能。

方法:

  • 在集中式训练、分布式执行的范式下,智能体会依据自身的历史轨迹和当前观察选择执行动作与环境交互,使用集中式的critic网络学习基于智能体联合观察和动作的全局Q值函数。

  • 在获得当前轨迹后,通过累积梯度技术沿着状态动作轨迹将全局Q值归因到每个智能体的特征上,将属于每个智能体的特征的归因信度叠加作为当前状态下智能体的个体Q值信度。

  • 使用个体Q值信度作为底层智能体策略网络的监督信号对智能体策略进行训练。

效果: 该算法在挑战性的星际争霸游戏平台进行了测试,实验显示QPD能够在同质和异质场景中学习到协调的策略,取得先进的性能。

成为VIP会员查看完整内容
77

相关内容

【ICML2020】用于强化学习的对比无监督表示嵌入
专知会员服务
27+阅读 · 2020年7月6日
【ICML2020-浙江大学】对抗性互信息的文本生成
专知会员服务
43+阅读 · 2020年7月4日
【ICML2020】对比多视角表示学习
专知会员服务
52+阅读 · 2020年6月28日
多智能体深度强化学习的若干关键科学问题
专知会员服务
171+阅读 · 2020年5月24日
最新《经济学中的强化学习》2020大综述,42页pdf128篇文献
MIT新书《强化学习与最优控制》
专知会员服务
270+阅读 · 2019年10月9日
专知会员服务
198+阅读 · 2019年8月30日
深入机器学习系列之:高斯混合模型
数据猿
6+阅读 · 2019年1月10日
除了DQN/A3C,还有哪些高级强化学习成果
论智
14+阅读 · 2018年10月28日
入门 | 从Q学习到DDPG,一文简述多种强化学习算法
浅析强化学习及使用Policy Network实现自动化控制
人工智能学家
6+阅读 · 2017年10月2日
【强化学习】强化学习+深度学习=人工智能
产业智能官
51+阅读 · 2017年8月11日
Arxiv
3+阅读 · 2019年3月29日
Generalization and Regularization in DQN
Arxiv
6+阅读 · 2019年1月30日
Learning Embedding Adaptation for Few-Shot Learning
Arxiv
16+阅读 · 2018年12月10日
Arxiv
5+阅读 · 2018年5月1日
Arxiv
16+阅读 · 2018年4月2日
VIP会员
相关VIP内容
【ICML2020】用于强化学习的对比无监督表示嵌入
专知会员服务
27+阅读 · 2020年7月6日
【ICML2020-浙江大学】对抗性互信息的文本生成
专知会员服务
43+阅读 · 2020年7月4日
【ICML2020】对比多视角表示学习
专知会员服务
52+阅读 · 2020年6月28日
多智能体深度强化学习的若干关键科学问题
专知会员服务
171+阅读 · 2020年5月24日
最新《经济学中的强化学习》2020大综述,42页pdf128篇文献
MIT新书《强化学习与最优控制》
专知会员服务
270+阅读 · 2019年10月9日
专知会员服务
198+阅读 · 2019年8月30日
微信扫码咨询专知VIP会员