热门
最新
红包
立Flag
投票
同城
我的
发布
NeurIPS 2020 论文推荐:
Joint Policy Search for Multi-agent Collaboration with Imperfect Information
在信息不完全的情况下,学习多智能体合作的良好联合策略仍然是一个基本的挑战。而在两方零和博弈中,协调上升方法(每次优化一个主体的策略,如自我发挥)具有保证作用,而在多主体合作的情况下,它们往往收敛到次优纳什均衡。另一方面,在不完全信息博弈中,由于策略之间复杂的相互作用(例如,上游的更新影响下游的状态可达性),直接建模联合策略变化并不是件容易的事。
本文中作者通过一个新的术语——策略变化密度(policy-change density),证明了全局策略值的变化可以分解为局部的策略变化。在此基础上,作者提出了联合策略搜索(Joint Policy Search)方法,在不完全信息博弈中迭代地改进协作主体的联合策略,而无需重新评估整个博弈。在多智能体协同表格博弈中,JPS被证明不会降低性能,并且可以改进单边方法(如CFR)提供的解决方案,优于为协同策略学习而设计的算法(如BAD)。此外,对于真实世界的游戏,JPS有一个在线表单,可以自然地与梯度更新链接。
运用这个方法,作者先在一些小规模的非完美信息合作游戏(主要是桥牌叫牌阶段的简化版)上进行了测试。结果发现确实有用,新的策略都改进了得分,而且越复杂的游戏,改进越大。最后在真的桥牌叫牌环境下测试,在1k游戏中比WBridge5(冠军软件)在每板上的表现高出0.63 IMPs/b
论文链接:https://www.aminer.cn/pub/5f3a584491e011765c8a0fa0?f=cs
CSDN App 扫码分享
评论
1
打赏
- 复制链接
- 举报