arXiv cs.RO 机器人学· Addison Kalanther, Sanika Bharvirkar, Daniel Bostwick, Chinmay Maheshwari, Shankar Sastry·· 2 天前AI 评分37
在部分可观测动态博弈中针对未知对手编排 Level-K 策略
Orchestrating Level-$K$ Policies Against Unknown Opponents in Partially-Observable Dynamic Games
AI 导读
研究将 Level-K 策略库的部署问题建模为部分可观测马尔可夫博弈中的动态编排,比较基于分类的编排器(CBO,使用离线数据或 on-policy 数据聚合训练)与强化学习编排器(RLBO)。在追逃实验中,on-policy 训练提升分类与回报,但 RLBO 回报高于 on-policy 与离线 CBO。给定预训练策略库,RLBO 以更少训练步数达到与直接在追逃者动作空间上训练的策略相当的性能。
来源:arXiv cs.RO 机器人学 · arxiv.org