We present multi-agent A* (MAA*), the first complete and optimal heuristic search algorithm for solving decentralized partially-observable Markov decision problems (DEC-POMDPs) with finite horizon. The algorithm is suitable for computing optimal plans for a cooperative group of agents that operate in a stochastic environment such as multirobot coordination, network traffic control, `or distributed resource allocation. Solving such problems efiectively is a major challenge in the area of planning under uncertainty. Our solution is based on a synthesis of classical heuristic search and decentralized control theory. Experimental results show that MAA* has significant advantages. We introduce an anytime variant of MAA* and conclude with a discussion of promising extensions such as an approach to solving infinite horizon problems.
Markov Decision Processes (MDPs) are a mathematical framework for modeling sequential decision problems under uncertainty as well as Reinforcement Learning problems. Written by experts in the field, this book provides a global view of current research using MDPs in Artificial Intelligence. It starts with an introductory presentation of the fundamental aspects of MDPs (planning in MDPs, Reinforcement Learning, Partially Observable MDPs, Markov games and the use of non-classical criteria). Then it presents more advanced research trends in the domain and gives some concrete examples using illustrative applications.
RESUME Nous presentons le premier formalisme de recherche heuristique permettant de resoudre les POMDPs decentralises (DEC-POMDP). Notre algorithme peut etre utilise pour calculer des plans optimaux dans des domaines comme la multirobotique ou les reseaux de communication, et ceci a horizon fini comme a horizon infini. Nous presentons ici une nouvelle classe d'algorithmes qui fait le lien entre les methodes de recherche heuristique classiques et la theorie du controle decentralise. Nous prouvons l'optimalite de ce formalisme dans le cadre des politiques deterministes, et nous evaluons sa performance sur quelques exemples d'applications repandus dans le domaine du controle decentralise. ABSTRACT We present the first generalized heuristic search formalism that is able to solve decentralized POMDPs of both finite and infinite horizon. Our algorithm is suitable for computing optimal plans for a cooperative group of agents that operate in a stochastic environment. These problems arise in domains such as multi-robot coordination, or network traffic control. We present a framework that is based on classical heuristic search on the one hand, and on decentralized control theory on the other hand. We prove that our approach is able to generate optimal deterministic controllers, and we study its performance on examples from the literature.
Nous abordons dans cette these la resolution optimale des processus de decision markoviens decentralises (DEC-POMDPs). Le modele DEC-POMDP constitue un formalisme theorique pour la description de problemes de prise de decision distribuee et cooperative, et cette these est l'une des premieres a proposer des algorithmes exactes de recherche de politiques optimales. Les avancees qui en decoulent nous permettent en particulier de proposer un cadre theorique pour la construction des systemes multi-agents. Nous distinguons deux familles d'approches pour la resolution des DEC-POMDPs. Lorsqu'un modele a priori est disponible, une solution optimale peut-etre obtenue de maniere centralisee et hors ligne par un processus de planification. Nous proposons dans ce cadre un nouvel algorithme de programmation dynamique a base de points, synthese de la programmation dynamique multi-agent et de la programmation dynamique a base de points mono-agent. Il presente l'avantage de concentrer l'effort de calcul dans les regions pertinentes de l'espace des politiques. Nous introduisons aussi et pour la premiere fois un algorithme de recherche heuristique pour la planification optimale de comportements decentralises, base sur la recherche A* du meilleur d'abord. Lorsque le modele n'est pas connu, la politique globale peut etre obtenue par un processus d'essai erreur au sein de chaque agent. Il s'agit alors de l'apprentissage, et plus particulierement de l'apprentissage par renforcement. Nous analysons les contraintes supplementaires dans le cas de l'apprentissage multi-agent, et nous introduisons un nouvel algorithme d'apprentissage par renforcement multi-agent par notifications reciproques.
Nous abordons dans cette these la resolution optimale des processus de decision markoviens decentralises (DEC-POMDPs). Le modele DEC-POMDP constitue un formalisme theorique pour la description de problemes de prise de decision distribuee et cooperative, et cette these est l'une des premieres a proposer des algorithmes exactes de recherche de politiques optimales. Les avancees qui en decoulent nous permettent en particulier de proposer un cadre theorique pour la construction des systemes multi-agents. Nous distinguons deux familles d'approches pour la resolution des DEC-POMDPs. Lorsqu'un modele a priori est disponible, une solution optimale peut-etre obtenue de maniere centralisee et hors ligne par un processus de planification. Nous proposons dans ce cadre un nouvel algorithme de programmation dynamique a base de points, synthese de la programmation dynamique multi-agent et de la programmation dynamique a base de points mono-agent. Il presente l'avantage de concentrer l'effort de calcul dans les regions pertinentes de l'espace des politiques. Nous introduisons aussi et pour la premiere fois un algorithme de recherche heuristique pour la planification optimale de comportements decentralises, base sur la recherche A* du meilleur d'abord. Lorsque le modele n'est pas connu, la politique globale peut etre obtenue par un processus d'essai erreur au sein de chaque agent. Il s'agit alors de l'apprentissage, et plus particulierement de l'apprentissage par renforcement. Nous analysons les contraintes supplementaires dans le cas de l'apprentissage multi-agent, et nous introduisons un nouvel algorithme d'apprentissage par renforcement multi-agent par notifications reciproques.
Patrouiller implique habituellement une equipe d'agents dont le but consiste a visiter aussi frequemment que possible les zones strategiques d'un environnement. Pour une telle tâche, les agents impliques doivent coordonner leurs actions afin d'atteindre des performances optimales. Les recherches actuelles sur le probleme de la patrouille multi-agent (ou PPMA) considere generalement que l'environnement est reduit a un graphe metrique. Sous cette hypothese, ce probleme peut donc concerner une large gamme d'applications, telles que la gestion d'un reseau informatique, les jeux video ou la determination d'itineraires de vehicules. Dans cet article, nous concentrons notre attention sur des instances particulieres de ce probleme. Nous considerons uniquement le pire cas ou tous les agents commencent a patrouiller a partir d'un noeud donne. Nous formulons le probleme de la patrouille multi-agent a l'aide d'un processus decisionnel de Markov (PDM). Trouver une politique optimale de patrouille se reduira alors a resoudre ce PDM. Nous prouvons d'une part que les strategies multi-agents optimales sont necessairement cycliques. D'autre part, nous avons montre que determiner une strategie de patrouille multi-agent consiste a trouver deux politiques a horizon ni. Un algorithme meilleur d'abord est utilise pour determiner une telle politique. Les resultats experimentaux montrent que, pour toutes les congurations testees, notre approche ameliore substantiellement ceux obtenus avec la methode d'apprentissage par renforcement proposee par Santana et al..
We introduce point-based dynamic programming (DP) for decentralized partially observable Markov decision processes (DEC-POMDPs), a new discrete DP algorithm for planning strategies for cooperative multi-agent systems. Our approach makes a connection between optimal DP algorithms for partially observable stochastic games, and point-based approximations for single-agent POMDPs. We show for the first time how relevant multi-agent belief states can be computed. Building on this insight, we then show how the linear programming part in current multi-agent DP algorithms can be avoided, and how multi-agent DP can thus be applied to solve larger problems. We derive both an optimal and an approximated version of our algorithm, and we show its efficiency on test examples from the literature.
RESUME. Nous presentons un nouvel algorithme de planification pour la constructio n de systemes multi-agents reactifs et situes pouvant se modeliser par des proces sus de decision de Markov decentralises (DEC-POMDP). Cet algorithme est fonde sur la pr dynamique a base de points. Il est derive de techniques de programmation dy namique optimale utilisees pour resoudre des jeux stochastiques partiellement observable s(POSG) et des techniques d’approximation utilisees pour resoudre des POMDP mono-agen ts. Nous montrons pour la premiere fois qu’il est possible de determiner un ensemble d’etats de cr oyance multi-agent pertinents, et nous montrons comment ce calcul permet ensuite d’evite r le recours a la programmation lineaire tres couteuse dans le cas multi-agent. Nous detaillons une ver sion exacte et une version approximative de notre algorithme, et nous montrons son effica cite sur un exemple de la litterature.
In the domain of decentralized Markov decision processes, we develop the first complete and optimal algorithm that is able to extract deterministic policy vectors based on finite state controllers for a cooperative team of agents. Our algorithm applies to the discounted infinite horizon case and extends best-first search methods to the domain of decentralized control theory. We prove the optimality of our approach and give some first experimental results for two small test problems. We believe this to be an important step forward in learning and planning in stochastic multi-agent systems.
Nous presentons ici MAA*, le premier algorithme de recherche heuristique a la fois complet et optimal pour resoudre des processus de decision markovien decentralises (DEC-POMDPs) a horizon fini. Il permet de calculer des plans optimaux pour un groupe d'agents cooperatifs dans un environnement stochastique et partiellement observable. La resolution de tels problemes est particulierement dur, mais permet d'aborder des domaines importants tels que le controle de robots autonomes. Notre approche consiste en une synthese entre des methodes de recherche heuristique et la theorie du controle decentralise, et nous sommes capables de montrer qu'elle presente des avantages interessants vis-a-vis des solutions existantes.
We present a new algorithm for cooperative reinforcement learning in multiagent systems. Our main concern is the correct coordination between the members of the team: We seek to obtain an optimal solution for the team as a whole while keeping the learning as much decentralized as possible. We consider autonomous and independently learning agents that do not store any explicit information about their teammatesý behavior, as well as possibly different reward functions for each agent. Coordination between agents occurs through communication, namely the mutual notification algorithm.
We present a new algorithm for cooperative reinforcement learning in multiagent systems. We consider autonomous and independently learning agents, and we seek to obtain an optimal solution for the team as a whole while keeping the learning as much decentralized as possible. Coordination between agents occurs through communication, namely the mutual notification algorithm. We define the learning problem as a decentralized process using the MDP formalism. We then give an optimality criterion and prove the convergence of the algorithm for deterministic environments. We introduce variable and hierarchical communication strategies which considerably reduce the number of communications. Finally we study the convergence properties and communication overhead on a small example.
Nous presentons un nouvel algorithme d'apprentissage par renforcement pour des systemes multi-agents cooperatifs. Le probleme de controle est formalise comme un processus de decision markovien que nous cherchons a resoudre de maniere decentralisee. Pour cela, nous proposons une variante du Q-learning avec communication, a savoir un mecanisme de notification reciproque. Nous allons introduire le probleme de cooperation multi-agents et poser un critere d'optimalite pour la solution souhaitee. Nous allons ensuite presenter l'algorithme de notification reciproque, prouver sa convergence et etudier des variantes de l'algorithme qui permettent des strategies de communication plus flexibles. Nous conclurons avec les performances de l'algorithme sur un exemple d'apprentissage precis.
Francois Charpillet合作论文数Automatics and Computer science (INRIA);National Institute of Research8
Alain Dutech合作论文数INRIA - Team MAIA ; LORIA1