One Step is Enough: Multi-Agent Reinforcement Learning based on One-Step Policy Optimization for Order Dispatch on Ride-Sharing Platforms

Zijian et al. — 2025


Résumé (FR)

Cet article s’attaque au problème de dispatch de commandes dans les systèmes de covoiturage avec véhicules autonomes (AV) via l’apprentissage par renforcement multi-agents (MARL). Le MARL est présenté comme une solution prometteuse permettant de décomposer les espaces d’état et d’action larges entre agents individuels pour contourner la malédiction de la dimensionnalité. Les auteurs proposent deux nouvelles méthodes contournant l’estimation de la fonction de valeur en exploitant la propriété d’homogénéité des flottes AV. Ils adaptent Group Relative Policy Optimization (GRPO) pour la tâche de dispatch, puis introduisent One-Step Policy Optimization (OSPO), plus efficace, entraînable avec des récompenses de groupe à une seule étape. Les expériences valident la supériorité des approches proposées sur des benchmarks de covoiturage réalistes.

Summary (EN)

Order dispatch is a critical task in autonomous vehicle ride-sharing systems. The paper proposes two novel MARL methods that bypass value function estimation by leveraging the homogeneous property of AV fleets: an adaptation of Group Relative Policy Optimization (GRPO) and a more efficient One-Step Policy Optimization (OSPO) trained with one-step group rewards. Experiments demonstrate superior performance over state-of-the-art baselines.


Points clés

AspectDétail
——

Lien avec la problématique

Concepts liés