Ride-Hailing Order Dispatching at DiDi via Reinforcement Learning

Qin, Zhiwei et al. — 2020


Résumé (FR)

Cet article décrit comment DiDi a fait évoluer son approche du dispatching d’ordres de covoiturage d’une optimisation combinatoire vers un modèle de processus de décision semi-Markovien avec apprentissage par renforcement profond. L’approche proposée apprend une fonction de valeur spatiotemporelle qui capture les effets à long terme des décisions de dispatching sur les revenus et la satisfaction des utilisateurs. Les politiques apprises sont déployées en production sur des millions de courses quotidiennes. Les expériences A/B en conditions réelles montrent des gains mesurables en termes de taux de réponse et de revenus des chauffeurs. Les auteurs discutent des défis pratiques liés au déploiement industriel de systèmes d’apprentissage par renforcement à grande échelle. Ce travail constitue une référence importante pour le transfert de méthodes RL vers des environnements de production réels. Il fournit également des perspectives sur les compromis entre exploration et exploitation dans des contextes commerciaux.

Summary (EN)

This paper describes how DiDi evolved its ride-hailing order dispatching from combinatorial optimization toward a semi-Markov decision process model with deep reinforcement learning. The proposed approach learns a spatiotemporal value function that captures long-term effects of dispatching decisions on revenue and user satisfaction. Learned policies are deployed in production serving millions of daily trips. Real-world A/B experiments demonstrate measurable gains in response rates and driver revenue. The authors discuss practical challenges of deploying industrial-scale reinforcement learning systems. This work is an important reference for transferring RL methods to real production environments. It also provides insights on exploration-exploitation tradeoffs in commercial contexts.


Points clés

AspectDétail
Thèmerl-fleet
VenueINFORMS Journal on Applied Analytics
Mots-clésorder dispatching, reinforcement learning, ride-hailing, DiDi, semi-Markov decision process
DOI10.1287/inte.2020.1047

Concepts liés