A Deep Value-network Based Approach for Multi-Driver Order Dispatching
Tang, Xiaocheng et al. — 2019
Résumé (FR)
Cet article présente une approche basée sur des réseaux de valeur profonds pour le dispatching d’ordres multi-conducteurs sur la plateforme DiDi. Le problème de dispatching est modélisé comme un processus de décision semi-Markovien pour prendre en compte la dimension temporelle des actions. Les auteurs proposent les Cerebellar Value Networks (CVNet) avec une couche de représentation d’état distribué innovante. Un schéma d’évaluation de politique régularisée pénalise les grandes constantes de Lipschitz du réseau de valeur pour améliorer la robustesse. Des tests A/B à grande échelle sur la plateforme DiDi démontrent des améliorations significatives du revenu total des conducteurs et de l’expérience utilisateur. Ce travail illustre comment l’apprentissage par renforcement profond peut être déployé industriellement pour le dispatching de véhicules. Les résultats valident la supériorité de l’approche sur les méthodes combinatoires classiques.
Summary (EN)
This paper presents a deep value-network based approach for multi-driver order dispatching on the DiDi ride-hailing platform. The dispatching problem is modeled as a Semi Markov Decision Process to account for the temporal aspect of dispatching actions. The authors propose Cerebellar Value Networks (CVNet) with a novel distributed state representation layer. A regularized policy evaluation scheme penalizes large Lipschitz constants of the value network for robustness against noise. Large-scale online A/B tests on DiDi’s platform demonstrate significant improvements in total driver income and user experience metrics. This work illustrates how deep reinforcement learning can be industrially deployed for vehicle dispatching. Results validate the superiority of the approach over classical combinatorial methods.
Points clés
| Aspect | Détail |
|---|---|
| Thème | rl-fleet |
| Venue | Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining (KDD 2019) |
| Mots-clés | order dispatching, deep reinforcement learning, ride-hailing, semi-Markov decision process, DiDi |
| DOI | 10.1145/3292500.3330724 |