A Deep Value-network Based Approach for Multi-Driver Order Dispatching

Tang, Xiaocheng et al. — 2019


Résumé (FR)

Cet article présente une approche basée sur des réseaux de valeur profonds pour le dispatching d’ordres multi-conducteurs sur la plateforme DiDi. Le problème de dispatching est modélisé comme un processus de décision semi-Markovien pour prendre en compte la dimension temporelle des actions. Les auteurs proposent les Cerebellar Value Networks (CVNet) avec une couche de représentation d’état distribué innovante. Un schéma d’évaluation de politique régularisée pénalise les grandes constantes de Lipschitz du réseau de valeur pour améliorer la robustesse. Des tests A/B à grande échelle sur la plateforme DiDi démontrent des améliorations significatives du revenu total des conducteurs et de l’expérience utilisateur. Ce travail illustre comment l’apprentissage par renforcement profond peut être déployé industriellement pour le dispatching de véhicules. Les résultats valident la supériorité de l’approche sur les méthodes combinatoires classiques.

Summary (EN)

This paper presents a deep value-network based approach for multi-driver order dispatching on the DiDi ride-hailing platform. The dispatching problem is modeled as a Semi Markov Decision Process to account for the temporal aspect of dispatching actions. The authors propose Cerebellar Value Networks (CVNet) with a novel distributed state representation layer. A regularized policy evaluation scheme penalizes large Lipschitz constants of the value network for robustness against noise. Large-scale online A/B tests on DiDi’s platform demonstrate significant improvements in total driver income and user experience metrics. This work illustrates how deep reinforcement learning can be industrially deployed for vehicle dispatching. Results validate the superiority of the approach over classical combinatorial methods.


Points clés

AspectDétail
Thèmerl-fleet
VenueProceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining (KDD 2019)
Mots-clésorder dispatching, deep reinforcement learning, ride-hailing, semi-Markov decision process, DiDi
DOI10.1145/3292500.3330724

Concepts liés