Real-world ride-hailing vehicle repositioning using deep reinforcement learning
Jiao, Yan et al. — 2021
Résumé (FR)
Cet article présente un cadre pratique basé sur l’apprentissage par renforcement profond et la planification au moment de la décision pour le repositionnement de véhicules en temps réel sur les plateformes de covoiturage. L’approche apprend la fonction de valeur d’état spatiotemporel à l’aide d’un algorithme d’entraînement par lots avec des réseaux de valeur profonds. La politique optimale de repositionnement est générée à la demande via une recherche de politique basée sur la valeur. Le cadre est évalué en simulation et en déploiement réel, démontrant des performances prometteuses. Les auteurs montrent comment intégrer les connaissances du domaine métier dans l’architecture d’apprentissage par renforcement. La méthode est validée sur des données de course réelles issues de plateformes opérationnelles. Les résultats confirment la supériorité de l’approche sur les stratégies de repositionnement heuristiques.
Summary (EN)
This paper presents a practical deep reinforcement learning and decision-time planning framework for real-world vehicle repositioning on ride-hailing platforms. The approach learns the spatiotemporal state-value function using a batch training algorithm with deep value networks. The optimal repositioning action is generated on-demand through value-based policy search. The framework is evaluated in simulation and real-world deployment, demonstrating promising performance. The authors show how to integrate domain knowledge into the reinforcement learning architecture. The method is validated on real trip data from operational platforms. Results confirm the superiority of the approach over heuristic repositioning strategies.
Points clés
| Aspect | Détail |
|---|---|
| Thème | rl-fleet |
| Venue | Transportation Research Part C: Emerging Technologies |
| Mots-clés | vehicle repositioning, deep reinforcement learning, ride-hailing, spatiotemporal value function, decision-time planning |
| DOI | 10.1016/j.trc.2021.103289 |