Modèle d’Optimisation pour Flottes de Taxis Autonomes Améliore Rentabilité et Efficacité
Une équipe de chercheurs de l’Université de technologie de Guangdong a mis au point un modèle révolutionnaire de planification dynamique pour les flottes de taxis électriques autonomes, qui améliore considérablement la rentabilité opérationnelle à long terme en intégrant des prévisions de revenus futurs dans la prise de décision en temps réel. Conçu par Zeng Weiliang et Han Yu de l’École d’automatisation, en collaboration avec Fu Hui de l’École d’ingénierie électromécanique, ce modèle exploite des techniques d’apprentissage par renforcement pour optimiser simultanément les stratégies de routage, de charge et de décharge. Cette avancée marque un tournant décisif dans le domaine de la mobilité urbaine intelligente.
Publié dans la revue Industrial Engineering Journal, l’étude aborde une limitation critique des modèles traditionnels de gestion des taxis : leur focalisation excessive sur l’optimisation des coûts immédiats, au détriment de l’impact que les décisions actuelles peuvent avoir sur les bénéfices futurs. Les systèmes conventionnels s’appuient souvent sur des algorithmes de correspondance avides, attribuant tout simplement le véhicule disponible le plus proche à chaque nouvelle demande de course, sans tenir compte de la façon dont cette décision affectera la disponibilité future, le positionnement stratégique ou le coût énergétique. Bien que ces méthodes soient efficaces sur le plan computationnel, elles conduisent fréquemment à une distribution sous-optimale de la flotte, à des temps d’attente plus longs pour les passagers et à une utilisation inefficace de l’énergie, en particulier pour les flottes autonomes à grande échelle fonctionnant 24 heures sur 24.
Pour surmonter ces lacunes, l’équipe a développé un nouveau cadre qui évalue non seulement le bénéfice immédiat de chaque décision d’attribution, mais aussi son impact potentiel sur les gains futurs. Cette approche prospective est rendue possible grâce à l’utilisation d’une fonction de valeur d’état approximée par des réseaux neuronaux profonds, qui estime le retour cumulatif à long terme associé à l’état spatio-temporel d’un véhicule après l’exécution d’une action spécifique. En intégrant cette valeur future prévue dans la décision d’attribution actuelle, le modèle permet un repositionnement plus stratégique des véhicules, une gestion intelligente de la charge et une meilleure correspondance avec les passagers.
L’innovation centrale réside dans l’intégration de la technologie Véhicule vers le réseau (V2G) et des tarifs d’électricité variables selon les heures dans la logique de planification. Contrairement aux modèles conventionnels qui considèrent la charge comme une activité nécessaire mais passive, ce système utilise activement les stations de charge comme des micro-réseaux, où les taxis autonomes inactifs peuvent se charger pendant les heures creuses ou vendre de l’énergie au réseau pendant les pics de consommation, générant ainsi des revenus supplémentaires. Ce flux bidirectionnel d’énergie transforme les véhicules électriques, de simples unités de transport, en actifs énergétiques mobiles qui contribuent à la stabilité du réseau tout en réduisant simultanément les coûts opérationnels de la flotte.
Le modèle fonctionne dans une fenêtre temporelle fixe — fixée à cinq minutes dans la simulation — pendant laquelle le système évalue toutes les actions disponibles pour chaque véhicule « attribuable ». Ces actions incluent le stationnement, le repositionnement vers une nouvelle zone, la charge, la décharge ou l’acceptation d’une demande de passager. Chaque action reçoit une valeur composée qui combine son retour financier immédiat avec la valeur future actualisée de l’état résultant du véhicule. La solution globale d’attribution est ensuite déterminée en résolvant un problème de correspondance bipartite pondérée qui maximise la valeur totale de la flotte, tout en respectant des contraintes telles qu’un véhicule par course et une course par véhicule.
Pour garantir une efficacité computationnelle et une évolutivité, les chercheurs ont mis en œuvre un processus de résolution en deux étapes. Tout d’abord, une heuristique gloutonne identifie une solution initiale de haute qualité basée sur le classement des valeurs d’action, en priorisant l’acceptation des passagers lorsque les valeurs sont comparables. Cette solution initiale est ensuite affinée à l’aide d’un solveur de programmation en nombres entiers, permettant au système de gérer des environnements urbains à grande échelle avec des centaines de véhicules et des milliers de nœuds. L’ensemble du processus est répété à chaque pas de temps, permettant une adaptation continue aux conditions de circulation et aux modèles de demande en évolution.
L’entraînement de la fonction de valeur d’état repose sur une architecture d’apprentissage par renforcement profond améliorée par des réseaux neuronaux doubles et un mécanisme de répétition d’expérience, des techniques couramment utilisées dans l’apprentissage Q profond (DQN). Un réseau d’évaluation estime la valeur actuelle des états des véhicules, tandis qu’un réseau cible distinct fournit des signaux d’entraînement stables en calculant les retours futurs par bootstrap. Les tuples d’expérience — composés d’un état, d’une action, d’une récompense et d’un état suivant — sont stockés dans un tampon de répétition et échantillonnés par mini-lots pour mettre à jour le réseau d’évaluation, améliorant ainsi l’efficacité des données et réduisant la corrélation entre les mises à jour consécutives. L’équilibre entre exploration et exploitation est géré par une politique ε-greedy, où le système explore initialement des actions aléatoires pour recueillir diverses expériences avant de passer progressivement à des décisions guidées par la valeur à mesure que le modèle converge.
La validation expérimentale a été réalisée à l’aide d’un réseau routier simulé extrait de Shenzhen, couvrant une zone urbaine de 6 km × 6 km avec 2 876 routes et 1 712 intersections. La flotte de test se composait de 40 véhicules électriques autonomes, chacun équipé d’une batterie de 200 kWh, capable de se charger et de se décharger à 150 kW. Les demandes de courses ont été générées selon un processus de Poisson calibré avec des données historiques de demande de taxis, les probabilités d’origine étant concentrées vers le centre-ville et les destinations attribuées aléatoirement. La tolérance d’attente des passagers a été modélisée comme une variable aléatoire uniforme entre 10 et 30 minutes, reflétant des attentes utilisateur réalistes.
Les tarifs commerciaux d’électricité variables selon les heures à Shenzhen ont été intégrés à la simulation, avec des périodes distinctes de pointe, de période intermédiaire et d’heures creuses. Pendant les heures de pointe (10h00–15h00 et 18h00–21h00), les prix de l’électricité ont atteint 1,38 yuan/kWh, tandis qu’en heures creuses, ils sont tombés à 0,28 yuan/kWh entre 23h00 et 07h00. Cette différence de prix significative crée de puissants incitations économiques pour des stratégies intelligentes de charge et de décharge, que le modèle proposé exploite pour minimiser les coûts énergétiques nets.
Les performances ont été comparées à trois approches établies : Premier arrivé, premier servi (FCFS), qui attribue le véhicule disponible le plus proche à chaque demande ; Avantage optimal (OB), qui maximise le revenu immédiat à chaque pas de temps ; et un modèle standard de Réseau Q profond (DQN) adapté à l’attribution de plusieurs véhicules. Tous les algorithmes ont été testés sur une période de fonctionnement simulée de 100 jours, les résultats étant moyennés sur 10 ensembles de tests indépendants pour garantir une solidité statistique.
Les résultats ont révélé des avantages substantiels pour le modèle proposé. Au cours de la simulation de 100 jours, le nouveau modèle a obtenu une augmentation de 25 % du profit opérationnel total par rapport au meilleur modèle de référence. Ce gain provient d’une combinaison de taux de service plus élevés, de dépenses énergétiques réduites et d’une meilleure utilisation de la flotte. Plus précisément, le taux de réponse aux passagers — la proportion de demandes de course satisfaites avec succès — a augmenté de 4 points de pourcentage, dépassant 73 % contre 69 % pour le DQN et moins de 60 % pour FCFS et OB. Par ailleurs, le temps d’attente moyen des passagers a diminué de 20 %, passant de plus de 20 minutes avec FCFS à un peu moins de 8 minutes, améliorant ainsi la satisfaction des utilisateurs et la compétitivité sur le marché de la mobilité.
La réduction des coûts énergétiques a été particulièrement impressionnante. Malgré une consommation électrique globale plus élevée due à une plus grande mobilité des véhicules et à un volume de service accru, le coût énergétique net — la différence entre les dépenses de charge et les revenus de décharge — a été réduit de 50 %. Cette économie spectaculaire est attribuée à la capacité du modèle à anticiper les fluctuations des prix et à planifier stratégiquement la charge pendant les périodes à faible coût, tout en vendant l’énergie stockée au réseau pendant les fenêtres de prix élevés. En revanche, le modèle DQN, bien qu’il ait tenté d’intégrer la valeur future, n’a pas réussi à saisir pleinement les modèles temporels des prix de l’électricité et a souvent convergé vers des optima locaux, conduisant à une gestion énergétique moins efficace.
Le succès du modèle souligne également l’importance d’une conception de système holistique dans la mobilité autonome. Plutôt que de traiter le routage, la charge et la correspondance des passagers comme des problèmes d’optimisation séparés, le cadre intégré reconnaît leur interdépendance. Par exemple, envoyer un véhicule vers une zone à forte demande située à distance peut entraîner des coûts de déplacement immédiats, mais peut générer des récompenses à long terme plus élevées s’il permet plusieurs courses consécutives. De même, retarder une course pour se charger d’abord dans une station voisine peut légèrement augmenter le temps d’attente du passager, mais garantit que le véhicule reste opérationnel et évite des relocalisations d’urgence coûteuses ultérieurement.
En outre, le modèle démontre comment les flottes autonomes peuvent servir de ressources énergétiques flexibles au sein de l’infrastructure des villes intelligentes. En agrégeant la capacité de stockage de dizaines, voire de centaines de véhicules, les opérateurs de flotte peuvent participer à des programmes de réponse à la demande, fournir des services de régulation de fréquence et aider à équilibrer l’intégration des énergies renouvelables. Ce double rôle — en tant que fournisseurs de mobilité et actifs soutenant le réseau — améliore la viabilité économique des services de mobilité autonome tout en contribuant à des objectifs de durabilité plus larges.
Une autre force clé de l’approche est son adaptabilité à différents contextes urbains et exigences opérationnelles. La fonction de valeur basée sur les réseaux neuronaux peut être réentraînée avec des modèles de demande locaux, des réseaux routiers et des tarifs électriques, la rendant applicable à des villes du monde entier. En outre, la conception modulaire permet l’intégration de contraintes ou d’objectifs supplémentaires, tels que des modèles de dégradation de la batterie, la congestion des stations de charge ou des métriques d’impact environnemental, sans nécessiter de changements fondamentaux dans l’algorithme principal.
Malgré ses succès, les auteurs reconnaissent plusieurs limites et pistes pour des travaux futurs. Le modèle actuel suppose des conditions idéalisées, notamment une charge/décharge instantanée, aucune file d’attente aux stations de charge et une connaissance parfaite des distributions de demande futures. Dans une mise en œuvre réelle, des facteurs tels que le vieillissement de la batterie, les taux de charge variables et le comportement incertain des passagers devraient être pris en compte. En outre, la transition de la simulation aux tests dans le monde réel présente des défis liés à la précision des capteurs, à la latence de communication et à la garantie de sécurité.
Cependant, cette étude représente un pas significatif en avant dans la gestion intelligente des flottes de véhicules électriques autonomes. Son accent mis sur la valeur à long terme plutôt que sur les gains à court terme s’aligne sur les réalités opérationnelles des services de mobilité 24/7, où les décisions prises aujourd’hui influencent directement la rentabilité de demain. Alors que les villes du monde entier cherchent à réduire la congestion, les émissions et les coûts de transport, des solutions comme celle-ci offrent une voie vers des systèmes de mobilité urbaine plus efficaces, durables et économiquement viables.
Les implications s’étendent au-delà des services de covoiturage. Les mêmes principes pourraient être appliqués à d’autres applications de véhicules autonomes partagés, comme les flottes de livraison, les navettes de microtransit ou la logistique du dernier kilomètre. Dans chaque cas, la capacité d’anticiper la demande future et d’optimiser à la fois le mouvement et l’utilisation de l’énergie peut conduire à des améliorations substantielles de la performance. En outre, à mesure que la technologie des véhicules autonomes mûrit et que les cadres réglementaires évoluent, l’intégration des capacités V2G pourrait devenir une fonctionnalité standard, transformant les véhicules électriques en composants intégraux de réseaux énergétiques distribués.
D’un point de vue politique, la recherche souligne la nécessité d’une planification coordonnée entre les secteurs des transports et de l’énergie. Les municipalités qui investissent dans la mobilité autonome doivent considérer les synergies avec le développement des réseaux intelligents, en s’assurant que l’infrastructure de charge ne soit pas seulement suffisante en quantité, mais aussi stratégiquement positionnée et capable de gérer des flux d’énergie bidirectionnels. Les structures d’incitation, telles que les prix dynamiques ou les péages de congestion, peuvent encore plus orienter le comportement de la flotte vers des résultats socialement optimaux, comme une congestion réduite dans le centre-ville ou des pics de charge électrique plus bas.
Pour les parties prenantes industrielles, l’étude fournit un cas d’affaires convaincant pour l’adoption de systèmes avancés d’attribution pilotés par l’intelligence artificielle. Bien que l’investissement initial dans l’infrastructure de données et l’expertise en apprentissage automatique puisse être significatif, les retours à long terme en termes de revenus accrus, de coûts opérationnels réduits et de satisfaction client accrue peuvent largement dépasser ces dépenses. Les entreprises qui adoptent ces technologies tôt pourraient acquérir un avantage concurrentiel sur le marché de la mobilité en tant que service, en pleine évolution rapide.
En conclusion, le travail de Zeng Weiliang, Han Yu et Fu Hui présente une solution complète et pratique à l’un des défis les plus urgents dans le domaine du transport autonome : comment équilibrer les exigences de service immédiates avec l’efficacité opérationnelle à long terme. En intégrant les attentes de revenus futurs dans les décisions d’attribution en temps réel et en exploitant la fonctionnalité double des véhicules électriques en tant que transporteurs et porteurs d’énergie, le modèle établit une nouvelle norme pour la gestion intelligente des flottes. À mesure que les taxis électriques autonomes passeront de projets pilotes à une mise en œuvre généralisée, des approches comme celle-ci seront essentielles pour débloquer tout leur potentiel économique et environnemental.
Zeng Weiliang, Han Yu, Fu Hui. Industrial Engineering Journal. doi: 10.3969/j.issn.1007-7375.230095