Stratégie innovante de tarification pour la recharge des véhicules électriques
Dans un contexte où les villes du monde entier cherchent à accélérer leur transition vers une mobilité durable, une étude pionnière menée par Lu Siyue et une équipe d’ingénieurs de State Grid Beijing Electric Power Company propose une approche révolutionnaire pour la gestion de la recharge des véhicules électriques (VE). Ce travail, publié dans le numéro de septembre 2024 de la revue Computer Applications and Software, introduit un modèle de tarification dynamique qui vise à optimiser simultanément l’intégration des énergies renouvelables et le flux du trafic urbain. Le cœur de la recherche repose sur un cadre d’optimisation en deux niveaux, conçu pour minimiser le coût social global tout en améliorant la stabilité du réseau électrique et en réduisant la congestion dans les zones métropolitaines.
La problématique centrale de cette étude est l’interdépendance croissante entre les réseaux de distribution d’électricité (DN) et les réseaux de transport urbain (UTN). L’essor massif des véhicules électriques, bien qu’essentiel pour la décarbonation, pose de nouveaux défis. Un comportement de recharge non coordonné peut entraîner des surcharges localisées sur le réseau, une utilisation inefficace de l’énergie éolienne ou solaire, et une augmentation de la congestion autour des stations de recharge. Les modèles de tarification traditionnels, souvent basés sur des tarifs horaires simples ou des prix fixes par station, échouent à saisir cette complexité systémique. Ils ne prennent pas en compte les interactions dynamiques entre la demande d’électricité, la disponibilité des sources renouvelables et les choix de trajet des conducteurs. Lu Siyue et son équipe ont donc conçu une solution plus holistique, capable de considérer à la fois l’incertitude de la production éolienne et la variabilité aléatoire des déplacements quotidiens.
Le modèle proposé est fondé sur une structure de programmation à deux niveaux. Le niveau supérieur, ou « couche supérieure », se concentre sur la détermination des frais de service de recharge (Charging Service Fees, CSF). Ce niveau est formulé comme un problème d’optimisation de cône du second ordre (SOCP), une technique mathématique sophistiquée qui permet de modéliser avec précision les contraintes physiques du réseau électrique, telles que les pertes de puissance, les limites de tension et de courant, tout en intégrant explicitement l’incertitude de la production éolienne. En traitant les CSF comme une variable de décision, le modèle donne aux gestionnaires du réseau un levier puissant. Ils peuvent ajuster ces frais en temps réel pour influencer le comportement des conducteurs, en les incitant à recharger lorsque le vent souffle fort et que l’énergie est abondante, ou à éviter les périodes de pointe où le réseau est sous tension.
Le niveau inférieur, ou « couche inférieure », simule le comportement des utilisateurs à l’aide d’un problème d’affectation du trafic basé sur le principe d’équilibre de l’utilisateur (User Equilibrium, UE). Contrairement aux modèles simplistes, cette couche ne suppose pas que tous les conducteurs suivent un itinéraire prédéfini. Elle reconnaît que les décisions sont rationnelles et individuelles : chaque conducteur cherche à minimiser son coût total, qui inclut le temps de trajet, le temps d’attente en file d’attente à la station de recharge, et le coût de l’électricité elle-même. Ce modèle prend en compte l’aléa des flux de trafic entre les points d’origine et de destination (OD), reflétant ainsi la nature imprévisible des déplacements urbains. L’interaction entre les deux niveaux crée un système dynamique : les prix de recharge (CSF) fixés par le gestionnaire du réseau influencent les choix de trajet des conducteurs, ce qui modifie la demande d’électricité dans différentes parties de la ville, ce qui à son tour affecte les conditions du réseau et peut justifier un nouvel ajustement des prix.
Ce qui distingue véritablement cette recherche est son utilisation du deep reinforcement learning (DRL), ou apprentissage par renforcement profond, pour résoudre ce problème complexe et stochastique. La nature couplée et incertaine du modèle à deux niveaux rend les méthodes d’optimisation classiques peu pratiques ou impossibles à appliquer à grande échelle. Le DRL, en revanche, offre une solution élégante. Il s’agit d’une approche inspirée du comportement humain, où un « agent » (dans ce cas, le système de tarification) apprend par essais et erreurs à prendre les meilleures décisions possibles dans un environnement complexe. En utilisant des réseaux de neurones, l’agent peut apprendre des relations non linéaires et subtiles entre des milliers de variables, comme la vitesse du vent à un endroit donné, le niveau de congestion sur une autoroute, et le prix optimal à appliquer à une station de recharge spécifique.
L’équipe de Lu Siyue a implémenté et comparé deux types d’algorithmes DRL : un basé sur les gradients (Deep Deterministic Policy Gradient, DDPG) et un autre sans gradient (Deep Genetic Policy, DGP). Les résultats ont été éloquents. L’algorithme DGP, qui fonctionne par une méthode d’évolution similaire à la sélection naturelle, a surpassé son homologue DDPG. Il a convergé vers des solutions plus proches de l’optimum théorique, démontrant une robustesse et une capacité d’adaptation supérieures, particulièrement dans des environnements très instables.
Les implications pratiques de cette recherche sont immenses. Dans une simulation sur un réseau test de cinq nœuds, l’application des CSF optimisés a permis de réduire le coût social global de 14,9 %, passant de 10 022,6 yuans à 8 543,2 yuans. Ce gain massif est le résultat d’une synergie parfaite entre l’énergie et les transports. L’utilisation de l’énergie éolique a connu une amélioration spectaculaire, avec un taux de rejet (curtailment) qui est tombé de 31,1 % à seulement 4,8 %. Cela signifie que presque toute l’énergie éolienne produite a pu être injectée dans le réseau, réduisant considérablement le gaspillage. Parallèlement, le trafic s’est équilibré : les routes principales, auparavant saturées, ont vu leur flux diminuer, tandis que les itinéraires secondaires ont été davantage utilisés. Bien que le coût individuel par trajet ait légèrement augmenté (de 1,43 à 1,45 yuans), le bénéfice pour la société dans son ensemble est indéniable, prouvant que de petits ajustements au niveau individuel peuvent générer des gains colossaux collectivement.
Pour tester la scalabilité de leur modèle, les chercheurs l’ont appliqué à un cas réel d’une ville, un réseau complexe de 39 nœuds et 10 stations de recharge. Ce réseau urbain, composé de routes périphériques, d’autoroutes urbaines et de voies intérieures, était alimenté par un réseau électrique avec trois parcs éoliens. Sous des conditions de demande de trafic et de production éolienne incertaines, la stratégie de tarification pilotée par DRL a réduit le coût total du système de 2,05 %. Plus impressionnant encore, elle a permis une intégration massive de l’énergie éolique : le taux de consommation est passé de 21,3 % à 62,6 % sur un nœud clé, et de 31,6 % à 95,3 % sur un autre. Ces chiffres témoignent d’une transformation radicale de la façon dont l’énergie renouvelable est absorbée par le système.
Un des points forts de l’étude est sa capacité à fonctionner « hors échantillon » (out-of-sample). En modifiant artificiellement les distributions de probabilité de la demande de trafic et de la production éolique, les chercheurs ont testé la robustesse de leur modèle face à des scénarios imprévus. Le système a maintenu des performances élevées, prouvant que la politique d’apprentissage n’est pas simplement surajustée aux données de formation, mais qu’elle a appris des principes généraux applicables à de nombreuses situations. Cette résilience est essentielle pour un déploiement dans le monde réel, où les conditions météorologiques et les habitudes de déplacement sont par nature volatiles.
La recherche met également en lumière les limites des méthodes traditionnelles. Lorsqu’elle a été comparée à un algorithme d’apprentissage par renforcement non profond (FQI) avec un espace d’actions discrétisé (par exemple, seulement trois niveaux de prix : bas, moyen, haut), la méthode DRL a largement dominé. L’algorithme FQI n’a réussi à converger que pour quelques stations et n’a réduit le coût total que de 0,20 %, soit dix fois moins que le DRL. Ce contraste frappant souligne l’importance cruciale des espaces d’actions continus et des représentations d’état de haute dimension offerts par le deep learning pour gérer des systèmes complexes et interconnectés.
Sur le plan politique, les résultats suggèrent une voie vers une gouvernance urbaine plus intelligente. Actuellement, les services publics et les autorités de transport opèrent souvent en silos, ce qui conduit à des inefficacités. Cette étude démontre que la coordination centralisée peut débloquer des gains majeurs. Un opérateur pourrait, par exemple, prévoir une forte production éolique l’après-midi et en conséquence baisser les frais de recharge dans les stations à proximité, incitant ainsi les conducteurs à recharger à ce moment-là. Inversement, si un système de surveillance détecte une congestion croissante autour d’une station populaire, les frais peuvent être augmentés temporairement pour détourner le trafic vers des stations moins chargées. Cette capacité à passer d’une gestion réactive à une gestion proactive est une révolution pour la planification urbaine.
Le rôle de l’intelligence artificielle dans cette transformation est fondamental. Alors que les anciens systèmes de « recharge intelligente » reposaient sur des règles simples et rigides, le DRL permet une prise de décision adaptative et basée sur les données. Le réseau neuronal apprend à comprendre des relations complexes : comment une augmentation de 10 % de la production éolique à un endroit donné influence-t-elle le prix optimal à appliquer à une station située à 5 kilomètres de là ? Cette connaissance est appliquée en temps réel, et au fil des itérations, la politique devient de plus en plus fine, atteignant des performances quasi optimales même dans des environnements chaotiques.
Une autre force du DRL est sa capacité à fonctionner avec une information partielle. Dans la réalité, un opérateur ne connaît pas l’état de charge de chaque véhicule, sa destination exacte ou son itinéraire préféré. Le modèle contourne cette limitation en utilisant des données agrégées observables, comme le flux de trafic global sur une route ou la vitesse du vent, comme des indicateurs suffisants pour guider ses décisions. À travers une interaction continue avec l’environnement, l’agent apprend à inférer des états cachés et à agir de manière optimale, tout comme un opérateur humain expérimenté le ferait.
Les applications de ce cadre vont bien au-delà de la recharge des véhicules électriques. Il pourrait être adapté à la gestion du transport en commun, des services de vélos en libre-service, ou des scooters électriques. En traitant le prix comme un levier de contrôle et en utilisant le machine learning pour l’optimiser, les villes peuvent atteindre une allocation des ressources plus efficace, réduire leur empreinte carbone et améliorer significativement la qualité de vie de leurs habitants. À mesure que les populations urbaines continuent de croître, ces outils deviendront indispensables.
Enfin, l’étude se distingue par son engagement envers la transparence et la reproductibilité. Toutes les simulations ont été réalisées avec des solveurs open-source (Mosek et Baron) dans un environnement Python, et le cadre DRL a été construit avec PyTorch, une bibliothèque largement utilisée et reconnue. La comparaison rigoureuse avec des méthodes de référence, y compris la programmation stochastique basée sur des scénarios, garantit que les conclusions sont solides et bien étayées. L’utilisation de topologies de réseaux réalistes renforce la validité externe des résultats.
En conclusion, le travail de Lu Siyue et de ses collègues représente une avancée majeure dans l’intégration des systèmes énergétiques et de transport. En combinant une modélisation mathématique rigoureuse avec les dernières avancées en intelligence artificielle, ils ont conçu une stratégie de tarification qui est à la fois techniquement robuste et pragmatiquement applicable. Elle offre une feuille de route claire pour les villes qui cherchent à devenir plus intelligentes, plus vertes et plus résilientes. Avec des tests sur le terrain et des affinements supplémentaires, cette recherche pourrait bien devenir la pierre angulaire d’une nouvelle ère de gestion urbaine intégrée.
Lu Siyue, Ji Hongquan, Zhang Lu, Xu Hui, Wang Peiyi, State Grid Beijing Electric Power Company, Computer Applications and Software, DOI: 10.3969/j.issn.1000-386x.2024.09.053