Nouvelle méthode IA stabilise la tension du réseau face aux énergies renouvelables
L’essor des véhicules électriques et des énergies renouvelables solaires et éoliennes impose aux réseaux de distribution électrique des défis sans précédent. L’instabilité de tension, autrefois rare, devient aujourd’hui une réalité quotidienne pour de nombreux systèmes de distribution actifs. La racine du problème réside dans l’imprévisibilité et la rapidité des fluctuations de puissance générées par les parcs photovoltaïques et les stations de recharge rapide pour véhicules électriques. Ces variations, pouvant parfois dépasser 15% de la capacité nominale en une minute, risquent de faire sortir les tensions nodales des limites de sécurité, menaçant la stabilité du réseau et la durée de vie des équipements.
Les méthodes traditionnelles de régulation de tension, s’appuyant sur des dispositifs comme les régulateurs de tension (VR), les condensateurs commutables (SCR) et les systèmes de stockage d’énergie (ESS), peinent à suivre le rythme. Ces équipements opèrent sur des échelles de temps différentes : les VR et SCR sont lents, conçus pour minimiser l’usure mécanique, tandis que les onduleurs des générateurs distribués (DG) et les compensateurs statiques d’énergie réactive (SVC) peuvent répondre en quelques secondes. Cette disparité de temps de réponse crée un problème complexe de coordination. L’interaction non coordonnée entre dispositifs rapides et mécaniques lents peut entraîner une commutation excessive, une saturation des contrôles, voire un effondrement de tension.
Les tentatives de résolution par modèles d’optimisation conventionnels ont montré leurs limites. Le problème est intrinsèquement non convexe et implique un mélange de variables décisionnelles continues et discrètes – comme la puissance de charge continue d’une batterie et la position discrète du prise d’un régulateur de tension. Résoudre ce problème d’optimisation non linéaire en nombres entiers mixte à grande échelle est prohibitif en calcul, surtout pour des applications en temps réel. La complexité croît exponentiellement avec la taille du réseau, en faisant un problème NP-difficile. Cette complexité a stimulé l’intérêt pour les approches basées sur les données, notamment l’apprentissage par renforcement profond (DRL), capable d’apprendre des politiques de contrôle optimales par l’expérience sans nécessiter un modèle mathématique explicite du réseau.
Cependant, les méthodes DRL existantes présentent leurs propres limitations. Les Deep Q-Networks (DQN), par exemple, sont efficaces pour les actions discrètes mais échouent avec des variables continues. Inversement, des algorithmes comme le Deep Deterministic Policy Gradient (DDPG) excellent avec les actions continues mais ne peuvent gérer les actions discrètes. Dans un réseau avec multiples VR et SCR, chacun ayant de nombreuses positions discrètes, une approche DQN mène à une « malédiction de la dimensionnalité », où l’espace d’action devient si vaste que l’apprentissage devient inefficace et instable. Des solutions multi-agents DRL ont été proposées pour atténuer ceci, mais elles introduisent de nouvelles complexités de coordination et de convergence.
Une solution innovante émerge d’un effort de recherche collaboratif mené par Jian Zhang de l’Université de Technologie de Hefei, Mingjian Cui de l’Université de Tianjin et Yigang He de l’Université de Wuhan. Leurs travaux, publiés dans la prestigieuse Transactions of China Electrotechnical Society, présentent une nouvelle stratégie de coordination de tension bi-temporelle qui combine harmonieusement les forces de l’apprentissage basé sur les données et la rigueur de la modélisation physique. Cette approche hybride, contrairement aux méthodes purement sans modèle ou purement basées sur un modèle, est conçue pour surmonter les limitations fondamentales des deux paradigmes.
L’innovation centrale réside dans son architecture de contrôle hiérarchique à deux couches. La première couche opère sur une échelle de temps lente – typiquement horaire – et est responsable de fixer les points de fonctionnement à long terme des dispositifs lents : les rapports de transformation des VR, les états de commutation des SCR et la puissance de charge/décharge des ESS. C’est ici que la complexité des actions mixtes discrètes-continues est la plus aiguë. Pour la résoudre, les chercheurs ont développé un algorithme Deep Deterministic Policy Gradient (DDPG) adapté. L’idée maîtresse est un processus en trois étapes : relaxation, prédiction et correction.
Lors de la phase de relaxation, les positions discrètes des prises des VR et SCR sont traitées comme des variables continues, permettant au réseau acteur du DDPG de produire une « action prototype » incluant à la fois des composantes continues (puissance ESS) et discrètes relaxées (rapport VR, état SCR). Durant la phase de prédiction, au lieu de forcer ce prototype en une action discrète unique, l’algorithme recherche dans l’espace d’actions discrètes les K plus proches voisins des valeurs relaxées. Ceci crée un ensemble restreint et gérable d’actions candidates. Lors de la phase de correction, chaque candidat est jumelé avec la puissance ESS continue du prototype et évalué par le réseau critique pour déterminer sa valeur attendue à long terme. L’action avec la valeur la plus élevée est ensuite sélectionnée pour implémentation.
Ce mécanisme « relaxation-prédiction-correction » est une trouvaille remarquable. Il permet à l’apprentissage fluide et basé sur le gradient du DDPG de guider la recherche dans l’espace discret, évitant l’explosion combinatoire d’une approche DQN pure. En évaluant seulement K candidats (par exemple 20 ou 40) par décision, la charge computationnelle reste faible, tandis que la politique peut encore converger vers une solution quasi-optimale. Les chercheurs ont démontré que cette méthode permet un processus d’entraînement bien plus stable et une convergence beaucoup plus rapide que les méthodes multi-agents DQN existantes.
La seconde couche du système de contrôle opère sur une échelle de temps rapide – toutes les 5 à 15 minutes – et gère les fluctuations rapides de tension causées par l’intermittence des renouvelables et de la charge des VE. À cette couche, les décisions de l’échelle lente (positions VR, états SCR, puissance ESS) sont traitées comme des paramètres fixes. Dans ce contexte, le système calcule alors la puissance réactive optimale de sortie pour tous les onduleurs des DG et les SVC. Ceci est réalisé non pas avec un autre agent DRL, mais en résolvant un modèle de programmation quadratique (QP) basé sur la physique, dérivé des équations de flux de puissance du réseau de distribution.
C’est ici que la modélisation physique excelle. Le modèle QP applique explicitement les lois de la physique – lois de Kirchhoff et équations de flux de puissance – garantissant que la solution est physiquement réalisable et respecte toutes les contraintes opérationnelles, comme les limites de capacité des onduleurs et les bornes de tension. En minimisant la somme des écarts de tension au carré sur tous les nœuds, le modèle produit une dispatch de puissance réactive mathématiquement optimale pour l’état actuel du réseau. Comme les variables de l’échelle lente sont fixes, ce problème QP est convexe et peut être résolu à l’optimalité globale en millisecondes à l’aide de solveurs standards comme MOSEK.
Les deux couches sont étroitement couplées via la structure de récompense de l’agent DRL. Le coût pour chaque période horaire dans le MDP est défini comme la somme des valeurs optimales des objectifs de toutes les optimisations QP de l’échelle rapide durant cette heure. Essentiellement, l’agent DRL apprend à fixer les variables de l’échelle lente de manière à minimiser l' »effort » total requis par les contrôleurs de l’échelle rapide pour maintenir la stabilité de tension. Ceci crée une boucle de rétroaction où la politique à long terme est directement informée des conséquences physiques à court terme de ses actions.
Les performances de cette stratégie bi-temporelle ont été rigoureusement testées sur deux systèmes de référence IEEE standard : le réseau équilibré à 33 nœuds et le réseau déséquilibré à 123 nœuds. Dans les deux cas, les résultats furent convaincants. Lorsque les dispositifs de l’échelle lente étaient fixés à des valeurs aléatoires ou constantes, le coût horaire moyen de déviation de tension était catastrophiquement élevé, indiquant de graves et fréquentes violations de tension. Un modèle QP en nombres entiers mixte traditionnel mono-temporel, optimisant tous les dispositifs simultanément sur un horizon de 24 heures, fut utilisé comme référence pour une performance quasi-optimale. Ce modèle atteignit de très faibles coûts mais nécessita plus de 78 secondes pour le système à 33 nœuds et 189 secondes pour le système à 123 nœuds – bien trop lent pour une utilisation en temps réel.
La méthode proposée, après une période d’entraînement de 600 jours de données simulées, atteignit une performance remarquablement proche de cette référence. Pour le système à 33 nœuds, le coût moyen convergea vers 0.0262 (pu), contre une valeur optimale de 0.0207 (pu). Pour le système à 123 nœuds, il atteignit 0.0410 (pu) contre une valeur optimale de 0.0349 (pu). Le véritable triomphe, cependant, fut sa rapidité. Le temps moyen pour calculer une action de contrôle pour une seule journée fut seulement de 1.7 à 2.1 secondes pour le système à 33 nœuds et de 8.9 à 10.5 secondes pour le système à 123 nœuds. Ceci représente une accélération respectivement de 36.7 fois et 18.0 fois par rapport à l’optimisation traditionnelle. Plus important encore, le temps de calcul par intervalle était de seulement 7.4 millisecondes et 73 millisecondes, bien dans les exigences du contrôle en temps réel.
La recherche a également fourni des insights précieux pour le réglage pratique de l’algorithme. Le nombre de plus proches voisins, K, s’est avéré être un hyperparamètre critique. Fixer K=1, ce qui force essentiellement l’action prototype au point discret le plus proche, a résulté en un processus d’entraînement très instable avec de grandes fluctuations de performance. Au contraire, fixer K=20 pour le système à 33 nœuds et K=40 pour le système à 123 nœuds a mené à une convergence rapide et régulière vers une politique stable et performante. Ceci démontre qu’un faible degré d' »exploration » dans l’espace discret est essentiel pour un apprentissage robuste.
Un autre résultat clé fut la performance supérieure de cette approche à agent unique et DDPG adapté par rapport aux méthodes multi-agents DQN rapportées dans la littérature. Les courbes d’apprentissage ont montré une convergence beaucoup plus rapide et régulière, que les auteurs attribuent à un espace de recherche effectif bien plus petit et à la stabilité inhérente du framework DDPG. C’est un avantage significatif, car un entraînement instable peut rendre un algorithme impraticable pour un déploiement réel.
Les implications de ces travaux sont vastes. Elle fournit une solution pratique et évolutive pour le contrôle de tension dans le réseau de distribution moderne et actif. La méthode est intrinsèquement flexible et peut être appliquée à des réseaux triphasés équilibrés et déséquilibrés, la rendant adaptée aux environnements urbains et ruraux réels. La séparation des échelles de temps reflète la dynamique naturelle du réseau, où les dispositifs mécaniques lents préparent le terrain pour que les dispositifs électroniques rapides affinent le profil de tension.
Pour les utilities et les opérateurs de réseau, cela représente un outil puissant pour intégrer des niveaux plus élevés d’énergies renouvelables et de recharge de VE sans investissements coûteux en infrastructure. En gérant proactivement la tension avec une stratégie coordonnée et intelligente, ils peuvent prévenir les incidents de surtension et de sous-tension, prolonger la durée de vie des équipements comme les régulateurs de tension, et maintenir la qualité de l’alimentation pour tous les clients. L’utilisation du DRL signifie aussi que le système peut s’adapter à l’évolution des conditions dans le temps, apprenant des nouveaux patterns de charge et de génération.
Les chercheurs reconnaissent que leurs travaux actuels utilisent un jeu de données d’entraînement fixe et ne testent pas pleinement la généralisation de l’algorithme à des conditions non vues. Les travaux futurs se concentreront sur l’apprentissage en ligne et les tests avec des ensembles de validation glissants pour garantir que le contrôleur reste robuste dans un réseau dynamique et évolutif. Néanmoins, les fondations qu’ils ont posées sont solides. En combinant l’adaptabilité de l’intelligence artificielle et la fiabilité des lois physiques, ils ont créé un système de contrôle qui est non seulement plus rapide et plus efficace, mais aussi plus fiable. Cette approche hybride pourrait bien devenir le blueprint pour la prochaine génération de systèmes intelligents de gestion du réseau.
Jian Zhang, Mingjian Cui, Yigang He, Transactions of China Electrotechnical Society, DOI:10.19595/j.cnki.1000-6753.tces.222273