Stratégie avancée de gestion énergétique pour véhicules hybrides
Dans le paysage en pleine évolution de la mobilité zéro émission, une architecture automobile se distingue par sa capacité à allier autonomie étendue, recharge rapide et réactivité dynamique : le véhicule électrique hybride à pile à combustible (FCHEV). Contrairement aux véhicules électriques à batterie (BEV) qui dépendent exclusivement de l’électricité stockée, les FCHEV associent une pile à combustible à hydrogène à un ou plusieurs systèmes de stockage d’énergie électrochimique – généralement des batteries lithium-ion et de plus en plus souvent des supercondensateurs. Cette architecture tripartite offre un équilibre convaincant : la production propre à haute densité énergétique de l’hydrogène, la fonction tampon en régime stable des batteries, et les décharges puissantes ultra-rapides (ainsi que l’absorption régénérative) des supercondensateurs. Pourtant, cette force même – la complexité du système – crée un défi de contrôle redoutable : comment répartir la puissance entre trois sources distinctes en temps réel, dans des conditions de conduite constamment changeantes, tout en maximisant l’efficacité, la durabilité et la conduite ?
Une étude récemment publiée par l’Université de Science et Technologie du Henan apporte une réponse robuste. Son noyau dur repose sur une nouvelle stratégie intelligente de gestion de l’énergie (EMS) construite autour d’une version améliorée de l’algorithme d’apprentissage par renforcement profond Soft Actor-Critic (SAC). Les chercheurs n’ont pas simplement ajusté un modèle existant ; ils ont repensé son processus d’apprentissage fondamental et son interaction avec la chaîne de traction physique. Le résultat est un système qui ne se contente pas de réagir à la demande du conducteur – il anticipe, optimise et protège, obtenant une amélioration mesurable de 6,4 % en moyenne de l’économie de carburant par rapport à son prédécesseur, tout en lissant considérablement la charge opérationnelle sur le composant le plus sensible : la pile à combustible.
Revenons un instant en arrière. Les stratégies de contrôle traditionnelles des FCHEV se divisent en deux grandes catégories. Les stratégies basées sur des règles sont simples et fiables mais inflexibles ; ce sont essentiellement des réponses préprogrammées « si-alors » qui ne peuvent pas s’adapter à des situations de trafic nouvelles ou complexes. Les stratégies basées sur l’optimisation, comme la programmation dynamique (DP), peuvent produire des résultats quasi optimaux mais sont computationalement exhaustives et nécessitent souvent la connaissance de l’intégralité du cycle de conduite futur – les rendant impracticales pour une utilisation en temps réel à bord. L’émergence de l’apprentissage par renforcement profond (DRL) promettait une voie médiane : un algorithme capable d’apprendre la politique de contrôle optimale par l’expérience simulée, s’adaptant à de nouvelles situations avec une intuition quasi humaine, tout en fonctionnant assez efficacement pour être intégré dans l’unité de contrôle d’un véhicule.
Les premiers succès du DRL dans les EMS utilisaient des algorithmes comme le Q-learning ou sa version approfondie, les Deep Q-Networks (DQN). Cependant, ces approches se heurtent à un obstacle fondamental : le « fléau de la dimension ». La répartition de la puissance dans un FCHEV n’est pas un simple interrupteur marche/arrêt ; c’est une décision continue – combien de kilowatts la pile à combustible doit-elle produire à cet instant ? Combien la batterie doit-elle contribuer ? Ce sont des variables qui peuvent prendre un nombre infini de valeurs entre leurs limites minimales et maximales. Le Q-learning lutte énormément dans de tels espaces d’action continus à haute dimension.
Le domaine s’est alors tourné vers des algorithmes comme le Deep Deterministic Policy Gradient (DDPG), qui excelle dans les domaines continus. Le DDPG apprend une politique déterministe, ce qui signifie que pour chaque état observé – la vitesse du véhicule, l’accélération, l’état de charge de la batterie (SoC), etc. – il produit une et une seule action « meilleure ». Bien que ce soit efficace sur le plan computationnel, c’est aussi fragile. Le monde réel est désordonné. Une lecture de capteur peut être momentanément bruyante, ou un conducteur peut effectuer une manœuvre inattendue. Une politique déterministe, s’étant entièrement engagée envers une action précise, manque de flexibilité pour absorber gracieusement de telles perturbations. C’est comme un funambule sans aucune marge de manœuvre.
C’est là que l’algorithme Soft Actor-Critic (SAC) entre en scène. Le SAC appartient à une nouvelle génération de méthodes DRL qui intègrent le principe d’entropie maximale. Au lieu de rechercher une action unique et rigoureusement optimale, le SAC recherche une politique stochastique (probabiliste) – une distribution d’actions qui sont toutes « suffisamment bonnes », pondérées par leur probabilité de succès. Cette randomisation intégrée sert d’exploration, permettant au contrôleur de gérer avec grâce les incertitudes et d’éviter de rester définitivement coincé dans des schémas de contrôle sous-optimaux. C’est le funambule qui peut effectuer de petites oscillations correctives pour maintenir l’équilibre.
L’équipe de recherche, dirigée par le professeur Tao Fazhan, a reconnu le potentiel du SAC mais aussi son point faible : l’instabilité de l’apprentissage. Dans les phases chaotiques précoces de l’apprentissage, un agent DRL prend de nombreuses mauvaises décisions. Dans une configuration SAC traditionnelle, chacune de ces mauvaises expériences – par exemple, un cas où l’agent a ordonné à la pile à combustible de monter en puissance à 100 % lors d’un roulage en douceur – est enregistrée dans la « banque de mémoire » de l’agent, appelée tampon de rejeu d’expérience. Pendant l’entraînement, l’algorithme échantillonne aléatoirement dans ce tampon pour apprendre. Si le tampon est inondé d’échecs catastrophiques des premières heures d’entraînement, l’ensemble du processus d’apprentissage peut dérailler, conduisant à un contrôleur soit non fonctionnel, soit très sous-optimal.
Leur solution ingénieuse a été d’introduire un mécanisme de « Rejeu d’Expérience Heuristique ». Imaginez-le comme un mentor sage supervisant l’apprentissage d’un novice. Avant qu’une nouvelle expérience ne soit ajoutée à la banque de mémoire, le système effectue un rapide contrôle de cohérence. Il compare la nouvelle action à une bibliothèque de stratégies de contrôle de haute qualité connues, issues de années de données expérimentales antérieures et d’expertise métier. Si la nouvelle action est déraisonnable – par exemple, vider le supercondensateur à zéro en moins d’une seconde, ou pousser la pile à combustible au-delà de sa plage de fonctionnement sûre – l’expérience est rejetée. L’agent est alors invité à réessayer, générant une action plus plausible à enregistrer à la place.
Ce filtre simple mais puissant agit comme un stabilisateur d’apprentissage. Il ne donne pas la solution sur un plateau ; il empêche simplement l’agent d’apprendre de ses erreurs les plus flagrantes et dommageables pour le système. L’analyse de convergence de l’article le démontre vivement : les courbes de perte et de récompense de l’apprentissage du SAC amélioré montrent une progression régulière et constante, tandis que les courbes du SAC traditionnel présentent des pics et des plateaux violents, indicateurs d’un processus d’apprentissage constamment saboté par ses propres échecs passés.
Mais l’intelligence ne s’arrête pas à l’algorithme. Une EMS véritablement efficace pour un FCHEV à trois sources doit d’abord simplifier le problème qu’elle tente de résoudre. L’équipe a employé une architecture intelligente en deux étapes : la Stratification de Puissance.
La première étape utilise un filtre flou adaptatif pour effectuer une « décomposition fréquentielle » en temps réel de la demande de puissance du conducteur. Imaginez le signal de puissance comme un accord musical complexe. Ce filtre agit comme un égaliseur audio sophistiqué, séparant l’accord en ses notes constitutives. Les « notes » haute fréquence – les pics de puissance brusques nécessaires pour une accélération aggressive ou les surtensions soudaines absorbées lors d’un freinage dur – sont instantanément acheminées vers le supercondensateur. Ce composant est unique pour ce rôle, capable de se charger et de se décharger à des centaines de fois la vitesse d’une batterie, avec une dégradation minime.
En délestant ces événements transitoires de haute puissance, le système crée un signal de puissance « moyenne et basse fréquence » plus calme et plus gérable pour la deuxième étape – le contrôleur basé sur le SAC. Ce contrôleur n’a plus qu’à décider comment répartir cette demande de puissance lissée entre la pile à combustible et la batterie lithium. Cette division du travail est cruciale : elle protège la pile à combustible des pics de courant dommageables et du cyclage thermique, et elle protège la batterie du stress des courants élevés, prolongeant ainsi la durée de vie des deux composants coûteux.
L' »objectif » du contrôleur SAC, défini par sa fonction de récompense, est élégamment multifacette. Il ne s’agit pas seulement de minimiser la consommation d’hydrogène, même si c’est primordial. La fonction de récompense, inspirée du principe de la Stratégie de Minimisation de la Consommation Équivalente (ECMS), pénalise également le contrôleur s’il permet au SoC de la batterie de s’éloigner trop de son point de consigne idéal (0,7 dans leurs tests). Cela garantit que la batterie reste dans sa fenêtre de fonctionnement la plus efficace et la plus durable, prête à aider en cas de besoin sans être chroniquement surchargée ou déplétée.
La validation de ce système a été rigoureuse. Les chercheurs ont soumis leur stratégie SAC améliorée à une batterie de quatre cycles de conduite standard de l’industrie : le chaos stop-and-go du Urban Dynamometer Driving Schedule (UDDS), la croisière stable du Highway Fuel Economy Test (HWFET), le profil mixte du New European Driving Cycle (NEDC) et le cycle plus agressif du West Virginia University Suburban Cycle (WVUSUB). Sur ce spectre diversifié, les résultats ont été constants et convaincants.
Dans le cycle UDDS très dynamique, la stratification de puissance a brillé. Lorsque le conducteur a enfoncé l’accélérateur à l’arrêt, le supercondensateur a fourni la bouffée de puissance initiale, permettant à la pile à combustible d’augmenter sa puissance plus progressivement et en douceur. Pendant le freinage, le supercondensateur a absorbé avidément l’énergie régénérative qui aurait autrement submergé le circuit de charge de la batterie. Les données de l’article montrent qu’avec le SAC amélioré, la courbe de puissance de sortie de la pile à combustible était nettement moins irrégulière qu’avec le SAC traditionnel, un indicateur direct d’une réduction du stress mécanique et thermique.
Crucialement, ce fonctionnement plus lisse n’est pas venu au détriment de l’efficacité. En fait, il l’a améliorée. La pile à combustible fonctionne le plus efficacement dans une « plage optimale » spécifique de sa plage de puissance. En l’empêchant d’être tirée en dehors de cette zone par des demandes transitoires, le système l’a maintenue dans sa bande de haute efficacité pour de plus longues périodes. Les données le confirment : le SAC amélioré a constamment démontré une efficacité opérationnelle de la pile à combustible plus élevée, en particulier pendant les segments les plus volatils du cycle de conduite.
Les chiffres de l’économie de carburant parlent d’eux-mêmes. La stratégie améliorée a affiché une consommation d’hydrogène équivalente de 2,3 L/100 km sur l’UDDS, contre 2,5 pour le SAC traditionnel – une amélioration totale de 8 %. Sur le HWFET, le gain était de 4,3 %, et sur l’exigeant WVUSUB, il était de 6,9 %. En moyenne sur les quatre tests, l’amélioration s’est établie à 6,4 %, un résultat très significatif. Pour une industrie où un gain de 1 % est célébré, c’est un bond en avant massif.
Au-delà de la simulation, l’équipe est passée à la validation matériel-in-the-loop sur un banc d’essai sophistiqué. Cette plateforme intégrait des composants réels – pile à combustible, pack batterie lithium, module supercondensateur et un dynamomètre pour simuler la charge routière – contrôlés par l’algorithme fonctionnant dans un environnement LabVIEW. Le test en conditions réelles a reflété les simulations : le SAC amélioré a maintenu l’efficacité de la pile à combustible presque exclusivement dans la plage optimale de 50 à 60 %, même pendant une période délibérément difficile de 200 secondes de demande de puissance fluctuant rapidement. Pendant ce temps, le SoC de la batterie a diminué de façon magnifiquement linéaire et prévisible, confirmant la capacité de la stratégie à gérer l’équilibre énergétique à long terme sans stress inutile.
Ce travail représente une avancée significative, mais les auteurs envisagent déjà l’avenir. Leur conclusion note une frontière critique : bien que leur stratégie économise efficacement l’énergie de la batterie, elle ne modélise pas directement la dégradation interne de la batterie. Une batterie ne perd pas seulement sa charge ; sa chimie interne se détériore lentement à chaque cycle de charge/décharge, surtout sous stress élevé. La prochaine génération d’EMS intelligents devra intégrer des modèles de santé prédictifs, transformant le contrôleur d’un comptable de l’énergie en un « médecin de groupe motopropulseur » holistique qui prescrit des actions non seulement pour l’efficacité immédiate, mais aussi pour la longévité pluriannuelle.
Sur un marché où le coût total de possession des véhicules à hydrogène reste un obstacle clé, prolonger la durée de vie de la pile à combustible de 10 000 $ ou du pack batterie de 15 000 $ n’est pas une note technique en bas de page – c’est un impératif commercial. En mariant l’apprentissage par renforcement profond avec des heuristiques pratiques et informées par la physique, cette recherche de l’Université de Science et Technologie du Henan a produit une stratégie qui n’est pas seulement élégante académiquement, mais aussi pertinente industriellement. C’est un signal clair que l’avenir de la mobilité intelligente ne sera pas écrit dans un code rigide, mais dans des algorithmes adaptatifs, auto-correcteurs, qui apprennent, protègent et optimisent – tout comme les meilleurs conducteurs humains.
Tao Fazhan, Lu Hongxin, Fu Zhumu, Sun Haochen, Ma Haoxiang. Gestion intelligente de l’énergie pour les véhicules électriques hybrides à pile à combustible. Journal de l’Université de Science et Technologie du Henan (Sciences Naturelles), 2023, 44(6) : 49–56. DOI:10.15926/j.issn1672-6871.2023.06.007