8 septembre 2026

Highway-Env RL

Développement d’un agent capable de conduire sur une autoroute à 3 voies tout en évitant les collisions avec les autres véhicules. Un DQN développé de zéro avec PyTorch a été implémenté, puis comparé à un modèle PPO fourni par Stable-Baselines3 afin d’évaluer leurs performances.

Stack
DQNPPO TensorBoardStable-Baseline3PytorchPython

Agent DQN entrainé

Environnement

De quoi est constitué l'environnement ?

- Observation : matrice 5×5 représentant l’agent et les 4 véhicules les plus proches.
- Actions : 5 actions discrètes — gauche, droite, maintenir la voie, accélérer et ralentir.
- Entraînement : 100 000 étapes avec highway-fast-v0.
- Récompense : favorise une conduite rapide et le maintien sur les voies appropriées ; une collision entraîne une pénalité de -1.
- Évaluation : test avec 40 véhicules dans des conditions plus difficiles (trafic dense et conduite agressive).
- Environnement : highway-v0 de Farama Foundation.

DQN vs PPO

Comparaison DQN & PPO

DQN — 🏆 Meilleur modèle
  • Récompense moyenne : 33.40 ± 8.15
  • Implémentation : DQN développé from scratch avec PyTorch
  • Architecture : MLP à 3 couches — 25 → 256 → 256 → 5
  • Paramètre clé : réduction de gamma de 0.99 à 0.8
  • Résultat : meilleure capacité à réagir rapidement aux véhicules et aux situations imprévisibles.
PPO
  • Récompense moyenne : ~27.8
  • Implémentation : Stable-Baselines3
  • Environnements : 4 environnements parallèles
  • Expérimentations : différents rollouts, taux d’apprentissage et bonus d’entropie
  • Résultat : les performances plafonnent après environ 30 000 étapes, avec une adaptation moins efficace dans un environnement très dynamique.

Comment nous y sommes arrivé ?

optimisation des paramètres de l'agent
optimisation des paramètres de l'agent

Rapport du projet

Rapport du projet

Notebook projet Highway Env RL
Source

Notebook projet Highway Env RL