Highway-Env RL
Développement d’un agent capable de conduire sur une autoroute à 3 voies tout en évitant les collisions avec les autres véhicules. Un DQN développé de zéro avec PyTorch a été implémenté, puis comparé à un modèle PPO fourni par Stable-Baselines3 afin d’évaluer leurs performances.
Agent DQN entrainé
Environnement
De quoi est constitué l'environnement ?
- Observation : matrice 5×5 représentant l’agent et les 4 véhicules les plus proches.
- Actions : 5 actions discrètes — gauche, droite, maintenir la voie, accélérer et ralentir.
- Entraînement : 100 000 étapes avec highway-fast-v0.
- Récompense : favorise une conduite rapide et le maintien sur les voies appropriées ; une collision entraîne une pénalité de -1.
- Évaluation : test avec 40 véhicules dans des conditions plus difficiles (trafic dense et conduite agressive).
- Environnement : highway-v0 de Farama Foundation.
DQN vs PPO
Comparaison DQN & PPO
- Récompense moyenne :
33.40 ± 8.15 - Implémentation : DQN développé from scratch avec PyTorch
- Architecture : MLP à 3 couches —
25 → 256 → 256 → 5 - Paramètre clé : réduction de
gammade 0.99 à 0.8 - Résultat : meilleure capacité à réagir rapidement aux véhicules et aux situations imprévisibles.
- Récompense moyenne :
~27.8 - Implémentation : Stable-Baselines3
- Environnements : 4 environnements parallèles
- Expérimentations : différents rollouts, taux d’apprentissage et bonus d’entropie
- Résultat : les performances plafonnent après environ 30 000 étapes, avec une adaptation moins efficace dans un environnement très dynamique.
Comment nous y sommes arrivé ?
Rapport du projet
Rapport du projet
Notebook projet Highway Env RL