Retour aux projets

IA / Apprentissage par renforcement

Apprendre à traverser.

Comparer une table Q et un réseau Q profond dans l’environnement FrozenLake.

Étude de l’apprentissage par renforcementExpérience d’apprentissage
Illustration conceptuelle d’une grille d’apprentissage par renforcement avec un parcours d’exemple.
Illustration conceptuelle d’une grille d’apprentissage par renforcement avec un parcours d’exemple.

01 / Le défi

La question derrière le système.

Comprendre comment l’exploration, les récompenses et la représentation des valeurs influencent le comportement appris.

Une exploration pédagogique de la manière dont un agent apprend à partir de récompenses. Deux approches traitent la même tâche sur une grille : le Q-learning tabulaire mémorise directement les valeurs état/action, tandis qu’un réseau de neurones PyTorch les approxime.

02 / La démarche

De l’architecture à la réalisation.

  1. 01

    Comparer le Q-learning tabulaire à un réseau Q profond dans le même environnement.

  2. 02

    Adapter les récompenses et faire évoluer le taux d’exploration ; utiliser une mémoire de rejeu et un réseau cible pour le DQN.

  3. 03

    Suivre les récompenses et l’exploration pendant l’entraînement, puis visualiser les résultats d’évaluation.

03 / Résultats

Ce que montrent les résultats.

  • Le dépôt comprend le code d’entraînement et d’évaluation, les modèles enregistrés et des graphiques pour les deux approches.

04 / Périmètre & prochaines étapes

Où en est le projet.

  • Les résultats concernent l’environnement pédagogique FrozenLake et ne démontrent pas de performances sur un système autonome physique.

La référence de départ provient de johnnycode8/gym_solutions. Les autres scripts adaptent ce travail avec des récompenses, une validation et des visualisations modifiées ; l’attribution est conservée dans le dépôt.

Ouvrons la discussion

Un système à construire.
Un problème à résoudre.