« Fonction Q » : différence entre les versions
(Page créée avec « == '''<span style="font-family:arial black;font-size:24px; color:#1880a6;">ROBOTIQUE</span>'''== == Définition == La fonction Q Q(s, a) estime la récompense cumulative actualisée attendue qu'un agent recevra en prenant l'action a dans l'état s et en suivant ensuite une politique donnée. Les fonctions Q sont centrales aux algorithmes d'apprentissage par renforcement tels que DQN (actions discrètes) et SAC, TD3 et DDPG (actions c... ») |
Aucun résumé des modifications |
||
| Ligne 9 : | Ligne 9 : | ||
== Français == | == Français == | ||
'''Fonction Q''' | '''Fonction Q''' (Fonction de valeur d'action) | ||
== Anglais == | == Anglais == | ||
Dernière version du 24 septembre 2026 à 21:36
ROBOTIQUE
Définition
La fonction Q Q(s, a) estime la récompense cumulative actualisée attendue qu'un agent recevra en prenant l'action a dans l'état s et en suivant ensuite une politique donnée.
Les fonctions Q sont centrales aux algorithmes d'apprentissage par renforcement tels que DQN (actions discrètes) et SAC, TD3 et DDPG (actions continues). En RL robotique, apprendre des fonctions Q précises pour les tâches de manipulation à long horizon est difficile car les récompenses sont rares et l'espace état-action est de haute dimension.
Les travaux récents en RL hors ligne (IQL, CQL) utilisent les fonctions Q pour extraire des politiques de contrôle à partir de datasets fixes sans interaction en ligne, comblant le fossé entre l'apprentissage par imitation et le RL.
Français
Fonction Q (Fonction de valeur d'action)
Anglais
Q function
Sources
Contributeurs: wiki





