Fonction de récompense apprise


Révision datée du 24 septembre 2026 à 21:31 par Pitpitt (discussion | contributions) (Page créée avec « == '''<span style="font-family:arial black;font-size:24px; color:#1880a6;">ROBOTIQUE</span>'''== == Définition == Une fonction de récompense qui est apprise à partir de données (préférences humaines, démonstrations ou descriptions en langage naturel) plutôt que conçue manuellement. Les méthodes d'apprentissage de récompense incluent l'RL inverse, la modélisation de récompense à partir de comparaisons humaines (style RLHF... »)
(diff) ← Version précédente | Voir la version actuelle (diff) | Version suivante → (diff)

ROBOTIQUE

Définition

Une fonction de récompense qui est apprise à partir de données (préférences humaines, démonstrations ou descriptions en langage naturel) plutôt que conçue manuellement. Les méthodes d'apprentissage de récompense incluent l'RL inverse, la modélisation de récompense à partir de comparaisons humaines (style RLHF), et le scoring de récompense basé sur VLM (utilisant la similarité CLIP ou l'évaluation par LLM).

Les récompenses apprises répondent au défi que les fonctions de récompense manuelles bien formées sont souvent difficiles à spécifier pour les tâches de manipulation complexes.

Français

Fonction de récompense apprise

Anglais

learned reward

Sources

Source : Robotic Center


LEXIQUE DE LA ROBOTIQUE Ligne robot.jpg

Robotique.jpg

Contributeurs: wiki