Apprentissage par préférences
ROBOTIQUE
Définition
Apprentissage à partir de jugements comparatifs humains (par exemple, « la trajectoire A est meilleure que la trajectoire B ») plutôt que de signaux de récompense explicites ou de démonstrations. Un modèle de récompense est entraîné pour être cohérent avec les préférences humaines, puis utilisé pour optimiser la politique de contrôle via RL. Cette approche (RLHF appliquée à la robotique) évite le besoin d'une ingénierie précise de récompense scalaire et peut capturer l'intention humaine nuancée.
Français
Apprentissage par préférences
Anglais
preference learning
Sources
Contributeurs: wiki





