Apprentissage par préférences


Révision datée du 22 septembre 2026 à 11:04 par Pitpitt (discussion | contributions) (Page créée avec « == '''<span style="font-family:arial black;font-size:24px; color:#1880a6;">ROBOTIQUE</span>'''== == Définition == Apprentissage à partir de jugements comparatifs humains (par exemple, « la trajectoire A est meilleure que la trajectoire B ») plutôt que de signaux de récompense explicites ou de démonstrations. Un modèle de récompense est entraîné pour être cohérent avec les préférences humaines, puis utilisé pour optimis... »)
(diff) ← Version précédente | Voir la version actuelle (diff) | Version suivante → (diff)

ROBOTIQUE

Définition

Apprentissage à partir de jugements comparatifs humains (par exemple, « la trajectoire A est meilleure que la trajectoire B ») plutôt que de signaux de récompense explicites ou de démonstrations. Un modèle de récompense est entraîné pour être cohérent avec les préférences humaines, puis utilisé pour optimiser la politique de contrôle via RL. Cette approche (RLHF appliquée à la robotique) évite le besoin d'une ingénierie précise de récompense scalaire et peut capturer l'intention humaine nuancée.

Français

Apprentissage par préférences

Anglais

preference learning

Sources

Source : Robotic Center


LEXIQUE DE LA ROBOTIQUE Ligne robot.jpg

Robotique.jpg

Contributeurs: wiki