Optimisation directe des préférences


Révision datée du 4 août 2026 à 15:21 par Patrickdrouin (discussion | contributions)
(diff) ← Version précédente | Voir la version actuelle (diff) | Version suivante → (diff)

Définition

L'optimisation directe des préférences (DPO) est une paramétrisation du modèle de récompense dans l'apprentissage par renforcement avec rétroaction humaine (ARRH) qui permet d'extraire la politique optimale correspondante sous forme fermée, ce qui permet de résoudre le problème d'ARRH standard avec seulement une simple perte de classification.

Compléments

L'algorithme résultant est stable, performant et léger en termes de calcul, éliminant le besoin d'échantillonnage à partir du modèle de langue lors du réglage fin ou de l'exécution d'un réglage important des hyperparamètres.

Alors que les grands modèles de langues acquièrent par le biais de texte une connaissance générale du monde et certaines compétences de raisonnement, il est difficile d'obtenir un contrôle précis de leur comportement de par la nature floue du jeu de données d'entraînement (la langue).

Les méthodes existantes pour obtenir une telle maniabilité collectent des étiquettes humaines sur la qualité relative des générations de modèles et affinent le modèle de langue non supervisé pour l'aligner sur ces préférences, souvent avec l'apprentissage par apprentissage par renforcement à rétroaction humaine (ARRH) qui est souvent complexe et instable.

Français

optimisation directe des préférences

Anglais

Direct Preference Optimization

DPO

Sources

Source : arxiv