« Optimisation directe des préférences » : différence entre les versions
Aucun résumé des modifications |
Aucun résumé des modifications |
||
| (Une version intermédiaire par le même utilisateur non affichée) | |||
| Ligne 3 : | Ligne 3 : | ||
== Compléments == | == Compléments == | ||
L'algorithme résultant est stable, performant et léger en termes de calcul, éliminant le besoin d'[[échantillonnage]] à partir du [[modèle de langue|modèle de langue]] lors du réglage fin ou de l'exécution d'un réglage important des [[hyperparamètres]]. | |||
Alors que les grands modèles de langues acquièrent par le biais de texte une connaissance générale du monde et certaines compétences de raisonnement, il est difficile d'obtenir un contrôle précis de leur comportement de par la nature floue du jeu de données d'entraînement (la langue). | |||
Les méthodes existantes pour obtenir une telle maniabilité collectent des étiquettes humaines sur la qualité relative des générations de modèles et affinent le modèle de langue non supervisé pour l'aligner sur ces préférences, souvent avec l'apprentissage par apprentissage par renforcement à rétroaction humaine (ARRH) qui est souvent complexe et instable. | |||
== Français == | == Français == | ||
''' optimisation directe des préférences ''' | ''' optimisation directe des préférences ''' | ||
| Ligne 18 : | Ligne 18 : | ||
==Sources== | ==Sources== | ||
[https://arxiv.org/abs/2305.18290 Source : arxiv ] | [https://arxiv.org/abs/2305.18290 Source : arxiv ] | ||
[[Catégorie:Publication]] | [[Catégorie:Publication]] | ||
Dernière version du 4 août 2026 à 15:21
Définition
L'optimisation directe des préférences (DPO) est une paramétrisation du modèle de récompense dans l'apprentissage par renforcement avec rétroaction humaine (ARRH) qui permet d'extraire la politique optimale correspondante sous forme fermée, ce qui permet de résoudre le problème d'ARRH standard avec seulement une simple perte de classification.
Compléments
L'algorithme résultant est stable, performant et léger en termes de calcul, éliminant le besoin d'échantillonnage à partir du modèle de langue lors du réglage fin ou de l'exécution d'un réglage important des hyperparamètres.
Alors que les grands modèles de langues acquièrent par le biais de texte une connaissance générale du monde et certaines compétences de raisonnement, il est difficile d'obtenir un contrôle précis de leur comportement de par la nature floue du jeu de données d'entraînement (la langue).
Les méthodes existantes pour obtenir une telle maniabilité collectent des étiquettes humaines sur la qualité relative des générations de modèles et affinent le modèle de langue non supervisé pour l'aligner sur ces préférences, souvent avec l'apprentissage par apprentissage par renforcement à rétroaction humaine (ARRH) qui est souvent complexe et instable.
Français
optimisation directe des préférences
Anglais
Direct Preference Optimization
DPO
Sources
Contributeurs: Louis Bouchard, Claude Coulombe, Patrick Drouin, wiki





