« Affinage par auto-jeu » : différence entre les versions
Aucun résumé des modifications |
m (Claude COULOMBE a déplacé la page Peaufinage par auto-jeu vers Affinage par auto-jeu) |
||
| (7 versions intermédiaires par 3 utilisateurs non affichées) | |||
| Ligne 1 : | Ligne 1 : | ||
== Définition == | == Définition == | ||
Algorithme | Algorithme d''''[[affinage]]''' pour les '''[[Grand modèle de langues (GML)|grands modèles de langues (GML)]]''' qui utilise un mécanisme qui lui permet de jouer contre lui-même (''self-play mechanism'') en utilisant les versions précédentes du modèle. | ||
Voir aussi [[Optimisation de la politique relative au groupe]] et [[Apprentissage par curriculum auto-évolutif]] | Voir aussi [[Optimisation de la politique relative au groupe]] et [[Apprentissage par curriculum auto-évolutif]] | ||
== Complément == | == Complément == | ||
Cette technique réduit la dépendance vis-à-vis des '''[[Jeu de données|jeux de données]]''' externes ou des [[ | Cette technique réduit la dépendance vis-à-vis des '''[[Jeu de données|jeux de données]]''' externes ou des [[Modèle enseignant|modèles enseignants]]. | ||
== Français == | == Français == | ||
''' peaufinage par auto-jeu''' | '''affinage par auto-jeu''' | ||
'''peaufinage par auto-jeu''' | |||
'''peaufinage par auto-apprentissage''' | |||
== Anglais == | == Anglais == | ||
| Ligne 16 : | Ligne 20 : | ||
''' SPIN''' | ''' SPIN''' | ||
<!--A language model finetuning algorithm for large language models that utilizes a self-play mechanism, allowing LLMs to improve themselves by playing against their previous iterations. This techinique reduces reliance on external preference datasets or stronger teacher models.--> | <!--A language model finetuning algorithm for large language models that utilizes a self-play mechanism, allowing LLMs to improve themselves by playing against their previous iterations. This techinique reduces reliance on external preference datasets or stronger teacher models.--> | ||
== Sources == | == Sources == | ||
[https://theses.hal.science/tel-05430689v1/file/154915_XU_2025_archivage.pdf Zhuofan Xu (2025) - Auto-jeu] | [https://theses.hal.science/tel-05430689v1/file/154915_XU_2025_archivage.pdf Zhuofan Xu (2025) - Auto-jeu] | ||
| Ligne 29 : | Ligne 31 : | ||
[https://verl.readthedocs.io/en/latest/algo/spin.html Source: verl] | [https://verl.readthedocs.io/en/latest/algo/spin.html Source: verl] | ||
[[Catégorie:GRAND LEXIQUE FRANÇAIS]] | |||
[[Catégorie:Publication]] | [[Catégorie:Publication]] | ||
Dernière version du 22 septembre 2026 à 18:34
Définition
Algorithme d'affinage pour les grands modèles de langues (GML) qui utilise un mécanisme qui lui permet de jouer contre lui-même (self-play mechanism) en utilisant les versions précédentes du modèle.
Voir aussi Optimisation de la politique relative au groupe et Apprentissage par curriculum auto-évolutif
Complément
Cette technique réduit la dépendance vis-à-vis des jeux de données externes ou des modèles enseignants.
Français
affinage par auto-jeu
peaufinage par auto-jeu
peaufinage par auto-apprentissage
Anglais
self-play fine-tuning
self-play fine tuning
SPIN
Sources
Contributeurs: Arianne Arel, Claude Coulombe, Patrick Drouin, wiki





