« Affinage par auto-jeu » : différence entre les versions


Aucun résumé des modifications
m (Claude COULOMBE a déplacé la page Peaufinage par auto-jeu vers Affinage par auto-jeu)
 
(4 versions intermédiaires par 3 utilisateurs non affichées)
Ligne 1 : Ligne 1 :
== Définition ==
== Définition ==
Algorithme de '''[[peaufinage]]''' pour les '''[[Grand modèle de langues (GML)|grands modèles de langues (GML)]]''' qui utilise un mécanisme qui lui permet de jouer contre lui-même (''self-play mechanism'') en utilisant les versions précédentes du modèle.   
Algorithme d''''[[affinage]]''' pour les '''[[Grand modèle de langues (GML)|grands modèles de langues (GML)]]''' qui utilise un mécanisme qui lui permet de jouer contre lui-même (''self-play mechanism'') en utilisant les versions précédentes du modèle.   


Voir aussi [[Optimisation de la politique relative au groupe]] et [[Apprentissage par curriculum auto-évolutif]]
Voir aussi [[Optimisation de la politique relative au groupe]] et [[Apprentissage par curriculum auto-évolutif]]


== Complément ==
== Complément ==
Cette technique réduit la dépendance vis-à-vis des '''[[Jeu de données|jeux de données]]''' externes ou des [[Modèles enseignants|modèles enseignants]].
Cette technique réduit la dépendance vis-à-vis des '''[[Jeu de données|jeux de données]]''' externes ou des [[Modèle enseignant|modèles enseignants]].


== Français ==
== Français ==
''' peaufinage par auto-jeu'''
'''affinage par auto-jeu'''
 
'''peaufinage par auto-jeu'''
 
'''peaufinage par auto-apprentissage'''


== Anglais ==
== Anglais ==
Ligne 27 : Ligne 31 :
[https://verl.readthedocs.io/en/latest/algo/spin.html  Source: verl]
[https://verl.readthedocs.io/en/latest/algo/spin.html  Source: verl]


[[Catégorie:GRAND LEXIQUE FRANÇAIS]]
[[Catégorie:Publication]]
[[Catégorie:Publication]]

Dernière version du 22 septembre 2026 à 18:34

Définition

Algorithme d'affinage pour les grands modèles de langues (GML) qui utilise un mécanisme qui lui permet de jouer contre lui-même (self-play mechanism) en utilisant les versions précédentes du modèle.

Voir aussi Optimisation de la politique relative au groupe et Apprentissage par curriculum auto-évolutif

Complément

Cette technique réduit la dépendance vis-à-vis des jeux de données externes ou des modèles enseignants.

Français

affinage par auto-jeu

peaufinage par auto-jeu

peaufinage par auto-apprentissage

Anglais

self-play fine-tuning

self-play fine tuning

SPIN

Sources

Zhuofan Xu (2025) - Auto-jeu

Source : arxiv

Source : GitHub

Source: verl