« Jeton génératif » : différence entre les versions
Aucun résumé des modifications |
Aucun résumé des modifications |
||
| (14 versions intermédiaires par 4 utilisateurs non affichées) | |||
| Ligne 1 : | Ligne 1 : | ||
==Définition== | ==Définition== | ||
En '''[[traitement automatique de la langue naturelle]]''', le | En '''[[traitement automatique de la langue naturelle]]''', le jeton est l'unité de base pour l'analyse de textes produite par un '''[[segmenteur]]''' (en anglais ''tokenizer''). | ||
En [[IA générative]], le jeton génératif (token) est l'unité de base pour mesure le travail d'un [[robot conversationnel génératif]]. | |||
==Compléments== | ==Compléments== | ||
Un | Un jeton génératif peut correspondre à un mot, à une partie de mot, une suite de caractères ou même parfois à une seule lettre ou symbole. | ||
Traditionnellement, en [[Traitement automatique de la langue naturelle|TALN]], les algorithmes travaillaient au niveau du mot ou des unités lexicales, mais depuis l'arrivée des techniques d'apprentissage profond, la segmentation s'effectue plutôt au niveau sous-lexical. Un atout important du traitement sous-lexical est d'éviter les mots ''hors-vocabulaire'', puisqu'on peut plus facilement créer de nouvelles unités lexicales à partir d'éléments sous-lexicaux. | Traditionnellement, en '''[[Traitement automatique de la langue naturelle|TALN]]''', les algorithmes travaillaient au niveau du mot ou des unités lexicales, mais depuis l'arrivée des techniques d'apprentissage profond, la segmentation s'effectue plutôt au niveau sous-lexical. Un atout important du traitement sous-lexical est d'éviter les mots ''hors-vocabulaire'', puisqu'on peut plus facilement créer de nouvelles unités lexicales à partir d'éléments sous-lexicaux. | ||
<hr/> | <hr/> | ||
Attention, on appelle les unités résultant de la segmentation des '''jetons''', mais le terme '''jeton''' est aussi utilisé en cybersécurité et dans les réseaux de communication. | |||
<hr/> | |||
Pour la suite du traitement, le jeton résultant est souvent converti en un nombre entier. On dit alors que le jeton est encodé. Le processus inverse, le décodage part de la représentation par un nombre entier vers un jeton. | |||
==Français== | |||
'''jeton génératif''' | |||
'''jeton textuel''' | |||
'''jeton''' | |||
'''segment textuel''' | '''segment textuel''' | ||
''' | '''segment de texte''' | ||
'''symbole''' | '''symbole''' | ||
| Ligne 31 : | Ligne 35 : | ||
==Anglais== | ==Anglais== | ||
''' | '''token''' | ||
==Sources== | ==Sources== | ||
| Ligne 46 : | Ligne 50 : | ||
[https://en.wikipedia.org/wiki/Lexical_analysis Wikipedia - Lexical Analysis] | [https://en.wikipedia.org/wiki/Lexical_analysis Wikipedia - Lexical Analysis] | ||
[[Catégorie:GRAND LEXIQUE FRANÇAIS]] | [[Catégorie:GRAND LEXIQUE FRANÇAIS]] | ||
[[Catégorie:Publication]] | |||
Dernière version du 29 septembre 2026 à 14:36
Définition
En traitement automatique de la langue naturelle, le jeton est l'unité de base pour l'analyse de textes produite par un segmenteur (en anglais tokenizer).
En IA générative, le jeton génératif (token) est l'unité de base pour mesure le travail d'un robot conversationnel génératif.
Compléments
Un jeton génératif peut correspondre à un mot, à une partie de mot, une suite de caractères ou même parfois à une seule lettre ou symbole.
Traditionnellement, en TALN, les algorithmes travaillaient au niveau du mot ou des unités lexicales, mais depuis l'arrivée des techniques d'apprentissage profond, la segmentation s'effectue plutôt au niveau sous-lexical. Un atout important du traitement sous-lexical est d'éviter les mots hors-vocabulaire, puisqu'on peut plus facilement créer de nouvelles unités lexicales à partir d'éléments sous-lexicaux.
Attention, on appelle les unités résultant de la segmentation des jetons, mais le terme jeton est aussi utilisé en cybersécurité et dans les réseaux de communication.
Pour la suite du traitement, le jeton résultant est souvent converti en un nombre entier. On dit alors que le jeton est encodé. Le processus inverse, le décodage part de la représentation par un nombre entier vers un jeton.
Français
jeton génératif
jeton textuel
jeton
segment textuel
segment de texte
symbole
unité sous-lexicale
unité lexicale
partie de mot
Anglais
token
Sources
Overview of Character-Based Models for Natural Language Processing, Adel et al. 2018
Contributeurs: Arianne Arel, Claude Coulombe, Patrick Drouin, wiki





