<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="fr">
	<id>https://datafranca.org/wiki/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Patrickdrouin</id>
	<title>DataFranca - Contributions [fr]</title>
	<link rel="self" type="application/atom+xml" href="https://datafranca.org/wiki/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Patrickdrouin"/>
	<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/Sp%C3%A9cial:Contributions/Patrickdrouin"/>
	<updated>2026-09-16T23:54:43Z</updated>
	<subtitle>Contributions</subtitle>
	<generator>MediaWiki 1.39.5</generator>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Mod%C3%A8le_ferm%C3%A9&amp;diff=132551</id>
		<title>Modèle fermé</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Mod%C3%A8le_ferm%C3%A9&amp;diff=132551"/>
		<updated>2026-09-08T19:36:10Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Paradigme dans lequel non seulement le code, mais les &#039;&#039;&#039;[[Paramètre|paramètres]]&#039;&#039;&#039; dont les [[poids]], le &#039;&#039;&#039;[[corpus]]&#039;&#039;&#039; d’entraînement et les détails architecturaux d&#039;un &#039;&#039;&#039;[[Modèle d&#039;intelligence artificielle|modèle d&#039;IA]]&#039;&#039;&#039; tels que les stratégies d’optimisation et les configurations des &#039;&#039;&#039;[[Hyperparamètre|hyperparamètres]]&#039;&#039;&#039; sont secrets ou partiellement divulgués. &lt;br /&gt;
&lt;br /&gt;
À défaut d’être transparents et personnalisables par l’utilisateur, les modèles de ce paradigme possèdent potentiellement une sécurité plus grande, une performance et une stabilité plus élevée.&lt;br /&gt;
&lt;br /&gt;
Voir aussi &#039;&#039;&#039;[[Licence_en_paramètres_ouverts|modèle en paramètres ouverts]]&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
*L&#039;interaction avec ces modèles s&#039;effectue par l&#039;intermédiaire d&#039;une &#039;&#039;&#039;[[Interface de programmation applicative|API]]&#039;&#039;&#039; ou d&#039;environnements de déploiement contrôlés.&lt;br /&gt;
*Son coût repose soit sur un modèle d&#039;abonnement, soit sur un modèle de paiement au &#039;&#039;&#039;[[jeton textuel]]&#039;&#039;&#039;.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;modèle fermé&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;modèle propriétaire&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;modèle à code-source fermé&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;closed-source model&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;closed model&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;proprietary model&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://www.lapresse.ca/affaires/techno/2026-09-03/intelligence-artificielle/nvidia-va-racheter-hugging-face-pour-12-9-milliards-de-dollars.php  Source : La Presse]&lt;br /&gt;
&lt;br /&gt;
[https://www.lapresse.ca/affaires/techno/2024-07-25/meta-evangeliste-inattendu-de-l-ia-en-code-ouvert.php Source : La Presse]&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/abs/2412.12004v3   Source : Arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://mediacenter.ibm.com/media/Open+Source+vs+Closed+AI%3A+LLMs%2C+Agents++the+AI+Stack+Explained/1_93qkt80c   Source : IBM]&lt;br /&gt;
&lt;br /&gt;
[https://medium.com/@akankshasinha247/the-open-vs-closed-ai-frontier-navigating-transparency-power-and-the-future-of-innovation-4b96c68feb06   Source : Medium]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:vocabulary]]&lt;br /&gt;
[[Catégorie:publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Mod%C3%A8le_ferm%C3%A9&amp;diff=132547</id>
		<title>Modèle fermé</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Mod%C3%A8le_ferm%C3%A9&amp;diff=132547"/>
		<updated>2026-09-08T19:30:49Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Paradigme dans lequel les &#039;&#039;&#039;[[Paramètre|paramètres]]&#039;&#039;&#039; dont les [[poids]], le &#039;&#039;&#039;[[corpus]]&#039;&#039;&#039; d’entraînement et les détails architecturaux d&#039;un &#039;&#039;&#039;[[Modèle d&#039;intelligence artificielle|modèle d&#039;IA]]&#039;&#039;&#039; tels que les stratégies d’optimisation et les configurations des &#039;&#039;&#039;[[Hyperparamètre|hyperparamètres]]&#039;&#039;&#039; sont secrets ou partiellement divulgués. &lt;br /&gt;
&lt;br /&gt;
À défaut d’être transparents et personnalisables par l’utilisateur, les modèles de ce paradigme possèdent potentiellement une sécurité plus grande, une performance et une stabilité plus élevée.&lt;br /&gt;
&lt;br /&gt;
Voir aussi &#039;&#039;&#039;[[apprentissage par renforcement avec rétroaction humaine]]&#039;&#039;&#039;,  &#039;&#039;&#039;[[apprentissage par curriculum]]&#039;&#039;&#039;, &#039;&#039;&#039;[[ChatGPT]]&#039;&#039;&#039;, &#039;&#039;&#039;[[Claude]]&#039;&#039;&#039;,  &#039;&#039;&#039;[[entraînement]]&#039;&#039;&#039;, &#039;&#039;&#039;[[Gemini]]&#039;&#039;&#039; et &#039;&#039;&#039;[[mixture d&#039;experts]]&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
*L&#039;interaction avec ces modèles s&#039;effectue par l&#039;intermédiaire d&#039;une &#039;&#039;&#039;[[Interface de programmation applicative|API]]&#039;&#039;&#039; ou d&#039;environnements de déploiement contrôlés.&lt;br /&gt;
*Son coût repose soit sur un modèle d&#039;abonnement, soit sur un modèle de paiement au &#039;&#039;&#039;[[jeton textuel]]&#039;&#039;&#039;.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;modèle fermé&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;modèle propriétaire&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;closed-source model&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;closed model&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;proprietary model&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://www.lapresse.ca/affaires/techno/2026-09-03/intelligence-artificielle/nvidia-va-racheter-hugging-face-pour-12-9-milliards-de-dollars.php  Source : La Presse]&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/abs/2412.12004v3   Source : Arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://mediacenter.ibm.com/media/Open+Source+vs+Closed+AI%3A+LLMs%2C+Agents++the+AI+Stack+Explained/1_93qkt80c   Source : IBM]&lt;br /&gt;
&lt;br /&gt;
[https://medium.com/@akankshasinha247/the-open-vs-closed-ai-frontier-navigating-transparency-power-and-the-future-of-innovation-4b96c68feb06   Source : Medium]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:vocabulary]]&lt;br /&gt;
[[Catégorie:publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Mod%C3%A8le_ferm%C3%A9&amp;diff=132546</id>
		<title>Modèle fermé</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Mod%C3%A8le_ferm%C3%A9&amp;diff=132546"/>
		<updated>2026-09-08T19:30:29Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Paradigme dans lequel les &#039;&#039;&#039;[[Paramètre|paramètres]]&#039;&#039;&#039; dont les [[poids]], le &#039;&#039;&#039;[[corpus]]&#039;&#039;&#039; d’entraînement et les détails architecturaux d&#039;un &#039;&#039;&#039;[[Modèle d&#039;intelligence artificielle|modèle d&#039;IA]]&#039;&#039;&#039; tels que les stratégies d’optimisation et les configurations des &#039;&#039;&#039;[[Hyperparamètre|hyperparamètres]]&#039;&#039;&#039; sont secrets ou partiellement divulgués. &lt;br /&gt;
&lt;br /&gt;
À défaut d’être transparents et personnalisables par l’utilisateur, les modèles de ce paradigme possèdent potentiellement une sécurité plus grande, une performance et une stabilité plus élevée.&lt;br /&gt;
&lt;br /&gt;
Voir aussi &#039;&#039;&#039;[[apprentissage par renforcement avec rétroaction humaine]]&#039;&#039;&#039;,  &#039;&#039;&#039;[[apprentissage par curriculum]]&#039;&#039;&#039;, &#039;&#039;&#039;[[ChatGPT]]&#039;&#039;&#039;, &#039;&#039;&#039;[[Claude]]&#039;&#039;&#039;,  &#039;&#039;&#039;[[entraînement]]&#039;&#039;&#039;, &#039;&#039;&#039;[[Gemini]]&#039;&#039;&#039; et &#039;&#039;&#039;[[mixture d&#039;experts]]&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
*L&#039;interaction avec ces modèles s&#039;effectue par l&#039;intermédiaire d&#039;une &#039;&#039;&#039;[[Interface de programmation applicative|API]]&#039;&#039;&#039; ou d&#039;environnements de déploiement contrôlés.&lt;br /&gt;
*Son coût repose soit sur un modèle d&#039;abonnement, soit sur un modèle de paiement au &#039;&#039;&#039;[[jeton textuel]]&#039;&#039;&#039;.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;modèle fermé&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;modèle propriétaire&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;closed-source model&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;closed model&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;proprietary model&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://www.lapresse.ca/affaires/techno/2026-09-03/intelligence-artificielle/nvidia-va-racheter-hugging-face-pour-12-9-milliards-de-dollars.php  Source : La Presse]&lt;br /&gt;
[https://arxiv.org/abs/2412.12004v3   Source : Arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://mediacenter.ibm.com/media/Open+Source+vs+Closed+AI%3A+LLMs%2C+Agents++the+AI+Stack+Explained/1_93qkt80c   Source : IBM]&lt;br /&gt;
&lt;br /&gt;
[https://medium.com/@akankshasinha247/the-open-vs-closed-ai-frontier-navigating-transparency-power-and-the-future-of-innovation-4b96c68feb06   Source : Medium]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:vocabulary]]&lt;br /&gt;
[[Catégorie:publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=R%C3%A9solution_de_probl%C3%A8me_par_auto-apprentissage&amp;diff=132510</id>
		<title>Résolution de problème par auto-apprentissage</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=R%C3%A9solution_de_probl%C3%A8me_par_auto-apprentissage&amp;diff=132510"/>
		<updated>2026-09-08T18:42:59Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
[[Système d&#039;IA]] qui évalue lui-même son propre &#039;&#039;&#039;[[entraînement]]&#039;&#039;&#039; et ses habiletés de résolution de problème ([[raisonnement]]), faisant en sorte qu’il ne requiert aucune &#039;&#039;&#039;[[étiquette]]&#039;&#039;&#039; de &#039;&#039;&#039;[[jeu de référence|référence]]&#039;&#039;&#039; ou des &#039;&#039;&#039;[[requête générative|requêtes]]&#039;&#039;&#039; définies par un humain. Il crée donc ses propres tâches, les résout et il valide ses réponses en utilisant trois modes de [[raisonnement]] classique : la &#039;&#039;&#039;[[raisonnement déductif|déduction]]&#039;&#039;&#039;, l’&#039;&#039;&#039;[[raisonnement abductif|abduction]]&#039;&#039;&#039; et l’&#039;&#039;&#039;[[raisonnement inductif|induction]]&#039;&#039;&#039;.&lt;br /&gt;
&lt;br /&gt;
Voir aussi &#039;&#039;&#039;[[peaufinage par auto-jeu]]&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Complément == &lt;br /&gt;
Nous préférons &#039;&#039;résolution de problème&#039;&#039; plutôt que &#039;&#039;raisonnement&#039;&#039; pour éviter anthropomorphisme. &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;système de résolution de problème par auto-apprentissage&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;système de raisonnement par auto-apprentissage&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; absolute zero reasoner&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; AZR&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://arxiv.org/abs/2505.03335   Source : Arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://medium.com/@ferreradaniel/the-absolute-zero-reasoner-ai-how-self-taught-machines-are-changing-everything-054333c37d2a   Source : Medium]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Absolute_zero_reasoner&amp;diff=132509</id>
		<title>Absolute zero reasoner</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Absolute_zero_reasoner&amp;diff=132509"/>
		<updated>2026-09-08T18:42:24Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : Patrickdrouin a déplacé la page Absolute zero reasoner vers Système de résolution de problème par auto-apprentissage&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#REDIRECTION [[Système de résolution de problème par auto-apprentissage]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=R%C3%A9solution_de_probl%C3%A8me_par_auto-apprentissage&amp;diff=132508</id>
		<title>Résolution de problème par auto-apprentissage</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=R%C3%A9solution_de_probl%C3%A8me_par_auto-apprentissage&amp;diff=132508"/>
		<updated>2026-09-08T18:42:24Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : Patrickdrouin a déplacé la page Absolute zero reasoner vers Système de résolution de problème par auto-apprentissage&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== en construction ==&lt;br /&gt;
&lt;br /&gt;
== Définition ==&lt;br /&gt;
[[Système d&#039;IA]] qui évalue lui-même son propre &#039;&#039;&#039;[[entraînement]]&#039;&#039;&#039; et ses habiletés de résolution de problème ([[raisonnement]]), faisant en sorte qu’il ne requiert aucune &#039;&#039;&#039;[[étiquette]]&#039;&#039;&#039; de &#039;&#039;&#039;[[jeu de référence|référence]]&#039;&#039;&#039; ou des &#039;&#039;&#039;[[requête générative|requêtes]]&#039;&#039;&#039; définies par un humain. Il crée donc ses propres tâches, les résout et il valide ses réponses en utilisant trois modes de [[raisonnement]] classique : la &#039;&#039;&#039;[[raisonnement déductif|déduction]]&#039;&#039;&#039;, l’&#039;&#039;&#039;[[raisonnement abductif|abduction]]&#039;&#039;&#039; et l’&#039;&#039;&#039;[[raisonnement inductif|induction]]&#039;&#039;&#039;.&lt;br /&gt;
&lt;br /&gt;
Voir aussi &#039;&#039;&#039;[[peaufinage par auto-jeu]]&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Complément == &lt;br /&gt;
Nous préférons &#039;&#039;résolution de problème&#039;&#039; plutôt que &#039;&#039;raisonnement&#039;&#039; pour éviter anthropomorphisme. &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;système de résolution de problème par auto-apprentissage&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;système de raisonnement par auto-apprentissage&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; absolute zero reasoner&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; AZR&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://arxiv.org/abs/2505.03335   Source : Arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://medium.com/@ferreradaniel/the-absolute-zero-reasoner-ai-how-self-taught-machines-are-changing-everything-054333c37d2a   Source : Medium]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=R%C3%A9solution_de_probl%C3%A8me_par_auto-apprentissage&amp;diff=132501</id>
		<title>Résolution de problème par auto-apprentissage</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=R%C3%A9solution_de_probl%C3%A8me_par_auto-apprentissage&amp;diff=132501"/>
		<updated>2026-09-08T18:35:13Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== en construction ==&lt;br /&gt;
&lt;br /&gt;
== Définition ==&lt;br /&gt;
[[Système d&#039;IA]] qui évalue lui-même son propre &#039;&#039;&#039;[[entraînement]]&#039;&#039;&#039; et ses habiletés de résolution de problème ([[raisonnement]]), faisant en sorte qu’il ne requiert aucune &#039;&#039;&#039;[[étiquette]]&#039;&#039;&#039; de &#039;&#039;&#039;[[jeu de référence|référence]]&#039;&#039;&#039; ou des &#039;&#039;&#039;[[requête générative|requêtes]]&#039;&#039;&#039; définies par un humain. Il crée donc ses propres tâches, les résout et il valide ses réponses en utilisant trois modes de [[raisonnement]] classique : la &#039;&#039;&#039;[[raisonnement déductif|déduction]]&#039;&#039;&#039;, l’&#039;&#039;&#039;[[raisonnement abductif|abduction]]&#039;&#039;&#039; et l’&#039;&#039;&#039;[[raisonnement inductif|induction]]&#039;&#039;&#039;.&lt;br /&gt;
&lt;br /&gt;
Voir aussi &#039;&#039;&#039;[[peaufinage par auto-jeu]]&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Complément == &lt;br /&gt;
Nous préférons &#039;&#039;résolution de problème&#039;&#039; plutôt que &#039;&#039;raisonnement&#039;&#039; pour éviter anthropomorphisme. &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;système de résolution de problème par auto-apprentissage&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;système de raisonnement par auto-apprentissage&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; absolute zero reasoner&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; AZR&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://arxiv.org/abs/2505.03335   Source : Arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://medium.com/@ferreradaniel/the-absolute-zero-reasoner-ai-how-self-taught-machines-are-changing-everything-054333c37d2a   Source : Medium]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=R%C3%A9solution_de_probl%C3%A8me_par_auto-apprentissage&amp;diff=132499</id>
		<title>Résolution de problème par auto-apprentissage</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=R%C3%A9solution_de_probl%C3%A8me_par_auto-apprentissage&amp;diff=132499"/>
		<updated>2026-09-08T18:34:21Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== en construction ==&lt;br /&gt;
&lt;br /&gt;
== Définition ==&lt;br /&gt;
[[Système d&#039;IA]] qui évalue lui-même son propre &#039;&#039;&#039;[[entraînement]]&#039;&#039;&#039; et ses habiletés de résolution de problème ([[raisonnement]]), faisant en sorte qu’il ne requiert aucune &#039;&#039;&#039;[[étiquette]]&#039;&#039;&#039; de &#039;&#039;&#039;[[jeu de référence|référence]]&#039;&#039;&#039; ou des &#039;&#039;&#039;[[requête générative|requêtes]]&#039;&#039;&#039; définies par un humain. Il crée donc ses propres tâches, les résout et il valide ses réponses en utilisant trois modes de [[raisonnement]] classique : la &#039;&#039;&#039;[[raisonnement déductif|déduction]]&#039;&#039;&#039;, l’&#039;&#039;&#039;[[raisonnement abductif|abduction]]&#039;&#039;&#039; et l’&#039;&#039;&#039;[[raisonnement inductif|induction]]&#039;&#039;&#039;.&lt;br /&gt;
&lt;br /&gt;
Voir aussi &#039;&#039;&#039;[[peaufinage par auto-jeu]]&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Complément == &lt;br /&gt;
Nous préférons &#039;&#039;résolution de problème&#039;&#039; plutôt que &#039;&#039;raisonnement&#039;&#039; pour éviter anthropomorphisme. &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;système de résolution de problème par auto-apprentissage&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;système de raisonnement par auto-apprentissage&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; absolute zero reasoner&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; AZR&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://arxiv.org/abs/2505.03335   Source : Arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://medium.com/@ferreradaniel/the-absolute-zero-reasoner-ai-how-self-taught-machines-are-changing-everything-054333c37d2a   Source : Medium]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:vocabulary]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Puissance_de_calcul_exig%C3%A9e&amp;diff=132458</id>
		<title>Puissance de calcul exigée</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Puissance_de_calcul_exig%C3%A9e&amp;diff=132458"/>
		<updated>2026-09-01T21:04:07Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : Patrickdrouin a déplacé la page Puissance de calcul exigée vers Puissance de calcul augmentée&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#REDIRECTION [[Puissance de calcul augmentée]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Augmentation_de_la_puissance_de_calcul_%C3%A0_l%27inf%C3%A9rence&amp;diff=132457</id>
		<title>Augmentation de la puissance de calcul à l&#039;inférence</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Augmentation_de_la_puissance_de_calcul_%C3%A0_l%27inf%C3%A9rence&amp;diff=132457"/>
		<updated>2026-09-01T21:04:07Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : Patrickdrouin a déplacé la page Puissance de calcul exigée vers Puissance de calcul augmentée&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Augmentation de la puissance de calcul (quantité de calcul par unité de temps) d&#039;un &#039;&#039;&#039;[[modèle]]&#039;&#039;&#039; d&#039;&#039;&#039;&#039;[[intelligence artificielle]]&#039;&#039;&#039; pré-entraîné pour qu&#039;il génère une réponse de meilleure qualité.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; puissance de calcul augmentée &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; test-time scaling&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; TTS&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; test-time computing&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;!--&#039;&#039;The amount of computational power and time required when an AI model is actually being used, so after it has been trained.&#039;&#039;--&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://arxiv.org/abs/2503.24235   Source : arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://huggingface.co/blog/Kseniase/testtimecompute#what-basically-is-test-time-compute-ttc   Source : Hugging Face]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Augmentation_de_la_puissance_de_calcul_%C3%A0_l%27inf%C3%A9rence&amp;diff=132456</id>
		<title>Augmentation de la puissance de calcul à l&#039;inférence</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Augmentation_de_la_puissance_de_calcul_%C3%A0_l%27inf%C3%A9rence&amp;diff=132456"/>
		<updated>2026-09-01T21:01:33Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Augmentation de la puissance de calcul (quantité de calcul par unité de temps) d&#039;un &#039;&#039;&#039;[[modèle]]&#039;&#039;&#039; d&#039;&#039;&#039;&#039;[[intelligence artificielle]]&#039;&#039;&#039; pré-entraîné pour qu&#039;il génère une réponse de meilleure qualité.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; puissance de calcul augmentée &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; test-time scaling&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; TTS&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; test-time computing&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;!--&#039;&#039;The amount of computational power and time required when an AI model is actually being used, so after it has been trained.&#039;&#039;--&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://arxiv.org/abs/2503.24235   Source : arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://huggingface.co/blog/Kseniase/testtimecompute#what-basically-is-test-time-compute-ttc   Source : Hugging Face]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Entropy_collapse&amp;diff=132455</id>
		<title>Entropy collapse</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Entropy_collapse&amp;diff=132455"/>
		<updated>2026-09-01T20:52:21Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : Patrickdrouin a déplacé la page Entropy collapse vers Effondrement de l&amp;#039;entropie : effondrement de l&amp;#039;entropie&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#REDIRECTION [[Effondrement de l&#039;entropie]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Effondrement_de_l%27entropie&amp;diff=132454</id>
		<title>Effondrement de l&#039;entropie</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Effondrement_de_l%27entropie&amp;diff=132454"/>
		<updated>2026-09-01T20:52:20Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : Patrickdrouin a déplacé la page Entropy collapse vers Effondrement de l&amp;#039;entropie : effondrement de l&amp;#039;entropie&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==Définition==&lt;br /&gt;
L&#039;effondrement de l&#039;entropie est une chute brutale de la diversité interne d&#039;un [[système d&#039;IA]], ou de ses options décisionnelle. En [[apprentissage par renforcement]], elle survient lorsque la rétroaction récompense les choix dominants plus vite que de nouvelles possibilités ne peuvent émerger.&lt;br /&gt;
&lt;br /&gt;
==Français==&lt;br /&gt;
&#039;&#039;&#039;effondrement de l&#039;entropie&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;effondrement entropique&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;effondrement de la diversité&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;perte de la diversité&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Anglais==&lt;br /&gt;
&#039;&#039;&#039;entropy collapse&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/html/2512.12381v1. Khan et Hoa (2025) - entropy collapse]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Effondrement_de_l%27entropie&amp;diff=132453</id>
		<title>Effondrement de l&#039;entropie</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Effondrement_de_l%27entropie&amp;diff=132453"/>
		<updated>2026-09-01T20:51:57Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==Définition==&lt;br /&gt;
L&#039;effondrement de l&#039;entropie est une chute brutale de la diversité interne d&#039;un [[système d&#039;IA]], ou de ses options décisionnelle. En [[apprentissage par renforcement]], elle survient lorsque la rétroaction récompense les choix dominants plus vite que de nouvelles possibilités ne peuvent émerger.&lt;br /&gt;
&lt;br /&gt;
==Français==&lt;br /&gt;
&#039;&#039;&#039;effondrement de l&#039;entropie&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;effondrement entropique&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;effondrement de la diversité&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;perte de la diversité&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Anglais==&lt;br /&gt;
&#039;&#039;&#039;entropy collapse&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/html/2512.12381v1. Khan et Hoa (2025) - entropy collapse]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Effondrement_de_l%27entropie&amp;diff=132452</id>
		<title>Effondrement de l&#039;entropie</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Effondrement_de_l%27entropie&amp;diff=132452"/>
		<updated>2026-09-01T20:50:53Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==Définition==&lt;br /&gt;
L&#039;effondrement de l&#039;entropie est une chute brutale de la diversité interne d&#039;un système d&#039;IA, ou de ses options décisionnelle. En apprentissage par renforcement, elle survient lorsque la rétroaction récompense les choix dominants plus vite que de nouvelles possibilités ne peuvent émerger.&lt;br /&gt;
&lt;br /&gt;
==Français==&lt;br /&gt;
&#039;&#039;&#039;effondrement de l&#039;entropie&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;effondrement entropique&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;effondrement de la diversité&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;perte de la diversité&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Anglais==&lt;br /&gt;
&#039;&#039;&#039;entropy collapse&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/html/2512.12381v1. Khan et Hoa (2025) - entropy collapse]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Effondrement_de_l%27entropie&amp;diff=132451</id>
		<title>Effondrement de l&#039;entropie</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Effondrement_de_l%27entropie&amp;diff=132451"/>
		<updated>2026-09-01T20:50:21Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==Définition==&lt;br /&gt;
L&#039;effondrement de l&#039;entropie est une chute brutale de la diversité interne d&#039;un système d&#039;IA, ou de ses options décisionnelle. En apprentissage par renforcement, elle survient lorsque la rétroaction récompense les choix dominants plus vite que de nouvelles idées ne peuvent émerger.&lt;br /&gt;
&lt;br /&gt;
==Français==&lt;br /&gt;
&#039;&#039;&#039;effondrement de l&#039;entropie&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;effondrement entropique&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;effondrement de la diversité&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;perte de la diversité&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Anglais==&lt;br /&gt;
&#039;&#039;&#039;entropy collapse&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/html/2512.12381v1. Khan et Hoa (2025) - entropy collapse]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Effondrement_de_l%27entropie&amp;diff=132450</id>
		<title>Effondrement de l&#039;entropie</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Effondrement_de_l%27entropie&amp;diff=132450"/>
		<updated>2026-09-01T20:49:18Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : Page créée avec « ==Définition== L&amp;#039;effondrement de l&amp;#039;entropie est une chute brutale de la diversité interne d&amp;#039;un système, ou de ses options décisionnelle. En apprentissage par renforcement, elle survient lorsque la rétroaction récompense les choix dominants plus vite que de nouvelles idées ne peuvent émerger.  ==Français== &amp;#039;&amp;#039;&amp;#039;effondrement de l&amp;#039;entropie&amp;#039;&amp;#039;&amp;#039;  &amp;#039;&amp;#039;&amp;#039;effondrement entropique&amp;#039;&amp;#039;&amp;#039;  &amp;#039;&amp;#039;&amp;#039;effondrement de la diversité&amp;#039;&amp;#039;&amp;#039;  &amp;#039;&amp;#039;&amp;#039;perte de la diversité&amp;#039;&amp;#039;&amp;#039;  ==Anglais== &amp;#039;&amp;#039;&amp;#039;entr... »&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==Définition==&lt;br /&gt;
L&#039;effondrement de l&#039;entropie est une chute brutale de la diversité interne d&#039;un système, ou de ses options décisionnelle. En apprentissage par renforcement, elle survient lorsque la rétroaction récompense les choix dominants plus vite que de nouvelles idées ne peuvent émerger.&lt;br /&gt;
&lt;br /&gt;
==Français==&lt;br /&gt;
&#039;&#039;&#039;effondrement de l&#039;entropie&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;effondrement entropique&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;effondrement de la diversité&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;perte de la diversité&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Anglais==&lt;br /&gt;
&#039;&#039;&#039;entropy collapse&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/html/2512.12381v1. Khan et Hoa (2025) - entropy collapse]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Effondrement_gravitationnel&amp;diff=132448</id>
		<title>Effondrement gravitationnel</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Effondrement_gravitationnel&amp;diff=132448"/>
		<updated>2026-09-01T20:33:00Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==[[:Catégorie:Spatiologie| &#039;&#039;&#039;&amp;lt;span style=&amp;quot;font-family:arial black;font-size:24px;  color:#983fab;&amp;quot;&amp;gt;SPATIOLOGIE&amp;lt;/span&amp;gt;&#039;&#039;&#039;]]==&lt;br /&gt;
&lt;br /&gt;
== Définition ==&lt;br /&gt;
Phénomène d&#039;effondrement d&#039;un objet céleste dans lequel les forces qui s&#039;opposent à la gravité cessent brusquement d&#039;équilibrer celle-ci. Ex : collapse galactique, collapse stellaire. &lt;br /&gt;
&lt;br /&gt;
→ cœur préstellaire, contraction &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;effondrement gravitationnel&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;collapse gravitationnel&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;collapse gravitational&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://datafranca.org/images/Dictionnaire-de-Spatiologie-2025     Sources :  Dictionnaire de Spatiologie]&lt;br /&gt;
&lt;br /&gt;
{{Modèle:Spatiologie}}&lt;br /&gt;
[[Catégorie:spatiologie]]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Astrophysique]]&lt;br /&gt;
[[Catégorie:101Astrophysique]]&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Couche_cach%C3%A9e&amp;diff=132436</id>
		<title>Couche cachée</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Couche_cach%C3%A9e&amp;diff=132436"/>
		<updated>2026-09-01T19:55:23Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==Définition==&lt;br /&gt;
Couche synthétique d&#039;un [[Réseau de neurones artificiels|réseau de neurones]] entre la [[couche d&#039;entrée]] (les &#039;&#039;&#039;[[attribut|attributs]]&#039;&#039;&#039;) et la [[couche de sortie]] (la &#039;&#039;&#039;[[ prédiction]]&#039;&#039;&#039;)&#039;&#039;&#039;.&#039;&#039;&#039; La seconde couche est une couche &#039;&#039;cachée&#039;&#039;, en ce sens qu&#039;elle n&#039;a qu&#039;une utilité intrinsèque pour le [[Réseau de neurones artificiels|réseau de neurones]] et n&#039;a pas de contact direct avec l&#039;extérieur. Les [[fonction d&#039;activation|fonctions d&#039;activations]] sont en général non linéaires sur cette couche mais il n&#039;y a pas de règle à respecter. &lt;br /&gt;
&lt;br /&gt;
Un [[Réseau de neurones artificiels|réseau de neurones]] se compose d&#039;une ou plusieurs couches cachées.&lt;br /&gt;
&lt;br /&gt;
==Français==&lt;br /&gt;
&#039;&#039;&#039; couche cachée &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; couche intermédiaire &#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
==Anglais==&lt;br /&gt;
&#039;&#039;&#039;  hidden layer &#039;&#039;&#039;&lt;br /&gt;
==Sources==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
[https://developers.google.com/machine-learning/glossary/ Source: Google, &#039;&#039;Machine learning glossary&#039;&#039;.]&lt;br /&gt;
&lt;br /&gt;
{{Modèle:GDT}}&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GDT]]&lt;br /&gt;
[[Category:GRAND LEXIQUE FRANÇAIS]]&lt;br /&gt;
[[Category:Apprentissage profond]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Distillation_attack&amp;diff=132284</id>
		<title>Distillation attack</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Distillation_attack&amp;diff=132284"/>
		<updated>2026-08-04T19:26:37Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : Patrickdrouin a déplacé la page Distillation attack vers Attaque par distillation&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#REDIRECTION [[Attaque par distillation]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132283</id>
		<title>Attaque par distillation</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132283"/>
		<updated>2026-08-04T19:26:36Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : Patrickdrouin a déplacé la page Distillation attack vers Attaque par distillation&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
L&#039;attaque par [[Distillation de modèles|distillation]] est une pratique où un modèle d&#039;IA puissant ([[modèle enseignant]]) est exploité pour en entraîner un nouveau modèle, plus petit et moins cher ([[modèle étudiant]]), en copiant ses réponses à un ensemble requêtes.&lt;br /&gt;
&lt;br /&gt;
== Compléments == &lt;br /&gt;
Un très grand nombres de requêtes sont utilisées pour générer un jeu de données basé principalement sur les [[chaîne de résolution|chaînes de résolution]] (COT). Ces données plus riches facilitent l&#039;apprentissage de la distribution de probabilité du [[modèle enseignant]].  &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;attaque par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;vol d&#039;IA par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;piratage par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;distillation attack&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
A distillation attack (or model extraction attack) is a form of artificial intelligence (AI) intellectual property theft. An adversary systematically prompts an expensive, highly capable &amp;quot;teacher&amp;quot; model via its API to harvest its responses. They then use this collected data to train a smaller, cheaper &amp;quot;student&amp;quot; model to perfectly mimic the advanced system. &lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://www.usine-digitale.fr/cybersecurite/cybersecurite-pourquoi-les-attaques-par-distillation-qui-visent-a-copier-des-modeles-dia-deviennent-un-enjeu-pour-les-entreprises.C67RUJ64TZFUVNH4UGAKEPYHZQ.html L&#039;usine digitale - attaque par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.ledevoir.com/economie/techno/958530/anthropic-accuse-deepseek-piller-modeles-ia-construire-siens. Le Devoir - distillation]&lt;br /&gt;
&lt;br /&gt;
[https://hyper.ai/fr/stories/5b29229d84a2ed48b0ac6517333e1b82  HyperAI - vol d&#039;IA par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.mindstudio.ai/blog/ai-model-distillation-attacks-explained Mind Studio - distillation attack]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Optimisation_directe_des_pr%C3%A9f%C3%A9rences&amp;diff=132282</id>
		<title>Optimisation directe des préférences</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Optimisation_directe_des_pr%C3%A9f%C3%A9rences&amp;diff=132282"/>
		<updated>2026-08-04T19:21:41Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
L&#039;optimisation directe des préférences (DPO) est une paramétrisation du modèle de récompense dans l&#039;[[apprentissage par renforcement avec rétroaction humaine]] (ARRH) qui permet d&#039;extraire la politique optimale correspondante sous forme fermée, ce qui permet de résoudre le problème d&#039;ARRH standard avec seulement une simple perte de classification. &lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
L&#039;algorithme résultant est stable, performant et léger en termes de calcul, éliminant le besoin d&#039;[[échantillonnage]] à partir du [[modèle de langue|modèle de langue]] lors du réglage fin ou de l&#039;exécution d&#039;un réglage important des [[hyperparamètres]].&lt;br /&gt;
&lt;br /&gt;
Alors que les grands modèles de langues acquièrent par le biais de texte une connaissance générale du monde et certaines compétences de raisonnement, il est difficile d&#039;obtenir un contrôle précis de leur comportement de par la nature floue du jeu de données d&#039;entraînement (la langue). &lt;br /&gt;
&lt;br /&gt;
Les méthodes existantes pour obtenir une telle maniabilité collectent des étiquettes humaines sur la qualité relative des générations de modèles et affinent le modèle de langue non supervisé pour l&#039;aligner sur ces préférences, souvent avec l&#039;apprentissage par apprentissage par renforcement à rétroaction humaine (ARRH) qui est souvent complexe et instable. &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; optimisation directe des préférences &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; Direct Preference Optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; DPO &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://arxiv.org/abs/2305.18290  Source : arxiv ]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Optimisation_directe_des_pr%C3%A9f%C3%A9rences&amp;diff=132281</id>
		<title>Optimisation directe des préférences</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Optimisation_directe_des_pr%C3%A9f%C3%A9rences&amp;diff=132281"/>
		<updated>2026-08-04T19:11:19Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
L&#039;optimisation directe des préférences (DPO) est une paramétrisation du modèle de récompense dans l&#039;[[apprentissage par renforcement avec rétroaction humaine]] (ARRH) qui permet d&#039;extraire la politique optimale correspondante sous forme fermée, ce qui permet de résoudre le problème d&#039;ARRH standard avec seulement une simple perte de classification. &lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
L&#039;algorithme résultant est stable, performant et léger en termes de calcul, éliminant le besoin d&#039;[[échantillonnage]] à partir du [[modèle de langue|modèle de langue]] lors du réglage fin ou de l&#039;exécution d&#039;un réglage important des [[hyperparamètres]].&lt;br /&gt;
&lt;br /&gt;
Alors que les modèles de langue non supervisés à grande échelle acquièrent une connaissance générale du monde et certaines compétences de raisonnement, il est difficile d&#039;obtenir un contrôle précis de leur comportement en raison de la nature totalement non supervisée de leur formation. &lt;br /&gt;
&lt;br /&gt;
Les méthodes existantes pour obtenir une telle maniabilité collectent des étiquettes humaines sur la qualité relative des générations de modèles et affinent le modèle de langue non supervisé pour l&#039;aligner sur ces préférences, souvent avec l&#039;apprentissage par apprentissage par renforcement à rétroaction humaine (ARRH) qui est souvent complexe et instable. &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; optimisation directe des préférences &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; Direct Preference Optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; DPO &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://arxiv.org/abs/2305.18290  Source : arxiv ]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Optimisation_directe_des_pr%C3%A9f%C3%A9rences&amp;diff=132276</id>
		<title>Optimisation directe des préférences</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Optimisation_directe_des_pr%C3%A9f%C3%A9rences&amp;diff=132276"/>
		<updated>2026-08-04T19:02:59Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
L&#039;optimisation directe des préférences (DPO) est une paramétrisation du modèle de récompense dans l&#039;[[apprentissage par renforcement avec rétroaction humaine]] (ARRH) qui permet d&#039;extraire la politique optimale correspondante sous forme fermée, ce qui permet de résoudre le problème d&#039;ARRH standard avec seulement une simple perte de classification. &lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
&lt;br /&gt;
L&#039;algorithme résultant est stable, performant et léger en termes de calcul, éliminant le besoin d&#039;échantillonnage à partir du modèle de langue lors du réglage fin ou de l&#039;exécution d&#039;un réglage important des hyperparamètres.&lt;br /&gt;
&lt;br /&gt;
Alors que les modèles de langage non supervisés à grande échelle acquièrent une connaissance générale du monde et certaines compétences de raisonnement, il est difficile d&#039;obtenir un contrôle précis de leur comportement en raison de la nature totalement non supervisée de leur formation. &lt;br /&gt;
&lt;br /&gt;
Les méthodes existantes pour obtenir une telle maniabilité collectent des étiquettes humaines sur la qualité relative des générations de modèles et affinent le modèle de langue non supervisé pour l&#039;aligner sur ces préférences, souvent avec l&#039;apprentissage par apprentissage par renforcement à rétroaction humaine (ARRH). &lt;br /&gt;
&lt;br /&gt;
Cependant, le ARRH est une procédure complexe et souvent instable, qui consiste d&#039;abord à adapter un modèle de récompense qui reflète les préférences humaines, puis à affiner le grand modèle de langue non supervisé à l&#039;aide de l&#039;apprentissage par renforcement pour maximiser cette récompense estimée sans trop s&#039;éloigner du modèle d&#039;origine. &lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; optimisation directe des préférences &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; Direct Preference Optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; DPO &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/abs/2305.18290  Source : arxiv ]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Optimisation_directe_des_pr%C3%A9f%C3%A9rences&amp;diff=132275</id>
		<title>Optimisation directe des préférences</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Optimisation_directe_des_pr%C3%A9f%C3%A9rences&amp;diff=132275"/>
		<updated>2026-08-04T19:00:55Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
L&#039;optimisation directe des préférences (DPO) est une paramétrisation du modèle de récompense dans le ARRH qui permet d&#039;extraire la politique optimale correspondante sous forme fermée, ce qui permet de résoudre le problème ARRH standard avec seulement une simple perte de classification. &lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
&lt;br /&gt;
L&#039;algorithme résultant est stable, performant et léger en termes de calcul, éliminant le besoin d&#039;échantillonnage à partir du modèle de langue lors du réglage fin ou de l&#039;exécution d&#039;un réglage important des hyperparamètres.&lt;br /&gt;
&lt;br /&gt;
Alors que les modèles de langage non supervisés à grande échelle acquièrent une connaissance générale du monde et certaines compétences de raisonnement, il est difficile d&#039;obtenir un contrôle précis de leur comportement en raison de la nature totalement non supervisée de leur formation. &lt;br /&gt;
&lt;br /&gt;
Les méthodes existantes pour obtenir une telle maniabilité collectent des étiquettes humaines sur la qualité relative des générations de modèles et affinent le modèle de langue non supervisé pour l&#039;aligner sur ces préférences, souvent avec l&#039;apprentissage par apprentissage par renforcement à rétroaction humaine (ARRH). &lt;br /&gt;
&lt;br /&gt;
Cependant, le ARRH est une procédure complexe et souvent instable, qui consiste d&#039;abord à adapter un modèle de récompense qui reflète les préférences humaines, puis à affiner le grand modèle de langue non supervisé à l&#039;aide de l&#039;apprentissage par renforcement pour maximiser cette récompense estimée sans trop s&#039;éloigner du modèle d&#039;origine. &lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; optimisation directe des préférences &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; Direct Preference Optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; DPO &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/abs/2305.18290  Source : arxiv ]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132273</id>
		<title>Attaque par distillation</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132273"/>
		<updated>2026-08-04T18:47:20Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
L&#039;attaque par [[Distillation de modèles|distillation]] est une pratique où un modèle d&#039;IA puissant ([[modèle enseignant]]) est exploité pour en entraîner un nouveau modèle, plus petit et moins cher ([[modèle étudiant]]), en copiant ses réponses à un ensemble requêtes.&lt;br /&gt;
&lt;br /&gt;
== Compléments == &lt;br /&gt;
Un très grand nombres de requêtes sont utilisées pour générer un jeu de données basé principalement sur les [[chaîne de résolution|chaînes de résolution]] (COT). Ces données plus riches facilitent l&#039;apprentissage de la distribution de probabilité du [[modèle enseignant]].  &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;attaque par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;vol d&#039;IA par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;distillation attack&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
A distillation attack (or model extraction attack) is a form of artificial intelligence (AI) intellectual property theft. An adversary systematically prompts an expensive, highly capable &amp;quot;teacher&amp;quot; model via its API to harvest its responses. They then use this collected data to train a smaller, cheaper &amp;quot;student&amp;quot; model to perfectly mimic the advanced system. &lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://www.usine-digitale.fr/cybersecurite/cybersecurite-pourquoi-les-attaques-par-distillation-qui-visent-a-copier-des-modeles-dia-deviennent-un-enjeu-pour-les-entreprises.C67RUJ64TZFUVNH4UGAKEPYHZQ.html L&#039;usine digitale - attaque par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.ledevoir.com/economie/techno/958530/anthropic-accuse-deepseek-piller-modeles-ia-construire-siens. Le Devoir - distillation]&lt;br /&gt;
&lt;br /&gt;
[https://hyper.ai/fr/stories/5b29229d84a2ed48b0ac6517333e1b82  HyperAI - vol d&#039;IA par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.mindstudio.ai/blog/ai-model-distillation-attacks-explained Mind Studio - distillation attack]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132272</id>
		<title>Attaque par distillation</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132272"/>
		<updated>2026-08-04T18:45:53Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
L&#039;attaque par [[Distillation de modèles|distillation]] est une pratique où un modèle d&#039;IA puissant ([[modèle enseignant]]) est exploité pour en entraîner un nouveau modèle, plus petit et moins cher ([[modèle étudiant]]), en copiant ses réponses à un ensemble requêtes.&lt;br /&gt;
&lt;br /&gt;
== Compléments == &lt;br /&gt;
Un très grand nombres de requêtes sont utilisées pour générer un jeu de données basé principalement sur les [[chaîne de résolution|chaînes de résolution]] (COT). Ces données plus riches facilitent la reconstruction de la distribution de probabilité du modèle enseignant.  &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;attaque par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;vol d&#039;IA par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;distillation attack&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
A distillation attack (or model extraction attack) is a form of artificial intelligence (AI) intellectual property theft. An adversary systematically prompts an expensive, highly capable &amp;quot;teacher&amp;quot; model via its API to harvest its responses. They then use this collected data to train a smaller, cheaper &amp;quot;student&amp;quot; model to perfectly mimic the advanced system. &lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://www.usine-digitale.fr/cybersecurite/cybersecurite-pourquoi-les-attaques-par-distillation-qui-visent-a-copier-des-modeles-dia-deviennent-un-enjeu-pour-les-entreprises.C67RUJ64TZFUVNH4UGAKEPYHZQ.html L&#039;usine digitale - attaque par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.ledevoir.com/economie/techno/958530/anthropic-accuse-deepseek-piller-modeles-ia-construire-siens. Le Devoir - distillation]&lt;br /&gt;
&lt;br /&gt;
[https://hyper.ai/fr/stories/5b29229d84a2ed48b0ac6517333e1b82  HyperAI - vol d&#039;IA par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.mindstudio.ai/blog/ai-model-distillation-attacks-explained Mind Studio - distillation attack]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132270</id>
		<title>Attaque par distillation</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132270"/>
		<updated>2026-08-04T18:38:53Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
L&#039;attaque par [[Distillation de modèles|distillation]] est une pratique où un modèle d&#039;IA puissant ([[modèle enseignant]]) est exploité pour en entraîner un nouveau modèle, plus petit et moins cher ([[modèle étudiant]]), en copiant ses réponses à un ensemble requêtes.&lt;br /&gt;
&lt;br /&gt;
== Compléments == &lt;br /&gt;
Un très grand nombres de requêtes sont utilisées pour générer un nouveau jeu de données, ce qui permet de reconstruire un distribution de probabilités. &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;attaque par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;vol d&#039;IA par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;distillation attack&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
A distillation attack (or model extraction attack) is a form of artificial intelligence (AI) intellectual property theft. An adversary systematically prompts an expensive, highly capable &amp;quot;teacher&amp;quot; model via its API to harvest its responses. They then use this collected data to train a smaller, cheaper &amp;quot;student&amp;quot; model to perfectly mimic the advanced system. &lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://www.usine-digitale.fr/cybersecurite/cybersecurite-pourquoi-les-attaques-par-distillation-qui-visent-a-copier-des-modeles-dia-deviennent-un-enjeu-pour-les-entreprises.C67RUJ64TZFUVNH4UGAKEPYHZQ.html L&#039;usine digitale - attaque par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.ledevoir.com/economie/techno/958530/anthropic-accuse-deepseek-piller-modeles-ia-construire-siens. Le Devoir - distillation]&lt;br /&gt;
&lt;br /&gt;
[https://hyper.ai/fr/stories/5b29229d84a2ed48b0ac6517333e1b82  HyperAI - vol d&#039;IA par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.mindstudio.ai/blog/ai-model-distillation-attacks-explained Mind Studio - distillation attack]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132269</id>
		<title>Attaque par distillation</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132269"/>
		<updated>2026-08-04T18:34:39Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
L&#039;attaque par [[Distillation de modèles|distillation]] est une pratique où un modèle d&#039;IA puissant ([[modèle enseignant]]) est exploité pour en entraîner un nouveau modèle, plus petit et moins cher ([[modèle étudiant]]), en copiant ses comportements et ses réponses.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;attaque par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;vol d&#039;IA par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;distillation attack&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
A distillation attack (or model extraction attack) is a form of artificial intelligence (AI) intellectual property theft. An adversary systematically prompts an expensive, highly capable &amp;quot;teacher&amp;quot; model via its API to harvest its responses. They then use this collected data to train a smaller, cheaper &amp;quot;student&amp;quot; model to perfectly mimic the advanced system. &lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://www.usine-digitale.fr/cybersecurite/cybersecurite-pourquoi-les-attaques-par-distillation-qui-visent-a-copier-des-modeles-dia-deviennent-un-enjeu-pour-les-entreprises.C67RUJ64TZFUVNH4UGAKEPYHZQ.html L&#039;usine digitale - attaque par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.ledevoir.com/economie/techno/958530/anthropic-accuse-deepseek-piller-modeles-ia-construire-siens. Le Devoir - distillation]&lt;br /&gt;
&lt;br /&gt;
[https://hyper.ai/fr/stories/5b29229d84a2ed48b0ac6517333e1b82  HyperAI - vol d&#039;IA par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.mindstudio.ai/blog/ai-model-distillation-attacks-explained Mind Studio - distillation attack]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132268</id>
		<title>Attaque par distillation</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132268"/>
		<updated>2026-08-04T18:33:33Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
L&#039;attaque par [[Distillation de modèles|distillation]] est une pratique où un modèle d&#039;IA puissant ([[modèle enseignant]]) est exploité pour en entraîner un nouveau modèle, plus petit et moins cher ([[modèle étudiant]]), en copiant ses comportements et ses réponses.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;attaque par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;distillation attack&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
A distillation attack (or model extraction attack) is a form of artificial intelligence (AI) intellectual property theft. An adversary systematically prompts an expensive, highly capable &amp;quot;teacher&amp;quot; model via its API to harvest its responses. They then use this collected data to train a smaller, cheaper &amp;quot;student&amp;quot; model to perfectly mimic the advanced system. &lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://www.usine-digitale.fr/cybersecurite/cybersecurite-pourquoi-les-attaques-par-distillation-qui-visent-a-copier-des-modeles-dia-deviennent-un-enjeu-pour-les-entreprises.C67RUJ64TZFUVNH4UGAKEPYHZQ.html L&#039;usine digitale - attaque par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.ledevoir.com/economie/techno/958530/anthropic-accuse-deepseek-piller-modeles-ia-construire-siens. Le Devoir - distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.mindstudio.ai/blog/ai-model-distillation-attacks-explained Mind Studio - distillation attack]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132267</id>
		<title>Attaque par distillation</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132267"/>
		<updated>2026-08-04T18:32:15Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Le vol de modèle par [[Distillation de modèles|distillation]] est une pratique où un modèle d&#039;IA puissant ([[modèle enseignant]]) est exploité pour en entraîner un nouveau modèle, plus petit et moins cher ([[modèle étudiant]]), en copiant ses comportements et ses réponses.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;attaque par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;vol d&#039;IA par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;vol de modèle par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;distillation attack&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
A distillation attack (or model extraction attack) is a form of artificial intelligence (AI) intellectual property theft. An adversary systematically prompts an expensive, highly capable &amp;quot;teacher&amp;quot; model via its API to harvest its responses. They then use this collected data to train a smaller, cheaper &amp;quot;student&amp;quot; model to perfectly mimic the advanced system. &lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://www.usine-digitale.fr/cybersecurite/cybersecurite-pourquoi-les-attaques-par-distillation-qui-visent-a-copier-des-modeles-dia-deviennent-un-enjeu-pour-les-entreprises.C67RUJ64TZFUVNH4UGAKEPYHZQ.html L&#039;usine digitale - attaque par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.ledevoir.com/economie/techno/958530/anthropic-accuse-deepseek-piller-modeles-ia-construire-siens. Le Devoir - distillation]&lt;br /&gt;
&lt;br /&gt;
[https://hyper.ai/fr/stories/5b29229d84a2ed48b0ac6517333e1b82 HyperAI - vol d&#039;IA par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.mindstudio.ai/blog/ai-model-distillation-attacks-explained Mind Studio - distillation attack]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132266</id>
		<title>Attaque par distillation</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132266"/>
		<updated>2026-08-04T18:31:51Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Le vol de modèle par [[Distillation de modèles|distillation]] est une pratique où un modèle d&#039;IA puissant ([[modèle enseignant]]) est exploité pour en entraîner un nouveau modèle, plus petit et moins cher ([[modèle étudiant]]), en copiant ses comportements et ses réponses.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;attaque par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;vol d&#039;IA par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;vol de modèle par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;distillation attack&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
A distillation attack (or model extraction attack) is a form of artificial intelligence (AI) intellectual property theft. An adversary systematically prompts an expensive, highly capable &amp;quot;teacher&amp;quot; model via its API to harvest its responses. They then use this collected data to train a smaller, cheaper &amp;quot;student&amp;quot; model to perfectly mimic the advanced system. &lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://www.usine-digitale.fr/cybersecurite/cybersecurite-pourquoi-les-attaques-par-distillation-qui-visent-a-copier-des-modeles-dia-deviennent-un-enjeu-pour-les-entreprises.C67RUJ64TZFUVNH4UGAKEPYHZQ.html L&#039;usine digitale - attaque par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.ledevoir.com/economie/techno/958530/anthropic-accuse-deepseek-piller-modeles-ia-construire-siens. Le Devoir - distillation]&lt;br /&gt;
&lt;br /&gt;
[https://hyper.ai/fr/stories/5b29229d84a2ed48b0ac6517333e1b82 HyperAI - vol d&#039;IA par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.mindstudio.ai/blog/ai-model-distillation-attacks-explained - distillation attack]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132265</id>
		<title>Attaque par distillation</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attaque_par_distillation&amp;diff=132265"/>
		<updated>2026-08-04T18:30:28Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Le vol de modèle par [[Distillation de modèles|distillation]] est une pratique où un modèle d&#039;IA puissant ([[modèle enseignant]]) est exploité pour en entraîner un nouveau modèle, plus petit et moins cher ([[modèle étudiant]]), en copiant ses comportements et ses réponses.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;attaque par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;vol de modèle par distillation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;distillation attack&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
A distillation attack (or model extraction attack) is a form of artificial intelligence (AI) intellectual property theft. An adversary systematically prompts an expensive, highly capable &amp;quot;teacher&amp;quot; model via its API to harvest its responses. They then use this collected data to train a smaller, cheaper &amp;quot;student&amp;quot; model to perfectly mimic the advanced system. &lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://www.usine-digitale.fr/cybersecurite/cybersecurite-pourquoi-les-attaques-par-distillation-qui-visent-a-copier-des-modeles-dia-deviennent-un-enjeu-pour-les-entreprises.C67RUJ64TZFUVNH4UGAKEPYHZQ.html L&#039;usine digitale - attaque par distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.ledevoir.com/economie/techno/958530/anthropic-accuse-deepseek-piller-modeles-ia-construire-siens. Le Devoir - distillation]&lt;br /&gt;
&lt;br /&gt;
[https://www.mindstudio.ai/blog/ai-model-distillation-attacks-explained - distillation attack]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Puits_d%27attention&amp;diff=128227</id>
		<title>Puits d&#039;attention</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Puits_d%27attention&amp;diff=128227"/>
		<updated>2026-06-09T19:21:57Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Phénomène présent dans tous les &#039;&#039;&#039;[[Grand modèle de langues (GML)| grands modèles de langues]]&#039;&#039;&#039; &#039;&#039;&#039;[[Modèle autorégressif|autorégressifs]]&#039;&#039;&#039;, dans lesquels les premiers [[jeton textuel|jetons textuels]] représentent une part extrêmement importante du score d&#039;attention, même s&#039;ils ne sont pas importants sur le plan sémantique. &lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
Ce terme peut désigner le phénomène ou le type de &#039;&#039;&#039;[[jeton textuel]]&#039;&#039;&#039; concerné par le phénomène. &lt;br /&gt;
&lt;br /&gt;
Le phénomène apparaît à la suite d&#039;une optimisation efficace sur une quantité suffisante de &#039;&#039;&#039;[[données d&#039;entraînement]]&#039;&#039;&#039;. &lt;br /&gt;
&lt;br /&gt;
La raison pour laquelle les [[jeton textuel|jetons textuels]] initiaux sont considérés comme des « jetons puits » est intuitive : ils sont visibles par presque tous les [[jeton textuel|jetons]] suivants en raison de la nature autorégressive du modèle, ce qui les rend plus aptes à servir de « puits d&#039;attention ».&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; puits d&#039;attention&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; attention sink&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;This term can refer to the phenomenon or to the type of token concerned by the phenomenon. This phenomenon is present in all autoregressive large language models, in which the first few tokens make up for a shockingly large amount of the attention score, even if the tokens are not semantically important. It emerges after effective optimization on sufficient training data. &#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;The reason behind initial tokens as “sink tokens” is intuitive: initial tokens are visible to almost all subsequent tokens because of the autoregressive language modeling nature, making them more readily trained to serve as “attention sinks”.&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;This phenomenon has been widely adopted in applications such as streaming/long context generation, KV cache optimization, inference acceleration, model quantization, and others.&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://arxiv.org/abs/2309.17453   Source : arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/abs/2410.10781   Source : arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://huggingface.co/blog/tomaarsen/attention-sinks   Source : Hugging Face Blog]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=%C3%89chantillonnage_%C3%A0_troncature_k_fixe&amp;diff=128222</id>
		<title>Échantillonnage à troncature k fixe</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=%C3%89chantillonnage_%C3%A0_troncature_k_fixe&amp;diff=128222"/>
		<updated>2026-06-09T19:14:16Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
&lt;br /&gt;
Stratégie d&#039;échantillonnage qui prélève un élément parmi un nombre fixe &#039;&#039;k&#039;&#039; des meilleurs éléments d&#039;un ensemble. La valeur de &#039;&#039;k&#039;&#039; reste constante, &lt;br /&gt;
&lt;br /&gt;
Ceci signifie que la méthode ne s&#039;adapte pas au contexte, ce qui a conduit à l&#039;&#039;&#039;&#039;[[échantillonnage à troncature de masse p]]&#039;&#039;&#039;.&lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
Cette stratégie d&#039;échantillonnage est utilisée par les [[Grand modèle de langues|grands modèles de langues]] pour choisir aléatoirement un jeton parmi un nombre fixe &#039;&#039;k&#039;&#039; de &#039;&#039;&#039;[[jeton textuel|jetons textuels]]&#039;&#039;&#039;. La valeur de &#039;&#039;k&#039;&#039; reste constante, ce qui signifie que la méthode ne s&#039;adapte pas au contexte du texte généré. &lt;br /&gt;
&lt;br /&gt;
Une valeur &#039;&#039;k&#039;&#039; plus petite rendra le résultat plus ciblé mais moins créatif, tandis qu&#039;une valeur &#039;&#039;k&#039;&#039; plus grande rendra le résultat plus diversifié mais potentiellement moins pertinent.&lt;br /&gt;
&lt;br /&gt;
Cette limitation a conduit à l&#039;&#039;&#039;&#039;[[échantillonnage à troncature de masse p]]&#039;&#039;&#039;.&lt;br /&gt;
&amp;lt;hr&amp;gt;&lt;br /&gt;
Le terme « échantillonnage à troncature &#039;&#039;k&#039;&#039; fixe » est plus exact que terme « échantillonnage des &#039;&#039;k&#039;&#039; meilleurs » car elle définit l&#039;action algorithmique (la troncature) plutôt que simplement le résultat.&lt;br /&gt;
&amp;lt;hr&amp;gt;&lt;br /&gt;
Attention: À ne pas confondre avec la &#039;&#039;&#039;[[température]]&#039;&#039;&#039; d&#039;un grand modèle de langues.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;Échantillonnage à troncature k fixe&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Échantillonnage parmi les k meilleurs&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Échantillonnage Top-k&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; Top-k sampling&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Sampling strategy that always samples from a fixed number of tokens, which may be too restrictive or too broad depending on the context. The value of K remains constant, meaning the method isn&#039;t adaptive to the context of the text being generated, which led to top-p sampling.&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;A smaller K will make the output more focused but less creative, while a larger K will make the output more diverse but potentially less relevant.&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://medium.com/thinking-sand/the-top-k-and-top-p-parameters-explained-bfaecc8cd342   Source : Medium - Top-k sampling, Top-p sampling]&lt;br /&gt;
&lt;br /&gt;
[https://en.wikipedia.org/wiki/Top-p_sampling#Top-k_sampling  Wikipedia - Top-k sampling]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=%C3%89chantillonnage_%C3%A0_troncature_k_fixe&amp;diff=128221</id>
		<title>Échantillonnage à troncature k fixe</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=%C3%89chantillonnage_%C3%A0_troncature_k_fixe&amp;diff=128221"/>
		<updated>2026-06-09T19:11:51Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
&lt;br /&gt;
Stratégie d&#039;échantillonnage qui prélève un élément parmi un nombre fixe &#039;&#039;k&#039;&#039; des meilleurs éléments d&#039;un ensemble. La valeur de &#039;&#039;k&#039;&#039; reste constante, &lt;br /&gt;
&lt;br /&gt;
Ceci signifie que la méthode ne s&#039;adapte pas au contexte, ce qui a conduit à l&#039;&#039;&#039;&#039;[[échantillonnage à troncature de masse p]]&#039;&#039;&#039;.&lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
Cette stratégie d&#039;échantillonnage est utilisée par les [[Grand modèle de langues|grands modèles de langues]] pour choisir aléatoirement un jeton parmi un nombre fixe &#039;&#039;k&#039;&#039; de &#039;&#039;&#039;[[jeton textuel|jetons textuels]]&#039;&#039;&#039;. La valeur de &#039;&#039;k&#039;&#039; reste constante, ce qui signifie que la méthode ne s&#039;adapte pas au contexte du texte généré. &lt;br /&gt;
&lt;br /&gt;
Une valeur &#039;&#039;k&#039;&#039; plus petite rendra le résultat plus ciblé mais moins créatif, tandis qu&#039;une valeur &#039;&#039;k&#039;&#039; plus grande rendra le résultat plus diversifié mais potentiellement moins pertinent.&lt;br /&gt;
&lt;br /&gt;
Cette limitation a conduit à l&#039;&#039;&#039;&#039;[[échantillonnage à troncature de masse p]]&#039;&#039;&#039;.&lt;br /&gt;
&amp;lt;hr&amp;gt;&lt;br /&gt;
Le terme « échantillonnage à troncature &#039;&#039;k&#039;&#039; fixe » est plus exact que terme « échantillonnage des &#039;&#039;k&#039;&#039; meilleurs » car elle définit l&#039;action algorithmique (la troncature) plutôt que simplement le résultat.&lt;br /&gt;
&amp;lt;hr&amp;gt;&lt;br /&gt;
Attention: À ne pas confondre avec la &#039;&#039;&#039;[[température]]&#039;&#039;&#039; d&#039;un grand modèle de langues.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;Échantillonnage à troncature k fixe&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Échantillonnage parmi les k meilleurs&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Échantillonnage Top-k&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; Top-k sampling&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Sampling strategy that always samples from a fixed number of tokens, which may be too restrictive or too broad depending on the context. The value of K remains constant, meaning the method isn&#039;t adaptive to the context of the text being generated, which led to top-p sampling.&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;A smaller K will make the output more focused but less creative, while a larger K will make the output more diverse but potentially less relevant.&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://medium.com/thinking-sand/the-top-k-and-top-p-parameters-explained-bfaecc8cd342   Source : Medium - Top-k sampling, Top-p sampling]&lt;br /&gt;
&lt;br /&gt;
[https://en.wikipedia.org/wiki/Top-p_sampling#Top-k_sampling  Wikipedia - Top-k sampling]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attention_clairsem%C3%A9e&amp;diff=128220</id>
		<title>Attention clairsemée</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attention_clairsem%C3%A9e&amp;diff=128220"/>
		<updated>2026-06-09T19:10:44Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Technique d&#039;optimisation d&#039;une [[Réseau autoattentif|architecture auto-attentive]] qui vise à réduire le nombre de calculs nécessaires au mécanisme d&#039;auto-attention. &lt;br /&gt;
&lt;br /&gt;
== Compléments == &lt;br /&gt;
Au lieu de comparer tous les [[jeton textuel|jetons textuels]] entre eux, un processus de sélection concentre l&#039;attention sur certains jetons en particulier selon différentes heuristiques. Par exemple, es heuristiques exploitent une largeur de fenêtre, la position d&#039;un jeton dans une phrase, la similarité des jetons, etc.&lt;br /&gt;
&lt;br /&gt;
Cette technique d&#039;optimisation a été mise de l&#039;avant par la société DeepSeek-AI. &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;attention clairsemée&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;attention parcimonieuse&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;attention creuse&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;attention clairsemée native&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;sparse attention&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;native sparse attention&#039;&#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
Long-context modeling is crucial for next-generation language models, yet the high computational cost of standard attention mechanisms poses significant computational challenges. Sparse attention offers a promising direction for improving efficiency while maintaining model capabilities. We present NSA, a Natively trainable Sparse Attention mechanism that integrates algorithmic innovations with hardware-aligned optimizations to achieve efficient long-context modeling. NSA employs a dynamic hierarchical sparse strategy, combining coarse-grained token compression with fine-grained token selection to preserve both global context awareness and local precision. Our approach advances sparse attention design with two key innovations: (1) We achieve substantial speedups through arithmetic intensity-balanced algorithm design, with implementation optimizations for modern hardware. (2) We enable end-to-end training, reducing pretraining computation without sacrificing model performance.&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://espace.etsmtl.ca/id/eprint/3299/ Aroosa Hameed (2023) - attention clairsemée ]&lt;br /&gt;
&lt;br /&gt;
[https://fr.wikipedia.org/wiki/Attention_(apprentissage_automatique) Wikipedia - attention clairsemée]&lt;br /&gt;
&lt;br /&gt;
[https://aarnphm.xyz/thoughts/papers/DeepSeek_V3_2.pdf  DeepSeek - sparse attention]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attention_clairsem%C3%A9e&amp;diff=128219</id>
		<title>Attention clairsemée</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attention_clairsem%C3%A9e&amp;diff=128219"/>
		<updated>2026-06-09T19:10:21Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Technique d&#039;optimisation d&#039;une [[Réseau autoattentif|architecture auto-attentive]] qui vise à réduire le nombre de calculs nécessaires au mécanisme d&#039;auto-attention. &lt;br /&gt;
&lt;br /&gt;
== Compléments == &lt;br /&gt;
Au lieu de comparer tous les [[jeton textuel|jetons textuels]] entre eux, un processus de sélection concentre l&#039;attention sur certains jetons en particulier selon différentes heuristiques. Par exemple, es heuristiques exploitent une largeur de fenêtre, la position d&#039;un jeton dans une phrase, la similarité des jetons, etc.&lt;br /&gt;
&lt;br /&gt;
Cette technique d&#039;optimisation a été mise de l&#039;avant par la société DeepSeek-AI. &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;attention clairsemée&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;attention parcimonieuse&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;attention creuse&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;attention clairsemée native&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;sparse attention&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;native sparse attention&#039;&#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
Long-context modeling is crucial for next-generation language models, yet the high computational cost of standard attention mechanisms poses significant computational challenges. Sparse attention offers a promising direction for improving efficiency while maintaining model capabilities. We present NSA, a Natively trainable Sparse Attention mechanism that integrates algorithmic innovations with hardware-aligned optimizations to achieve efficient long-context modeling. NSA employs a dynamic hierarchical sparse strategy, combining coarse-grained token compression with fine-grained token selection to preserve both global context awareness and local precision. Our approach advances sparse attention design with two key innovations: (1) We achieve substantial speedups through arithmetic intensity-balanced algorithm design, with implementation optimizations for modern hardware. (2) We enable end-to-end training, reducing pretraining computation without sacrificing model performance.&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://espace.etsmtl.ca/id/eprint/3299/ Aroosa Hameed (2023) - attention clairsemée ]&lt;br /&gt;
&lt;br /&gt;
[https://fr.wikipedia.org/wiki/Attention_(apprentissage_automatique) Wikipedia - attention clairsemée]&lt;br /&gt;
&lt;br /&gt;
[https://aarnphm.xyz/thoughts/papers/DeepSeek_V3_2.pdf  DeepSeek - sparse attention]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;br /&gt;
[[Catégorie:Publications]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Puits_d%27attention&amp;diff=128216</id>
		<title>Puits d&#039;attention</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Puits_d%27attention&amp;diff=128216"/>
		<updated>2026-06-09T19:08:52Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Ce terme peut désigner le phénomène ou le type de &#039;&#039;&#039;[[jeton textuel]]&#039;&#039;&#039; concerné par le phénomène. &lt;br /&gt;
&lt;br /&gt;
Phénomène présent dans tous les &#039;&#039;&#039;[[Grand modèle de langues (GML)| grands modèles de langues]]&#039;&#039;&#039; &#039;&#039;&#039;[[Modèle autorégressif|autorégressifs]]&#039;&#039;&#039;, dans lesquels les premiers [[jeton textuel|jetons textuels]] représentent une part extrêmement importante du score d&#039;attention, même s&#039;ils ne sont pas importants sur le plan sémantique. &lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
Ce phénomène apparaît à la suite d&#039;une optimisation efficace sur une quantité suffisante de &#039;&#039;&#039;[[données d&#039;entraînement]]&#039;&#039;&#039;. &lt;br /&gt;
&lt;br /&gt;
La raison pour laquelle les [[jeton textuel|jetons textuels]] initiaux sont considérés comme des « jetons puits » est intuitive : ils sont visibles par presque tous les [[jeton textuel|jetons]] suivants en raison de la nature autorégressive du modèle, ce qui les rend plus aptes à servir de « puits d&#039;attention ».&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; puits d&#039;attention&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; attention sink&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;This term can refer to the phenomenon or to the type of token concerned by the phenomenon. This phenomenon is present in all autoregressive large language models, in which the first few tokens make up for a shockingly large amount of the attention score, even if the tokens are not semantically important. It emerges after effective optimization on sufficient training data. &#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;The reason behind initial tokens as “sink tokens” is intuitive: initial tokens are visible to almost all subsequent tokens because of the autoregressive language modeling nature, making them more readily trained to serve as “attention sinks”.&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;This phenomenon has been widely adopted in applications such as streaming/long context generation, KV cache optimization, inference acceleration, model quantization, and others.&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://arxiv.org/abs/2309.17453   Source : arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/abs/2410.10781   Source : arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://huggingface.co/blog/tomaarsen/attention-sinks   Source : Hugging Face Blog]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attention_clairsem%C3%A9e&amp;diff=128215</id>
		<title>Attention clairsemée</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attention_clairsem%C3%A9e&amp;diff=128215"/>
		<updated>2026-06-09T19:07:51Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Technique d&#039;optimisation d&#039;une [[Réseau autoattentif|architecture auto-attentive]] qui vise à réduire le nombre de calculs nécessaires au mécanisme d&#039;auto-attention. &lt;br /&gt;
&lt;br /&gt;
== Compléments == &lt;br /&gt;
Au lieu de comparer tous les [[jeton textuel|jetons textuels]] entre eux, un processus de sélection concentre l&#039;attention sur certains segments en particulier selon différentes heuristiques. Par exemple, es heuristiques exploitent une largeur de fenêtre, la position d&#039;un jeton dans une phrase, la similarité des jetons, etc.&lt;br /&gt;
&lt;br /&gt;
Cette technique d&#039;optimisation a été mise de l&#039;avant par la société DeepSeek-AI. &lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039;attention clairsemée&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;attention parcimonieuse&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;attention creuse&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;attention clairsemée native&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;sparse attention&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;native sparse attention&#039;&#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
Long-context modeling is crucial for next-generation language models, yet the high computational cost of standard attention mechanisms poses significant computational challenges. Sparse attention offers a promising direction for improving efficiency while maintaining model capabilities. We present NSA, a Natively trainable Sparse Attention mechanism that integrates algorithmic innovations with hardware-aligned optimizations to achieve efficient long-context modeling. NSA employs a dynamic hierarchical sparse strategy, combining coarse-grained token compression with fine-grained token selection to preserve both global context awareness and local precision. Our approach advances sparse attention design with two key innovations: (1) We achieve substantial speedups through arithmetic intensity-balanced algorithm design, with implementation optimizations for modern hardware. (2) We enable end-to-end training, reducing pretraining computation without sacrificing model performance.&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://espace.etsmtl.ca/id/eprint/3299/ Aroosa Hameed (2023) - attention clairsemée ]&lt;br /&gt;
&lt;br /&gt;
[https://fr.wikipedia.org/wiki/Attention_(apprentissage_automatique) Wikipedia - attention clairsemée]&lt;br /&gt;
&lt;br /&gt;
[https://aarnphm.xyz/thoughts/papers/DeepSeek_V3_2.pdf  DeepSeek - sparse attention]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Puits_d%27attention&amp;diff=128214</id>
		<title>Puits d&#039;attention</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Puits_d%27attention&amp;diff=128214"/>
		<updated>2026-06-09T19:05:39Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Ce terme peut désigner le phénomène ou le type de &#039;&#039;&#039;[[jeton textuel]]&#039;&#039;&#039; concerné par le phénomène. &lt;br /&gt;
&lt;br /&gt;
Phénomène présent dans tous les &#039;&#039;&#039;[[Grand modèle de langues (GML)| grands modèles de langues]]&#039;&#039;&#039; &#039;&#039;&#039;[[Modèle autorégressif|autorégressifs]]&#039;&#039;&#039;, dans lesquels les premiers [[jeton textuel|jetons textuels]] représentent une part extrêmement importante du score d&#039;attention, même s&#039;ils ne sont pas importants sur le plan sémantique. &lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
Ce phénomène apparaît à la suite d&#039;une optimisation efficace sur une quantité suffisante de &#039;&#039;&#039;[[données d&#039;entraînement]]&#039;&#039;&#039;. &lt;br /&gt;
&lt;br /&gt;
La raison pour laquelle les [[jeton textuel|jetons textuels]] initiaux sont considérés comme des « segments puits » est intuitive : ils sont visibles par presque tous les [[jeton textuel|jetons]] suivants en raison de la nature autorégressive du modèle, ce qui les rend plus aptes à servir de « puits d&#039;attention ».&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; puits d&#039;attention&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; attention sink&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;This term can refer to the phenomenon or to the type of token concerned by the phenomenon. This phenomenon is present in all autoregressive large language models, in which the first few tokens make up for a shockingly large amount of the attention score, even if the tokens are not semantically important. It emerges after effective optimization on sufficient training data. &#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;The reason behind initial tokens as “sink tokens” is intuitive: initial tokens are visible to almost all subsequent tokens because of the autoregressive language modeling nature, making them more readily trained to serve as “attention sinks”.&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;This phenomenon has been widely adopted in applications such as streaming/long context generation, KV cache optimization, inference acceleration, model quantization, and others.&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://arxiv.org/abs/2309.17453   Source : arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/abs/2410.10781   Source : arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://huggingface.co/blog/tomaarsen/attention-sinks   Source : Hugging Face Blog]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Puits_d%27attention&amp;diff=128210</id>
		<title>Puits d&#039;attention</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Puits_d%27attention&amp;diff=128210"/>
		<updated>2026-06-09T19:04:58Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Ce terme peut désigner le phénomène ou le type de &#039;&#039;&#039;[[jeton textuel]]&#039;&#039;&#039; concerné par le phénomène. &lt;br /&gt;
&lt;br /&gt;
Phénomène présent dans tous les &#039;&#039;&#039;[[Grand modèle de langues (GML)| grands modèles de langues]]&#039;&#039;&#039; &#039;&#039;&#039;[[Modèle autorégressif|autorégressifs]]&#039;&#039;&#039;, dans lesquels les premiers [[jeton textuel|jetons textuels]] représentent une part extrêmement importante du score d&#039;attention, même s&#039;ils ne sont pas importants sur le plan sémantique. &lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
Ce phénomène apparaît à la suite d&#039;une optimisation efficace sur une quantité suffisante de &#039;&#039;&#039;[[données d&#039;entraînement]]&#039;&#039;&#039;. &lt;br /&gt;
&lt;br /&gt;
La raison pour laquelle les [[jeton textuel|jetons textuels]] initiaux sont considérés comme des « segments puits » est intuitive : ils sont visibles par presque tous les [[jeton textuel|jetons]] suivants en raison de la nature autorégressive du modèle, ce qui les rend plus aptes à servir de « puits d&#039;attention ».&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; puits d&#039;attention&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; attention sink&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;This term can refer to the phenomenon or to the type of token concerned by the phenomenon. This phenomenon is present in all autoregressive large language models, in which the first few tokens make up for a shockingly large amount of the attention score, even if the tokens are not semantically important. It emerges after effective optimization on sufficient training data. &#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;The reason behind initial tokens as “sink tokens” is intuitive: initial tokens are visible to almost all subsequent tokens because of the autoregressive language modeling nature, making them more readily trained to serve as “attention sinks”.&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;This phenomenon has been widely adopted in applications such as streaming/long context generation, KV cache optimization, inference acceleration, model quantization, and others.&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://arxiv.org/abs/2309.17453   Source : arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/abs/2410.10781   Source : arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://huggingface.co/blog/tomaarsen/attention-sinks   Source : Hugging Face Blog]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Encodage_positionnel&amp;diff=128209</id>
		<title>Encodage positionnel</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Encodage_positionnel&amp;diff=128209"/>
		<updated>2026-06-09T18:54:10Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Méthode des &#039;&#039;&#039;[[Réseau autoattentif|réseaux autoattentifs]]&#039;&#039;&#039; qui aide à préserver l’ordre séquentiel des &#039;&#039;&#039;[[jeton textuel|jetons textuels]]&#039;&#039;&#039; (tokens) en ajoutant des informations sur la position de chaque &#039;&#039;&#039;[[jeton textuel|segment]]&#039;&#039;&#039; dans la séquence, ce qui leur permet d’avoir une meilleure compréhension &#039;&#039;&#039;[[Fenêtre contextuelle|contextuelle]]&#039;&#039;&#039; et d’éviter les problèmes de symétrie.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; encodage positionnel &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039;positional encoding&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; PE&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;!--Positional encoding refers to a method in transformer models that helps to maintain the sequential order of words. This is a crucial component for understanding the context within a sentence and between sentences.--&amp;gt;&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://www.kdnuggets.com/generative-ai-key-terms-explained    Source : kdnuggets]&lt;br /&gt;
&lt;br /&gt;
[https://www.btb.termiumplus.gc.ca/tpv2alpha/alpha-eng.html?lang=eng&amp;amp;i=1&amp;amp;srchtxt=POSITIONAL+ENCODING&amp;amp;index=alt&amp;amp;codom2nd_wet=1#resultrecs   Source : TERMIUM Plus]&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Attention_%C3%A9clair&amp;diff=128207</id>
		<title>Attention éclair</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Attention_%C3%A9clair&amp;diff=128207"/>
		<updated>2026-06-09T18:53:04Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==Définition==&lt;br /&gt;
&lt;br /&gt;
Ce concept regroupe différentes approches algorithmiques pour augmenter la performance en temps d&#039;exécution et/ou en mémoire du [[mécanisme d&#039;attention]] original. &lt;br /&gt;
&lt;br /&gt;
Sur le plan technique, il existe différentes implémentations qui dépendent entre autres de l&#039;organisation matérielle des processeurs graphiques, souvent pour un fabricant de puces en particulier.&lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
&lt;br /&gt;
Les [[Réseau autoattentif|couches d&#039;auto-attention]] permettent de comprendre les relations contextuelles entre les données d&#039;entrée. Cependant, la consommation maximale de mémoire des [[processeur graphique|processeurs graphiques]] pour les [[Réseau autoattentif|couches d&#039;auto-attention]] augmente de manière quadratique avec la longueur de la séquence d’entrée. Ainsi, l&#039;[[Réseau autoattentif|algorithme d&#039;auto-attention classique]] devient rapidement prohibitif en termes de mémoire pour les longs contextes d&#039;entrée.&lt;br /&gt;
&lt;br /&gt;
Afin de résoudre ce problème, Tri Dao et al. ont inventé en 2022 l&#039;algorithme d&#039;attention éclair (FlashAttention) dont le coût en mémoire n&#039;augmente que linéairement avec la longueur de la séquence d&#039;entrée. Évidemment, l’algorithme d’attention éclair est un peu plus lent. En contrepartie,  l&#039;attention-éclair est plus rapide en inférence que l&#039;attention classique car elle réduit considérablement les accès mémoires plus lents du processeur graphique en se concentrant plutôt sur la mémoire vive statique (SRAM) qui est plus rapide.&lt;br /&gt;
&lt;br /&gt;
Le mécanisme d&#039;attention éclair proposé par Qin &amp;amp; al. en 2023, appelé &#039;&#039;&#039;lightning attention&#039;&#039;&#039;, fait appel à une approximation qui s&#039;exécute en temps linéaire alors que le mécanisme d&#039;attention original s&#039;exécute en temps quadratique. Cette amélioration est basée sur la [[normalisation du gradient]] pour lutter contre l&#039;[[explosion du gradient]] et l&#039;utilisation privilégiée de la diagonale de la matrice d&#039;attention c.-à-d. les [[jeton textuel|jetons textuels]] voisins pour lutter contre l&#039;[[évanescence du  gradient]].&lt;br /&gt;
&lt;br /&gt;
==Français==&lt;br /&gt;
&#039;&#039;&#039;attention éclair&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;attention flash&#039;&#039;&#039; &amp;lt;small&amp;gt;&#039;&#039;Calque de l&#039;anglais&#039;&#039;&amp;lt;/small&amp;gt;&lt;br /&gt;
&lt;br /&gt;
==Anglais==&lt;br /&gt;
&#039;&#039;&#039;FlashAttention&#039;&#039;&#039; &amp;lt;small&amp;gt;&#039;&#039; Proposition originale de Tri Dao et al. (2022)&#039;&#039;&amp;lt;/small&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;flash attention&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;lightning attention&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/pdf/2407.08608v2 - arxiv - Jay Shah &amp;amp; al. 2024 - FlashAttention-3]&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/pdf/2307.14995v1 - arxiv - Qin &amp;amp; al. 2023 - Lightning Attention]&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/abs/2205.14135  - arxiv - Tri Dao et al. (2022) - FlashAttention]&lt;br /&gt;
&lt;br /&gt;
[https://gordicaleksa.medium.com/eli5-flash-attention-5c44017022ad Source: Medium]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND LEXIQUE FRANÇAIS]]&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Suppression_de_segment_textuel&amp;diff=128206</id>
		<title>Suppression de segment textuel</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Suppression_de_segment_textuel&amp;diff=128206"/>
		<updated>2026-06-09T18:49:13Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : Patrickdrouin a déplacé la page Suppression de segment textuel vers Suppression de jeton textuel&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;#REDIRECTION [[Suppression de jeton textuel]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Suppression_de_jeton&amp;diff=128205</id>
		<title>Suppression de jeton</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Suppression_de_jeton&amp;diff=128205"/>
		<updated>2026-06-09T18:49:12Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : Patrickdrouin a déplacé la page Suppression de segment textuel vers Suppression de jeton textuel&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Technique utilisée pour le &#039;&#039;&#039;[[préentraînement]]&#039;&#039;&#039; d’un &#039;&#039;&#039;[[modèle de langue|modèle]]&#039;&#039;&#039; où les &#039;&#039;&#039;[[jeton textuel|jetons textuels]]&#039;&#039;&#039; sont retirés de manière aléatoire des documents afin de permettre au modèle de déterminer les jetons à partir desquels les positions sont supprimées.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; suppression de jeton textuel&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; destruction de jeton textuel&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; token deletion&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;!--&#039;&#039;Token deletion takes the original sentence and randomly deletes a token from the sequence. Tokens are randomly removed from the documents. The model is pre-trained to determine tokens at which positions are removed.&#039;&#039;--&amp;gt;&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://arxiv.org/abs/2405.12630   Source : arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://yangyutu.github.io/llm_book.github.io/docs/chapter_foundation/t5.html   Source : GitHub]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND_LEXIQUE_FRANÇAIS]]&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Suppression_de_jeton&amp;diff=128203</id>
		<title>Suppression de jeton</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Suppression_de_jeton&amp;diff=128203"/>
		<updated>2026-06-09T18:47:48Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Définition ==&lt;br /&gt;
Technique utilisée pour le &#039;&#039;&#039;[[préentraînement]]&#039;&#039;&#039; d’un &#039;&#039;&#039;[[modèle de langue|modèle]]&#039;&#039;&#039; où les &#039;&#039;&#039;[[jeton textuel|jetons textuels]]&#039;&#039;&#039; sont retirés de manière aléatoire des documents afin de permettre au modèle de déterminer les jetons à partir desquels les positions sont supprimées.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&#039;&#039;&#039; suppression de jeton textuel&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039; destruction de jeton textuel&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&#039;&#039;&#039; token deletion&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;!--&#039;&#039;Token deletion takes the original sentence and randomly deletes a token from the sequence. Tokens are randomly removed from the documents. The model is pre-trained to determine tokens at which positions are removed.&#039;&#039;--&amp;gt;&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://arxiv.org/abs/2405.12630   Source : arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://yangyutu.github.io/llm_book.github.io/docs/chapter_foundation/t5.html   Source : GitHub]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:GRAND_LEXIQUE_FRANÇAIS]]&lt;br /&gt;
[[Catégorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Surconsommation_de_jetons_textuels&amp;diff=128198</id>
		<title>Surconsommation de jetons textuels</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Surconsommation_de_jetons_textuels&amp;diff=128198"/>
		<updated>2026-06-09T18:43:11Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==Définition==&lt;br /&gt;
Action de dépenser délibérément un maximum de [[jeton textuel|jetons textuels]] alloué à un [[Grand modèle de langues (GML)|grand modèle de langues (GLM)]].&lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
La surconsommation de jetons est souvent le résultat de l&#039;exécution de plusieurs agents dédiés à différents sous-tâches (typiquement de programmation) simultanément. &lt;br /&gt;
&lt;br /&gt;
==Français==&lt;br /&gt;
&#039;&#039;&#039;surconsommation de jetons&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;surconsommation de jetons textuels&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;maximisation de jetons&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;maximisation de jetons textuels&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Anglais==&lt;br /&gt;
&#039;&#039;&#039;tokenmaxxing&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;token maxxing&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;token maxing&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://en.wikipedia.org/wiki/Token_maxxing Forbes - tokenmaxxing]&lt;br /&gt;
&lt;br /&gt;
[https://en.wikipedia.org/wiki/Token_maxxing Wikipedia - token maxxing]&lt;br /&gt;
&lt;br /&gt;
[https://www.lesaffaires.com/mon-entreprise/management-et-rh/tokenmaxxing-quand-lia-cree-de-nouvelles-inegalites-rh/ Les affaires]&lt;br /&gt;
&lt;br /&gt;
[https://www.01net.com/actualites/comment-le-tokenmaxxing-transforme-lusage-de-lia-en-competition-chez-les-geants-de-la-tech.html 01net]&lt;br /&gt;
&lt;br /&gt;
[[Categorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Surconsommation_de_jetons_textuels&amp;diff=128196</id>
		<title>Surconsommation de jetons textuels</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Surconsommation_de_jetons_textuels&amp;diff=128196"/>
		<updated>2026-06-09T18:41:29Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==Définition==&lt;br /&gt;
Action de dépenser délibérément un maximum de [[jeton textuel|jetons textuels]] alloué à un [[Grand modèle de langues (GML)|grand modèle de langues (GLM)]].&lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
La surconsommation de jetons est souvent le résultat de l&#039;exécution de plusieurs agents dédiés à différents sous-tâches (typiquement de programmation) simultanément. &lt;br /&gt;
&lt;br /&gt;
==Français==&lt;br /&gt;
&#039;&#039;&#039;surconsommation de jetons&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;maximisation de jetons&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Anglais==&lt;br /&gt;
&#039;&#039;&#039;tokenmaxxing&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;token maxxing&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;token maxing&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://en.wikipedia.org/wiki/Token_maxxing Forbes - tokenmaxxing]&lt;br /&gt;
&lt;br /&gt;
[https://en.wikipedia.org/wiki/Token_maxxing Wikipedia - token maxxing]&lt;br /&gt;
&lt;br /&gt;
[https://www.lesaffaires.com/mon-entreprise/management-et-rh/tokenmaxxing-quand-lia-cree-de-nouvelles-inegalites-rh/ Les affaires]&lt;br /&gt;
&lt;br /&gt;
[https://www.01net.com/actualites/comment-le-tokenmaxxing-transforme-lusage-de-lia-en-competition-chez-les-geants-de-la-tech.html 01net]&lt;br /&gt;
&lt;br /&gt;
[[Categorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Surconsommation_de_jetons_textuels&amp;diff=128195</id>
		<title>Surconsommation de jetons textuels</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Surconsommation_de_jetons_textuels&amp;diff=128195"/>
		<updated>2026-06-09T18:40:56Z</updated>

		<summary type="html">&lt;p&gt;Patrickdrouin : Page créée avec « ==Définition== Action de dépenser délibérément un maximum de jetons textuels alloué à un grand modèle de langues (GLM).  == Compléments == La surconsommation de jetons est souvent le résultat de l&amp;#039;exécution de plusieurs agents dédiés à différents sous-tâches (typiquement de programmation) simultanément.   ==Français== &amp;#039;&amp;#039;&amp;#039;surconsommation de jetons&amp;#039;&amp;#039;&amp;#039;  &amp;#039;&amp;#039;&amp;#039;maximisation de jetons&amp;#039;&amp;#039;&amp;#039;  ==Anglais== &amp;#039;... »&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==Définition==&lt;br /&gt;
Action de dépenser délibérément un maximum de [[jeton textuel|jetons textuels]] alloué à un [[Grand modèle de langues (GML)|grand modèle de langues (GLM)]].&lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
La surconsommation de jetons est souvent le résultat de l&#039;exécution de plusieurs agents dédiés à différents sous-tâches (typiquement de programmation) simultanément. &lt;br /&gt;
&lt;br /&gt;
==Français==&lt;br /&gt;
&#039;&#039;&#039;surconsommation de jetons&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;maximisation de jetons&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Anglais==&lt;br /&gt;
&#039;&#039;&#039;tokenmaxxing&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;token maxxing&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;token maxing&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
[https://en.wikipedia.org/wiki/Token_maxxing Forbes - tokenmaxxing]&lt;br /&gt;
&lt;br /&gt;
[https://en.wikipedia.org/wiki/Token_maxxing Wikipedia - token maxxing]&lt;br /&gt;
&lt;br /&gt;
[https://www.lesaffaires.com/mon-entreprise/management-et-rh/tokenmaxxing-quand-lia-cree-de-nouvelles-inegalites-rh/ Les affaires]&lt;br /&gt;
&lt;br /&gt;
[https://www.01net.com/actualites/comment-le-tokenmaxxing-transforme-lusage-de-lia-en-competition-chez-les-geants-de-la-tech.html 01net]&lt;br /&gt;
&lt;br /&gt;
[[Categorie:Publication]]&lt;/div&gt;</summary>
		<author><name>Patrickdrouin</name></author>
	</entry>
</feed>