<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="fr">
	<id>https://datafranca.org/wiki/index.php?action=history&amp;feed=atom&amp;title=Policy_entropy</id>
	<title>Policy entropy - Historique des versions</title>
	<link rel="self" type="application/atom+xml" href="https://datafranca.org/wiki/index.php?action=history&amp;feed=atom&amp;title=Policy_entropy"/>
	<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Policy_entropy&amp;action=history"/>
	<updated>2026-09-15T09:58:25Z</updated>
	<subtitle>Historique des versions pour cette page sur le wiki</subtitle>
	<generator>MediaWiki 1.39.5</generator>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Policy_entropy&amp;diff=132588&amp;oldid=prev</id>
		<title>Arianne : Page créée avec « == en construction ==  == Définition == En &#039;&#039;&#039;apprentissage par renforcement&#039;&#039;&#039;, mesure du caractère aléatoire ou de l’incertitude dans le choix des actions d’un &#039;&#039;&#039;agent&#039;&#039;&#039;.   Une entropie élevée indique plus de souplesse; une entropie faible indique plus de rigidité.  Voir aussi &#039;&#039;&#039;Policy entropy collapse&#039;&#039;&#039;  == Français == &#039;&#039;&#039; XXXXXXXX&#039;&#039;&#039;  == Anglais == &#039;&#039;&#039; policy entropy&#039;&#039;&#039;  == Sources == [https://www.alignmentforum.org/posts/C4tvfHn2Df... »</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Policy_entropy&amp;diff=132588&amp;oldid=prev"/>
		<updated>2026-09-14T16:45:41Z</updated>

		<summary type="html">&lt;p&gt;Page créée avec « == en construction ==  == Définition == En &amp;#039;&amp;#039;&amp;#039;&lt;a href=&quot;/wiki/Apprentissage_par_renforcement&quot; title=&quot;Apprentissage par renforcement&quot;&gt;apprentissage par renforcement&lt;/a&gt;&amp;#039;&amp;#039;&amp;#039;, mesure du caractère aléatoire ou de l’incertitude dans le choix des actions d’un &amp;#039;&amp;#039;&amp;#039;&lt;a href=&quot;/wiki/Agent&quot; title=&quot;Agent&quot;&gt;agent&lt;/a&gt;&amp;#039;&amp;#039;&amp;#039;.   Une entropie élevée indique plus de souplesse; une entropie faible indique plus de rigidité.  Voir aussi &amp;#039;&amp;#039;&amp;#039;&lt;a href=&quot;/wiki/Policy_entropy_collapse&quot; title=&quot;Policy entropy collapse&quot;&gt;Policy entropy collapse&lt;/a&gt;&amp;#039;&amp;#039;&amp;#039;  == Français == &amp;#039;&amp;#039;&amp;#039; XXXXXXXX&amp;#039;&amp;#039;&amp;#039;  == Anglais == &amp;#039;&amp;#039;&amp;#039; policy entropy&amp;#039;&amp;#039;&amp;#039;  == Sources == [https://www.alignmentforum.org/posts/C4tvfHn2Df... »&lt;/p&gt;
&lt;p&gt;&lt;b&gt;Nouvelle page&lt;/b&gt;&lt;/p&gt;&lt;div&gt;== en construction ==&lt;br /&gt;
&lt;br /&gt;
== Définition ==&lt;br /&gt;
En &amp;#039;&amp;#039;&amp;#039;[[apprentissage par renforcement]]&amp;#039;&amp;#039;&amp;#039;, mesure du caractère aléatoire ou de l’incertitude dans le choix des actions d’un &amp;#039;&amp;#039;&amp;#039;[[agent]]&amp;#039;&amp;#039;&amp;#039;. &lt;br /&gt;
&lt;br /&gt;
Une entropie élevée indique plus de souplesse; une entropie faible indique plus de rigidité.&lt;br /&gt;
&lt;br /&gt;
Voir aussi &amp;#039;&amp;#039;&amp;#039;[[Policy entropy collapse]]&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039; XXXXXXXX&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039; policy entropy&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://www.alignmentforum.org/posts/C4tvfHn2DfxyYYwaL/policy-entropy-learning-and-alignment-or-maybe-your-llm   Source : AI Alignment Forum]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:vocabulary]]&lt;/div&gt;</summary>
		<author><name>Arianne</name></author>
	</entry>
</feed>