<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="fr">
	<id>https://datafranca.org/wiki/index.php?action=history&amp;feed=atom&amp;title=Apprentissage_par_pr%C3%A9f%C3%A9rences</id>
	<title>Apprentissage par préférences - Historique des versions</title>
	<link rel="self" type="application/atom+xml" href="https://datafranca.org/wiki/index.php?action=history&amp;feed=atom&amp;title=Apprentissage_par_pr%C3%A9f%C3%A9rences"/>
	<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Apprentissage_par_pr%C3%A9f%C3%A9rences&amp;action=history"/>
	<updated>2026-09-24T16:00:19Z</updated>
	<subtitle>Historique des versions pour cette page sur le wiki</subtitle>
	<generator>MediaWiki 1.39.5</generator>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Apprentissage_par_pr%C3%A9f%C3%A9rences&amp;diff=132789&amp;oldid=prev</id>
		<title>Pitpitt : Page créée avec « == &#039;&#039;&#039;&lt;span style=&quot;font-family:arial black;font-size:24px;  color:#1880a6;&quot;&gt;ROBOTIQUE&lt;/span&gt;&#039;&#039;&#039;==  == Définition == Apprentissage à partir de jugements comparatifs humains (par exemple, « la trajectoire A est meilleure que la trajectoire B ») plutôt que de signaux de récompense explicites ou de démonstrations. Un modèle de récompense est entraîné pour être cohérent avec les préférences humaines, puis utilisé pour optimis... »</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Apprentissage_par_pr%C3%A9f%C3%A9rences&amp;diff=132789&amp;oldid=prev"/>
		<updated>2026-09-22T15:04:53Z</updated>

		<summary type="html">&lt;p&gt;Page créée avec « ==&lt;a href=&quot;/wiki/Cat%C3%A9gorie:Robotique&quot; title=&quot;Catégorie:Robotique&quot;&gt; &amp;#039;&amp;#039;&amp;#039;&amp;lt;span style=&amp;quot;font-family:arial black;font-size:24px;  color:#1880a6;&amp;quot;&amp;gt;ROBOTIQUE&amp;lt;/span&amp;gt;&amp;#039;&amp;#039;&amp;#039;&lt;/a&gt;==  == Définition == Apprentissage à partir de jugements comparatifs humains (par exemple, « la trajectoire A est meilleure que la trajectoire B ») plutôt que de signaux de récompense explicites ou de démonstrations. Un modèle de récompense est entraîné pour être cohérent avec les préférences humaines, puis utilisé pour optimis... »&lt;/p&gt;
&lt;p&gt;&lt;b&gt;Nouvelle page&lt;/b&gt;&lt;/p&gt;&lt;div&gt;==[[:Catégorie:Robotique | &amp;#039;&amp;#039;&amp;#039;&amp;lt;span style=&amp;quot;font-family:arial black;font-size:24px;  color:#1880a6;&amp;quot;&amp;gt;ROBOTIQUE&amp;lt;/span&amp;gt;&amp;#039;&amp;#039;&amp;#039;]]==&lt;br /&gt;
&lt;br /&gt;
== Définition ==&lt;br /&gt;
Apprentissage à partir de jugements comparatifs humains (par exemple, « la trajectoire A est meilleure que la trajectoire B ») plutôt que de signaux de récompense explicites ou de démonstrations. Un modèle de récompense est entraîné pour être cohérent avec les préférences humaines, puis utilisé pour optimiser la politique de contrôle via RL. Cette approche (RLHF appliquée à la robotique) évite le besoin d&amp;#039;une ingénierie précise de récompense scalaire et peut capturer l&amp;#039;intention humaine nuancée.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;Apprentissage par préférences&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;preference learning&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
==Sources==&lt;br /&gt;
&lt;br /&gt;
[https://www.roboticscenter.ai/fr/glossary    Source : Robotic Center]&lt;br /&gt;
&lt;br /&gt;
{{Modèle:Robotique}}&lt;br /&gt;
[[Catégorie:Robotique]]&lt;/div&gt;</summary>
		<author><name>Pitpitt</name></author>
	</entry>
</feed>