<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="fr">
	<id>https://datafranca.org/wiki/index.php?action=history&amp;feed=atom&amp;title=Large_audio_language_model</id>
	<title>Large audio language model - Historique des versions</title>
	<link rel="self" type="application/atom+xml" href="https://datafranca.org/wiki/index.php?action=history&amp;feed=atom&amp;title=Large_audio_language_model"/>
	<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Large_audio_language_model&amp;action=history"/>
	<updated>2026-09-10T13:43:27Z</updated>
	<subtitle>Historique des versions pour cette page sur le wiki</subtitle>
	<generator>MediaWiki 1.39.5</generator>
	<entry>
		<id>https://datafranca.org/wiki/index.php?title=Large_audio_language_model&amp;diff=132465&amp;oldid=prev</id>
		<title>Arianne : Page créée avec « == en construction ==  == Définition == &#039;&#039;&#039;Modèle multimodal&#039;&#039;&#039; qui enrichit les &#039;&#039;&#039;grands modèles de langues&#039;&#039;&#039; en leur ajoutant des capacités auditives, telles que la compréhension et la &#039;&#039;&#039;génération audio&#039;&#039;&#039;, grâce à une architecture intégrant trois composantes : un encodeur acoustique, un projecteur d’alignement et un &#039;&#039;LLM backbone&#039;&#039;. Son &#039;&#039;&#039;entraînement&#039;&#039;&#039; se fait... »</title>
		<link rel="alternate" type="text/html" href="https://datafranca.org/wiki/index.php?title=Large_audio_language_model&amp;diff=132465&amp;oldid=prev"/>
		<updated>2026-09-02T15:56:54Z</updated>

		<summary type="html">&lt;p&gt;Page créée avec « == en construction ==  == Définition == &amp;#039;&amp;#039;&amp;#039;&lt;a href=&quot;/wiki/Mod%C3%A8le_multimodal&quot; title=&quot;Modèle multimodal&quot;&gt;Modèle multimodal&lt;/a&gt;&amp;#039;&amp;#039;&amp;#039; qui enrichit les &amp;#039;&amp;#039;&amp;#039;&lt;a href=&quot;/wiki/Grand_mod%C3%A8le_de_langues_(GML)&quot; title=&quot;Grand modèle de langues (GML)&quot;&gt;grands modèles de langues&lt;/a&gt;&amp;#039;&amp;#039;&amp;#039; en leur ajoutant des capacités auditives, telles que la compréhension et la &amp;#039;&amp;#039;&amp;#039;&lt;a href=&quot;/wiki/G%C3%A9n%C3%A9ration_automatique_d%27audio&quot; title=&quot;Génération automatique d&amp;#039;audio&quot;&gt;génération audio&lt;/a&gt;&amp;#039;&amp;#039;&amp;#039;, grâce à une architecture intégrant trois composantes : un encodeur acoustique, un projecteur d’alignement et un &amp;#039;&amp;#039;LLM backbone&amp;#039;&amp;#039;. Son &amp;#039;&amp;#039;&amp;#039;&lt;a href=&quot;/wiki/Entra%C3%AEnement&quot; title=&quot;Entraînement&quot;&gt;entraînement&lt;/a&gt;&amp;#039;&amp;#039;&amp;#039; se fait... »&lt;/p&gt;
&lt;p&gt;&lt;b&gt;Nouvelle page&lt;/b&gt;&lt;/p&gt;&lt;div&gt;== en construction ==&lt;br /&gt;
&lt;br /&gt;
== Définition ==&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039;[[Modèle multimodal]]&amp;#039;&amp;#039;&amp;#039; qui enrichit les &amp;#039;&amp;#039;&amp;#039;[[Grand modèle de langues (GML)|grands modèles de langues]]&amp;#039;&amp;#039;&amp;#039; en leur ajoutant des capacités auditives, telles que la compréhension et la &amp;#039;&amp;#039;&amp;#039;[[Génération automatique d&amp;#039;audio|génération audio]]&amp;#039;&amp;#039;&amp;#039;, grâce à une architecture intégrant trois composantes : un encodeur acoustique, un projecteur d’alignement et un &amp;#039;&amp;#039;LLM backbone&amp;#039;&amp;#039;. Son &amp;#039;&amp;#039;&amp;#039;[[entraînement]]&amp;#039;&amp;#039;&amp;#039; se fait avec de vastes &amp;#039;&amp;#039;&amp;#039;[[corpus]]&amp;#039;&amp;#039;&amp;#039; de paires audio-textes, couvrant souvent la parole, la musique et des scènes ambiantes.&lt;br /&gt;
&lt;br /&gt;
== Compléments ==&lt;br /&gt;
Ces modèles peuvent faire de nombreuses tâches, telles que: la &amp;#039;&amp;#039;&amp;#039;[[reconnaissance automatique de la parole]]&amp;#039;&amp;#039;&amp;#039;, le sous-titrage audio et le raisonnement audio complexe.&lt;br /&gt;
&lt;br /&gt;
== Français ==&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039; XXXXXXXX&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
== Anglais ==&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039; large audio language model&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
&amp;#039;&amp;#039;&amp;#039; LALM&amp;#039;&amp;#039;&amp;#039;&lt;br /&gt;
&lt;br /&gt;
== Sources ==&lt;br /&gt;
[https://aclanthology.org/2025.findings-acl.56/   Source : ACL Anthology]&lt;br /&gt;
&lt;br /&gt;
[https://arxiv.org/abs/2605.20266   Source : Arxiv]&lt;br /&gt;
&lt;br /&gt;
[https://www.emergentmind.com/topics/large-audio-language-model-lalm   Source : Emergent Mind]&lt;br /&gt;
&lt;br /&gt;
[[Catégorie:vocabulary]]&lt;/div&gt;</summary>
		<author><name>Arianne</name></author>
	</entry>
</feed>