Large audio language model


en construction

Définition

Modèle multimodal qui enrichit les grands modèles de langues en leur ajoutant des capacités auditives, telles que la compréhension et la génération audio, grâce à une architecture intégrant trois composantes : un encodeur acoustique, un projecteur d’alignement et un LLM backbone. Son entraînement se fait avec de vastes corpus de paires audio-textes, couvrant souvent la parole, la musique et des scènes ambiantes.

Compléments

Ces modèles peuvent faire de nombreuses tâches, telles que: la reconnaissance automatique de la parole, le sous-titrage audio et le raisonnement audio complexe.

Français

XXXXXXXX

Anglais

large audio language model

LALM

Sources

Source : ACL Anthology

Source : Arxiv

Source : Emergent Mind

Contributeurs: Arianne Arel