Large audio language model
en construction
Définition
Modèle multimodal qui enrichit les grands modèles de langues en leur ajoutant des capacités auditives, telles que la compréhension et la génération audio, grâce à une architecture intégrant trois composantes : un encodeur acoustique, un projecteur d’alignement et un LLM backbone. Son entraînement se fait avec de vastes corpus de paires audio-textes, couvrant souvent la parole, la musique et des scènes ambiantes.
Compléments
Ces modèles peuvent faire de nombreuses tâches, telles que: la reconnaissance automatique de la parole, le sous-titrage audio et le raisonnement audio complexe.
Français
XXXXXXXX
Anglais
large audio language model
LALM
Sources
Contributeurs: Arianne Arel





