LexiqueÉtage 1 · Le Modèleun bloc plein, seul : la machine à prédireÉtage 1 · Le Modèle
multimodal
Nº 058 · v2026-08EN : multimodalUn modèle multimodal traite plusieurs natures d’entrée dans le même calcul : du texte, des images, du son, sans les convertir d’abord dans un format unique. Comme une personne qui regarde un graphique en écoutant son commentaire, plutôt que d’en lire la description écrite.
Ce que ce n’est pas
Le multimodal n’est pas un enchaînement de modèles spécialisés. Reconnaître le texte d’une image avec un outil, puis donner ce texte à un modèle de langage, ce n’est pas du multimodal : c’est une chaîne, et tout ce que la reconnaissance a perdu, la mise en page, les couleurs, un geste sur une photo, est perdu définitivement. Ce n’est pas non plus un synonyme d’IA générative : un modèle peut être multimodal en entrée et ne produire que du texte, ce qui est le cas le plus courant.
En profondeur
Le mécanisme est le même que pour le texte, à un détail près. Une image est découpée en carrés, un son en tranches, et chaque morceau est converti en une représentation numérique de même nature que celle d’un fragment de texte. À partir de là, l’attention traite indifféremment tous ces éléments : rien dans l’architecture ne distingue un carré d’image d’un bout de mot. C’est ce qui permet à une question écrite de porter sur une zone précise d’une image, sans passe intermédiaire.
Il faut distinguer l’entrée et la sortie, que le mot recouvre indistinctement. Beaucoup de modèles lisent des images et n’écrivent que du texte : on les qualifie de multimodaux, à juste titre, mais ils ne dessinent rien. D’autres produisent des images ou du son, et relèvent alors de la génération dans ces domaines. Un système qui semble tout faire combine en général plusieurs modèles derrière une même interface, ce qui est une affaire de harnais et non de modèle.
Les conséquences pratiques sont concrètes et souvent sous-estimées. Un document numérisé, une capture d’écran, un schéma annoté à la main deviennent des entrées directes, ce qui supprime des chaînes entières de conversion. En contrepartie, les images coûtent cher : une seule peut consommer autant de tokens que plusieurs pages de texte, et la facture d’un traitement documentaire s’en ressent. Enfin, la qualité de lecture reste inégale sur les tableaux denses et l’écriture manuscrite, ce qui se vérifie sur ses propres documents avant de s’engager.
Relations où vivent les voisins
- Souvent confondu avec
- Étage 1 · Le Modèleun bloc plein, seul : la machine à prédireIA générative
Vérifier 3 questions · cliquez votre réponse
Niveau 1 · Reconnaître
Vous convertissez un PDF en texte avec un outil de reconnaissance, puis vous donnez ce texte au modèle. Est-ce du multimodal ?
Niveau 2 · Distinguer
Un modèle multimodal produit-il nécessairement des images ?
Niveau 2 · Distinguer
Quel est le principal effet de bord économique du traitement d’images par un modèle ?
Lexigraph, « Multimodal », v2026-08, https://lexigraph.org/fr/multimodal, CC BY 4.0.