Aller au contenu

LexiqueÉtage 1 · Le Modèleun bloc plein, seul : la machine à prédireÉtage 1 · Le Modèle

transformeur

057 · v2026-08EN : transformer

Le transformeur est l’architecture de réseau qui équipe presque tous les modèles actuels : à chaque étape, chaque fragment de texte regarde tous les autres et retient ceux qui l’éclairent. Comme un lecteur qui, sur chaque mot, revient à ceux qui en fixent le sens.

Ce que ce n’est pas

Le transformeur n’est pas un modèle, c’est un plan de construction : deux modèles bâtis dessus peuvent tout avoir de différent, la taille, les données, le comportement. Ce n’est pas non plus une méthode d’apprentissage : il décrit comment l’information circule, pas comment les paramètres sont ajustés. Et le mot n’a aucun rapport avec les transformateurs électriques ni avec l’idée de transformer un texte : il vient du titre de l’article fondateur.

En profondeur

L’innovation porte un nom, l’attention. Les architectures antérieures lisaient le texte de gauche à droite en entretenant une mémoire de ce qui précédait, ce qui les rendait lentes à entraîner et oublieuses sur les longues distances. Le transformeur remplace cette lecture séquentielle par une opération où chaque fragment calcule directement sa pertinence vis-à-vis de tous les autres. Un pronom peut ainsi se relier à son antécédent situé cinq cents mots plus tôt en une seule étape, et non en cinq cents.

Deux conséquences en découlent, et elles expliquent l’histoire des dix dernières années. La première est que le calcul devient massivement parallélisable : tous les fragments se traitent simultanément, ce qui convient exactement aux accélérateurs graphiques et a rendu possible l’entraînement sur des corpus gigantesques. La seconde est un coût : comparer chaque fragment à tous les autres croît avec le carré de la longueur, ce qui explique pourquoi les fenêtres de contexte ont mis des années à s’allonger et pourquoi une entrée deux fois plus longue coûte davantage que le double.

L’architecture est aujourd’hui si dominante qu’elle a débordé le texte. Les mêmes principes traitent l’image découpée en carrés, le son découpé en tranches, la vidéo, le code ou les structures moléculaires : il suffit que l’entrée puisse être découpée en une suite d’éléments. C’est ce qui rend possibles les modèles multimodaux, où plusieurs natures d’entrée cohabitent dans le même mécanisme. Autrement dit, l’architecture n’a rien de spécifiquement linguistique, ce qui est sans doute la raison de son succès.

Relations où vivent les voisins

Vérifier 3 questions · cliquez votre réponse

Niveau 1 · Reconnaître

Qu’apporte l’attention par rapport à une lecture séquentielle ?

Niveau 2 · Distinguer

Pourquoi une entrée deux fois plus longue coûte-t-elle plus que le double ?

Niveau 2 · Distinguer

Pourquoi la même architecture sert-elle au texte, à l’image et au son ?

057 · v2026-08 · première rédaction

Lexigraph, « Transformeur », v2026-08, https://lexigraph.org/fr/transformeur, CC BY 4.0.