Aller au contenu

LexiqueÉtage 1 · Le Modèleun bloc plein, seul : la machine à prédireÉtage 1 · Le Modèle

inférence

051 · v2026-08EN : inference

L’inférence est le moment où un modèle déjà entraîné produit une réponse : il lit ce qu’on lui donne et écrit la suite, sans rien apprendre au passage. Comme un musicien qui joue un morceau, par opposition aux années passées à travailler son instrument.

Ce que ce n’est pas

L’inférence n’est pas l’entraînement, et les deux ne se ressemblent en rien : l’entraînement modifie le modèle et se compte en semaines de calcul, l’inférence ne le modifie pas et se compte en secondes. Ce n’est pas non plus une recherche : rien n’est retrouvé dans une base, tout est reconstruit. Et le mot ne désigne aucune déduction logique, malgré ce que suggère son sens ordinaire en français : il vient du vocabulaire statistique, où inférer signifie estimer à partir d’un modèle.

En profondeur

L’inférence procède par petits pas. Le modèle ne compose pas une réponse d’un bloc : il prédit le fragment de texte le plus probable, l’ajoute à ce qu’il a déjà, puis recommence avec cette suite comme nouvelle entrée. C’est ce mécanisme qui explique l’affichage mot à mot, mais aussi une propriété plus profonde : chaque fragment produit influence tous les suivants, si bien qu’un mauvais départ se propage. C’est ce qui rend efficaces les consignes qui demandent de raisonner avant de conclure, puisqu’elles allongent le chemin avant la réponse.

C’est là que se joue l’économie du système. L’entraînement est un investissement unique et colossal ; l’inférence est un coût récurrent, proportionnel à l’usage, qui finit par le dépasser largement pour un service très employé. Deux grandeurs comptent : la longueur de l’entrée, qui doit être relue à chaque requête, et celle de la sortie, produite fragment par fragment et donc plus chère. Beaucoup d’optimisations réelles consistent simplement à donner moins à lire et à demander moins à écrire.

La phase d’inférence est aussi la seule qu’une organisation contrôle vraiment. Elle ne choisit pas ce que le modèle a appris, mais elle choisit ce qu’elle lui donne à lire, avec quelles instructions, avec quels outils, et ce qu’elle fait de la sortie. Autrement dit, tout le harnais opère à l’inférence. C’est pourquoi la question « faut-il réentraîner ? » se pose beaucoup moins souvent qu’on ne le croit : la plupart des problèmes se règlent en changeant ce qui entoure l’appel, pas le modèle appelé.

Relations où vivent les voisins

Vérifier 3 questions · cliquez votre réponse

Niveau 1 · Reconnaître

Que se passe-t-il dans le modèle pendant une inférence ?

Niveau 2 · Distinguer

Pour un service très utilisé, quel coût finit par dominer l’autre ?

Niveau 2 · Distinguer

Pourquoi demander au modèle de « détailler son raisonnement » change-t-il souvent la qualité de la réponse ?

051 · v2026-08 · première rédaction

Lexigraph, « Inférence », v2026-08, https://lexigraph.org/fr/inference, CC BY 4.0.