LexiqueÉtage 1 · Le Modèleun bloc plein, seul : la machine à prédireÉtage 1 · Le Modèle
données d’entraînement
Nº 050 · v2026-08EN : training dataLes données d’entraînement sont les exemples à partir desquels un modèle a été formé : c’est de leur contenu que dépendent ce qu’il sait dire et ce qu’il ignore. Comme la bibliothèque où quelqu’un a tout appris, et dont les manques deviennent les siens.
Ce que ce n’est pas
Les données d’entraînement ne sont pas ce que vous donnez au modèle en lui parlant : cela s’appelle le contexte, cela vaut pour une conversation, et cela n’entraîne rien. Elles ne sont pas non plus stockées dans le modèle, qui ne conserve que des paramètres. Et ce ne sont pas de simples matières premières interchangeables : leur composition détermine les langues bien servies, les domaines maîtrisés, la date au-delà de laquelle le modèle ne sait rien, et les biais qu’il reproduira.
En profondeur
La composition explique les comportements mieux que n’importe quelle autre variable. Une langue sous-représentée donne des réponses plus pauvres et un découpage en tokens plus coûteux. Un domaine absent produit des réponses plausibles mais creuses, ce qui est plus dangereux qu’un refus. Une sur-représentation de certains points de vue se retrouve dans les formulations. Et comme le corpus s’arrête à une date, le modèle ignore tout ce qui a suivi, sans le savoir : il répondra sur ces sujets avec la même assurance que sur le reste.
La qualité prime désormais sur la quantité. Les progrès récents viennent moins d’ajouter du texte que de mieux le choisir : filtrage des duplicats, retrait des contenus de mauvaise qualité, équilibrage des domaines, et surtout ajout de données soigneusement écrites pour enseigner un comportement plutôt qu’un savoir. C’est ce dernier point qui distingue un modèle brut, qui se contente de continuer un texte, d’un modèle utilisable, qui suit une consigne et refuse certaines demandes.
Le statut juridique de cette matière est le sujet ouvert de la période. Une part des corpus provient du web, donc d’œuvres protégées, et les contentieux portent sur la légitimité de cet usage, sur la rémunération des ayants droit et sur la présence de données personnelles. Cela a des conséquences directes pour une organisation : la provenance des données d’un modèle fait partie de ce qu’on évalue avant de l’adopter, au même titre que ses performances, parce qu’elle porte un risque qu’aucune mesure technique ne réduit après coup.
Relations où vivent les voisins
Vérifier 3 questions · cliquez votre réponse
Niveau 1 · Reconnaître
Vous collez un rapport interne dans une conversation. Cela entraîne-t-il le modèle ?
Niveau 2 · Distinguer
Un modèle répond de façon fluide mais fausse sur un sujet très spécialisé. L’explication la plus probable ?
Niveau 2 · Distinguer
Pourquoi la provenance des données d’entraînement concerne-t-elle une organisation qui ne fait qu’utiliser un modèle ?
Lexigraph, « Données d’entraînement », v2026-08, https://lexigraph.org/fr/donnees-d-entrainement, CC BY 4.0.