LexiqueÉtage 1 · Le Modèleun bloc plein, seul : la machine à prédireÉtage 1 · Le Modèle
token
Nº 006 · v2026-08EN : tokenUn token est le petit morceau de texte que le modèle manipule : ni une lettre, ni tout à fait un mot, plutôt un bout de mot courant. Ce que vous écrivez lui arrive découpé ainsi, comme un texte lu syllabe par syllabe.
Ce que ce n’est pas
Un token n’est pas un mot. Le découpage suit la fréquence des suites de caractères, pas la grammaire : un mot courant tient en un seul token, tandis qu’un mot rare, un nom propre ou une référence en occupent plusieurs. C’est pourquoi le même texte ne coûte pas le même nombre de tokens d’une langue à l’autre, et pourquoi compter les mots d’un document ne dit qu’approximativement s’il tiendra dans la fenêtre de contexte.
En profondeur
Le tokeniseur
Le découpage est produit par un tokeniseur, construit en même temps que le modèle à partir de ses textes d’entraînement : il retient un vocabulaire fixe de fragments fréquents, et tout texte entrant est réécrit comme une suite de ces fragments. Le modèle ne voit donc jamais des lettres ni des mots, seulement des numéros de fragments, ce qui explique ses maladresses sur les tâches de caractères : compter les lettres d’un mot ou l’écrire à l’envers lui demande de raisonner sur une matière qu’il ne perçoit pas directement. Un token n’existe pas dans l’absolu : il n’existe que relativement au découpage d’un modèle donné, et deux modèles ne comptent pas le même texte de la même façon.
L’unité de compte
Le token est aussi l’unité de compte du système : la facturation, les limites d’usage et une bonne part du temps de réponse se mesurent en tokens, en entrée comme en sortie. Cela produit des effets contre-intuitifs. Un tableau très structuré peut coûter plus cher qu’un paragraphe qui dit la même chose, parce que la ponctuation et la mise en forme se paient. Et les langues moins représentées dans les données d’entraînement sont découpées plus finement, donc consomment davantage de tokens à contenu égal. Raisonner en pages ou en signes conduit à sous-estimer une facture ou à dépasser une limite sans comprendre pourquoi.
Deux confusions
Deux confusions coexistent et méritent d’être séparées. La première est linguistique : le token n’est pas un mot, et les intuitions tirées du comptage de mots se transportent mal, en particulier sur les identifiants, les adresses et les chiffres, très coûteux en tokens. La seconde est de vocabulaire : dans le monde du logiciel, un token désigne aussi un jeton d’authentification, sans le moindre rapport avec le découpage du texte, et la même réunion peut donc employer le mot dans deux sens. Reste un piège pratique : un texte trop long n’est pas refusé poliment, il est tronqué, et ce qui disparaît disparaît en silence.
Sous le capot2 temps · la forme réelle des objets
Un tokeniseur est une table de fragments et un algorithme de découpe. Rien de plus : pas de grammaire, pas de sens. Le voir à l’œuvre explique d’un coup pourquoi le modèle bute sur les lettres, pourquoi votre facture surprend, et pourquoi un texte trop long disparaît en silence.
- 01
Ce que devient une phrase
Le découpage remplace le texte par une suite de numéros de fragments. Les frontières ne sont ni les lettres ni les mots : ce sont les morceaux fréquents du corpus d’entraînement, et l’espace qui précède un mot fait partie du fragment.
encoder("Le chat dort.") // → ["Le", " chat", " dort", "."] 4 fragments // → [2506, 8848, 41823, 13] ce que le modèle reçoit encoder("Le chat dodeline.") // → ["Le", " chat", " dod", "eline", "."] 5 : un mot rare éclate // → [2506, 8848, 41654, 8863, 13] encoder("anticonstitutionnellement") // → ["anti", "constitution", "nel", "lement"] 4 fragments pour UN mot encoder("A-4417") // → ["A", "-", "44", "17"] 4 : un identifiant coûte cher- " chat"
- L’espace appartient au fragment. C’est pourquoi un même mot en début et en milieu de phrase n’est pas le même token, et pourquoi coller deux mots change le découpage des deux.
- [2506, ...]
- Le modèle ne voit que ces entiers. Ni lettres, ni mots : les « r » de « serrure » n’existent nulle part dans ce qu’il reçoit, il n’y a que le numéro du fragment qui les contenait.
Le piègeLes nombres ci-dessus sont illustratifs : chaque tokeniseur a sa propre table, et les entiers d’un modèle n’ont aucun sens pour un autre. Un compte exact se demande au tokeniseur visé.
- 02
Pourquoi la facture surprend
Le token est l’unité de compte : facturation, limites, et une part du temps de réponse. Comme la découpe suit la fréquence dans le corpus d’entraînement, ce qui est rare coûte cher, et ce qui est mis en forme se paie.
// même information, deux présentations compter("Chiffre d'affaires 2024 : 1,2 M€") // ~14 tokens compter('| Année | CA |\n|---|---|\n| 2024 | 1,2 M€ |') // ~28 tokens // la ponctuation du tableau se paie, le sens est le même // même phrase, deux langues compter("The meeting is postponed to Tuesday.") // ~7 tokens compter("La réunion est reportée à mardi.") // ~11 tokens // une langue moins représentée est découpée plus finement // et ce qui coûte le plus n'est pas ce qu'on croit compter("f47ac10b-58cc-4372-a567-0e02b2c3d479") // ~25 tokens // un identifiant : presque un token par caractèreLe piègeL’erreur de dimensionnement coûte plus cher encore que l’erreur de facture : un corpus d’identifiants ou de code occupe deux à trois fois la place d’un texte courant de même longueur apparente, et c’est la fenêtre qui déborde.
- contextece que le harnais fait quand la somme des tokens dépasse la fenêtre
- embedding (plongement)l’autre traduction du texte en nombres, à ne pas confondre avec celle ci
Ce qui varieLa table de fragments appartient au modèle et change avec lui : un compte exact demande le tokeniseur du modèle visé, jamais une règle générale, et les nombres ci-dessus n’ont valeur que d’ordre de grandeur. Ce qui ne varie pas : la découpe suit la fréquence et non la grammaire, l’unité de facturation est le fragment, et un texte qui dépasse la limite est tronqué sans avertissement.
Relations où vivent les voisins
Vérifier 3 questions · cliquez votre réponse
Niveau 1 · Reconnaître
Vous collez un document de mille mots. Combien de tokens cela représente-t-il ?
Niveau 2 · Distinguer
Le même texte traduit coûte plus cher à traiter en français qu’en anglais. Pourquoi ?
Niveau 2 · Distinguer
Pourquoi un modèle peine-t-il à compter les lettres d’un mot ?
Lexigraph, « Token », v2026-08, https://www.lexigraph.org/fr/token/, CC BY 4.0.