Aller au contenu

LexiqueÉtage 1 · Le Modèleun bloc plein, seul : la machine à prédireÉtage 1 · Le Modèle

token

Nº 006 · v2026-08EN : token

Un token est le petit morceau de texte que le modèle manipule : ni une lettre, ni tout à fait un mot, plutôt un bout de mot courant. Ce que vous écrivez lui arrive découpé ainsi, comme un texte lu syllabe par syllabe.

Ce que ce n’est pas

Un token n’est pas un mot. Le découpage suit la fréquence des suites de caractères, pas la grammaire : un mot courant tient en un seul token, tandis qu’un mot rare, un nom propre ou une référence en occupent plusieurs. C’est pourquoi le même texte ne coûte pas le même nombre de tokens d’une langue à l’autre, et pourquoi compter les mots d’un document ne dit qu’approximativement s’il tiendra dans la fenêtre de contexte.

En profondeur

Le tokeniseur

Le découpage est produit par un tokeniseur, construit en même temps que le modèle à partir de ses textes d’entraînement : il retient un vocabulaire fixe de fragments fréquents, et tout texte entrant est réécrit comme une suite de ces fragments. Le modèle ne voit donc jamais des lettres ni des mots, seulement des numéros de fragments, ce qui explique ses maladresses sur les tâches de caractères : compter les lettres d’un mot ou l’écrire à l’envers lui demande de raisonner sur une matière qu’il ne perçoit pas directement. Un token n’existe pas dans l’absolu : il n’existe que relativement au découpage d’un modèle donné, et deux modèles ne comptent pas le même texte de la même façon.

L’unité de compte

Le token est aussi l’unité de compte du système : la facturation, les limites d’usage et une bonne part du temps de réponse se mesurent en tokens, en entrée comme en sortie. Cela produit des effets contre-intuitifs. Un tableau très structuré peut coûter plus cher qu’un paragraphe qui dit la même chose, parce que la ponctuation et la mise en forme se paient. Et les langues moins représentées dans les données d’entraînement sont découpées plus finement, donc consomment davantage de tokens à contenu égal. Raisonner en pages ou en signes conduit à sous-estimer une facture ou à dépasser une limite sans comprendre pourquoi.

Deux confusions

Deux confusions coexistent et méritent d’être séparées. La première est linguistique : le token n’est pas un mot, et les intuitions tirées du comptage de mots se transportent mal, en particulier sur les identifiants, les adresses et les chiffres, très coûteux en tokens. La seconde est de vocabulaire : dans le monde du logiciel, un token désigne aussi un jeton d’authentification, sans le moindre rapport avec le découpage du texte, et la même réunion peut donc employer le mot dans deux sens. Reste un piège pratique : un texte trop long n’est pas refusé poliment, il est tronqué, et ce qui disparaît disparaît en silence.

Sous le capot2 temps · la forme réelle des objets

Un tokeniseur est une table de fragments et un algorithme de découpe. Rien de plus : pas de grammaire, pas de sens. Le voir à l’œuvre explique d’un coup pourquoi le modèle bute sur les lettres, pourquoi votre facture surprend, et pourquoi un texte trop long disparaît en silence.

  1. 01

    Ce que devient une phrase

    Le découpage remplace le texte par une suite de numéros de fragments. Les frontières ne sont ni les lettres ni les mots : ce sont les morceaux fréquents du corpus d’entraînement, et l’espace qui précède un mot fait partie du fragment.

    js
    encoder("Le chat dort.")
    // →  ["Le", " chat", " dort", "."]              4 fragments
    // →  [2506, 8848, 41823, 13]                    ce que le modèle reçoit
    
    encoder("Le chat dodeline.")
    // →  ["Le", " chat", " dod", "eline", "."]      5 : un mot rare éclate
    // →  [2506, 8848, 41654, 8863, 13]
    
    encoder("anticonstitutionnellement")
    // →  ["anti", "constitution", "nel", "lement"]  4 fragments pour UN mot
    
    encoder("A-4417")
    // →  ["A", "-", "44", "17"]                     4 : un identifiant coûte cher
    
    " chat"
    L’espace appartient au fragment. C’est pourquoi un même mot en début et en milieu de phrase n’est pas le même token, et pourquoi coller deux mots change le découpage des deux.
    [2506, ...]
    Le modèle ne voit que ces entiers. Ni lettres, ni mots : les « r » de « serrure » n’existent nulle part dans ce qu’il reçoit, il n’y a que le numéro du fragment qui les contenait.

    Le piègeLes nombres ci-dessus sont illustratifs : chaque tokeniseur a sa propre table, et les entiers d’un modèle n’ont aucun sens pour un autre. Un compte exact se demande au tokeniseur visé.

  2. 02

    Pourquoi la facture surprend

    Le token est l’unité de compte : facturation, limites, et une part du temps de réponse. Comme la découpe suit la fréquence dans le corpus d’entraînement, ce qui est rare coûte cher, et ce qui est mis en forme se paie.

    js
    // même information, deux présentations
    compter("Chiffre d'affaires 2024 : 1,2 M€")                    // ~14 tokens
    compter('| Année | CA |\n|---|---|\n| 2024 | 1,2 M€ |')        // ~28 tokens
    //        la ponctuation du tableau se paie, le sens est le même
    
    // même phrase, deux langues
    compter("The meeting is postponed to Tuesday.")                // ~7 tokens
    compter("La réunion est reportée à mardi.")                    // ~11 tokens
    //        une langue moins représentée est découpée plus finement
    
    // et ce qui coûte le plus n'est pas ce qu'on croit
    compter("f47ac10b-58cc-4372-a567-0e02b2c3d479")                // ~25 tokens
    //        un identifiant : presque un token par caractère
    

    Le piègeL’erreur de dimensionnement coûte plus cher encore que l’erreur de facture : un corpus d’identifiants ou de code occupe deux à trois fois la place d’un texte courant de même longueur apparente, et c’est la fenêtre qui déborde.

Montré ailleurs
  • contextece que le harnais fait quand la somme des tokens dépasse la fenêtre
  • embedding (plongement)l’autre traduction du texte en nombres, à ne pas confondre avec celle ci

Ce qui varieLa table de fragments appartient au modèle et change avec lui : un compte exact demande le tokeniseur du modèle visé, jamais une règle générale, et les nombres ci-dessus n’ont valeur que d’ordre de grandeur. Ce qui ne varie pas : la découpe suit la fréquence et non la grammaire, l’unité de facturation est le fragment, et un texte qui dépasse la limite est tronqué sans avertissement.

Relations où vivent les voisins

Frontières liées
Token ou Mot

Vérifier 3 questions · cliquez votre réponse

Niveau 1 · Reconnaître

Vous collez un document de mille mots. Combien de tokens cela représente-t-il ?

Niveau 2 · Distinguer

Le même texte traduit coûte plus cher à traiter en français qu’en anglais. Pourquoi ?

Niveau 2 · Distinguer

Pourquoi un modèle peine-t-il à compter les lettres d’un mot ?

Nº 006 · v2026-08 · première rédaction en · responsabilité éditoriale Anthony Capirchio

Lexigraph, « Token », v2026-08, https://www.lexigraph.org/fr/token/, CC BY 4.0.

Signaler

Ce qui part avec votre message

Fiche · Token
Nº 006 · v2026-08 · /fr/token

De quoi s’agit-il
0 / 600

Elle ne sert qu’à vous répondre, et à rien d’autre. Ce qui est enregistré