Aller au contenu

LexiqueÉtage 3 · L’Agentle bloc pris dans une boucle : il recommence jusqu’au résultatÉtage 3 · L’Agent

évaluation (evals)

Nº 024 · v2026-08EN : evals

Une évaluation est une série de cas d’épreuve rejoués à chaque changement, pour voir si le système répond toujours correctement. Comme repasser le même parcours de conduite après chaque réglage : cela ne prouve pas qu’on conduit bien partout, seulement qu’on n’a rien cassé.

Ce que ce n’est pas

Une évaluation ne garantit rien. Elle mesure le comportement sur les cas qu’elle contient et reste muette sur tous les autres : un bon score dit qu’on n’a pas régressé là où l’on regarde, pas que le système est fiable. Ce n’est pas non plus un test logiciel classique, car la même entrée peut produire deux sorties différentes et la bonne réponse n’est pas toujours unique. On y raisonne donc en taux sur un lot de cas, jamais en égalité ligne à ligne.

En profondeur

Les trois pièces

Une évaluation se compose de trois pièces : un jeu de cas, un critère de réussite et un juge. Les cas viennent des usages réels et surtout des incidents passés, chaque défaut corrigé devant laisser un cas derrière lui. Le critère est la partie difficile, car « bonne réponse » se décline en exactitude, format respecté, absence d’invention, ton, coût et délai, qui ne progressent pas ensemble. Le juge peut être une comparaison exacte, une règle programmée, une personne, ou un modèle chargé de noter, chacun avec ses biais et son prix.

Noter un chemin

Évaluer un agent est plus difficile qu’évaluer une réponse, car il faut noter un chemin et pas seulement une arrivée. Deux exécutions du même cas peuvent diverger, ce qui oblige à rejouer plusieurs fois et à lire des taux plutôt que des verdicts. On y regarde le résultat final, mais aussi le nombre de tours consommés, les outils appelés à tort et les actions dangereuses évitées. Un agent qui atteint son objectif en brûlant vingt tours et en effaçant un fichier au passage n’a pas réussi, même si la réponse finale est juste.

Les trois pièges

Le premier piège est le jeu de cas figé : à force d’optimiser dessus, on règle le système pour l’examen plutôt que pour le métier. Le deuxième est le juge automatique utilisé sans contrôle, qui note généreusement, préfère les réponses longues et partage les angles morts de ce qu’il évalue. Le troisième est de croire que l’évaluation remplace la surveillance : elle regarde en arrière, sur des cas choisis, tandis que la production apporte chaque jour des situations que personne n’avait prévues. Une évaluation ne remplace donc ni les traces, ni les garde-fous, ni l’accord humain aux points irréversibles.

Sous le capot2 temps · la forme réelle des objets

Une évaluation est un jeu de cas versionné, pas un tableau de scores. Voir la forme d’un cas répond à la question que tout le monde repousse : que note-t-on exactement, et qui décide que c’est bon.

  1. 01

    La forme d’un cas

    Un cas porte son entrée, ses juges et son origine. Les trois comptent, et le troisième plus qu’on ne croit : un cas dont on a oublié pourquoi il existe est un cas que personne n’ose modifier ni supprimer.

    js
    {
      id: 'plafond-2024',
      entree: 'Quel est mon plafond de remboursement ?',
      origine: 'incident du 2026-03-14',   // chaque défaut corrigé laisse un cas
    
      // « bonne réponse » n'existe pas : trois critères, notés séparément,
      // parce qu'ils ne progressent pas ensemble
      juges: [
        exact((r) => r.montant === 2400),                 // programmé : sûr, étroit
        regle((r) => r.cite('contrat-2024.pdf')),         // programmé : vérifiable
        modele('La réponse invente-t-elle un chiffre ?'), // modèle : large, biaisé
      ],
    }
    
    exact
    Le juge le moins cher et le plus fiable, quand il s’applique. Toute la compétence consiste à formuler assez de cas pour qu’il s’applique souvent.
    modele
    Le juge modèle : indispensable pour ce qui ne se compare pas caractère à caractère, et le seul des trois dont la note ne vaut rien tant qu’on ne l’a pas confronté à un échantillon corrigé à la main. Ses biais sont documentés, la fiche `juge-automatique` les détaille.

    Le piègeLe champ « origine » est ce qui permet de renouveler le jeu de cas depuis le réel au lieu de le laisser vieillir. Sans lui, on ne sait plus quel incident une ligne protégeait, donc on n’ose ni la retirer ni la remplacer, et le jeu se fige.

  2. 02

    Noter un chemin, pas une arrivée

    Évaluer un agent demande de rejouer : deux exécutions du même cas divergent. On lit donc des taux et non des verdicts, et on regarde le trajet autant que la réponse, parce qu’un objectif atteint peut l’avoir été d’une façon inacceptable.

    js
    const runs = await Promise.all(
      Array.from({ length: 10 }, () => executer(cas)),   // le même cas, dix fois
    );
    
    const bilan = {
      reussite: taux(runs, (r) => r.ok),                 // un taux, pas un verdict
      tours: mediane(runs, (r) => r.tours),              // ce que le chemin coûte
      outils_a_tort: taux(runs, (r) => r.appels.some((a) => !a.utile)),
      irreversibles_sans_accord: runs.filter((r) => r.aAgiSansConfirmation).length,
    };
    
    // un agent qui atteint l'objectif en vingt tours et efface un fichier au
    // passage n'a pas réussi : le taux de réussite seul ne le dirait jamais.
    if (bilan.irreversibles_sans_accord > 0) echouer(bilan);
    
    length: 10
    Le nombre de rejeux. Il n’a pas à être grand, il a à être constant : c’est la comparaison d’une version à l’autre qui informe, pas la valeur absolue.
    irreversibles_sans_accord
    Le seul critère du lot qui n’est pas un taux mais un compte, parce qu’il ne se moyenne pas : une seule occurrence suffit à faire échouer la version.

    Le piègeCe compte fait échouer une version à lui seul, et c’est voulu : sur les actions sans retour, un taux n’a pas de sens, puisqu’il resterait excellent en laissant passer le cas qu’on cherchait précisément à empêcher.

Montré ailleurs

Ce qui varieLes outillages d’évaluation exposent chacun leur vocabulaire, et les noms employés ici sont ceux du sens commun, pas d’un produit. Ce qui ne varie pas : plusieurs critères notés séparément plutôt qu’un score unique, un rejeu pour lire des taux dès qu’un agent est en jeu, un juge modèle qu’il faut lui même contrôler, et des cas qui viennent des incidents réels.

Relations où vivent les voisins

Vérifier 3 questions · cliquez votre réponse

Niveau 1 · Reconnaître

Votre jeu d’évaluation passe à cent pour cent après une modification. Que pouvez-vous en conclure ?

Niveau 2 · Distinguer

Pourquoi ne peut-on pas évaluer un agent comme on teste un logiciel classique ?

Niveau 2 · Distinguer

Qu’est-ce qu’une évaluation ne pourra jamais remplacer ?

À essayer 2 pratiques

Des manipulations concrètes où ce terme se rencontre, en dix minutes.

Qui manipule ça 7 métiers

Les postes dont ce terme fait partie du travail ordinaire.

Nº 024 · v2026-08 · première rédaction en · responsabilité éditoriale Anthony Capirchio

Lexigraph, « Évaluation (evals) », v2026-08, https://www.lexigraph.org/fr/evaluation/, CC BY 4.0.

Signaler

Ce qui part avec votre message

Fiche · Évaluation (evals)
Nº 024 · v2026-08 · /fr/evaluation

De quoi s’agit-il
0 / 600

Elle ne sert qu’à vous répondre, et à rien d’autre. Ce qui est enregistré