LexiqueÉtage 2 · Le Harnaisle bloc et ses plaques rapportées : ce qu’on lui ajouteÉtage 2 · Le Harnais
RAG
Nº 013 · v2026-08EN : RAGLe RAG consiste à chercher les documents utiles à votre question, puis à les donner à lire au modèle avant qu’il réponde : comme un collègue qui, avant de vous répondre, va sortir le bon classeur et le relit devant vous.
Ce que ce n’est pas
Le RAG n’apprend rien au modèle. Les documents retrouvés sont placés sous ses yeux le temps d’une réponse, puis ils disparaissent : le modèle qui répond est exactement le même avant et après. C’est ce qui le sépare du fine-tuning, qui, lui, modifie le modèle. Ce n’est pas non plus une recherche sur le web : le RAG interroge un corpus que vous avez choisi et que vous entretenez.
En profondeur
Les deux temps
Un RAG travaille en deux temps. En amont, les documents sont découpés en passages et indexés de façon à pouvoir être retrouvés par le sens, et pas seulement par les mots exacts qu’ils contiennent. Au moment de la question, le harnais interroge cet index, sélectionne quelques passages et les ajoute au contexte, juste avant la demande de la personne. Le modèle lit cet ensemble et rédige sa réponse à partir de ce qu’il a sous les yeux, ce qui permet d’exiger qu’il cite les passages sur lesquels il s’appuie.
Rien ne bouge dans le modèle
Tout cela se joue dans le harnais : les poids du modèle ne bougent jamais. C’est la différence de fond avec le fine-tuning, qui poursuit l’entraînement et transforme le modèle lui-même. La conséquence pratique est nette : mettre à jour une information revient à modifier un document, et retirer une information revient à la supprimer du corpus, sans qu’aucun entraînement soit relancé. En contrepartie, le coût se déplace vers chaque requête, puisque les passages retrouvés occupent la fenêtre de contexte et se paient à chaque appel.
Le piège le plus courant
Le piège le plus courant est de croire qu’un RAG supprime les hallucinations. Il réduit surtout les occasions d’en produire, en donnant au modèle la matière qui lui manquait ; si la recherche ramène le mauvais passage, le modèle répondra avec le même aplomb sur une base fausse. La qualité d’un RAG se joue donc d’abord dans la recherche, rarement dans le choix du modèle : découpage des documents, fraîcheur du corpus, versions contradictoires qui cohabitent, droits d’accès qui ne sont pas répercutés. Un corpus que l’on n’élague jamais finit par se retourner contre le système, qui cite alors fidèlement une procédure abrogée.
Sous le capot3 temps · la forme réelle des objets
Un RAG n’ajoute aucune connaissance au modèle : il fabrique, à chaque question, un morceau de contexte. Tout ce qui fait sa qualité tient donc dans trois objets : ce qu’on indexe, comment on filtre, et ce qu’on colle finalement sous les yeux du modèle.
- 01
Ce qu’on indexe vraiment
Un passage indexé n’est pas un morceau de texte : c’est un texte plus ce qui permet d’en décider. Les métadonnées pèsent autant que le contenu, parce que ce sont elles qui répondront aux deux questions qui font échouer les RAG en production : qui a le droit de voir ceci, et est-ce encore en vigueur.
{ id: 'contrat-2024#p37', texte: 'Le plafond annuel est fixé à 2 400 euros.', vecteur: [0.021, -0.184, /* ... */], // ce qui suit décide plus souvent que le vecteur source: 'contrat-2024.pdf', page: 37, // pour que la citation soit vérifiable version: '2024-01', abroge_par: null, // renseigné le jour où une version le remplace droits: ['assure', 'gestionnaire'], indexe_le: '2026-02-11', // pour repérer ce qui n'a pas été réindexé }Le piègeUn corpus qu’on n’élague jamais se retourne contre le système : sans le champ « abrogé par », la procédure de 2019 et celle de 2024 sont deux passages également plausibles, et le modèle citera fidèlement celle que la recherche aura ramenée en premier.
- 02
Filtrer pendant, jamais après
Le filtre de droits appartient à la recherche elle même. Filtrer les résultats après coup revient à avoir déjà lu, et souvent déjà transmis, ce qu’on n’avait pas le droit de lire : c’est la fuite la plus courante de ce genre de systèmes.
const passages = await index.chercher(question, { k: 5, filtre: (p) => p.droits.some((d) => session.roles.includes(d)) && // droits DE LA SESSION p.abroge_par === null, // rien d'abrogé }); // la porte de sortie, aussi importante que la recherche elle-même if (passages.length === 0) { return "Je n'ai rien trouvé dans les documents auxquels vous avez accès."; } // sans ce retour, le modèle reçoit un contexte vide et répond quand même : // de mémoire, donc à côté, et avec le même aplomb.- session.roles
- Les droits de la personne qui pose la question, pas ceux du service qui a indexé. Un index construit avec un compte d’administration voit tout : c’est au moment de chercher que la restriction doit s’appliquer.
- k
- Le nombre de passages retenus. L’augmenter ne rend pas la réponse meilleure : au delà de quelques passages, l’information utile se dilue et le coût monte à chaque tour.
- 03
Ce que le modèle voit à la fin
Le résultat de tout ce travail est un bloc de texte, ajouté au contexte juste avant la question. Rien d’autre ne parvient au modèle : ni le score, ni la base, ni les droits. D’où la nécessité d’écrire la provenance dans le texte lui même, sans quoi aucune citation n’est possible.
[contrat-2024.pdf · page 37 · version 2024-01] Le plafond annuel est fixé à 2 400 euros. [notice-2023.pdf · page 4 · version 2023-06] Le plafond annuel est fixé à 1 800 euros. Répondez uniquement à partir des passages ci-dessus, en citant la référence entre crochets. Si les passages se contredisent, dites-le.Le piègeDeux passages contradictoires sont ici, et c’est le cas réel le plus fréquent. Le modèle n’a aucun moyen de savoir lequel fait foi : il tranchera par plausibilité, sauf si on lui demande explicitement de signaler la contradiction, et surtout si l’index avait renseigné « abrogé par » au temps 01.
- embedding (plongement)le vecteur du champ « vecteur », et pourquoi le plus proche n’est pas le bon
- contexteoù ce bloc s’insère exactement, et ce qu’il coûte à chaque tour
Ce qui varieLes noms d’interface d’un index varient, et les bases documentaires exposent chacune leur propre vocabulaire de filtres et de scores. Ce qui ne varie pas : aucun entraînement n’a lieu, la restriction d’accès doit s’appliquer pendant la recherche, la provenance doit voyager dans le texte pour être citable, et ce qui arrive au modèle est un bloc de texte comme un autre.
Relations où vivent les voisins
- Requiert
- Étage 1 · Le Modèleun bloc plein, seul : la machine à prédiremodèle de langage (LLM)Étage 2 · Le Harnaisle bloc et ses plaques rapportées : ce qu’on lui ajoutecontexte
- Souvent confondu avec
- Étage 1 · Le Modèleun bloc plein, seul : la machine à prédirefine-tuning
- Frontières liées
- Fine-tuning ou RAGRAG ou Recherche web
Vérifier 3 questions · cliquez votre réponse
Niveau 1 · Reconnaître
Vous branchez un RAG sur vos procédures internes. Qu’est-ce qui a changé dans le modèle ?
Niveau 2 · Distinguer
Un assistant branché en RAG cite une procédure abrogée l’an dernier. Où est le problème ?
Niveau 2 · Distinguer
Vous voulez que l’assistant adopte le ton et les formulations de la maison. Le RAG suffit-il ?
Qui manipule ça 1 métier
Les postes dont ce terme fait partie du travail ordinaire.
Lexigraph, « RAG », v2026-08, https://www.lexigraph.org/fr/rag/, CC BY 4.0.