Chapitre 8 · Leçon 2 sur 3 · FDAIO-2026.1
Le RAG : faire répondre l’IA à partir de TES documents
Un LLM seul est un consultant brillant qui a tout lu sur Internet, mais ne connaît rien à ton entreprise — et qui, pour rendre service, invente parfois une réponse crédible. Le RAG (Retrieval-Augmented Generation) lui impose une règle simple : « Avant de répondre, je te glisse les bonnes pages du classeur de l’entreprise ; tu réponds uniquement à partir de ça, et tu cites la page. » L’IA ne devient pas plus intelligente : elle devient sourcée et à jour. C’est la différence entre une IA qui bavarde et une IA en qui on peut avoir confiance.
Un RAG, c’est deux moments. La préparation (une seule fois) : on rassemble les documents, on les découpe en morceaux (chunks), chaque morceau reçoit une empreinte de sens (embedding) — une suite de chiffres qui capture de quoi il parle —, et on range ces empreintes dans une base vectorielle, une bibliothèque consultable par le sens. La réponse (à chaque question) : la question reçoit son empreinte, la bibliothèque renvoie les morceaux les plus proches par le sens, on donne à l’IA la question + ces morceaux, et elle rédige une réponse fondée sur eux, en citant ses sources. Le réglage n°1 de la qualité, c’est la taille des morceaux : trop gros, on noie l’IA de bruit ; trop petit, on coupe les idées en deux. On teste, on mesure, on ajuste.
Le RAG est le bon choix quand la réponse existe déjà, écrite, dans des documents nombreux ou changeants, et qu’il faut citer la source (juridique, assurance, santé, conformité). Mais on fait plus simple quand on peut : si la réponse tient dans quelques pages stables, on les colle dans la consigne (« long-contexte ») — inutile de monter un RAG. Changer le style et non le savoir, c’est du fine-tuning, rare et coûteux, qui ne sert pas à apprendre des faits. Et une règle dure (« pas de remboursement après 30 jours ») se code par une simple règle informatique : l’IA n’a rien à y faire. On choisit toujours l’intervention la plus simple qui résout vraiment le problème : « puissant » n’est pas « adapté ».
À retenir
- Le RAG rend l’IA sourcée et à jour : elle répond à partir de TES documents et cite la page.
- Préparation (une fois) : documents → chunks → empreintes (embeddings) → base vectorielle.
- Réponse : on récupère les morceaux les plus proches par le sens, l’IA répond + cite.
- Levier n°1 de qualité : la taille des morceaux (ni trop gros, ni trop petit) — on teste.
- RAG quand la réponse est écrite, nombreuse/changeante, et qu’il faut citer.
- Plus simple si possible : long-contexte, règle informatique ; le fine-tuning n’apprend pas des faits.
Cette leçon compte pour l’évaluation du bloc, qui contrôle les 3 portes dures N2.P1.cas_viable, N2.P4.securite, N2.P5.rentabilite. Une porte dure ne se contourne pas : elle se franchit, ou le bloc est refusé.