RAG : pourquoi votre chatbot se trompe même avec vos propres documents
Vous uploadez vos documents et posez une question dont vous savez la réponse écrite noir sur blanc. L'IA se trompe quand même. La raison, expliquée simplement avec l'exemple officiel d'Anthropic, tient en un principe : elle ne lit jamais tout, elle ne pioche que quelques extraits.
Auteur : Attuoman Prince Josias
Publié le
Un chatbot connecté à vos documents ne les lit jamais en entier : il découpe le texte en petits morceaux, récupère seulement ceux qui semblent liés à votre question, puis répond avec ça seulement (technique appelée RAG, retrieval-augmented generation).
Exemple officiel d'Anthropic : une règle de télétravail et son exception se trouvent dans deux passages différents d'un document RH. Si le système ne récupère qu'un des deux, la réponse devient fausse ou incomplète.
Anthropic a mesuré le problème : donner du contexte à chaque morceau avant de le ranger réduit les échecs de recherche de 49 %, et de 67 % combiné à un tri supplémentaire.
Bon réflexe : demander à l'IA de citer le passage exact sur lequel elle s'appuie.
Ce résumé (uniquement ce résumé, pas l'article) est généré par Claude Sonnet 5, relu et validé par Attuoman Prince Josias, auteur de l'article.
Vous glissez vos propres documents dans une IA et lui posez une question dont vous savez, avec certitude, que la réponse est écrite noir sur blanc dans le fichier. Et pourtant, elle se trompe, ou répond "je ne trouve pas cette information". Ce n'est pas que l'IA n'a pas lu votre document. C'est qu'elle ne l'a jamais vraiment lu en entier, et la raison tient en un principe simple, une fois qu'on l'a vu une fois.
Dans cet article :
- Le principe, avec un exemple simple
- Pourquoi ça part mal : l'exemple du congé RH
- La preuve chiffrée : moins 49 % d'échecs
- Ce qu'il faut en retenir
- Questions fréquentes
Le principe, avec un exemple simple
Imaginez un assistant de recherche très efficace, mais pressé. Vous lui posez une question, et plutôt que de relire tout votre classeur de documents du début à la fin, il file droit vers les quelques pages dont le sujet ressemble le plus à votre question, les feuillette rapidement, et rédige sa réponse uniquement à partir de ce qu'il a sous les yeux. C'est exactement ce que fait une IA connectée à vos documents. Cette technique a un nom, RAG, mais retenez surtout le principe : chercher d'abord quelques passages pertinents, puis répondre seulement à partir de ces passages-là, pas du document entier.
Le problème, c'est que ce tri se fait avant même que l'IA ne "réfléchisse" à votre question. Si les pages qu'elle a attrapées ne contiennent pas vraiment la réponse, ou si un document a été découpé en petits morceaux qui séparent une information de la nuance écrite juste après, l'IA répondra avec ce qu'elle a, aussi incomplet soit-il, souvent sans même vous prévenir qu'il lui manquait un morceau.
Pourquoi ça part mal : l'exemple du congé RH
Anthropic, dans sa propre documentation technique, prend un exemple très parlant. Un employé demande à un assistant IA s'il a droit à du télétravail. La bonne réponse tient en une phrase : "Normalement non, mais les ressources humaines peuvent accorder une exception." Problème : cette règle et son exception se trouvent dans deux passages différents du document. Si le système ne récupère que le premier passage (la règle) sans le second (l'exception), l'IA répond simplement "non", ce qui est incomplet, voire trompeur.
Ce n'est pas un cas rare ou extrême. C'est le fonctionnement normal d'un système qui découpe les documents en petits morceaux avant de les ranger : dès qu'une information dépend du morceau d'à côté, le risque de réponse tronquée existe.
La preuve chiffrée : moins 49 % d'échecs
Anthropic a mesuré l'ampleur du problème, et surtout ce qui le corrige. En donnant à chaque petit morceau de document un peu du contexte du document entier avant de le ranger, plutôt que de le laisser isolé, l'entreprise a mesuré une réduction de 49 % du taux d'échec de recherche. En combinant cette méthode avec une étape de tri supplémentaire, la réduction grimpe à 67 %.
Ce chiffre confirme, mesures à l'appui, ce que l'exemple du congé RH suggérait déjà : le problème ne vient presque jamais d'un manque d'intelligence du modèle, mais d'un découpage qui a laissé un passage orphelin de son contexte.
Ce qu'il faut en retenir
Connecter une IA à vos documents ne lui donne pas une lecture complète et attentive de leur contenu. Cela lui donne la capacité d'aller chercher quelques extraits qui semblent pertinents, puis de répondre seulement à partir de ces extraits. La plupart des erreurs qu'on attribue à "l'IA qui n'a pas compris" viennent en réalité de cette étape de recherche, silencieuse et invisible, qui a lieu avant même que la génération de la réponse ne commence.
Questions fréquentes
RAG, ça veut dire quoi exactement ?
C'est l'abréviation de "retrieval-augmented generation", soit génération augmentée par la recherche. En clair : l'IA cherche d'abord quelques passages pertinents dans vos documents, puis rédige sa réponse à partir de ces passages, plutôt que de répondre uniquement avec ce qu'elle a appris pendant son entraînement.
Pourquoi l'IA rate parfois une info qui est clairement dans mon document ?
Parce que le document a été découpé en petits morceaux avant d'être rangé, et que l'étape de recherche n'a pas forcément récupéré le bon morceau, ou l'a récupéré sans le passage voisin qui apportait une nuance essentielle.
Est-ce que le RAG remplace l'entraînement d'un modèle ?
Non. Le RAG ne change rien à ce que le modèle a appris pendant son entraînement : il ajoute simplement des informations extérieures et à jour au moment de répondre, un peu comme donner une fiche à consulter juste avant un examen plutôt que de réapprendre tout le cours.
Comment savoir si une réponse vient vraiment de mes documents ?
Le signe le plus fiable reste une citation précise : demandez à l'IA de citer la phrase ou le passage exact sur lequel elle s'appuie. Si elle ne peut pas le faire, la réponse vient probablement de ses connaissances générales, pas de votre document.
Sources principales :
- Anthropic : "Introducing Contextual Retrieval"
Détaille l'exemple du congé RH et mesure la réduction de 49 % (67 % avec reclassement) du taux d'échec de recherche. (anthropic.com) - AWS : "What is Retrieval-Augmented Generation?"
Définition officielle du RAG et exemple d'un assistant RH d'entreprise. (aws.amazon.com)
Une newsletter par semaine, gratuite.
Actus IA, tutoriels et outils. Zero spam, desabonnement en 1 clic.
Notez cet article