Plus vous ajoutez de documents à votre base, plus les réponses deviennent floues
Empiler des fichiers pour « enrichir » une base IA finit souvent par noyer le signal. Comment ranger pour que les réponses redeviennent nettes.
Auteur : Attuoman Prince Josias
Publié le
Ajouter des documents à une base ne l'enrichit pas forcément : doublons, versions anciennes et textes proches noient le signal utile, et le système ramène un mélange au lieu d'un passage précis.
Les travaux cités le confirment : Lost in the Middle sur la zone aveugle du milieu, et When More Documents Hurt RAG, où l'exactitude chute de 75 % à moins de 40 % en passant de 54 à 1 128 documents.
Ce qui inverse la courbe : une source de vérité par sujet, des titres et dates visibles, des pages plus denses, et cinq questions fixes à rejouer après chaque gros ajout pour mesurer la qualité réelle.
Ce résumé (uniquement ce résumé, pas l'article) est généré par Claude Sonnet 5, relu et validé par Attuoman Prince Josias, auteur de l'article.
Vous avez ajouté encore quarante PDF « pour que l'IA sache plus de choses ». La base affiche 1 200 fichiers, un compteur rassurant. Les réponses, elles, sont devenues plus molles : un mélange de deux procédures, une vieille version qui ressurgit, une phrase juste mais trop générale pour servir. Vous n'avez pas enrichi le système. Vous l'avez noyé.
Ce n'est pas que le modèle devient moins intelligent. C'est que le signal utile se noie. Trop de pages proches, de doublons, de versions anciennes, et le système ramène un mélange au lieu d'un passage précis. Le Lab a déjà expliqué pourquoi un chatbot se trompe même avec vos documents : il ne lit pas tout, il pioche des extraits. Ici, on regarde l'autre levier : le volume. Combien vous empilez, et ce que ça fait à la pioche.
Pourquoi plus devient moins, une fois le tas trop grand
Quand plusieurs textes se contredisent légèrement, le modèle lisse. Quand dix fichiers répètent la même idée avec des mots différents, il généralise. Quand une vieille procédure traîne encore, elle peut ressortir au mauvais moment. Ajouter un document n'ajoute pas une vérité. Ça ajoute un candidat de plus dans le tas.
Liu et al., dans Lost in the Middle, ont montré que l'information utile se perd au milieu d'un long contexte, et que la performance peut même passer sous le niveau « sans document ». Un autre papier, More Documents, Same Length (Levy, Mazor, Shalmon, Hassid, Stanovsky, 2025), isole le nombre de documents en gardant la longueur de contexte constante : augmenter le nombre de documents, à soi seul, pose un problème distinct de la longueur. Autrement dit, découper plus fin, ou coller plus de fichiers, n'est pas le même geste que « donner plus de contexte ».
Le compteur de fichiers de votre outil ne mesure pas la qualité. Il mesure l'empilement.
Ce que mesurent les papiers, pas le compteur de fichiers
Jacob, Lindgren, Zaharia, Carbin, Khattab et Drozdov, dans Drowning in Documents, observent que les rerankers (souvent des cross-encoders) aident d'abord, puis dégradent la qualité au-delà d'un certain volume : trop de documents à scorer, et le reranker se met à bien noter des pages sans rapport lexical ni sémantique avec la question. L'intuition « on rerankera, ça ira » casse à l'échelle.
Plus proche de votre base interne : le papier When More Documents Hurt RAG documente, sur un corpus réel, une chute d'exactitude de 75 % à moins de 40 % en passant de 54 à 1 128 documents (près de 89 000 chunks). Les auteurs appellent ça une dilution de la recherche vectorielle : le top-k ramène des voisins sémantiques qui n'ont pas le bon contexte. Leur correctif n'est pas « un modèle plus gros ». C'est un cadrage par domaine, via des métadonnées, avant la synthèse.
Sauf que l'interface vous félicite à chaque upload. La pastille verte dit « indexé ». Elle ne dit pas « encore utile ». Anthropic, avec le contextual retrieval, a montré qu'ajouter du contexte aux extraits réduit déjà les échecs sur une base donnée. Ça n'autorise pas d'empiler quatre versions de la même procédure. Le contextual retrieval soigne le découpage. Il ne soigne pas le grenier.
Une base utile ressemble à une bibliothèque rangée, pas à un grenier où l'on empile « au cas où ».
Ce qui inverse la courbe, concrètement
- Une source de vérité par sujet : une procédure active, pas quatre versions. Archivez les vieilles. Ne les laissez pas dans l'index « au cas où ».
- Des titres et des dates visibles : ce qui est obsolète doit pouvoir être exclu. Un fichier sans date est un piège à rag, pas une archive.
- Moins de pages, plus de densité : retirez les introductions creuses et les annexes inutiles au questionnement. Le milieu du tas, Lost in the Middle l'a montré, est déjà la zone aveugle.
- Un test régulier : cinq questions fixes dont vous connaissez la bonne réponse. Si la qualité baisse après un gros ajout, vous le voyez. Sans ces cinq questions, vous naviguez au ressenti, trop tard.
Faut-il tout supprimer et recommencer ? Rarement. Commencez par les doublons évidents et les versions datées. Mesurez à nouveau avec vos cinq questions. Il n'y a pas de chiffre magique de fichiers. Le signal, c'est la qualité des réponses sur vos cas réels, pas le compteur. Les outils payants aident au découpage et à la recherche. Ils ne remplacent pas le choix de ce qui mérite d'être dans la base.
Pour le dossier que vous collez dans un chat, le guide coller tout le dossier ne suffit pas dit la même chose à petite échelle : trois fichiers, une intention, des titres propres. Ici, c'est la même discipline, pour une base qui doit durer.
Questions fréquentes
Faut-il tout supprimer et recommencer ?
Rarement. Commencez par retirer les doublons évidents et les versions datées. Mesurez à nouveau avec vos cinq questions tests. Le grand ménage n'est utile que si le tas est vraiment illisible.
Combien de documents, c'est trop ?
Il n'y a pas de chiffre magique. Le signal, c'est la qualité des réponses sur vos cas réels, pas le compteur de fichiers. Une chute après un gros ajout est déjà trop.
Les outils payants règlent-ils ça automatiquement ?
Ils aident au découpage et à la recherche. Ils ne remplacent pas le choix de ce qui mérite d'être dans la base. Un reranker n'aime pas un grenier plus qu'un humain.
En quoi c'est différent d'un problème de RAG classique ?
Le RAG classique se trompe en piochant le mauvais extrait d'un document utile. Ici, le volume crée des extraits concurrents, des versions mortes, une dilution. Même pioche, tas plus sale.
Une newsletter par semaine, gratuite.
Actus IA, tutoriels et outils. Zero spam, desabonnement en 1 clic.
Notez cet article