Pourquoi une IA préfère inventer une réponse plutôt que de dire "je ne sais pas"
Une IA qui invente une date ou un fait plutôt que d'admettre son ignorance n'est pas malhonnête : elle applique la stratégie la plus payante face à des tests qui notent une erreur assurée et un "je ne sais pas" de façon identique. La preuve, testée par OpenAI sur l'un de ses propres auteurs.
Auteur : Attuoman Prince Josias
Publié le
Une étude officielle d'OpenAI (2025) montre que deviner une réponse, même fausse, rapporte mathématiquement plus qu'admettre une ignorance : la plupart des benchmarks notent une erreur assurée et un « je ne sais pas » de façon identique (zéro), comme un examen sans point négatif.
Preuve testée par les auteurs eux-mêmes : un chatbot interrogé sur le sujet de thèse de l'un d'eux a donné trois réponses différentes, toutes fausses, sans jamais admettre son ignorance.
Solution proposée par OpenAI : pénaliser les erreurs assurées plus lourdement que l'incertitude honnête dans les grands classements de modèles, pas seulement dans des tests séparés.
Ce résumé (uniquement ce résumé, pas l'article) est généré par Claude Sonnet 5, relu et validé par Attuoman Prince Josias, auteur de l'article.
Demandez à un chatbot une information très précise et obscure, par exemple la date de naissance exacte d'une personne peu connue. Il y a de fortes chances qu'il vous donne une date, avec assurance. Une date fausse. Ce n'est pas qu'il essaie de vous tromper. C'est que, mathématiquement, deviner lui rapporte plus qu'admettre son ignorance. OpenAI l'a démontré noir sur blanc dans ses propres recherches.
Dans cet article :
- L'exemple de l'examen à choix multiples
- La preuve qu'OpenAI a testée sur son propre auteur
- D'où vient vraiment cette habitude
- Ce qu'OpenAI propose pour corriger le tir
- Ce qu'il faut en retenir
- Questions fréquentes
L'exemple de l'examen à choix multiples
Imaginez un examen où une bonne réponse rapporte un point, une mauvaise réponse n'en coûte aucun, et une case laissée vide ne rapporte, elle non plus, strictement rien. Quelle est la meilleure stratégie, même sans rien savoir ? Toujours répondre au hasard. On ne perd rien à se tromper, et on gagne parfois un point par chance. Laisser la case vide, à l'inverse, garantit un score nul, ni pire ni meilleur qu'une mauvaise réponse.
C'est très exactement la situation dans laquelle se trouve un modèle de langage pendant son évaluation. La plupart des tests utilisés pour mesurer et classer les IA notent une réponse fausse et un "je ne sais pas" de façon identique : zéro. Deviner devient alors, du point de vue purement mathématique de l'entraînement, la meilleure stratégie possible.
La preuve qu'OpenAI a testée sur son propre auteur
Dans une étude publiée en 2025, des chercheurs d'OpenAI ont voulu vérifier cette idée avec un exemple très concret : ils ont demandé à un assistant IA très utilisé le sujet exact de la thèse de doctorat de l'un des auteurs de l'étude lui-même. Le modèle a donné trois réponses différentes, à trois tentatives différentes. Aucune n'était la bonne. Il n'a, à aucun moment, répondu qu'il l'ignorait.
L'explication tient au raisonnement de l'examen à choix multiples. Sur une question aussi précise, deviner une date ou un titre a une petite chance de tomber juste. Répondre "je ne sais pas" a, elle, une chance nulle d'être comptée comme juste. Répété sur des milliers de questions d'entraînement, ce calcul pousse le modèle à préférer, presque systématiquement, une réponse assurée à une honnête incertitude.
D'où vient vraiment cette habitude
On pourrait croire qu'il suffirait de mieux entraîner les modèles pour corriger ce défaut une bonne fois pour toutes. Ce n'est pourtant pas si simple. Le problème ne vient pas d'un raté isolé dans l'entraînement, mais de la façon dont presque tous les grands classements et benchmarks utilisés pour comparer les modèles sont eux-mêmes construits : ils récompensent l'exactitude brute, jamais la prudence honnête. Un modèle qui admettrait plus souvent son ignorance obtiendrait, sur ces mêmes classements, un moins bon score qu'un modèle qui devine sans relâche, même si le premier est, dans les faits, plus digne de confiance.
Ce qu'OpenAI propose pour corriger le tir
La piste que propose l'étude ressemble, elle aussi, à un examen : pénaliser une mauvaise réponse assurée plus lourdement qu'un "je ne sais pas", un peu comme un barème à points négatifs pour les erreurs. Dans ce genre de système, deviner à l'aveugle devient risqué, et admettre une lacune redevient la meilleure stratégie, y compris pour un modèle purement rationnel, sans aucune notion de sincérité.
L'idée n'a rien d'anecdotique pour l'étude : elle plaide pour intégrer ce type de barème directement dans les grands classements utilisés par toute l'industrie, plutôt que de le réserver à des tests séparés spécifiquement dédiés à l'honnêteté des modèles.
Ce qu'il faut en retenir
Une IA qui invente une réponse plutôt que d'admettre son ignorance n'est pas malhonnête au sens humain du terme. Elle applique, sans le savoir, la stratégie mathématiquement la plus payante face à un système de notation qui ne récompense jamais la prudence. Tant que les classements utilisés pour évaluer et entraîner les modèles continueront de noter une erreur assurée et un aveu d'ignorance de la même façon, deviner restera, pour une IA, le choix le plus rationnel.
Questions fréquentes
C'est donc un bug qu'on pourrait corriger facilement ?
Pas vraiment. Le mécanisme vient de la façon dont les modèles sont évalués et classés à grande échelle, pas d'une erreur isolée dans le code. Le corriger demande de changer les règles de notation elles-mêmes, à l'échelle de toute l'industrie.
Un modèle plus gros ou plus récent se trompe-t-il moins souvent de cette façon ?
Pas nécessairement. L'étude d'OpenAI note que la taille du modèle ne règle pas ce problème à elle seule, puisqu'il vient de l'incitation créée par l'évaluation, pas d'un manque de capacité du modèle.
Demander à l'IA de dire "je ne sais pas" fonctionne-t-il vraiment ?
Ça aide, sans être infaillible. Préciser explicitement que l'incertitude est acceptée change la logique de la réponse, mais ne supprime pas entièrement la tendance acquise pendant l'entraînement à préférer une réponse assurée.
Ce problème concerne-t-il tous les assistants IA ?
Oui, dans la mesure où la quasi-totalité des modèles actuels sont entraînés et classés avec des méthodes d'évaluation similaires, basées sur l'exactitude brute plutôt que sur la prudence.
Sources principales :
- OpenAI : "Why language models hallucinate" (septembre 2025)
Étude officielle détaillant l'exemple de la thèse de doctorat et le raisonnement de l'examen à choix multiples. (openai.com)
Une newsletter par semaine, gratuite.
Actus IA, tutoriels et outils. Zero spam, desabonnement en 1 clic.
Notez cet article