Aller au contenu
Tutoriel

Pourquoi une IA préfère inventer une réponse plutôt que de dire "je ne sais pas"

Une IA qui invente une date ou un fait plutôt que d'admettre son ignorance n'est pas malhonnête : elle applique la stratégie la plus payante face à des tests qui notent une erreur assurée et un "je ne sais pas" de façon identique. La preuve, testée par OpenAI sur l'un de ses propres auteurs.

Attuoman Prince Josias

Auteur : Attuoman Prince Josias

Publié le

Pourquoi une IA préfère inventer une réponse plutôt que de dire "je ne sais pas"

Demandez à un chatbot une information très précise et obscure, par exemple la date de naissance exacte d'une personne peu connue. Il y a de fortes chances qu'il vous donne une date, avec assurance. Une date fausse. Ce n'est pas qu'il essaie de vous tromper. C'est que, mathématiquement, deviner lui rapporte plus qu'admettre son ignorance. OpenAI l'a démontré noir sur blanc dans ses propres recherches.

Dans cet article :

L'exemple de l'examen à choix multiples

Imaginez un examen où une bonne réponse rapporte un point, une mauvaise réponse n'en coûte aucun, et une case laissée vide ne rapporte, elle non plus, strictement rien. Quelle est la meilleure stratégie, même sans rien savoir ? Toujours répondre au hasard. On ne perd rien à se tromper, et on gagne parfois un point par chance. Laisser la case vide, à l'inverse, garantit un score nul, ni pire ni meilleur qu'une mauvaise réponse.

C'est très exactement la situation dans laquelle se trouve un modèle de langage pendant son évaluation. La plupart des tests utilisés pour mesurer et classer les IA notent une réponse fausse et un "je ne sais pas" de façon identique : zéro. Deviner devient alors, du point de vue purement mathématique de l'entraînement, la meilleure stratégie possible.

La preuve qu'OpenAI a testée sur son propre auteur

Dans une étude publiée en 2025, des chercheurs d'OpenAI ont voulu vérifier cette idée avec un exemple très concret : ils ont demandé à un assistant IA très utilisé le sujet exact de la thèse de doctorat de l'un des auteurs de l'étude lui-même. Le modèle a donné trois réponses différentes, à trois tentatives différentes. Aucune n'était la bonne. Il n'a, à aucun moment, répondu qu'il l'ignorait.

L'explication tient au raisonnement de l'examen à choix multiples. Sur une question aussi précise, deviner une date ou un titre a une petite chance de tomber juste. Répondre "je ne sais pas" a, elle, une chance nulle d'être comptée comme juste. Répété sur des milliers de questions d'entraînement, ce calcul pousse le modèle à préférer, presque systématiquement, une réponse assurée à une honnête incertitude.

D'où vient vraiment cette habitude

On pourrait croire qu'il suffirait de mieux entraîner les modèles pour corriger ce défaut une bonne fois pour toutes. Ce n'est pourtant pas si simple. Le problème ne vient pas d'un raté isolé dans l'entraînement, mais de la façon dont presque tous les grands classements et benchmarks utilisés pour comparer les modèles sont eux-mêmes construits : ils récompensent l'exactitude brute, jamais la prudence honnête. Un modèle qui admettrait plus souvent son ignorance obtiendrait, sur ces mêmes classements, un moins bon score qu'un modèle qui devine sans relâche, même si le premier est, dans les faits, plus digne de confiance.

Ce qu'OpenAI propose pour corriger le tir

La piste que propose l'étude ressemble, elle aussi, à un examen : pénaliser une mauvaise réponse assurée plus lourdement qu'un "je ne sais pas", un peu comme un barème à points négatifs pour les erreurs. Dans ce genre de système, deviner à l'aveugle devient risqué, et admettre une lacune redevient la meilleure stratégie, y compris pour un modèle purement rationnel, sans aucune notion de sincérité.

L'idée n'a rien d'anecdotique pour l'étude : elle plaide pour intégrer ce type de barème directement dans les grands classements utilisés par toute l'industrie, plutôt que de le réserver à des tests séparés spécifiquement dédiés à l'honnêteté des modèles.

Une astuce simple à tester : demandez explicitement à une IA de répondre "je ne sais pas" plutôt que de deviner si elle n'est pas certaine. Cette seule consigne change la logique de la réponse et réduit, dans bien des cas, la tentation d'inventer un chiffre ou une date au hasard.

Ce qu'il faut en retenir

Une IA qui invente une réponse plutôt que d'admettre son ignorance n'est pas malhonnête au sens humain du terme. Elle applique, sans le savoir, la stratégie mathématiquement la plus payante face à un système de notation qui ne récompense jamais la prudence. Tant que les classements utilisés pour évaluer et entraîner les modèles continueront de noter une erreur assurée et un aveu d'ignorance de la même façon, deviner restera, pour une IA, le choix le plus rationnel.

Questions fréquentes

C'est donc un bug qu'on pourrait corriger facilement ?

Pas vraiment. Le mécanisme vient de la façon dont les modèles sont évalués et classés à grande échelle, pas d'une erreur isolée dans le code. Le corriger demande de changer les règles de notation elles-mêmes, à l'échelle de toute l'industrie.

Un modèle plus gros ou plus récent se trompe-t-il moins souvent de cette façon ?

Pas nécessairement. L'étude d'OpenAI note que la taille du modèle ne règle pas ce problème à elle seule, puisqu'il vient de l'incitation créée par l'évaluation, pas d'un manque de capacité du modèle.

Demander à l'IA de dire "je ne sais pas" fonctionne-t-il vraiment ?

Ça aide, sans être infaillible. Préciser explicitement que l'incertitude est acceptée change la logique de la réponse, mais ne supprime pas entièrement la tendance acquise pendant l'entraînement à préférer une réponse assurée.

Ce problème concerne-t-il tous les assistants IA ?

Oui, dans la mesure où la quasi-totalité des modèles actuels sont entraînés et classés avec des méthodes d'évaluation similaires, basées sur l'exactitude brute plutôt que sur la prudence.

Sources principales :

  • OpenAI : "Why language models hallucinate" (septembre 2025)
    Étude officielle détaillant l'exemple de la thèse de doctorat et le raisonnement de l'examen à choix multiples. (openai.com)

Une newsletter par semaine, gratuite.

Actus IA, tutoriels et outils. Zero spam, desabonnement en 1 clic.

hallucination IA OpenAI benchmark incertitude calibration vulgarisation recherche IA

Notez cet article

5,0/5 (1 vote)

Commentaires 0

Aucun commentaire pour l'instant.

Tu peux être le premier.

Connectez-vous pour laisser un commentaire

Compte gratuit, 30 secondes.