Pourquoi faire tourner une IA coûte si cher, même quand une question semble gratuite
Une question à un chatbot IA semble gratuite et instantanée. Derrière, un vrai calcul consomme de la vraie électricité, sur du vrai matériel. Ce coût caché, expliqué simplement avec l'image d'une cuisine de restaurant, et un chiffre qui a tout changé en 2026.
Auteur : Attuoman Prince Josias
Publié le
Entraîner un modèle IA (GPT-4 ~79M$, Gemini Ultra ~191M$) est une dépense unique et colossale. Mais chaque question posée déclenche un second coût, répété à l'infini : l'inférence, environ 0,3 à 0,4 Wh par question texte courte.
Chiffre clé de 2026 : l'inférence cumulée représente désormais environ 63 % de l'énergie consommée sur la vie d'un modèle de pointe, contre 37 % pour l'entraînement, l'usage coûte maintenant plus cher que la construction du modèle.
Une question longue ou un modèle qui « réfléchit » peut faire grimper ce coût à plusieurs dizaines de Wh.
Ce résumé (uniquement ce résumé, pas l'article) est généré par Claude Sonnet 5, relu et validé par Attuoman Prince Josias, auteur de l'article.
Vous posez une question à un chatbot IA, la réponse arrive en quelques secondes, et rien ne vous est facturé. Tout semble gratuit et instantané. Pourtant, derrière chaque réponse, un vrai calcul tourne sur du vrai matériel, dans un vrai bâtiment qui consomme de la vraie électricité. Individuellement, ce coût est minuscule. Multiplié par les milliards de questions posées chaque jour dans le monde, il devient l'un des postes de dépense les plus lourds de toute l'industrie de l'IA.
Dans cet article :
- La cuisine qu'il faut construire une fois
- Le repas qu'il faut refaire à chaque question
- Le chiffre qui a changé la donne en 2026
- Pourquoi une question longue coûte plus cher
- Ce qu'il faut en retenir
- Questions fréquentes
La cuisine qu'il faut construire une fois
Avant qu'un modèle IA ne réponde à qui que ce soit, il faut d'abord l'entraîner : lui faire ingérer d'énormes quantités de texte, pendant des semaines, sur des milliers de machines spécialisées tournant sans interruption. C'est une dépense unique, payée une seule fois, mais absolument colossale. Les estimations publiques situent l'entraînement de GPT-4 autour de 79 millions de dollars, celui de Gemini Ultra autour de 191 millions, et les modèles les plus récents commencent à franchir le cap du milliard de dollars.
Une bonne image : c'est la construction d'une cuisine de restaurant. Les fourneaux, les plans de travail, la mise au point des recettes, tout cela coûte cher une seule fois, avant même le premier client servi.
Le repas qu'il faut refaire à chaque question
Une fois le modèle entraîné, chaque question posée déclenche un second type de dépense, celle-là répétée à l'infini : l'inférence, c'est-à-dire le calcul qui produit une réponse à partir du modèle déjà prêt. C'est le repas qu'il faut refaire, avec de vrais ingrédients et du vrai temps de cuisinier, à chaque nouvelle commande, même si la recette a déjà été mise au point une fois pour toutes.
Une question texte courte consomme, en moyenne, environ 0,3 à 0,4 wattheure d'électricité, l'équivalent d'une recherche sur un moteur de recherche classique. Individuellement, c'est négligeable. Mais ce chiffre se répète des milliards de fois par jour, à l'échelle de la planète.
Le chiffre qui a changé la donne en 2026
On pourrait croire que le plus gros de la dépense reste la construction du modèle, cette cuisine bâtie une seule fois. Ce n'est pourtant plus le cas. En 2026, l'inférence (l'usage quotidien, cumulé) représente environ 63 % de l'énergie consommée sur toute la vie d'un modèle de pointe, contre 37 % seulement pour son entraînement initial. Autrement dit, servir les repas coûte désormais plus cher, au total, que d'avoir construit la cuisine.
Pourquoi une question longue coûte plus cher
Toutes les questions ne se valent pas. Un modèle qui "réfléchit" longuement avant de répondre, ou une conversation qui s'étire sur des dizaines de messages, oblige la cuisine à préparer un repas bien plus élaboré à chaque fois. Sur ce type de requête, la consommation peut grimper à plusieurs dizaines de wattheures, au lieu des 0,3 à 0,4 habituels. C'est la même logique, en plus long : plus il y a d'ingrédients à traiter et d'étapes à refaire, plus l'addition grimpe, même si le client ne voit toujours qu'une réponse gratuite à l'écran.
Ce qu'il faut en retenir
L'entraînement d'un modèle IA reste une dépense spectaculaire, mais ponctuelle. Ce qui pèse vraiment sur la durée, ce sont les milliards de petites questions posées chaque jour, chacune presque gratuite à l'unité, mais qui s'additionnent en une facture d'électricité et de matériel parmi les plus lourdes de toute l'industrie technologique. La prochaine fois qu'une réponse IA vous paraît instantanée et sans coût, il y a, quelque part, un vrai bâtiment qui vient de consommer un peu de vraie électricité pour vous la fournir.
Questions fréquentes
Une seule question à un chatbot consomme-t-elle beaucoup d'électricité ?
Non, individuellement, c'est de l'ordre de 0,3 à 0,4 wattheure pour une question texte courte, comparable à une recherche web classique. Le problème vient du volume, pas de la question elle-même.
Pourquoi certains abonnements IA sont-ils payants s'il existe une version gratuite ?
Parce que chaque requête a un coût réel et récurrent en électricité et en matériel. Un accès gratuit reste rarement illimité bien longtemps, précisément à cause de ce coût qui se répète à chaque question.
L'entraînement coûte-t-il encore plus cher que l'utilisation ?
Ça a longtemps été le cas, mais la tendance s'est inversée en 2026 : l'usage cumulé (l'inférence) représente désormais environ 63 % de l'énergie totale consommée sur la vie d'un modèle, contre 37 % pour son entraînement.
Une IA qui "réfléchit" plus longtemps coûte-t-elle vraiment plus cher ?
Oui. Plus une réponse demande d'étapes de calcul, notamment sur les modèles de raisonnement ou les longues conversations, plus la consommation grimpe, parfois jusqu'à plusieurs dizaines de wattheures au lieu de moins d'un wattheure.
Sources principales :
- Projet Celsius : "Une requête ChatGPT consomme 0,3 Wh : les vrais chiffres 2026"
Détaille la répartition 63 % inférence / 37 % entraînement et les consommations par modèle. (projetcelsius.com) - OutilsIA : "Combien consomme ChatGPT ?"
Reprend les chiffres officiels communiqués par OpenAI (0,34 Wh et 0,32 ml d'eau par requête moyenne). (outilsia.fr) - GPU Nex : "Économie de l'inférence AI : l'effondrement des coûts"
Chiffre les coûts d'entraînement de GPT-4 et Gemini Ultra, et la croissance du marché de l'inférence. (gpunex.com)
Une newsletter par semaine, gratuite.
Actus IA, tutoriels et outils. Zero spam, desabonnement en 1 clic.
Notez cet article