📊 Data
🤖 Le coût énergétique et carbone de l'IA
On lit tout et son contraire sur la consommation de l'intelligence artificielle : que chaque question à un chatbot vide une bouteille d'eau, ou au contraire que tout cela est négligeable. Les deux camps ont un point commun : ils ne font jamais le calcul. Cette page le fait, de bout en bout, avec un cas réel et vérifiable : LLaMA 3.1 405B, le grand modèle de Meta sorti en 2024, le dernier de cette taille dont l'entraînement soit documenté publiquement. On refait tous les calculs à la main, puis on les compare aux chiffres officiels publiés par l'entreprise.
1. Entraîner un modèle : la fabrication
Entraîner un modèle de langage, c'est lui faire lire une quantité colossale de texte en corrigeant, à chaque mot, des centaines de milliards de petits curseurs numériques appelés paramètres. L'opération se fait une fois, elle dure quelques mois, et elle mobilise un des plus gros calculateurs de la planète. Deux nombres suffisent à tout décrire.
Les deux nombres qui décrivent un modèle
tokens de données d'entraînement
paramètres dans le modèle
tokens lus par paramètre
Source : Meta, The Llama 3 Herd of Models (2024), le rapport technique de 92 pages publié avec le modèle : 15,6 mille milliards de tokens, 405 milliards de paramètres.
Le token est l'unité de compte du texte : un morceau de mot, environ 0,75 mot en français. Les 15,6 mille milliards de tokens avalés par LLaMA 3.1 représentent de l'ordre de 12 mille milliards de mots, soit à peu près tout le web librement accessible, plusieurs fois. À raison de 250 mots à la minute et sans jamais dormir, un humain mettrait 90 000 ans à lire ce corpus.
Le paramètre est un nombre stocké dans le modèle, ajusté pendant l'entraînement. Les 405 milliards de paramètres du modèle occupent 810 gigaoctets en mémoire, soit largement plus que ce qu'une seule carte graphique peut contenir : il faut déjà plusieurs GPU rien que pour ranger le modèle.
L'optimum de Chinchilla : combien de données pour combien de paramètres ?
Voilà la vraie question d'ingénieur. Avec un budget de calcul donné, vaut-il mieux un gros modèle nourri de peu de texte, ou un petit modèle nourri de beaucoup ? En 2022, l'équipe DeepMind a tranché avec le papier Chinchilla : pour minimiser l'erreur du modèle à budget de calcul constant, il faut environ 20 tokens par paramètre, et les deux doivent grandir ensemble.
Ce résultat a été un choc, parce qu'il montrait que les modèles de l'époque étaient massivement sous-entraînés : GPT-3, avec ses 175 milliards de paramètres et 300 milliards de tokens, était à 1,7 token par paramètre, soit douze fois moins que l'optimum. On avait dépensé le budget du mauvais côté.
Sources : Hoffmann et al., DeepMind (2022), Training Compute-Optimal Large Language Models pour la règle des 20 tokens par paramètre ; Brown et al., OpenAI (2020), Language Models are Few-Shot Learners pour les caractéristiques de GPT-3 (175 milliards de paramètres, 300 milliards de tokens).
Pourquoi LLaMA 3 est à 38 tokens par paramètre, et pas 20
Deux raisons. D'abord, les lois d'échelle recalculées par Meta sur leurs propres données placent leur optimum aux alentours de 40 tokens par paramètre à cette échelle de calcul : l'optimum de Chinchilla n'est pas une constante universelle, il dépend du corpus et de l'architecture.
Ensuite et surtout, Chinchilla ne minimise que le coût de l'entraînement. Or un modèle est entraîné une fois et utilisé des milliards de fois. Un modèle plus petit mais sur-entraîné coûte plus cher à fabriquer et beaucoup moins cher à faire tourner. C'est exactement la stratégie du petit frère LLaMA 3 8B : 8 milliards de paramètres, les mêmes 15 000 milliards de tokens, soit 1 875 tokens par paramètre, presque cent fois l'optimum de Chinchilla. Totalement absurde du point de vue de l'entraînement, parfaitement rationnel du point de vue de la facture d'électricité sur cinq ans.
Source : les lois d'échelle recalculées par Meta et le dimensionnement des modèles 8B, 70B et 405B sont détaillés dans The Llama 3 Herd of Models, section 3.2.1 (scaling laws).
Combien de calcul ? La formule 6ND
Un FLOP (floating point operation) est une opération élémentaire sur des nombres à virgule : une addition, une multiplication. C'est la brique de base de tout calcul. Le nombre de FLOPs nécessaires pour entraîner un modèle s'estime avec une formule d'une simplicité déroutante :
N = nombre de paramètres, D = nombre de tokens d'entraînement
D'où vient ce 6 ?
- 2 FLOPs pour la passe avant. Faire passer un token dans le modèle, c'est essentiellement une suite de multiplications de matrices. Chaque paramètre y est utilisé exactement une fois, dans un « multiplie puis ajoute » : une multiplication et une addition, donc 2 FLOPs par paramètre et par token.
- 4 FLOPs pour la passe arrière. Pour corriger le modèle, il faut calculer deux gradients : celui par rapport aux paramètres, et celui par rapport aux entrées de chaque couche, pour pouvoir propager l'erreur vers l'arrière. Chacun coûte autant que la passe avant, d'où deux fois le coût de la passe avant.
- Total : 6 FLOPs par paramètre et par token, à multiplier par le nombre de tokens vus.
Source : cette approximation vient de Kaplan et al., OpenAI (2020), Scaling Laws for Neural Language Models, qui établit le budget de calcul C ≈ 6ND ; elle est reprise telle quelle par le papier Chinchilla et par la plupart des estimations publiées depuis.
Application au cas qui nous occupe : 6 × 405 milliards × 15,6 mille milliards = 3,8 × 1025 FLOPs. Trente-huit millions de milliards de milliards d'opérations. Le mécanisme d'attention, quadratique avec la longueur du contexte, ajoute encore quelques pour cent que la formule néglige.
16 000 cartes H100, et 69 jours
Reste à savoir combien de temps met une machine à encaisser 3,8 × 1025 opérations. La NVIDIA H100 est le cheval de trait de cette génération : environ 1 pétaFLOPS de pic théorique en précision BF16, celle qu'on utilise à l'entraînement, pour 700 watts de consommation.
Sauf qu'on n'atteint jamais le pic. Meta constate un débit moyen de 400 TFLOPS par carte, soit 40 % du pic théorique. Le reste part en attentes mémoire, en communication entre cartes, et en pannes : sur les 54 jours du run principal, l'équipe a compté 419 interruptions non planifiées, soit une toutes les trois heures, dont 78 % d'origine matérielle. À cette échelle, le matériel casse en permanence.
Sources : NVIDIA, fiche technique de la H100 pour les 700 W et le pic de 989 TFLOPS en BF16 ; The Llama 3 Herd of Models pour les 16 000 cartes, le débit moyen de 400 TFLOPS par carte et les 419 interruptions non planifiées en 54 jours (section 3.3, « infrastructure, mise à l'échelle et efficacité »).
heures de GPU (calcul théorique)
sur 16 000 cartes en parallèle
heures de GPU réellement déclarées par Meta
Le calcul : 3,8 × 1025 FLOPs divisés par 400 TFLOPS donnent 26,3 millions d'heures de GPU ; réparties sur 16 000 cartes, cela fait 69 jours de calcul non-stop. Meta déclare officiellement 30,8 millions d'heures : notre estimation à la louche tombe 17 % en dessous du chiffre réel, ce qui est une excellente nouvelle pour la méthode. Tout ce qu'on n'a pas modélisé (essais ratés, réglages, mise au point) explique l'écart.
Source : Meta, fiche officielle du modèle LLaMA 3.1 (rubrique Training Energy Use) : 30,84 millions d'heures de GPU H100-80GB à 700 W de TDP pour le seul modèle 405B.
Ce que ça coûte en dollars
Meta possède ses machines, mais le prix de location chez un hébergeur est le meilleur étalon pour répondre à la question « combien ça coûterait ». Une H100 se loue aujourd'hui autour de 2 $ de l'heure chez les loueurs spécialisés, contre 4 à 8 $ chez les grands fournisseurs de cloud.
de location : 26,3 M h × 2 $/h
de salaires : 50 personnes à 500 k$/an
au total, fourchette 65 à 85 M$
Un ordre de grandeur qui mérite d'être médité : le calcul brut ne représente que les deux tiers de la facture. Et ces 78 millions de dollars ne sont que le run final : ils ne comptent ni les dizaines d'expériences préparatoires, ni la constitution du corpus, ni les 400 millions de dollars de cartes graphiques immobilisées.
Attention, ces deux chiffres sont des hypothèses, pas des données publiées : Meta possède ses machines et ne communique ni le coût du run, ni la masse salariale de l'équipe. Le prix de 2 $ l'heure est pris dans le bas de la fourchette observée chez les loueurs spécialisés de GPU en 2025-2026 ; les 50 personnes à 500 k$ sont un ordre de grandeur pour une équipe de recherche de ce niveau dans la Silicon Valley. À prendre pour ce que c'est : une estimation, à 30 % près au mieux.
L'énergie : du GPU à la prise de courant
Là, c'est mécanique. Une H100 consomme 700 W en charge, et elle est en charge en permanence pendant 69 jours :
et ce n'est que la consommation des puces elles-mêmes
Ce chiffre-là, celui qu'on lit partout, est une sous-estimation. Un GPU ne tourne pas tout seul dans le vide : il est monté dans un serveur qui a son processeur hôte, sa mémoire vive, ses disques et ses cartes réseau à 400 Gb/s ; un serveur à huit H100 tire environ 10 kW alors que les huit GPU n'en font que 5,6. Et ce serveur est posé dans un bâtiment qu'il faut refroidir, alimenter en courant ondulé, éclairer.
Le PUE, la mesure du gaspillage d'un datacenter
Le PUE (Power Usage Effectiveness) est le rapport entre l'électricité qui entre dans le bâtiment et celle qui arrive réellement aux serveurs. Un PUE de 1,5 signifie que pour 1 kWh utile, on en dépense 0,5 de plus en refroidissement, en pertes d'onduleurs et de transformateurs, en éclairage. Un PUE de 1,0 serait le datacenter parfait, qui n'existe pas.
La moyenne mondiale stagne autour de 1,54 depuis six ans (enquête Uptime Institute). Les datacenters récents des géants du numérique tournent plutôt entre 1,10 et 1,20, grâce au refroidissement liquide direct sur les puces et à des températures de consigne plus élevées. On retient ici 1,2, une valeur favorable.
Sources : Uptime Institute, enquête mondiale sur les datacenters (2025) pour le PUE moyen de 1,54 ; Google publie trimestriellement le PUE de chacun de ses sites, autour de 1,09 en moyenne sur son parc.
Le carbone : pourquoi il faut prendre le facteur d'émission marginal
Nous avons 31 GWh. Reste à les convertir en CO₂, et c'est là que se joue tout le débat : selon le facteur d'émission retenu, le résultat varie d'un facteur vingt.
Le réflexe habituel est de prendre la moyenne du réseau : aux États-Unis, 386 gCO₂e/kWh selon l'agence environnementale américaine. C'est la bonne réponse à la question « quelle est l'intensité carbone de l'électricité américaine ». Mais ce n'est pas notre question. La nôtre est : qu'est-ce qui change si ce datacenter n'existe pas ? Et la réponse est complètement différente.
La logique du marginal, en une image
Sur un réseau électrique, les moyens de production sont appelés par ordre de coût croissant. Le nucléaire, l'éolien, le solaire et l'hydraulique ont un coût de fonctionnement quasi nul : ils tournent déjà à fond dès qu'ils le peuvent. Ils ne peuvent pas produire davantage parce qu'un datacenter s'allume.
Donc le kilowattheure supplémentaire, celui que le datacenter appelle, ne vient jamais du mix moyen. Il vient de la dernière centrale allumée, celle qui est en réserve et qu'on démarre pour suivre la demande. Aux États-Unis, cette centrale est presque toujours une turbine à gaz en cycle combiné, parfois encore du charbon dans certaines régions.
Autrement dit : le mix moyen décrit un état du réseau, le facteur marginal décrit une conséquence. Quand on cherche l'empreinte d'une consommation nouvelle et qu'on veut savoir si elle vaut le coup, c'est le marginal qu'il faut prendre. C'est exactement le même raisonnement que pour une voiture électrique branchée un soir d'hiver.
Un cycle combiné gaz moderne émet environ 350 gCO₂e/kWh à la cheminée. En ajoutant l'amont, c'est-à-dire l'extraction, la liquéfaction, le transport et surtout les fuites de méthane sur toute la chaîne, on arrive à 450 gCO₂e/kWh en cycle de vie complet. C'est la valeur retenue ici. La littérature situe le marginal des réseaux dominés par le gaz entre 400 et 600 g, et le taux marginal moyen américain publié par l'EPA, qui inclut encore du charbon, monte à 670 g.
Sources : GIEC, 5ᵉ rapport, annexe III (médiane de 490 gCO₂e/kWh en cycle de vie complet pour un cycle combiné gaz, fourchette 410 à 650) ; EPA, eGRID pour la moyenne du réseau américain (386 g) et le taux marginal « non-baseload » (670 g) ; EPA, AVERT, l'outil officiel qui calcule les émissions ajoutées ou évitées par un MWh supplémentaire sur chaque région américaine, c'est-à-dire exactement le raisonnement marginal décrit ci-dessus. Pour la France, le facteur de la Base Empreinte de l'ADEME est de l'ordre de 50 g/kWh en cycle de vie.
Le résultat : environ 13 931 tonnes de CO₂e pour entraîner un modèle
31 GWh × 450 gCO₂e/kWh = 13 931 tonnes de CO₂e. Soit, en repères parlants :
- 6 966 allers-retours Paris-New York en classe éco, à 2 tCO₂e le voyage
- l'empreinte carbone annuelle complète de 1 548 Français, à 9 tonnes par personne et par an
- en électricité, les 31 GWh correspondent à 6 587 foyers français pendant un an, ou à 21 heures de production d'un réacteur nucléaire de 1 500 MW
Vérification : que dit Meta officiellement ?
C'est tout l'intérêt de ce cas d'étude : la fiche du modèle publie les chiffres. Meta déclare 30,84 millions d'heures de GPU et 8 930 tonnes de CO₂e pour le seul modèle 405B, en méthode dite « location-based ».
En divisant, on retrouve un facteur d'émission implicite de 414 gCO₂e/kWh, très proche des 450 g d'un cycle combiné gaz que nous avons retenus. Mais leur calcul ne compte que les GPU : ni le reste du serveur, ni le refroidissement. En leur appliquant les mêmes facteurs 1,4 et 1,2, on obtient environ 15 000 tonnes, soit à nouveau notre ordre de grandeur. Retenons 10 000 à 15 000 tonnes de CO₂e pour l'entraînement d'un très grand modèle.
Et une ligne à retenir : dans la même fiche, Meta déclare 0 tonne en méthode « market-based », grâce à l'achat de certificats d'électricité renouvelable. C'est comptablement exact et physiquement faux : les certificats n'empêchent aucune turbine à gaz de tourner au moment où le datacenter appelle du courant. La molécule de CO₂ ne lit pas les certificats.
Source : fiche officielle du modèle LLaMA 3.1 : 8 930 tCO₂e en méthode « location-based » et 0 tCO₂e en méthode « market-based » pour le modèle 405B. La distinction entre ces deux méthodes est définie par le GHG Protocol, Scope 2 Guidance.
🎓 D'où vient tout ce raisonnement
Cette partie sur l'entraînement est très largement inspirée d'un cours de Stanford disponible librement en ligne : l'optimum de Chinchilla, la formule 6ND, l'écart entre le pic théorique d'un GPU et son débit réel, la façon dont un run d'entraînement se déroule vraiment. C'est la meilleure introduction que je connaisse à la fabrication d'un grand modèle de langage, et elle reste accessible sans être spécialiste. Si le sujet vous intéresse, allez la voir en entier : elle vaut largement le temps qu'on y passe.

Stanford CS229 : Building Large Language Models (LLMs)
Cours de Yann Dubois, chaîne Stanford Online (2024). Voir sur YouTube, la vidéo ne se charge qu'au clic
2. Faire tourner le modèle : l'inférence
L'entraînement est un événement ; l'utilisation est un régime permanent. Une fois le modèle fabriqué, chaque question posée déclenche un calcul appelé inférence. Prenons le même modèle de 405 milliards de paramètres, et calculons ce que coûte une réponse.
La formule : 2 FLOPs par paramètre et par token
En inférence, il n'y a plus de passe arrière : on ne corrige plus le modèle, on l'utilise. Il ne reste donc que la passe avant, soit 2 FLOPs par paramètre pour chaque token produit :
Le modèle recommence ce calcul complet pour chaque mot qu'il écrit.
Le vrai facteur limitant n'est pas le calcul, c'est la mémoire
C'est le point que presque toutes les estimations ratent. Pour écrire un token, le GPU doit relire l'intégralité des paramètres du modèle depuis sa mémoire. Pas une partie : la totalité. En précision FP8, cela fait 405 gigaoctets à faire transiter, à chaque mot.
Sur un nœud de huit H100, la bande passante mémoire cumulée est d'environ 27 téraoctets par seconde. Relire tous les poids prend donc 15 millisecondes, alors que le calcul associé à un seul token ne demande que 0,13 milliseconde. Autrement dit : le GPU passe 99 % de son temps à attendre la mémoire. Si l'on servait une seule conversation à la fois, l'énergie par token serait catastrophique.
Le regroupement des requêtes : ce qui rend l'IA soutenable
La solution est élégante : puisqu'on a lu tous les poids, autant s'en servir pour plusieurs conversations à la fois. C'est le traitement par lots. Le fournisseur regroupe des dizaines de requêtes d'utilisateurs différents et les fait avancer d'un mot toutes ensemble, en ne relisant les poids qu'une seule fois. L'énergie par token est donc divisée par la taille du lot.
Le gain finit par s'arrêter : quand le lot atteint environ 120 requêtes, le calcul devient plus long que la lecture mémoire, et le GPU est enfin saturé. On atteint le plancher physique de 0,72 joule par token. En pratique, les fournisseurs ne peuvent pas toujours remplir les lots (il faut des requêtes simultanées, et il faut répondre vite), on retient donc un point de fonctionnement réaliste à 64 requêtes en parallèle, soit 1,3 joule par token généré.
Ce calcul est propre à cette page. Il est reconstruit à partir des caractéristiques publiées de la H100 (fiche technique NVIDIA : 3,35 To/s de bande passante mémoire HBM3 et 1 979 TFLOPS de pic dense en FP8 par carte). Le mécanisme est décrit en détail dans Pope et al., Google (2022), Efficiently Scaling Transformer Inference, qui montre pourquoi l'inférence est limitée par la mémoire et non par le calcul, et pourquoi le regroupement des requêtes change tout.
Lire coûte moins cher qu'écrire
La question que vous vous posez en lisant votre prompt : mon long texte d'entrée coûte-t-il autant que la réponse ? Non. Les tokens d'entrée sont traités tous en même temps, en une seule passe qui sature naturellement le GPU. Ils coûtent donc le plancher, 0,72 J, contre 1,3 J pour un token écrit, qui doit être produit un par un. C'est d'ailleurs pour cela que les tarifs des API sont toujours de 3 à 5 fois plus élevés en sortie qu'en entrée.
Du GPU à la prise : les deux ratios à ajouter
Les 0,38 Wh que consomment les GPU pour une requête type ne sont pas la facture. Il faut ajouter, dans cet ordre :
- × 1,4 pour le reste du serveur : processeur hôte qui prépare les requêtes, mémoire vive, stockage, cartes réseau, ventilateurs. Sur un serveur d'IA, les GPU pèsent de 60 à 75 % de la consommation, pas 100 %.
- × 1,2 pour le refroidissement et les pertes : c'est le PUE. Toute l'électricité qui entre dans une puce en ressort sous forme de chaleur, il faut donc l'évacuer : groupes froids, pompes, ventilateurs de salle, plus les pertes des onduleurs et des transformateurs. Pour un datacenter d'IA récent en refroidissement liquide, 1,2 ; pour un datacenter moyen dans le monde, 1,54.
Un troisième facteur, souvent oublié, est la capacité inutilisée : pour absorber les pics et garantir la disponibilité, une partie du parc tourne à vide. Google chiffre cette réserve à environ 10 % de la consommation par requête. On ne l'ajoute pas ici, mais elle va dans le sens d'une sous-estimation.
Le résultat : 0,64 Wh et 0,29 gCO₂e par requête
Pour une requête de 1 000 tokens de contexte et 500 tokens de réponse, sur un modèle dense de 405 milliards de paramètres : 0,64 Wh à la prise, soit 0,29 gCO₂e sur un réseau à 450 g/kWh.
À titre de comparaison, Google a publié en 2025 une mesure réelle sur son parc : 0,24 Wh pour une requête texte médiane à Gemini. Notre chiffre est deux fois et demie plus élevé, ce qui est cohérent : nous avons pris un modèle dense de 405 milliards de paramètres et une réponse longue, là où la requête médiane à un assistant grand public est courte et servie par un modèle plus petit, souvent à experts spécialisés dont une fraction seulement s'active.
Source des 0,24 Wh : Elsworth et al., Google (2025), Measuring the environmental impact of delivering AI at Google Scale, repris sur le blog de Google Cloud : 0,24 Wh, 0,03 gCO₂e et 0,26 mL d'eau pour la requête texte médiane à Gemini, mesure qui inclut le serveur complet, le PUE et environ 10 % de machines en réserve. Autre mesure publiée par un opérateur, l'analyse de cycle de vie de Mistral Large 2 (Mistral AI, Carbone 4 et ADEME, 2025) : 1,14 gCO₂e pour une réponse de 400 tokens.
Les tokens qu'on ne voit pas : le raisonnement
Ces 0,64 Wh valent pour une petite question posée en passant. Mais l'usage professionnel de l'IA n'y ressemble pas du tout : on lui donne un gros document et on lui demande un vrai travail dessus. Et surtout, entre la question et la réponse, le modèle écrit énormément de texte que personne ne lit.
Si vous déroulez le détail d'une réponse d'un modèle récent, vous le voyez à l'œuvre : il reformule la question, pose un plan, essaie une piste, se rend compte qu'elle ne marche pas, revient en arrière, vérifie un calcul, recommence. Ce sont les tokens de raisonnement. Ils sont produits exactement comme les autres, un par un, au même coût énergétique, et ils sont d'ailleurs facturés comme des tokens de sortie par toutes les API du marché. Sur une tâche un peu réfléchie, il est courant que le modèle génère trois à dix fois plus de raisonnement que de réponse finale.
Le calcul : résumer un PDF de 50 pages en 10 pages
- Entrée : 30 000 tokens lus. 50 pages denses, à environ 450 mots la page, soit de l'ordre de 600 tokens par page.
- Réponse visible : 6 000 tokens générés. Les 10 pages du résumé.
- Raisonnement invisible : 18 000 tokens générés. Trois fois la réponse finale, en plans, brouillons, relectures et corrections. C'est le poste le plus lourd de toute la tâche.
Total : 30 000 tokens lus et 24 000 tokens écrits, soit 25 Wh à la prise et 11 gCO₂e. C'est 39 fois la requête simple calculée plus haut, et davantage que la recharge complète d'un smartphone. La leçon est là : ce qui coûte cher, ce n'est pas de poser une question, c'est de faire travailler le modèle.
Sources : le fait que les tokens de raisonnement soient produits puis facturés comme des tokens de sortie est documenté par OpenAI et par Anthropic, qui exposent tous deux le compteur de ces tokens dans leur API. Le nombre de tokens par page (600) et le ratio de raisonnement (3) sont des hypothèses de cette page, pas des mesures.
Le vrai sujet : multiplier par des milliards
0,29 gramme de CO₂ par requête, c'est négligeable à l'échelle individuelle : cent requêtes par jour pendant un an font 11 kg de CO₂e, soit 0,1 % de l'empreinte annuelle d'un Français.
Mais OpenAI annonçait à l'été 2025 environ 2,5 milliards de requêtes par jour sur ChatGPT. À 0,64 Wh la requête, cela fait 587 GWh par an et environ 264 000 tonnes de CO₂e, pour un seul service. C'est 19 fois l'empreinte de l'entraînement du modèle, chaque année.
Voilà la conclusion la plus importante de cette page : sur la vie d'un modèle, l'utilisation pèse bien plus lourd que la fabrication. Les 13 931 tonnes de l'entraînement font un titre de presse ; ce sont les milliards de requêtes qui font la courbe de demande électrique.
Source des 2,5 milliards de requêtes par jour : chiffre donné par Sam Altman à Axios en juillet 2025, relayé notamment par TechCrunch. C'est le seul ordre de grandeur public sur le trafic de ChatGPT : OpenAI ne publie pas de rapport environnemental et ne documente ni la taille de ses modèles, ni leur consommation. Le résultat en GWh est donc à prendre comme un ordre de grandeur, pas comme une mesure.
3. L'empreinte environnementale des datacenters
Tout ce qui précède ne compte que des kilowattheures. Or un datacenter, ce n'est pas qu'un compteur électrique : c'est du silicium gravé à l'autre bout du monde, des machines remplacées tous les quatre ans, de l'eau évaporée, du béton et des terrains. Quatre angles morts, dans l'ordre d'importance.
3.1 La fabrication du matériel, ou le carbone incorporé
Une H100, ce sont 80 milliards de transistors gravés en 4 nanomètres chez TSMC à Taïwan, de la mémoire HBM empilée en couches, un substrat de haute précision, du cuivre, de l'or, des terres rares. La micro-électronique est l'une des industries les plus intensives en énergie et en eau ultrapure qui soient : les usines de TSMC consomment à elles seules plus de 20 TWh par an, sur un réseau taïwanais encore alimenté à plus de 80 % par des énergies fossiles, autour de 490 gCO₂e/kWh.
Sources : rapport de développement durable de TSMC (le fondeur pesait à lui seul environ 8 % de l'électricité taïwanaise en 2023) ; Our World in Data pour l'intensité carbone du réseau de Taïwan.
Les analyses de cycle de vie convergent sur un ordre de grandeur : pour un serveur de calcul utilisé intensivement sur 4 à 6 ans, la fabrication représente 10 à 30 % de l'empreinte totale, l'électricité le reste. Mais attention au piège :
Plus l'électricité est décarbonée, plus la fabrication devient dominante. Un serveur d'IA installé en France ou en Suède, alimenté à 50 gCO₂e/kWh, voit la part de sa fabrication grimper à 40 à 50 % de son empreinte totale. C'est le même phénomène que pour la voiture électrique : quand on résout le problème de l'usage, il reste celui de la fabrication. Décarboner le réseau ne dispense pas de faire durer le matériel.
Source : Schneider et al., Google (2025), Life-Cycle Emissions of AI Hardware, la première analyse de cycle de vie publiée pour des accélérateurs d'IA (cinq générations de TPU, de l'extraction des matières premières jusqu'à la fin de vie). C'est ce travail qui documente à la fois la part du carbone incorporé et le fait qu'elle grimpe quand le réseau se décarbone.
3.2 La durée de vie des composants
Le carbone incorporé s'amortit sur la durée de vie du matériel : plus une carte sert longtemps, moins sa fabrication pèse par année d'usage. Trois durées cohabitent, et elles ne disent pas la même chose.
- La durée comptable : 5 à 6 ans. Microsoft en 2022, puis Alphabet en 2023, ont allongé la durée d'amortissement de leurs serveurs de 4 à 6 ans ; Meta l'a portée à 5,5 ans en 2025. Des décisions comptables qui ont mécaniquement gonflé leurs bénéfices affichés de plusieurs milliards de dollars chacune, et qui n'ont rien à voir avec la physique.
- La durée physique : plus courte qu'on ne croit. Un GPU d'entraînement tourne à pleine charge 24 heures sur 24, proche de sa limite thermique. Les 419 interruptions matérielles en 54 jours du run LLaMA 3 donnent la mesure : à cette intensité d'usage, la mémoire HBM et les cartes lâchent régulièrement.
- La durée économique : 3 à 4 ans, et c'est elle qui décide. Une H100 achetée 25 000 $ en 2023 n'est pas cassée aujourd'hui, elle est simplement moins rentable au kWh qu'une génération suivante. Le remplacement est dicté par le coût d'opportunité de l'espace au sol et de l'électricité, pas par la panne.
Cette dernière logique est la plus problématique du point de vue environnemental : elle amortit un carbone de fabrication très lourd sur très peu d'années, et elle produit un flux de déchets électroniques que le secteur ne documente quasiment pas. La seule bonne nouvelle est la seconde vie : les cartes déclassées de l'entraînement partent vers des tâches moins exigeantes, où elles servent encore plusieurs années.
Sources sur les durées d'amortissement : Computer Weekly pour Microsoft (4 à 6 ans, 3,7 Md$ de charges en moins sur l'exercice 2023), The Register pour Alphabet (3,9 Md$ d'amortissements en moins et 3,0 Md$ de résultat net en plus en 2023) et The Stack pour Meta (passage à 5,5 ans, 2,9 Md$ d'amortissements en moins). Ces changements sont déclarés dans les rapports annuels (formulaires 10-K) de chaque entreprise.
3.3 L'électricité : le problème n'est pas le total, c'est la vitesse
415 TWh en 2024, soit à peu près la consommation électrique totale de la France, et sans doute 945 TWh en 2030. En part du mix mondial, on passe de 1,5 % à un peu moins de 3 % : c'est réel, mais ce n'est pas une apocalypse. Le vrai problème est ailleurs, et il est triple.
- La vitesse. +15 % par an, quatre fois plus vite que le reste de la consommation électrique, et +30 % par an pour les seuls serveurs d'IA. On ne construit pas 10 GW de production décarbonée en dix-huit mois. Donc on prolonge des centrales à charbon qui devaient fermer, et on commande des turbines à gaz, dont les carnets de commande sont pleins jusqu'en 2030.
- La concentration géographique. Les États-Unis concentrent près de la moitié de la consommation mondiale des datacenters, et certains territoires beaucoup plus : en Virginie du Nord, en Irlande, les datacenters dépassent 20 % de la consommation électrique locale. Le réseau, lui, est dimensionné pour autre chose.
- Le report sur les autres usagers. Quand une demande nouvelle et inélastique arrive sur un réseau contraint, le prix monte pour tout le monde, et les investissements de réseau se répercutent sur les factures des ménages. Plusieurs États américains en font déjà l'expérience.
Sources : Agence internationale de l'énergie, Energy and AI (2025) pour les volumes mondiaux et les rythmes de croissance ; office statistique irlandais (CSO) : les datacenters ont consommé 22 % de l'électricité comptée en Irlande en 2024, contre 5 % en 2015 ; JLARC, Data Centers in Virginia (2024), le rapport de la commission d'évaluation du parlement de Virginie, qui chiffre le poids des datacenters sur la demande électrique de l'État ; Utility Dive, d'après le contrôleur de marché de PJM pour le report sur les autres usagers : 6,3 milliards de dollars des 16,4 milliards de la dernière enchère de capacité sont attribuables à la demande des datacenters.
3.4 L'eau
Un datacenter consomme de l'eau de deux façons. Directement, d'abord : la plupart des installations refroidissent par évaporation, parce que c'est de très loin le moyen le plus efficace en énergie d'évacuer de la chaleur. Cette eau-là est réellement consommée, elle part dans l'atmosphère. Indirectement ensuite, via l'électricité : produire un kWh dans une centrale thermique demande de l'eau de refroidissement.
L'indicateur est le WUE (Water Usage Effectiveness), en litres par kWh. Il va d'environ 0,3 L/kWh chez les meilleurs à plus de 1 L/kWh pour un site classique en climat chaud. Google a déclaré 10,9 milliards de gallons d'eau consommés en 2025, soit environ 41 millions de m³ et une hausse de 34 % en un an : de quoi couvrir la consommation domestique de 750 000 Français.
Ramené à l'échelle d'une requête, cela reste minuscule : l'analyse de cycle de vie de Mistral AI chiffre à 45 millilitres l'eau d'une réponse de 400 tokens, l'équivalent de trois cuillères à soupe. Le problème n'est donc pas le volume mondial, qui reste marginal devant l'agriculture ; c'est l'endroit : beaucoup de datacenters sont implantés en Arizona, au Chili, en Espagne, là où l'eau manque déjà. Le refroidissement en circuit fermé supprime cette consommation, mais consomme davantage d'électricité : il n'y a pas de solution parfaite, seulement des arbitrages entre eau et énergie pour minimiser l'impact environnemental global. Un arbitrage qui, malheureusement, est rarement regardé de près aux États-Unis : c'est le plus souvent la loi du moins cher qui l'emporte.
Sources : Google, rapport environnemental 2026 : 10,9 milliards de gallons d'eau consommés en 2025, en hausse de 34 % en un an, dont 7,7 milliards « réapprovisionnés » via des projets de restauration ; Mistral AI, Carbone 4 et ADEME (2025) pour les 45 mL par réponse de 400 tokens ; Google (2025) donne 0,26 mL pour une requête texte médiane à Gemini, un chiffre bien plus bas parce que le modèle et la réponse sont plus petits. La conversion : 10,9 milliards de gallons font 41 millions de m³, à comparer aux 54 m³ de consommation domestique annuelle d'un Français (office français de la biodiversité, Eaufrance).
3.5 Et le reste
- Le béton et les sols. Un campus de datacenters occupe des dizaines d'hectares de terrain artificialisé, avec des bâtiments massifs dont le béton et l'acier portent leur propre carbone de construction.
- Les groupes électrogènes. Chaque site dispose de générateurs diesel de secours, testés régulièrement, qui émettent des oxydes d'azote et des particules fines dans le voisinage immédiat.
- Le bruit. Les installations de refroidissement tournent en continu ; c'est le premier motif de contestation locale aux États-Unis.
- Les métaux. Cuivre pour les câbles et les échangeurs, or et argent pour les contacts, terres rares pour les aimants et les composants passifs, gallium et germanium pour certaines puces. Autant de chaînes d'approvisionnement fragiles et rarement documentées.
Ces quatre points sont qualitatifs : aucun chiffre n'est avancé ici, précisément parce qu'il n'existe pas de donnée agrégée fiable. Le chapitre sur les impacts locaux du rapport Energy and AI de l'Agence internationale de l'énergie et le rapport JLARC sur la Virginie sont les deux documents publics qui les abordent le plus sérieusement.
4. Où l'IA va chercher ses électrons
On a vu qu'on ne construit pas 10 GW de production décarbonée en dix-huit mois. Reste à savoir ce que les entreprises font, concrètement, quand elles ont besoin d'un gigawatt tout de suite. La réponse est beaucoup moins glamour que les communiqués de presse, et c'est elle qui détermine le vrai facteur d'émission du kilowattheure d'IA.
4.1 Le grand retour de la turbine à gaz
Le meilleur indicateur de ce qui se passe vraiment n'est pas un rapport climat, c'est un carnet de commandes. Celui des trois fabricants de turbines à gaz qui comptent est saturé :
- GE Vernova terminait 2025 avec un carnet de l'ordre de 80 GW de turbines à gaz, et son directeur général annonce que la production est pour l'essentiel vendue jusqu'en 2030.
- Mitsubishi Power a ses créneaux de production réservés pour 2027 et 2028, et cherche à doubler sa capacité.
- Siemens Energy affiche le carnet de commandes le plus élevé de son histoire, environ 136 milliards d'euros.
Autrement dit : même si un opérateur décidait aujourd'hui de construire une centrale à gaz, il devrait attendre la fin de la décennie pour être livré. Alors certains ne passent pas par la case centrale, et installent des turbines directement sur leur terrain.
Le cas xAI : des turbines d'abord, les autorisations ensuite
Pour alimenter Colossus, son supercalculateur de Memphis, xAI n'a pas attendu le réseau. Dès avril 2025, l'imagerie thermique identifiait plus de 30 turbines à gaz en fonctionnement sur le site, alors qu'une seule autorisation avait été délivrée, en juillet 2025.
Rebelote pour Colossus 2, de l'autre côté de la frontière d'État, à Southaven dans le Mississippi : des dizaines de turbines tournaient sans autorisation fédérale au titre de la qualité de l'air. Le régulateur du Mississippi a fini par autoriser, le 10 mars 2026, 41 turbines permanentes sur ce seul site. En parallèle, un loueur spécialisé, Solaris Energy Infrastructure, consacre environ 400 MW de turbines mobiles à xAI.
Memphis est une ville où la qualité de l'air est déjà un sujet de santé publique, et les quartiers concernés sont parmi les plus pauvres de la ville. C'est la version la plus brutale de ce que signifie « aller vite ».
Le même schéma se répète ailleurs, en un peu plus encadré :
- Stargate, à Abilene au Texas (OpenAI, Oracle, SoftBank, construit par Crusoe) : une centrale de 360 MW sur le site même, dont le permis a été déposé cinq mois avant l'annonce publique du projet. Crusoe a commandé 10 turbines GE Vernova fin 2024, puis 19 de plus en juin 2025, soit plus d'un gigawatt. Ce sont des turbines aérodérivatives, c'est-à-dire des réacteurs d'avion adaptés au sol : on les installe très vite, mais leur rendement est nettement plus faible que celui d'un cycle combiné. Rapide et sale, donc.
- Hyperion, en Louisiane (Meta) : le régulateur de l'État a autorisé l'électricien Entergy à construire trois centrales à gaz totalisant 2,26 GW pour alimenter ce seul campus, qui vise à terme plus de 5 GW. Meta finance l'ensemble, ainsi que des lignes à 500 kV.
Sources : Utility Dive et Power Engineering pour les carnets de commandes de turbines ; Data Center Dynamics et Mississippi Free Press pour les turbines de xAI ; Data Center Dynamics pour la centrale d'Abilene ; Data Center Dynamics pour les centrales d'Entergy en Louisiane.
4.2 Ce que font vraiment Meta, Google, Microsoft et Oracle
Tous ces acteurs mènent en réalité deux stratégies en parallèle, et il faut les distinguer pour comprendre quoi que ce soit. D'un côté, les électrons de tout de suite : du gaz, du réseau, tout ce qui se raccorde en dix-huit mois. De l'autre, des contrats d'achat d'électricité de long terme (des PPA, pour power purchase agreement) sur du bas carbone, signés pour quinze à vingt-cinq ans.
- Microsoft a signé un PPA de 20 ans avec Constellation qui finance le redémarrage de Three Mile Island 1 (835 MW), rebaptisé Crane Clean Energy Center, arrêté depuis 2019 et dont le retour est visé pour 2028. C'est le premier réacteur américain remis en service à la demande d'un client.
- Meta a les deux visages du secteur à lui tout seul. Côté nucléaire : un PPA de 20 ans avec Constellation sur la centrale de Clinton, dans l'Illinois (1 121 MW à partir de juin 2027), qui sauve une centrale que la fin d'un dispositif de soutien de l'État condamnait. Côté gaz : les 2,26 GW de Louisiane vus plus haut. Le même acteur, la même année.
- Google a la stratégie la plus diversifiée, et la plus tournée vers du nouveau bas carbone : PPA de 25 ans avec NextEra pour redémarrer Duane Arnold (615 MW, Iowa, arrêté depuis 2020, retour visé début 2029) ; contrat avec Kairos Power sur un petit réacteur modulaire à sels fondus, via la TVA ; 200 MW achetés à Commonwealth Fusion Systems, c'est-à-dire un pari sur une technologie qui ne fonctionne pas encore ; et de la géothermie profonde avec Fervo.
- Oracle illustre l'écart entre le discours et le chantier. Sur le terrain, c'est du gaz, à Abilene. Dans les conférences, Larry Ellison annonce depuis 2024 détenir des permis de construire pour trois petits réacteurs modulaires, sans jamais préciser où, avec quel constructeur, ni pour quand.
- Amazon, pour compléter le tableau, a signé avec Talen un contrat de 17 ans et 18 milliards de dollars portant sur 1 920 MW de la centrale nucléaire de Susquehanna, en Pennsylvanie.
Un PPA nucléaire, ça ajoute des électrons ou ça les déplace ?
La question mérite d'être posée, parce que la réponse n'est pas la même selon les contrats, et que le marketing les présente tous de la même façon.
Ceux qui ajoutent vraiment. Three Mile Island et Duane Arnold sont des réacteurs arrêtés : sans le contrat, ils resteraient fermés. Chaque MWh produit est un MWh bas carbone nouveau sur le réseau, qui chasse effectivement du gaz. Même chose pour les augmentations de puissance des réacteurs existants et, demain, pour les petits réacteurs modulaires.
Ceux qui déplacent. Acheter la production d'une centrale qui tournait déjà et qui aurait tourné de toute façon ne change rien au bilan carbone du réseau : cela réattribue seulement des MWh propres à un client, et laisse les autres consommateurs se partager ce qui reste, c'est-à-dire davantage de gaz. Le cas de Clinton est entre les deux : la centrale existait, mais elle était menacée de fermeture.
C'est exactement le raisonnement marginal de la partie 1, appliqué aux contrats plutôt qu'aux kilowattheures. La bonne question n'est jamais « d'où vient mon électricité sur le papier », c'est « qu'est-ce qui change sur le réseau parce que je suis là ».
Sources : communiqué de Constellation pour Three Mile Island et Microsoft ; communiqué Constellation et Meta pour Clinton ; World Nuclear News pour Duane Arnold et Google ; communiqué de Talen Energy pour Amazon et Susquehanna ; CNBC pour l'annonce d'Oracle.
4.3 L'effet Trump sur le mix électrique américain
Tout ce qui précède se déroule dans un contexte politique qui pousse très fort dans une seule direction. Dès janvier 2025, un décret présidentiel déclare une « urgence énergétique nationale » et ouvre au ministère de l'Énergie des pouvoirs d'exception. Trois conséquences concrètes, mesurables :
- Des centrales à charbon qui devaient fermer restent ouvertes. Le ministère de l'Énergie utilise l'article 202(c) du Federal Power Act, un outil prévu pour les urgences réelles, afin d'ordonner à des centrales de continuer à tourner. Il l'a invoqué plus de fois en un an que n'importe quelle administration précédente en quatre ans, et au moins quinze fermetures de centrales à charbon ont été repoussées.
- L'éolien et le solaire sont freinés administrativement. Les crédits d'impôt de l'Inflation Reduction Act sont rabotés, et les projets éoliens et solaires nécessitant une autorisation fédérale doivent désormais remonter jusqu'au secrétaire à l'Intérieur. Or c'est précisément le solaire accompagné de batteries qui s'installe le plus vite aujourd'hui, en dix-huit mois.
- La facture est socialisée. Maintenir en vie des centrales non rentables se paie, et se répercute sur les consommateurs, en plus du renchérissement de la capacité déjà évoqué plus haut.
Le résultat est paradoxal pour qui suit le raisonnement de cette page : on freine la ressource la plus rapide à déployer et la moins carbonée, pendant qu'on prolonge la plus carbonée. Le facteur d'émission marginal américain, celui qui détermine l'empreinte réelle de chaque requête, remonte au lieu de descendre. La question « l'IA est-elle compatible avec le climat ? » se joue là, bien plus que dans l'efficacité des puces.
Sources : DeSmog et Stateline sur les fermetures de centrales à charbon repoussées et leur coût ; E&E News sur l'usage de l'article 202(c) ; Bipartisan Policy Center pour une synthèse des décrets sur l'IA et l'énergie.
4.4 La carte que la France a en main
Et si on prend le problème par l'autre bout ? Un opérateur d'IA cherche trois choses : de l'électricité disponible, pas chère et, de plus en plus, bas carbone, parce que ses clients et ses investisseurs le lui demandent. La France coche les trois cases une bonne partie de l'année, et ce n'est pas une opinion : c'est dans le bilan de RTE.
de production décarbonée en 2025
exportés en net, un record, soit 17 % de la production
de CO₂ par kWh, contre 450 g pour le marginal gaz américain
En 2025, la production bas carbone française a atteint un maximum historique de 521,1 TWh, la production thermique fossile son plus bas niveau depuis 75 ans, et les émissions du système électrique leur minimum historique à 10,9 millions de tonnes de CO₂e. Le pays a exporté 92,3 TWh nets, soit plus que la consommation annuelle de la Belgique, pour 5,4 milliards d'euros de recettes.
Et pourtant, il y a du gâchis. Au premier semestre 2025, le prix de gros est passé en dessous de zéro pendant 363 heures, soit 8 % du temps : il faut alors payer quelqu'un pour qu'il prenne les kilowattheures. Les écrêtements de renouvelables, c'est-à-dire la production solaire et éolienne qu'on éteint faute de preneur, ont doublé en 2025. Ces épisodes ont tous le même profil : mi-saison, printemps, week-ends et ponts ensoleillés et ventés, étés hors canicule, quand la demande est basse, que le parc nucléaire est disponible et que le solaire tourne à plein.
Le client qui manque au réseau français
Un datacenter est presque le consommateur idéal pour ce problème : sa consommation est constante, elle est indifférente à la géographie (un calcul se fait aussi bien à Dunkerque qu'en Virginie), et une partie de ses tâches, typiquement l'entraînement d'un modèle, est déplaçable dans le temps. C'est exactement ce qui manque à un système électrique qui produit trop au printemps.
Et l'argument carbone est massif : à 50 gCO₂e/kWh contre 450 g pour le kilowattheure marginal américain, le même entraînement émettrait 9 fois moins en France. Les 13 931 tonnes de notre cas d'étude tomberaient à environ 1 548 tonnes.
Ça a commencé à bouger, et vite. Fin 2024, RTE avait réservé environ 5 GW de capacité de raccordement pour une quarantaine de projets de datacenters. En mai 2026, on en est à près de 18 GW pour environ 80 projets. Une procédure accélérée, issue du sommet sur l'IA de février 2025 et validée par la CRE, a identifié cinq sites capables d'accueillir 700 MW à 1 GW chacun en trois à quatre ans, à proximité immédiate des lignes à 400 000 volts ; quatre d'entre eux sont déjà attribués. Le plus gros projet annoncé, le Campus AI porté par MGX, Bpifrance, Mistral AI et NVIDIA, vise 1,4 GW en région parisienne, dans un réseau de sites qui monterait à 3 GW.
Ce qu'il ne faut pas dire pour autant
« La France a de l'électricité en trop » serait faux, et le raccourci se retournerait vite. Trois nuances honnêtes :
1. La contrainte, c'est l'hiver. Le surplus est saisonnier. Un datacenter d'un gigawatt ne s'efface pas un soir de février à 19 h, et la pointe hivernale reste le dimensionnement du système français.
2. La file d'attente est en partie spéculative. Les datacenters déjà raccordés ne consomment qu'environ 20 % de la puissance qu'ils ont réservée. Les 18 GW annoncés ne sont pas 18 GW de consommation à venir.
3. Le réseau met du temps. Un raccordement en haute tension demande 2 à 7 ans. C'est bien plus rapide que de construire de la production, mais bien plus lent que le cycle de décision d'une entreprise d'IA.
La formulation juste est donc : la France dispose d'électricité bas carbone disponible une bonne partie de l'année, et d'un réseau capable de l'acheminer si on planifie. C'est un avantage industriel réel, à condition de le traiter comme un sujet de planification et pas comme un slogan.
Ce qu'il faut retenir
L'entraînement d'un très grand modèle, c'est environ 10 000 à 15 000 tonnes de CO₂e
3,8 × 10²⁵ FLOPs, 26 millions d'heures de GPU, 31 GWh, environ 75 M$. À l'échelle d'une entreprise, c'est un investissement industriel ordinaire ; à l'échelle du climat, c'est l'empreinte annuelle de 1 500 Français.
Une requête coûte moins d'un gramme de CO₂, mais il y en a des milliards
0,64 Wh et 0,29 gCO₂e par requête. Sur un an, l'usage d'un seul grand service dépasse d'un facteur 19 l'empreinte d'entraînement de son modèle. Se culpabiliser pour une question posée à un chatbot, c'est se tromper de combat de trois ordres de grandeur ; ignorer la courbe agrégée, c'est se tromper de sujet.
Le facteur d'émission compte plus que le calcul physique
Le même modèle entraîné en France plutôt qu'aux États-Unis émettrait neuf fois moins. Le débat sur l'IA et le climat est en réalité un débat sur la localisation des datacenters et sur la vitesse de décarbonation des réseaux qui les alimentent.
Le compteur électrique n'est pas toute l'histoire
Fabrication des puces, durée de vie de quatre ans, eau de refroidissement, artificialisation, réseaux locaux saturés : autant d'impacts que le seul chiffre en kWh ne capte pas, et qui deviennent proportionnellement plus lourds à mesure que l'électricité se décarbone.
Aujourd'hui, l'IA se branche surtout sur du gaz, et la France a une carte à jouer
Turbines commandées jusqu'en 2030, centrales installées sur les parkings des datacenters, fermetures de centrales à charbon repoussées par décret : les électrons de l'IA américaine sont fossiles, et le facteur d'émission marginal y remonte au lieu de baisser. Pendant ce temps la France exporte 92 TWh, éteint des éoliennes faute de preneur et affiche 50 gCO₂e/kWh. Le même calcul, au même moment, avec neuf fois moins d'émissions : c'est un argument industriel, pas un argument moral.
📚 Toutes les sources et les hypothèses de calcul
Avertissement. Toutes les valeurs de cette page sont des ordres de grandeur, pas des mesures. Les seuls chiffres réellement publiés par un opérateur sont ceux de la fiche du modèle LLaMA 3.1, ceux du rapport de Google sur Gemini et ceux de l'analyse de cycle de vie de Mistral ; tout le reste est reconstruit à partir des caractéristiques du matériel et de la littérature. Les facteurs 1,4 (serveur complet) et 1,2 (PUE) sont des hypothèses centrales, favorables plutôt que défavorables. Chaque chiffre est renvoyé à sa source au fil de la page, juste sous le passage concerné.
Inspiration. Toute la partie sur l'entraînement doit beaucoup au cours Stanford CS229 : Building Large Language Models (LLMs) (Yann Dubois, Stanford Online, 2024).
Hypothèses d'inférence. Modèle dense de 405 milliards de paramètres servi en FP8 sur un nœud de 8 H100 (405 Go de poids, 27 To/s de bande passante cumulée, 1 979 TFLOPS de pic dense par carte, 40 % d'utilisation effective). Lot de 64 requêtes simultanées. Une requête type de 1 000 tokens lus et 500 tokens générés. Les modèles récents à experts spécialisés (mixture of experts) n'activent qu'une fraction de leurs paramètres par token et consomment donc nettement moins à taille égale.
- Meta, fiche du modèle LLaMA 3.1 : 30,84 M heures de GPU H100 (700 W), 8 930 tCO₂e en méthode « location-based », 0 tCO₂e en méthode « market-based » pour le modèle 405B
- Meta, The Llama 3 Herd of Models (2024) : 15,6 T tokens, 405 Md de paramètres, 16 000 H100, débit de 400 TFLOPS par carte, 419 interruptions non planifiées en 54 jours
- Hoffmann et al., DeepMind (2022), Training Compute-Optimal Large Language Models : l'optimum dit « de Chinchilla », environ 20 tokens par paramètre
- NVIDIA, fiche technique H100 : 700 W de TDP, 3,35 To/s de bande passante HBM3, pics de calcul BF16 et FP8
- Agence internationale de l'énergie, Energy and AI (2025) : 415 TWh en 2024, 945 TWh en 2030, 1 200 TWh en 2035, +30 % par an pour les serveurs accélérés
- Google (2025), mesure de l'impact environnemental de l'inférence : 0,24 Wh et 0,03 gCO₂e pour une requête texte médiane à Gemini, dont environ 10 % de machines en réserve
- Mistral AI, Carbone 4 et ADEME (2025), analyse de cycle de vie de Mistral Large 2 : 1,14 gCO₂e et 45 mL d'eau pour une réponse de 400 tokens
- EPA, eGRID : intensité carbone moyenne du réseau américain (386 gCO₂e/kWh) et taux marginal « non-baseload » national
- Uptime Institute, enquête mondiale sur les datacenters (2025) : PUE moyen mondial de 1,54, stable depuis six ans
- Google, rapport environnemental : consommation d'eau des datacenters, 10,9 milliards de gallons en 2025
- Schneider et al., Google (2025), Life-Cycle Emissions of AI Hardware : première analyse de cycle de vie publiée pour des accélérateurs d'IA (cinq générations de TPU), part du carbone incorporé et effet de la décarbonation du réseau sur cette part
- Kaplan et al., OpenAI (2020), Scaling Laws for Neural Language Models : l'origine de l'approximation C ≈ 6ND utilisée pour le budget de calcul
- Brown et al., OpenAI (2020), Language Models are Few-Shot Learners : GPT-3, 175 Md de paramètres pour 300 Md de tokens
- Pope et al., Google (2022), Efficiently Scaling Transformer Inference : pourquoi l'inférence est limitée par la bande passante mémoire, et ce que change le regroupement des requêtes
- Elsworth et al., Google (2025), Measuring the environmental impact of delivering AI at Google Scale : la méthode complète derrière les 0,24 Wh, 0,03 gCO₂e et 0,26 mL par requête médiane à Gemini
- GIEC, 5ᵉ rapport d'évaluation, annexe III : émissions en cycle de vie par filière, médiane de 490 gCO₂e/kWh pour un cycle combiné gaz
- EPA, AVERT : l'outil officiel américain de calcul des émissions marginales, région par région
- GHG Protocol, Scope 2 Guidance : la définition des méthodes « location-based » et « market-based »
- TechCrunch, d'après Axios (juillet 2025) : 2,5 milliards de requêtes par jour sur ChatGPT
- Office statistique irlandais (CSO) : les datacenters ont consommé 22 % de l'électricité comptée en Irlande en 2024, contre 5 % en 2015
- JLARC, Data Centers in Virginia (2024) : le rapport de référence sur le poids des datacenters dans la demande électrique d'un État américain
- Utility Dive, d'après le contrôleur de marché de PJM : 6,3 Md$ sur 16,4 Md$ de la dernière enchère de capacité attribuables à la demande des datacenters
- TSMC, rapport de développement durable : consommation électrique du fondeur, environ 8 % de l'électricité taïwanaise
- Our World in Data : intensité carbone du réseau électrique taïwanais
- Durées d'amortissement des serveurs : Computer Weekly (Microsoft), The Register (Alphabet) et The Stack (Meta)
- Google : PUE publié trimestriellement pour chacun de ses datacenters
- ADEME, Base Empreinte : facteurs d'émission de l'électricité française
- Carnets de commandes de turbines à gaz : Utility Dive (80 GW de carnet chez GE Vernova) et Power Engineering (production vendue jusqu'en 2030)
- Turbines à gaz de xAI : Data Center Dynamics et Mississippi Free Press (41 turbines autorisées à Southaven le 10 mars 2026)
- Data Center Dynamics : la centrale à gaz de 360 MW sur le site de Stargate à Abilene
- Data Center Dynamics : les trois centrales à gaz d'Entergy (2,26 GW) autorisées pour le campus Hyperion de Meta en Louisiane
- Constellation : PPA de 20 ans avec Microsoft et redémarrage de Three Mile Island 1 (835 MW), rebaptisé Crane Clean Energy Center
- Constellation et Meta : PPA de 20 ans sur la centrale de Clinton (1 121 MW à partir de juin 2027)
- World Nuclear News : PPA de 25 ans entre Google et NextEra pour redémarrer Duane Arnold (615 MW, Iowa)
- Talen Energy : contrat de 17 ans et 18 Md$ avec Amazon sur 1 920 MW de la centrale de Susquehanna
- CNBC : l'annonce de Larry Ellison sur trois petits réacteurs modulaires pour Oracle
- Politique énergétique américaine : DeSmog (quinze fermetures de centrales à charbon repoussées), E&E News (usage de l'article 202(c)), Stateline (coût pour les consommateurs) et Bipartisan Policy Center (synthèse des décrets IA et énergie)
- RTE, bilan électrique 2025 : 92,3 TWh exportés en net (17 % de la production), plus de 95 % de production décarbonée, 521,1 TWh bas carbone, thermique fossile au plus bas depuis 75 ans, 10,9 MtCO₂e
- SFEN, d'après RTE : 363 heures de prix négatifs au premier semestre 2025, soit 8 % du temps et pv magazine : les écrêtements de renouvelables ont doublé en 2025
- RTE, les data centers en chiffres clés : près de 18 GW de capacité réservée pour environ 80 projets en mai 2026 contre 5 GW fin 2024, 10 TWh consommés aujourd'hui (2 % de la consommation française), 23 à 28 TWh projetés en 2035, procédure accélérée et cinq sites de 700 MW à 1 GW
- Data Center Dynamics : le Campus AI de MGX, Bpifrance, Mistral AI et NVIDIA, 1,4 GW en région parisienne