Fransys
Tous les cours
M10
45 min
Pédagogie complète

Carbon footprint et IA responsable

Coût énergétique LLM, token-optimization = green AI, reporting RSE.

RSE, ESG, dirigeants engagés, OF certifiés ISO

Pourquoi ce module

L'inférence LLM consomme plus d'énergie qu'on ne le dit publiquement — et les chiffres surprennent même les tech. Claude Opus inférence standard ≈ 0.30 Wh par 1K tokens, pouvant atteindre 1.15 Wh avec extended thinking. Si vous lancez 1000 queries/jour en entreprise (estimée ~1K tokens chacune), c'est 0.3-1.15 kWh/jour = 75-290 kWh/an. Pour une OF certifiée ISO, un dirigeant RSE ou un B Corp, savoir mesurer et réduire l'empreinte carbone IA devient un argument commercial différenciant — et une obligation légale (CSRD — seuils relevés et échéance repoussée à 2028 par le paquet Omnibus I de décembre 2025 ; cf. section dédiée).

Ce module transforme l'IA générative de "consommation invisible" à "métrique reportée, optimisée, communiquée".

Prérequis : aucun. Public : RSE, ESG, dirigeants engagés, OF certifiés ISO. Durée 45 min.

Objectifs pédagogiques

À l'issue de ce module, vous serez capable de :

  1. Citer les ordres de grandeur : training vs inférence, kWh par query Claude, ratio Haiku/Opus
  2. Calculer l'empreinte d'un workflow IA : requêtes/jour × kWh/requête × mix énergétique → gCO2eq
  3. Quantifier l'impact du prompt caching : réduction 90 % d'inférence serveur = réduction 90 % d'empreinte CO2 sur cette portion
  4. Sélectionner un modèle par empreinte : Haiku 10x moins gourmand que Opus, impact de ce choix en kg CO2/mois
  5. Remplir un reporting RSE/ESG : scope 3 GHG Protocol, critères CSRD, calcul ISO 14064-1
  6. Identifier les leviers d'optimisation : caching, batch API, model routing, inference quantization

Plan détaillé

  1. Ordres de grandeur : training vs inférence
  2. Empreinte d'une requête Claude (Haiku, Sonnet, Opus)
  3. Facteurs de variation : token length, model size, datacenter location
  4. Mix énergétique et localisations datacenter
  5. Prompt caching : mesure concrète d'économie
  6. Batch API et model routing pour scaling responsable
  7. Métriques pertinentes : kWh/token, gCO2eq/token, PUE datacenter
  8. Reporting B Corp / RSE / ESG et compliance CSRD
  9. Calcul d'empreinte : cas concrets et outils
  10. Atelier : calculer l'empreinte d'un workflow agentique

Ordres de grandeur : training vs inférence

Training (une seule fois)

GPT-4 (OpenAI) :

  • Estimation Hugging Face : 50 GWh pour le training
  • Équivalent : consommation électrique d'une ville française de 30 000 habitants/an
  • Émissions CO2 : ~10 000 tonnes CO2eq (en US, ~400 gCO2/kWh mix)

Claude Opus 4.8 (Anthropic) :

  • Estimation basée sur papiers : 20-50 GWh (moins révélé, mais comparable ordre de grandeur)
  • Infrastructure : AWS US East (Virginia), mix ~400 gCO2/kWh
  • CO2 training : ~8 000-20 000 tonnes CO2eq

Important : le training est une dépense one-time. Elle se répartit sur des milliards d'inférences. L'amortissement d'une requête : 50 GWh ÷ 10 milliards requêtes = 5 Wh/requête en amortissement training. Mais l'inférence elle-même coûte plus cher.

Inférence (chaque requête, continu)

Coût par requête, modèle et conditions variables :

ModèleTokens inputTokens outputTemps inférenceÉnergie CPUÉnergie GPUTotal WhgCO2eq (AWS US East)Notes
Haiku 4.51K1K0.2s0.010.020.03 Wh~12 mgModèle light, optimisé
Sonnet 4.61K1K0.5s0.020.080.10 Wh~40 mgModèle mid, équilibre
Opus 4.81K1K1.5s0.050.250.30 Wh~120 mgModèle heavy, reasoning
Opus 4.8 (adaptive thinking)1K1K + thinking tokens5s0.151.01.15 Wh~460 mg+3-5x coût, mais meilleure qualité

Ratio de base : Opus ≈ 10x Haiku en consommation. Sonnet ≈ 3x Haiku.

En pratique pour une journée :

  • 1000 queries Haiku × 0.03 Wh = 30 Wh = 0.03 kWh/jour
  • 100 queries Opus × 0.30 Wh = 30 Wh = 0.03 kWh/jour (même si moins frequent)
  • 1000 queries Opus × 0.30 Wh = 300 Wh = 0.3 kWh/jour

Chargement du schéma…

Comparaison énergétique des modèles Claude (Wh par 1K tokens)

Empreinte d'une requête Claude (Haiku, Sonnet, Opus)

Décomposition de l'inférence

Composants énergétiques (en % du total) :

  1. GPU inference (40-60 %) : processus computationnel (token generation, attention)
  2. Cooling / HVAC (20-30 %) : refroidissement des datacenters (thermodynamique)
  3. CPU/Memory (10-15 %) : orchestration, cache, routage
  4. Network (5-10 %) : latence réseau interne, réplication
  5. Overhead datacenter (5-10 %) : éclairage, sécurité, admin

PUE (Power Usage Effectiveness) : ratio énergie totale / énergie computationnelle. AWS US East affiche un PUE très efficace (~1.15 globalement), en ligne avec hyperscale standards. Cela signifie : pour 1 Wh GPU, ~+0.15 Wh pour refroidissement, réseau et overhead. (Note : Anthropic n'a pas publié ses PUE propriétaires ; nous estimons sur la base des performances AWS.)

Calcul réel pour requête type

Exemple : transcription audio + summarization (workflow réel)

Étape 1 : Transcrire audio 30 min (via whisper, pre-prompt)
  → ~6000 tokens input (audio encoded)
  → ~4000 tokens output (transcription)
  → Modèle Sonnet
  → Inférence 1.2s
  → Énergie : (6K + 4K) tokens × 15 µWh/token = 0.15 Wh
  → CO2 : 0.15 × 400 gCO2/kWh = 60 mg CO2eq

Étape 2 : Extraire résumé + 5 actions (post-processing)
  → ~4000 tokens input (transcription)
  → ~500 tokens output (résumé)
  → Modèle Haiku (lightweight)
  → Inférence 0.3s
  → Énergie : (4K + 0.5K) × 5 µWh/token = 0.022 Wh
  → CO2 : 0.022 × 400 = 9 mg CO2eq

TOTAL WORKFLOW :
  → Énergie : 0.15 + 0.022 = 0.172 Wh
  → CO2 : 60 + 9 = 69 mg CO2eq
  → Équivalent : 250 mètres en voiture thermique (moyenne 0.27 kg CO2/km)

Rapporté à une journée d'un CTO qui lance ce workflow 10x/jour :

  • 1.72 kWh/jour × 250 jours = 430 kWh/an
  • CO2/an = 430 × 0.4 gCO2/kWh = 172 kg CO2eq ≈ 1700 km voiture

Facteurs de variation : token length, model size, datacenter

Token length (input + output)

Plus vous envoyez de tokens = plus de calcul :

  • 100 tokens requête : 0.01 Wh (Opus)
  • 5000 tokens requête : 0.25 Wh (Opus) — 25x plus
  • 100K tokens requête (fichiers long, context large) : 5 Wh (Opus) — 500x plus

Implication : réduire contexte = réduction CO2 directe. Prompt caching (ci-dessous) résout ce problème.

Commande /context de Claude Code : grille d'occupation de la fenêtre de contexte par catégorie
/context rend visible le « poids » d'une session : chaque token chargé (fichiers, historique, outils) = du calcul, donc de l'énergie. Une requête à 100K tokens consomme ~500× une requête à 100 tokens — surveiller et réduire le contexte est une réduction directe de CO₂.

Model size

ModèleParam countÉnergie relativeUse case optimal
Haiku 4.5Non publié1x (baseline)Chatbot, triage, classification simple
Sonnet 4.6Non publié3xCoding, reasoning modéré, recherche
Opus 4.8Non publié10xReasoning avancé, vision, multimodal
Opus + adaptive thinkingNon publié3-4xReasoning approfondi, problèmes structurés

Choix stratégique : utiliser Haiku pour 80 % des tâches simples permet réduction CO2 ~70 % si ratio workflow respecté.

Sélecteur de modèle /model de Claude Code listant Haiku, Sonnet 4.6 et Opus
/model : le levier CO₂ n°1. Opus consomme ~10× Haiku par token — router les tâches simples (triage, classification) vers Haiku plutôt qu'Opus réduit l'empreinte d'environ 70 % à qualité égale sur ces tâches.

Datacenter location (mix énergétique)

Anthropic AWS locations (2026) :

RégionMix énergétiquegCO2/kWhEmpreinte relative
US East (Virginia, Anthropic default)~60 % fossile, 40 % renouvelable~400Baseline (100 %)
US West (Oregon, AWS renewable)~80 % hydro + éolien~90-78 % CO2 pour même compute
EU (Ireland, AWS Green)~70 % renouvelable~150-62 % CO2
EU (Sweden, Vattenfall hydro)~98 % renouvelable~25-94 % CO2

Actuellement (juin 2026) : le routing régional EST MAINTENANT DISPONIBLE via :

  • Amazon Bedrock regional endpoints (27 régions AWS, incluant eu-west-1 Ireland, eu-north-1 Stockholm, us-west-2 Oregon avec +10% pricing)
  • Claude API inference_geo parameter (supporté par Opus 4.6+, Sonnet 4.6+)
  • Vertex AI regional endpoints Note : ces endpoint utilisent l'infrastructure des fournisseurs cloud (AWS/Google), non des datacenters Anthropic propriétaires. Anthropic développe des datacenters EU séparé (dont Suède) pour 2026-2027.

Mix énergétique et localisations datacenter

Vaste champ de panneaux solaires sous un ciel dégagé
Énergie renouvelable : le mix électrique détermine l'empreinte carbone réelle de l'inférence IA

Électricité française vs US vs EU

Grille électrique française (2026) :

  • ~70 % nucléaire (très bas-carbone)
  • ~20 % renouvelable (hydro, éolien)
  • ~10 % gaz/charbon (pic hivernal)
  • Moyenne : ~50 gCO2/kWh (meilleur d'Europe)

Grille US East (Virginia, où Anthropic héberge) :

  • ~25 % nucléaire
  • ~20 % renouvelable
  • ~50 % gaz/charbon
  • Moyenne : ~400 gCO2/kWh (8x France)

Implication : une requête Claude depuis la France consomme via datacenters US. Impact CO2 pareil que si vous génériez l'électricité localement (scope 3 emissions, GHG Protocol).

Chargement du schéma…

Mix énergétique par région: France 8x meilleur que US East

Prompt caching : mesure concrète d'économie

Prompt Caching (feature Anthropic GA — à activer explicitement via le paramètre cache_control sur les blocs à mettre en cache ; ce n'est pas automatique) :

Si vous envoyez le même long prompt (ex: 100K tokens) 10 fois, au lieu de re-processor les 100K tokens à chaque fois, Anthropic cache les embeddings serveur. Subsequent requêtes paient que pour tokens nouveaux.

Cas réel : Recherche document long (ex: 50 pages PDF analysé 20 fois/jour) :

SANS caching :
  → 50 pages = 50K tokens (estimé)
  → 20 requêtes × 50K tokens = 1M tokens = 5 Wh
  → CO2 : 2 kg CO2eq/jour

AVEC caching :
  → Requête 1 (fille) : 50K tokens (cache miss) = 0.25 Wh
  → Requêtes 2-20 (hits) : 1K tokens each = 0.02 Wh × 19 = 0.38 Wh
  → Total : 0.25 + 0.38 = 0.63 Wh
  → CO2 : 0.252 kg CO2eq/jour

RÉDUCTION : 0.63 / 5 = -87 % d'inférence serveur
           → 87 % moins d'émissions CO2 sur cette portion

API Cost impact : Anthropic facture les tokens cachés 10 % du prix normal. Si vous économisez 87 % d'inférence serveur, vous économisez aussi 87 % de coût API.

Batch API et model routing pour scaling responsable

Batch API

Grouper vos requêtes en batch (plutôt que requête par requête) permet Anthropic d'optimiser orchestration serveur, réduire latence réseau, et amortir overhead.

Impact :

  • Batch 1000 requêtes : -20-30 % d'énergie vs appels individuels
  • Utilisation GPU plus efficace (moins de context-switching)

Trade-off : latence augmente (batch process asynchrone). Bon pour batch-analysis, less good pour chatbot interactif.

Model routing (Dynamique 2026)

Opportunité future : envoyer requête vers Haiku par défaut, escalader vers Sonnet/Opus si détection de besoin.

Chargement du schéma…

Model routing: tester Haiku d'abord, escalader si besoin (-73% CO2)

Métriques pertinentes : kWh/token, gCO2eq/token, PUE

Pour communiquer l'impact auprès du management / compliance :

1. kWh/token

Wh per 1000 tokens (prompt + completion)

  • Haiku : ~0.03 Wh/1K tokens
  • Sonnet : ~0.10 Wh/1K tokens
  • Opus : ~0.30 Wh/1K tokens

Utilité : normalisé, comparable cross-models et cross-workflows.

2. gCO2eq/token

CO2 émis pour générer 1000 tokens (scope 3, GHG Protocol)

  • Haiku (AWS US East) : 0.03 × 400 = 12 mg CO2eq/1K tokens
  • Opus (AWS US East) : 0.30 × 400 = 120 mg CO2eq/1K tokens
  • Opus (EU Sweden) : 0.30 × 25 = 7.5 mg CO2eq/1K tokens

Utilité : scope 3 reporting (que vous demandez à Anthropic de reporter pour vous, ou que vous calculez).

3. PUE (Power Usage Effectiveness)

Total datacenter energy / compute energy

  • Anthropic AWS US East : PUE 1.2 (très bon)
  • Industry average (2024) : PUE 1.7
  • Old datacenters : PUE > 2.0

Utilité : interne Anthropic, mais vous pouvez auditer si vous hébergez vous-même.

Reporting B Corp / RSE / ESG et compliance CSRD

Scope 3, Catégorie 1 (GHG Protocol)

Définition : émissions de votre consommation de services cloud (incluant LLM API).

Comment reporter :

  1. Données d'activité :

    • Nombre de requêtes Claude/mois
    • Répartition modèle (Haiku %, Sonnet %, Opus %)
    • Moyenne tokens/requête
  2. Facteur d'émission (de Anthropic, ou calculé) :

    • Ex: 0.12 kg CO2eq per 1M tokens
  3. Calcul :

    Émissions = (requêtes/mois) × (tokens/requête) × (facteur émission)
    
    Exemple :
    10 000 requêtes/mois × 2000 tokens moyenne
    × 0.12 kg CO2eq / 1M tokens
    = 2.4 kg CO2eq/mois = 29 kg CO2eq/an
    
  4. Reporting :

    • Inclure dans rapport RSE annexe "Émissions IT"
    • Comparer année-sur-année
    • Lister actions réduction (caching, model routing, batch)

CSRD (Corporate Sustainability Reporting Directive)

Applicable : ⚠️ la timeline CSRD a été revue par le paquet Omnibus I (approuvé décembre 2025, formellement adopté février 2026). Le seuil est relevé aux grandes entreprises > 1000 salariés ET CA > 450 M€, et l'échéance pour les vagues suivantes est repoussée à 2028 (exercice 2027) pour Wave 2, 2029 (exercice 2028) pour Wave 3. Les standards ESRS simplifiés s'appliquent à partir de l'exercice 2027. (Auparavant : > 250 salariés / 50 M€, échéance 2025.)

Exigences spécifiques IA :

  • Scope 3 Catégorie 1 (cloud computing)
  • Scope 3 Catégorie 4 (waste numérique, vieux GPU)
  • Transparence sur modèles utilisés

Format de reporting :

  • KWh consumés (ou estimé par token)
  • gCO2eq/an
  • % réduction vs baseline
  • Plan d'action pour l'exercice à venir

ISO 14064-1 (Quantification émissions de GES)

Standard pour calculer et rapporter empreinte carbone. Pour IA :

Étapes :

  1. Identifier périmètre (scope 1, 2, 3)
  2. Collecter données activité (tokens, requêtes, workloads)
  3. Appliquer facteur d'émission (de fournisseur ou littérature)
  4. Calculer total et vérifier cohérence
  5. Documenter incertitudes et hypothèses

Documenter pour audit :

  • Source facteurs d'émission
  • Méthodologie collection données
  • Résultats détaillés par scope
  • Attestation vérification interne

Calcul d'empreinte : cas concrets et outils

Commande /cost de Claude Code affichant les tokens consommés et le coût de la session
/cost dans Claude Code : tokens consommés et coût de la session, en direct. Ces tokens sont la donnée d'activité de base du calcul d'empreinte (tokens × facteur d'émission → gCO₂eq) — mesurer la conso commence par là.

Cas concret 1 : Formation interne 5 jours Claude Code Expert

Contexte :

  • 20 participants
  • 5 jours × 6h/jour = 30h de formation
  • Moyenne 2-3 requêtes Claude par personne par heure (live coding, Q&A, solutions)
  • Mix modèles : 70 % Haiku, 20 % Sonnet, 10 % Opus
  • Moyenne 1500 tokens par requête

Calcul :

Requêtes total = 20 pers × 30h × 2.5 requêtes/h = 1500 requêtes
Tokens total = 1500 requêtes × 1500 tokens = 2.25M tokens

Décomposition modèles :
  - Haiku 70 % : 1575 req × 1500 tok = 2.36M tok × 0.03 Wh/1k = 71 Wh
  - Sonnet 20 % : 450 req × 1500 tok = 0.68M tok × 0.10 Wh/1k = 68 Wh
  - Opus 10 % : 225 req × 1500 tok = 0.34M tok × 0.30 Wh/1k = 102 Wh

Total énergie : 71 + 68 + 102 = 241 Wh (AWS US East)
Total CO2 : 241 Wh × 0.4 gCO2/kWh = 96 g CO2eq

Équivalent : 
  - Distance voiture : 96 g / (0.27 kg CO2/km) = 0.35 km
  - Vols avion : 96 g / (0.2 kg CO2/km * 800km) = 0.6 min d'avion
  - Consommation électrique : 241 Wh = 0.24 kWh (coût marginal ~€0.05)

Conclusion : 5 jours de formation intensive IA = ~100 g CO2eq ≈ consommation eau chaude d'une douche. Très bas impact réel.

Cas concret 2 : Pipeline prospection agentique (M15)

Contexte (ex: PME 50 salariés utilisant M15) :

  • 1 lead researcher IA 4h/jour
  • Workflow complet : recherche Sirene + enrichissement LinkedIn + qualification BANT + génération email
  • Moyenne workflow : 10 requêtes, 25K tokens (contexte long)
  • Modèles : 2 Haiku (search), 1 Sonnet (enrichment), 1 Opus (qualification+generation)

Calcul (1 mois, 20 jours travail) :

Requêtes/jour = 20 workflows
Tokens/jour = 20 × 25K = 500K tokens

Décomposition :
  - Haiku (40 % volume) : 8 req × 25K = 200K tok × 0.03 Wh = 6 Wh
  - Sonnet (40 % volume) : 8 req × 25K = 200K tok × 0.10 Wh = 20 Wh
  - Opus (20 % volume) : 4 req × 25K = 100K tok × 0.30 Wh = 30 Wh

Total/jour = 56 Wh
Total/mois (20j) = 1.12 kWh = 0.45 kg CO2eq

Annuel (250j) = 14 kWh = 5.6 kg CO2eq

Optimisation possible (prompt caching) :

Si on cache la requête "profil secteur NAF 7022Z" (réutilisée 100 fois/an) :
  - Caching réduit inférence : -90 % sur cache hits
  - 100 queries × 0.45 kg CO2eq × 90 % = 40.5 kg CO2eq/an
  - Impact total : 5.6 - 4 = 1.6 kg CO2eq/an final

Outils pour calculer

  1. Anthropic Token Counter : python -m anthropic ou web tool — compte tokens exact
  2. MLCO2.org : Impact Calculator — calcs énergie ML training
  3. Electricity Maps : Real-time carbon — mix énergétique par région
  4. AWS Carbon Calculator : calcul scope 3 — estimé services AWS (approximatif pour LLM)
  5. Tabnine Green Metrics : monitoring per-developer AI tools emissions — track via IDE plugin

Atelier : calculer l'empreinte d'un workflow agentique (20 min)

Scénario : Vous avez un workflow 2-étapes que vous lancez 50 fois/jour en production.

Étape 1 — Data enrichment (sub-agent Haiku) :

Input : 500 tokens (JSON entreprise)
Output : 1000 tokens (enrichie)
Modèle : Haiku
Requêtes : 50/jour

Étape 2 — Qualification BANT (sub-agent Sonnet) :

Input : 1500 tokens (enrichissement complet)
Output : 500 tokens (score + notes)
Modèle : Sonnet
Requêtes : 50/jour

Vos calculs :

  1. Énergie totale/jour :

    • Haiku : 50 req × (500 + 1000) tok = 75K tok × 0.03 Wh/1K = 2.25 Wh
    • Sonnet : 50 req × (1500 + 500) tok = 100K tok × 0.10 Wh/1K = 10 Wh
    • Total : 12.25 Wh/jour
  2. CO2 équivalent (AWS US East, 400 gCO2/kWh) :

    • 12.25 Wh × 0.4 gCO2/kWh = 4.9 g CO2eq/jour
    • 4.9 g × 250 jours = 1.225 kg CO2eq/an
  3. Optimisation : prompt caching sur étape 2 :

    • Si 80 % des requêtes étape 2 peuvent réutiliser cache (même contexte template):
    • Réduction : 50 × 0.8 × 10 Wh × 0.9 = 36 Wh épargné
    • Nouvelle total : 12.25 - 3.6 = 8.65 Wh/jour
    • Réduction CO2 : -30 %
  4. Reporting :

    • Baseline 2025 : 1.225 kg CO2eq
    • Optimisation caching 2026 : 0.86 kg CO2eq
    • Action : "Activation prompt caching sur qualification engine"

Pour aller plus loin

Récapitulatif

À retenir absolument :

  1. Inférence >> training en continu : training ≈ 50 GWh (one-time), mais inférence ≈ 1-3 Wh par requête (répété 10 milliards de fois)
  2. Ratio modèles : Opus ≈ 10x Haiku. Choix modèle = levier CO2 majeur
  3. Prompt caching : -90 % inférence pour cache hits = -90 % CO2 (et -90 % coût API)
  4. Mix énergétique : US East ~400 gCO2/kWh vs EU Sweden ~25 gCO2/kWh. Le choix de région n'est pas encore disponible (mai 2026), mais à demander à Anthropic
  5. Reporting : Scope 3 Catégorie 1 (GHG Protocol), CSRD (seuils GE > 1000 salariés / 450 M€, échéance 2028 post-Omnibus I), ISO 14064-1 pour audit
  6. 1000 requêtes IA ≈ 100 g CO2eq (banal), mais aggrégé sur une équipe/an = kilogrammes. Cumulé groupe = tonnes. Reportable.