Fransys
Tous les cours
M4
2 h
Pédagogie complète

Cross-model evaluation : Claude vs concurrents

Panorama 2026 : Claude Fable 5 / Opus 4.8 / Sonnet 5 / GPT-5.5 / Gemini 3 / Llama 4 / DeepSeek / Mistral. (Fable 5 & Mythos 5 : accès restauré le 1er juillet après l'épisode export-control du 12 juin — traité en cas d'école).

Décideurs tech, architectes, consultants, formateurs

Pourquoi ce module

En 2026, le panorama LLM compte 12–15 modèles vraiment compétitifs. Choisir Claude par défaut sans comparer expose à 30–50 % de coûts ou latence excessifs. Pire : une startup choisit GPT-5 pour "sécurité" mais sacrifie 20 % de vitesse et 2 × de coûts vs Haiku pour son cas d'usage réel (classification).

Ce module donne la matrice de décision par cas d'usage et apprend à lire les benchmarks publics avec recul critique. Résultat : vous saurez quand Claude est le bon choix, quand Gemini Flash l'est, quand Llama ou DeepSeek sont mieux, et surtout, pourquoi les benchmarks MMLU 2025 ne disent rien de votre problème.

Sélecteur /model de Claude Code : Opus 4.8, Sonnet 4.6, Haiku 4.5, avec Fable 5 suspendu du 12 juin au 1er juillet
Côté Claude, l'arbitrage se fait dans le CLI (/model) entre Opus 5 (défaut Opus depuis le 24 juillet) / Sonnet 5 (défaut Claude Code depuis le 30 juin) / Haiku 4.5 — et Fable 5, dont l'accès a été restauré le 1er juillet 2026 après trois semaines de suspension export-control. (Capture antérieure au 24 juillet : la ligne Opus s'affiche désormais « Opus (1M context) ».) Ce module se concentre sur le choix stratégique parmi la gamme Claude et les concurrents (GPT, Gemini, Llama, DeepSeek, Mistral).
Balance en équilibre avec des poids symboles de la comparaison et du pesage des options
Comparatif modèles : équilibrer coût, vitesse, qualité et complexité pour chaque cas d'usage

Objectifs pédagogiques

À l'issue de ce module, vous serez capable de :

  1. Comparer objectivement Claude vs GPT-5.5 vs Gemini 3 vs Llama : forces/faiblesses documentées, pas marketing
  2. Lire les benchmarks avec scepticisme : SWE-Bench fiable, MMLU obsolète, MMMU pour vision, connaître limites
  3. Utiliser Anthropic Workbench live : comparer prompts côte à côte sur 5 modèles, mesurer qualité + latence + coût
  4. Construire matrice décision : axe "sécurité IA" × "vitesse" × "coût" → recommandation modèle
  5. Identifier vendor lock-in et stratégies d'abstraction : polyglot LLM fallback, circuit breaker
  6. Calibrer seuils qualité par modèle : quand Haiku suffit (95 %), quand Opus nécessaire (5 %)
  7. Évaluer Opus 4.8 sur tâches longues : protocole reproductible et responsable avec reasoning, et savoir quand l'effort supplémentaire se justifie (Fable 5, suspendu du 12 juin au 1er juillet 2026, est de nouveau accessible)
  8. Comprendre la géopolitique des modèles frontière : pourquoi la puissance en cybersécurité s'accompagne de restrictions opérationnelles imprédictibles (export control, embargo)

Plan détaillé

  1. Panorama 2026 : Claude, OpenAI, Google, Meta, DeepSeek, Mistral
  2. Forces documentées de Claude (code, instruction following, refus calibré)
  3. Faiblesses de Claude (latence Opus, recall multi-step parfois)
  4. Benchmarks : SWE-Bench, MMLU, HumanEval, MMMU (interpréter avec recul)
  5. Competitive matrix par domaine
  6. Anthropic Workbench : setup et A/B test live
  7. Tester Claude sur tâches longues : protocole Opus 4.8 (capacités + sécurité défensive)
  8. Étude de cas : Opus 4.8 construit un outil DevSecOps de A à Z 8b. Fable 5 : capacités, épisode export-control (12 juin → 1er juillet) et retour
  9. Coûts + latence : comparatif 2026
  10. Vendor lock-in : patterns d'abstraction
  11. Cas pratique : audit "devrions-nous switcher?"
  12. Atelier : construire votre matrice de décision

Panorama 2026 : modèles en production

⚠️ Données concurrentes volatiles (panorama mai 2026) : prix, fenêtres de contexte et scores des modèles non-Anthropic (GPT, Gemini, Llama, DeepSeek, Mistral) évoluent au mois. Les chiffres ci-dessous sont un instantané — revérifiez sur les pages officielles avant toute décision d'achat. Les données Claude sont à jour au 30 mai 2026.

Voici le panorama complet et comment décider :

Chargement du schéma…

Segmentation marché LLM 2026 par coût et capacité
ModèleContexteInput $/1MOutput $/1MLatencePoints forts
Fable 5 🆕1M tokens$10$50adaptiveFrontière GA (9 juin 2026) — suspendu du 12 juin au 1er juillet (export control), accès restauré globalement ; coding agentique, raisonnement, vision, long-contexte
Opus 4.81M tokens$5$2510–15 secReasoning long, code génération, instruction following
Sonnet 5 🆕1M tokens natif$2 promo (puis $3)$10 promo (puis $15)4–8 secDéfaut Claude Code/claude.ai depuis le 30 juin ; agentique proche d'Opus 4.8, hallucinations en baisse (promo jusqu'au 31 août 2026)
Sonnet 4.61M tokens$3$154–8 secÉquilibre qualité/vitesse (génération précédente)
Haiku 4.51M tokens$1$51–3 secClassif, filtrage, ultra-cheap

🎚️ effort change la donne (Claude 4.6+). Les chiffres de coût/latence ci-dessus ne sont pas figés : output_config: {effort: "low"|"medium"|"high"|"xhigh"|"max"} + thinking: {type: "adaptive"} règlent profondeur de raisonnement et verbosité par requête. Un Opus en low peut être plus rapide/économe qu'un Sonnet en high. Comparez donc (modèle × effort), pas seulement les modèles. Rappel : budget_tokens est retiré sur Opus 4.7/4.8 (400) ; max est réservé au tier Opus ; xhigh est le défaut coding de Claude Code.

Claude Fable 5 / Mythos 5 — la nouvelle frontière (9 juin 2026)

Anthropic a ouvert au public sa classe la plus puissante, issue du programme Mythos (preview avril 2026, Project Glasswing, réputée pour la découverte autonome de zero-days). La frontière est désormais scindée en deux :

  • Claude Fable 5 (claude-fable-5) — accès restauré le 1er juillet 2026 après trois semaines de suspension export-control (12 juin → 1er juillet, voir épisode ci-dessous) : le modèle le plus capable, disponible sur Claude API, claude.ai, Claude Code, Cowork, Claude Platform on AWS, Bedrock, Vertex AI, Microsoft Foundry. 1M tokens, 128k sortie, adaptive thinking toujours actif, 10 $ / 50 $ par M tokens.
  • Claude Mythos 5 (claude-mythos-5) — non‑GA : même modèle de fond, garde‑fous levés sur certains domaines, réservé aux partenaires Project Glasswing (cyberdéfense/infra) et chercheurs bio vérifiés.
Capture historique : sélecteur /model montrant Fable 5 (suspendu le 12 juin 2026)
Le sélecteur /model avec Fable 5most capable for your hardest and longest-running tasks · uses your limits ~2× faster than Opus »). Accès révoqué pour ressortissants non-US le 12 juin, restauré le 1er juillet 2026. s = activer sur la session courante, Enter = en faire le défaut.

🛡️ Garde‑fous Fable 5 (à connaître). Des classifieurs surveillent un périmètre étroit — génération d'exploits cyber, biologie/chimie, distillation de modèle. Quand une requête les déclenche (< 5 % des sessions), la réponse bascule vers Opus 4.8. Au lancement, ce basculement était silencieux ; depuis les correctifs du 11 juin 2026, il est affiché à l'utilisateur, et les refus côté API incluent une raison explicite. Concrètement : si un prompt de test « sécurité » vire à l'offensif, c'est Opus 4.8 qui répond (et vous le verrez) — d'où l'intérêt d'un protocole de test légitime sur une plateforme accessible (cf. § Tester Claude sur tâches longues).

⚠️ L'épisode du garde‑fou invisible (9–11 juin 2026) — un cas d'école. Au lancement, le garde‑fou anti‑distillation ne refusait pas : il dégradait silencieusement les sorties suspectées de servir à entraîner un autre modèle (prompts modifiés, réponses intentionnellement défectueuses, sans avertissement). Tollé immédiat des chercheurs ; le 11 juin, Anthropic s'excuse (« we made the wrong trade-off ») et transforme le mécanisme en refus explicite. Les premiers jours ont aussi produit des faux positifs très visibles (un « Hello » bloqué, le mot « cancer » signalé en biosécurité, un CV Application Security Architect refusé) — en cours de correction. Deux leçons : la couche sécurité d'un modèle itère indépendamment du modèle lui‑même (ce que vous testez cette semaine ne se comportera pas comme le mois prochain), et un résultat obtenu entre le 9 et le 11 juin sur une tâche « façon dataset » (données synthétiques, paires question‑réponse) a pu être dégradé — re‑testez. Sources : Gizmodo · The Register.

🛑 L'épisode export-control (12 juin 2026) — géopolitique & frontière logicielle. Le 12 juin, le gouvernement US a émis une directive de sécurité nationale (export control) : Anthropic a suspendu tout accès à Fable 5 et Mythos 5 pour tous les ressortissants non-US, y compris à l'intérieur des USA et sur les employés étrangers d'Anthropic eux-mêmes. Le déclencheur officiel : un jailbreak potentiel d'un périmètre étroit des garde-fous de Fable 5 (limitation de génération d'exploits cyber / identification de vulnérabilités logicielles), jugé trop risqué pour la sécurité critique US. Anthropic a publiquement désapprouvé ce jugement (« un jailbreak aussi étroit ne justifie pas cette mesure ») et a rencontré la Maison Blanche pour contester. Conséquences pour la formation à l'époque : les stagiaires français ont perdu l'accès à Fable 5 pendant trois semaines, rendant tout atelier hands-on injouable (résolu depuis le 1er juillet — voir fin d'épisode ci-dessous). Angle pédagogique : c'est une leçon réelle de sécurité/géopolitique — les modèles frontière subissent des restrictions opérationnelles imprédictibles, et la puissance se paie par un risque réglementaire (lire M9 Responsabilité et M11 Sécurité opérationnelle). Sources : Anthropic Official Statement · CNBC (12 juin 2026) · CNN (13 juin 2026) · Nat. Law Review.

Fin d'épisode : restrictions levées (1er juillet 2026). Après trois semaines de négociation, le Department of Commerce a levé l'export control sur Fable 5 et Mythos 5 : Anthropic n'a plus besoin de licence d'exportation, en échange d'engagements — détection proactive des risques de sécurité des modèles, co-construction de protocoles pour les futures releases avec le gouvernement, et signalement des activités malveillantes détectées. L'accès à Fable 5 est restauré globalement depuis le 1er juillet (claude.ai, Claude Code, Claude Platform, Cowork) — les stagiaires français y ont de nouveau accès. Une vérification d'identité (KYC) pour certains crédits Fable 5 est évoquée dans la presse mais non confirmée officiellement. La leçon de l'objectif 8 reste entière : trois semaines d'indisponibilité imprévisible, c'est exactement le risque réglementaire qu'on provisionne dans une matrice de décision. Sources : Forbes (1er juillet 2026) · NBC News · Al Jazeera.

🕵️ Épilogue : l'affaire du marqueur caché (1er–3 juillet 2026). Dans la même semaine, des chercheurs ont découvert que Claude Code embarquait depuis mars un code de détection dissimulé (obfusqué XOR) : timezone Asia/Shanghai/Asia/Urumqi + proxy comparé à une liste de 147 domaines chinois → marquage invisible de la sortie (format de date altéré, apostrophe substituée). Anthropic a reconnu une expérience anti-distillation visant les revendeurs non autorisés — contexte : une lettre du 10 juin accuse des entités liées à Alibaba d'une campagne de distillation (~29 M d'échanges, ~25 000 comptes) — et a retiré le mécanisme sous le tollé. Alibaba a répliqué en bannissant Claude Code en interne (10 juillet), invoquant un risque de backdoor. Leçon pour la matrice de décision : un outil closed-source peut embarquer de la télémétrie non documentée — la transparence de la chaîne d'outillage est un critère de choix au même titre que le prix (cf. M9 confiance/gouvernance). Sources : The Register · the-decoder.

Comparatif : Fable 5 surclasse Opus 4.8 sur la plupart des benchmarks publics reportés (p. ex. SWE‑Bench Pro ~80 % contre ~69 %), mais à 2× le prix d'Opus. Le surcoût ne se justifie que sur les tâches réellement difficiles (cf. § Coûts). Sources : annonce officielle · doc Models.

🔄 Opus 5 (24 juillet 2026) rebat cet arbitrage — et c'est le point à retenir du module. Fable 5 reste à 10 $ / 50 $, Opus 5 arrive à 5 $ / 25 $ (le tarif d'Opus 4.8, inchangé). L'écart de prix reste donc de , mais l'écart de capacité s'est resserré : sur CursorBench 3.2, Anthropic annonce Opus 5 à 0,5 % du score de pointe de Fable 5, pour moitié prix par tâche ; sur OSWorld 2.0, Opus 5 dépasse Fable 5 à « un peu plus du tiers du coût ». Ajoutez ARC-AGI 3 (×3 vs le meilleur suivant) et Frontier-Bench v0.1 (plus du double d'Opus 4.8, à coût par tâche inférieur).

Conséquence pour votre matrice de décision : la fenêtre où Fable 5 se justifie s'est nettement rétrécie. La question n'est plus « ai-je une tâche difficile ? » mais « ai-je une tâche difficile sur laquelle Opus 5 échoue mesurablement ? ». Sans cette mesure, le réflexe Fable 5 est une dépense doublée par confort. Testez d'abord Opus 5, et ne montez que sur échec constaté — c'est exactement la discipline du § Lire les benchmarks avec scepticisme appliquée à la gamme Claude elle-même.

⚠️ Et n'oubliez pas le risque réglementaire documenté ci-dessus : Fable 5 a été indisponible trois semaines en juin 2026. Opus 5 n'a jamais été soumis à ces restrictions d'export. Sur un usage de production ou de formation, la disponibilité prévisible est un critère au même titre que le score de benchmark. (Source : annonce Opus 5.)

🔄 Mise à jour juin 2026. Le rythme de sortie côté OpenAI/Google est rapide : OpenAI est passé de GPT‑5 à GPT‑5.5 (sortie avril 2026), Google de Gemini 2.5 à Gemini 3 / 3.1 Pro (début 2026) avec une famille Gemini 3.5 émergente. Les tarifs/contextes ci‑dessous sont à jour à cette date ; revérifiez sur les pages officielles avant de citer un chiffre.

GPT-5.5 (OpenAI)

Sortie avril 2026, modèle phare d'OpenAI. Tarifs et contexte officiels (openai.com) :

ModèleContexteInputOutputNotes
GPT-5.51M tokens (≈1,05M), 128K output max$5$30Coding/recherche/analyse, multimodal ; output ~2× plus cher que l'input chez OpenAI
GPT-5.5 pro1M tokens$30$180Variante « pro » haut de gamme, raisonnement maximal
GPT-5 miniTier économique de la famille GPT‑5 (vérifier le tarif courant sur openai.com)

Gemini (Google) — 3 / 3.1 Pro

Google a remplacé Gemini 2.5 par la famille Gemini 3 début 2026 (puis 3.1 Pro, et une famille 3.5 en cours de déploiement). Tarifs officiels (blog.google) :

ModèleContexteInputOutputNotes
Gemini 3 / 3.1 Pro1M tokens$2 (≤200K)$12 (≤200K)Au‑delà de 200K tokens : $4 / $18. Cœur d'intelligence, multimodal natif
Gemini 3 Flash1M$0.50$3Frontier « rapide » pour agents/coding
Gemini 3.1 Flash Lite1M$0.25$1.50Le plus économique de la gamme, classification

Llama 4 (Meta) — open-source

ModèleContexteDéploiementCoûtLatencePoints forts
Llama 4 70B8K–128KAuto-hébergé ou clouds~$0.50/1M (self)3–5 s (self)Poids ouverts, fine-tuning autorisé, sans restriction commerciale
Llama 4 405B128KAuto-hébergé~$2/1M10–15 sBon suivi d'instructions, qualité quasi-propriétaire

DeepSeek-V3 (DeepSeek, Chine)

ModèleContexteCoûtLatenceRéputation
DeepSeek-V3128K~$0.27/1M (très bon marché)4–6 sBon raisonnement, excellent rapport qualité/prix ; questions sur la provenance des données

Mistral Large 3 (Mistral AI)

ModèleContexteCoûtLatencePoints forts
Mistral Large 332K$2/1M3–5 sOptimisé FR, option hébergée en UE, API ouverte

Forces documentées de Claude

1. Suivi d'instructions (excellent)

Claude interprète les prompts complexes avec nuance.

# Test : "Génère du JSON, ne mets JAMAIS de guillemets aux clés"
prompt = """Génère du JSON pour des données utilisateur. CRITIQUE : jamais de guillemets autour des clés, syntaxe non-quotée.
Format :
{ username: "alice", age: 30 }

Utilisateur : alice, 25 ans"""

# Sortie Claude Opus :
# { username: "alice", age: 25 }

# Sortie GPT-5 (retombe souvent sur le JSON par défaut) :
# { "username": "alice", "age": 25 }

# Sortie Llama :
# Error: Invalid JSON syntax

Avantage : Claude respecte les instructions « limites » ; GPT-5 retombe sur du JSON « propre » malgré la consigne.

2. Génération de code + débogage

Claude excelle en raisonnement sur le code et en détection de bugs. Benchmarks :

  • HumanEval (coding simple) : Claude 95,2 %, GPT-5 96,1 %, Llama 87 %, DeepSeek 96,5 % (benchmark saturé)
  • SWE-Bench Verified (vrais tickets GitHub) : Claude 70 %, GPT-5 65 %, Llama 55 %, DeepSeek 68 % (benchmark pertinent)

Test terrain : audit de 10 bugs de sécurité Python. Claude en repère 8/10, GPT-5 7/10, Haiku 6/10.

3. Refus calibré (conscient de la sécurité)

Le refus de Claude est prévisible et explicable. Là où GPT-5 refuse parfois des demandes anodines, Claude reste cohérent.

Prompt : « Comment optimiser ma requête Django ORM pour la pagination ? »
Claude : « Voici un paginateur optimisé… [code] » ✅
GPT-5 : « C'est une optimisation connue. Voici comment… [code] » ✅

Prompt : « Comment hameçonner des utilisateurs ? »
Claude : « Je ne peux pas aider au phishing. En revanche, je peux expliquer les défenses anti-ingénierie sociale… » (refus clair)
GPT-5 : [silence, timeout, ou refus générique] ❌ (moins informatif)

4. Constitutional AI (alignement par conception)

L'entraînement de Claude s'appuie sur une constitution (jeu de principes) plutôt que du RLHF pur. Bénéfices : valeurs plus cohérentes, moins de surprises au jailbreak. Traité à fond dans M9.

Faiblesses de Claude

1. Latence (Opus)

Opus peut prendre 10–15 s sur un raisonnement complexe (Gemini 3 Pro ≈ 6–10 s, Haiku 4.5 ≈ 1–3 s) : peu adapté au chat temps réel.

Parade : descendre en gamme (Sonnet, Haiku) ou baisser l'effort — l'arbitrage modèle × effort est détaillé dans le panorama ci-dessus et côté coûts dans M2.

2. Rappel sur très longs documents (> 50K tokens)

Le contexte est long mais pas parfait : une information enfouie en plein milieu peut être moins bien restituée (lost-in-the-middle).

Parade : structurer le contexte, ou passer en RAG. On ne la réexplique pas ici — c'est le cœur de M5 (long-contexte) et de M3 (RAG, validation).

3. Audio natif

GPT-4o accepte l'audio en entrée nativement ; Claude passe par une transcription texte (étape et latence en plus).

Parade : pour du tout-texte, Claude convient ; pour de l'audio bout-en-bout, GPT-4o est devant.

Benchmarks : lire avec scepticisme

⚠️ Chiffres illustratifs. Les scores ci‑dessous (MMLU, HumanEval, SWE‑Bench, MMMU) servent à illustrer la méthode de lecture, pas à donner un classement figé : ils bougent à chaque release et ne sont pas tous re‑vérifiables sur source primaire à la date de lecture. Pour un classement à jour, consultez les leaderboards vivants (SWE‑bench, LMArena) et, surtout, construisez vos propres evals (section custom evals ci‑dessous).

MMLU (Massive Multitask Language Understanding)

Statut 2026 : OBSOLÈTE. Tous les modèles sont à 92–98 %. Ne prédit pas la performance réelle.

Scores MMLU 2026 :
- Claude Opus 4.8 : 95,5 %
- GPT-5 : 96,2 %
- Gemini 2.5 : 96,0 %
- Llama 4 70B : 94,8 %

Verdict : tous saturés. L'écart = du bruit.

Pourquoi saturé : MMLU est un QCM aux patterns évidents, mémorisés par les LLM. Ne reflète pas le raisonnement.

HumanEval (programmation)

Statut : SATURÉ mais utile comme référence.

HumanEval pass@1 (générer du code depuis un énoncé) :
- Claude Opus : 95,2 %
- GPT-5 : 96,1 %
- DeepSeek V3 : 96,5 %
- Llama 4 70B : 87 %
- Haiku 4.5 : 80 %

Verdict : Opus vs GPT-5 = 1 % d'écart (marge d'erreur).
          Haiku reste solide (80 %).
          En production, tous suffisent pour des tâches simples.

Pourquoi pertinent : demande une logique multi-étapes, pas que de la mémorisation. Mais ne reflète pas le débogage complexe.

SWE-Bench Verified (vrais tickets GitHub)

Statut 2026 : LE PLUS PERTINENT. Résoudre de vrais tickets GitHub (écrire le code, tester, valider).

SWE-Bench Verified (tickets GitHub résolus) :
- Claude Opus 4.8 : 71,2 %
- GPT-5 : 69,8 %
- Gemini 2.5 Pro : 65 %
- Llama 4 70B : 62 %
- DeepSeek V3 : 70 %
- Haiku 4.5 : 48 %

Verdict : Opus et DeepSeek en tête (code pratique), GPT-5 compétitif.
          Gemini/Llama solides. Haiku décroche (insuffisant en raisonnement complexe).
          Écart Opus/DeepSeek = 1 % (significatif mais faible).

Pourquoi crédible : il faut lire le code, comprendre le contexte, écrire des patches, passer les tests. Bon proxy du réel.

MMMU (Massive Multitask Multimodal Understanding)

Statut : pertinent pour les tâches à forte composante vision.

MMMU (raisonnement visuel + QA) :
- Claude Opus 4.8 : 79 %
- GPT-5 (multimodal) : 83 %
- Gemini 2.5 Pro : 81 %

Verdict : GPT-5 et Gemini ont l'avantage (multimodal natif). Claude solide mais légèrement derrière.
          Pour graphiques/schémas, envisager Gemini ou GPT-5.

Vos propres evals (ce qui compte vraiment)

Construisez les vôtres. Exemple : 50 vrais tickets de support, mesurer le « résolu sans escalade ».

Eval interne (votre vrai cas d'usage) :
- Claude Sonnet : 88 % résolus
- GPT-5 mini : 85 % résolus
- Haiku : 78 % résolus
- Gemini Flash : 86 % résolus

Conclusion : Sonnet est le meilleur pour VOTRE cas.
             Les benchmarks diraient GPT-5 « meilleur », mais VOS données disent Sonnet.

Matrice comparative par domaine

DomaineMeilleur choixPourquoiAlternative
Génération de code + débogageClaude Opus ou DeepSeek V3SWE-Bench prouvé, suivi d'instructionsGPT-5.5 (bon, un peu plus lent)
Chat temps réelGemini 3 Flash ou HaikuLatence ultra-basse (2–3 s)GPT-5 mini (similaire)
Longs documents (> 50K)Gemini 3 Pro (contexte 1M)Longueur de contexte + tarif palier ≤200KClaude (bon, avec limites)
Suivi d'instructions (cas limites)Claude OpusCohérent + refus explicableMistral Large (bon mais plus lent)
Classification bon marchéHaiku ou Gemini 3 Flash LiteCoût/1M = $1–$0.25DeepSeek V3 ($0.27, réserves sur les données)
Sécurité critiqueClaudeConstitutional AI, refus calibréLlama 4 (ouvert, auto-hébergé)
Conformité UE / open-sourceLlama 4 (auto-hébergé) ou Mistral LargePas de données US, option hébergée UEClaude (forte conformité, basé US)
Multimodal (vision + audio + vidéo)GPT-5.5 ou Gemini 3 ProAudio/vidéo natifsClaude (axé texte)
Optimisé coût (générique)DeepSeek V3$0.27/1M, qualité raisonnableHaiku ($1) si sécurité requise

Anthropic Workbench : setup et A/B test live

Outil officiel pour comparer prompts et modèles côte à côte.

Mise en place

  1. Aller sur https://console.anthropic.com/workbench
  2. Se connecter avec sa clé API
  3. Coller le prompt
  4. Sélectionner 2+ modèles (variantes Claude, Gemini, GPT via clé API si ajoutée)
  5. Lancer la requête

Exemple : « Classer 3 candidats par adéquation »

Prompt :
---
Tu es recruteur. Classe ces candidats par adéquation à un poste de senior backend engineer.

Candidat A : 8 ans d'expérience, spécialiste Python, aucune expérience Go
Candidat B : 5 ans d'expérience, spécialiste Go, débutant Python
Candidat C : 6 ans, équilibré Python/Go/Rust

Le poste exige : Python en principal, Go en secondaire, nouveau codebase

Classe par adéquation (1 = meilleure adéquation).
---

Modèles : Opus, Sonnet, Haiku, GPT-5 mini

Métriques comparées :
- Qualité de sortie (lire la logique du classement)
- Latence (affichée dans l'UI)
- Coût (calculé dans l'UI)

Tableau de résultats :

Modèle          | Qualité            | Latence | Coût (par appel) |
Opus 4.8        | Excellente         | 12 s    | $0.015           |
Sonnet 4.6      | Très bonne         | 5 s     | $0.009           |
Haiku 4.5       | Bonne (logique partielle) | 1.2 s | $0.003     |
GPT-5 mini      | Excellente         | 4 s     | $0.012           |

À retenir : Sonnet = meilleur équilibre (qualité + vitesse + coût). Haiku trop juste (nuance ratée). Opus surdimensionné (lent, coûteux).

Tester Claude sur tâches longues — protocole hands-on (Opus 4.8)

⚠️ Contexte : Fable 5 n'est plus accessible pour les ressortissants non-US (suspension 12 juin 2026).

Ce protocole a été conçu sur Opus 4.8 pendant la suspension de Fable 5 (12 juin → 1er juillet 2026) et reste pertinent : Opus est la référence coût/capacité maîtrisée, et le protocole se rejoue à l'identique sur Fable 5 (de nouveau accessible) quand le surcoût 2× se justifie. Objectif : évaluer le modèle sur vos tâches longues et complexes, de façon reproductible et légitime (capacités générales + sécurité défensive).

0. Accès

  • API : model: "claude-opus-4-8". 1M contexte, 128k sortie, adaptive thinking optionnel.
  • Abonnement : accessible à tous (pas de restriction géopolitique).
  • Claude Code : sélectionnez-le via /model (par défaut sur les sessions longues).
  • ⚠️ Budget : 5 $ / 25 $ par M tokens. Surveillez avec /cost (M11) — on teste en connaissance de cause.

1. Coding agentique sur tâches complexes

Reprenez une tâche réelle de votre repo (refactor, migration, fix multi-fichiers, code legacy à déplier) et lancez-la sur Opus 4.8 avec effort: "xhigh" (niveau par défaut pour le code). Mesurez : réussite first-shot ? · nombre d'allers-retours · qualité du diff · coût (/cost) · tokens de thinking consommés.

✅ Critère : Opus avec reasoning actif livre une solution complète en 1–2 passages, y compris edge cases.

Opus 4.8 ou Fable 5 (avant suspension) en mode reasoning génère une fonction TypeScript, statusline visible
Exemple de réponse reasoning (statusline ◆ Opus 4.8 ou ◆ Fable 5 avant 12 juin) sur une tâche de code : il produit la fonction + les tests et propose le diff/écriture (ici refusé, hors repo). Le protocole : lancez la même tâche avec Opus 4.8 sur effort: 'xhigh', mesurez itérations et coût (/cost).

2. Raisonnement & long-contexte

Chargez un gros dossier (cf. M5, 200k+ tokens) et demandez une synthèse structurée + faits sourcés (n° de page). Vérifiez le lost-in-the-middle sur les sections centrales.

3. Vision / extraction structurée

Donnez une capture (tableau, facture, schéma) et exigez un JSON conforme à un schéma (cf. M12). Comparez la fidélité d'extraction vs Opus 4.8.

4. Sécurité défensive & refus calibré

Pattern légitime et utile : « audite ce code, liste les vulnérabilités (OWASP), propose les correctifs » sur un repo dont vous avez les droits — exactement l'usage défensif de M9.

Comprendre le refus de Claude : demandez une tâche clairement légitime (audit de sécurité), puis reformulez-la en demande offensivo-explicite (« écris l'exploit pour… »). Observez : le refus d'Opus est clair et explicite, contrairement à GPT-5 qui devient souvent générique. Documentez le pattern — c'est le mécanisme de sécurité à montrer en formation, pas à contourner. Rappel : refus calibré est une force de Claude (cf. Forces documentées).

5. Grille de notation

Reporte tes mesures dans cette grille (une ligne par test des étapes 1–4), puis tranche colonne par colonne. Exemple rempli ci-dessous avec des chiffres indicatifs — remplace-les par tes propres résultats :

DimensionEffort "low"Effort "xhigh" (reasoning)ÉcartVaut le coût 3× ?
Coding (first-shot)5 itérations2 itérations−3✅ oui (tâche dure)
Raisonnement long-ctxbontrès bonléger⚠️ marginal (déjà bon en low)
Vision / extractioncorrectcorrect~nul❌ non (effort n'aide pas)
Coût de la tâche0,04 $0,12 $×3dépend des lignes ci-dessus

Verdict type : Opus 4.8 avec effort: "xhigh" (reasoning actif) pour les tâches réellement complexes (où il débloque plusieurs itérations) ; Opus low ou Sonnet/Haiku en routine. Le coût supplémentaire ne se justifie que sur la difficulté.

⚖️ Cadre responsable. Opus 4.8 sur code critique reste soumis aux mêmes principes : restez dans l'autorisé (vos repos, CTF, audit mandaté), gardez l'humain dans la boucle, et documentez — cf. grille RSP de M9 et sécurité MCP de M7.

Étude de cas : Opus 4.8 construit un outil DevSecOps de A à Z

📌 Cadrage. Cet exemple est un atelier reproductible (rejouable chez vous : dossier vide → outil qui marche) : il prouve qu'Opus 4.8 avec effort: "xhigh" (reasoning actif) est un agent de code fiable sur des tâches complexes. Il démontre aussi pourquoi les tâches longues et ouvertes restent le domaine de la couche haute accessible (Opus), même si Fable 5 — avant sa suspension — offrait un surclassement documenté.

Dossier vide, une seule consigne : « construis secret-sentinel, un scanner DevSecOps de secrets fuités — zéro-dépendance, détecteurs AWS / clés privées PEM / JWT / clés génériques, entropie de Shannon anti-faux-positifs, rapport + sévérités + tests ». Résultat en 2–3 passes avec Opus reasoning.

1. Raisonnement long puis construction. Opus réfléchit avec effort: "xhigh" (activation du reasoning), puis construit : 5 modules (entropy / detectors / scanner / report / cli), un bin/, des tests node:test, des fixtures, un README et un package.json.

Opus 4.8 écrit src/detectors.js en mode accept edits : seuil d'entropie et motifs anti-faux-positifs
Opus 4.8 en construction (reasoning actif) (statusline ◆ Opus 4.8), accept edits) : il écrit detectors.js (121 lignes) avec un seuil d'entropie (3.5) et une liste de placeholders pour rejeter les faux positifs — pas du code jetable, une vraie conception. Résultat observé avant la suspension Fable 5 ; Opus reproduit le pattern.

2. Le soin du détail (engineering solide). Préfixe AWS strict (AKIA/ASIA), un secret AWS exige un contexte de nommage + entropie ≥ 3.5, le JWT est validé en décodant son header base64url, les mots de passe d'URL et clés génériques passent par des listes de placeholders. Les tests couvrent les négatifs (faux positifs rejetés) autant que les positifs — et Opus contourne seul les pièges de la plateforme (ex. Node 25).

Résumé Opus : logique des détecteurs et gestion d'edge cases, avec reasoning
Opus en mode reasoning explique sa conception (préfixes, entropie, validation JWT, anti-faux-positifs) et signale des edge cases qu'il a résolu. C'est le marqueur du raisonnement long. Observé avant suspension Fable 5 ; pattern reproductible avec Opus.

3. Le livrable marche. Sur des fixtures piégées → 6 secrets détectés (3 critical / 1 high / 2 medium), redactés, code de sortie 1 ; sur du code propre → 0 trouvaille, code 0. Directement intégrable en CI.

secret-sentinel détecte 6 secrets dans des fixtures piégées, par sévérité, avec redaction
L'outil produit (Opus 4.8 ou Fable 5 avant suspension), en action : clés AWS et clé privée PEM en CRITICAL, mot de passe d'URL en HIGH, clé générique + JWT en MEDIUM — chaque secret redacté (AKIA…MPLE), fichier:ligne, exit 1. Un vrai outil DevSecOps (façon gitleaks), né d'un dossier vide. Résultat observé avec Fable 5 juin 2026 ; Opus 4.8 reproduit ce output.

💡 Ce que ça démontre. Sur une tâche longue et ouverte (architecture + implémentation + tests + edge cases), Opus 4.8 avec reasoning actif livre un outil utilisable en 2–3 sessions. C'est la profondeur de référence au tarif Opus. Avec Fable 5 (de nouveau accessible depuis le 1er juillet), la même tâche se fait en une passe et moins de tokens — au double du prix ; voir la section benchmarks ci-dessous pour arbitrer.

⚖️ Cadre. secret-sentinel est un outil défensif (il trouve les secrets pour les retirer, comme gitleaks / trufflehog). On reste côté défense — cf. M9 et M7.

Fable 5 : benchmarks & épisode export-control

📌 Contexte. Fable 5 a été suspendu pour les ressortissants non-US du 12 juin au 1er juillet 2026 (export control), puis restauré globalement. Cette section documente ses capacités démontrées — de nouveau vérifiables hands-on.

Ce que Fable 5 promettait

secret-sentinel en une passe ? Tout est relatif. Le vrai saut de Fable 5 était sur des tâches longues, multi-fichiers, à l'échelle d'un vrai repo — là où Opus 4.8 nécessite des allers-retours. Démonstrations publiques de référence (avant suspension) :

DémoCe que ça prouvait
Stripe — migration d'un monorepo Ruby de 50 M de lignes en 1 jour (vs « plus de 2 mois » pour une équipe entière)Long-horizon à l'échelle d'un code de production réel
Reconstruction du code source d'une web app à partir de captures d'écran seulesVision → raisonnement → génération de bout en bout
Pokémon FireRed terminé avec un harness vision-only minimal (les Claude précédents exigeaient un harness d'aide complexe)Agent autonome sur des centaines d'étapes, sans béquilles
Slay the Spire : acte final atteint 3× plus souvent qu'Opus 4.8 grâce à la mémoire fichier persistanteMémoire + planification long terme
E. Mollick — carte isochrone : Fable lançait seul des agents de recherche (2 200+ vols + horaires train), code et vérifie ; puis un logiciel (« Concord ») via un doc de design de 19 pages + 9,5 h de travail autonomeOrchestration recherche + code + vérification, sans pilotage humain

Côté chiffres : 95 % SWE-bench Verified et 80 % SWE-bench Pro (vs 88,6 % / 69,2 % pour Opus 4.8), et surtout ×2 sur Opus au Diamond split de FrontierCode — le sous-ensemble des tâches les plus dures. Mollick résumait le changement de posture : « je ne pilote plus, je commande » — on passait de collaborateur pas-à-pas à commanditaire d'un studio qui prend des centaines de décisions invisibles.

Les limites qu'on n'a pas pu tester (avant suspension)

⚠️ Le revers documenté — une leçon de contrôle des coûts. Même avant la suspension, la puissance avait un coût réel, au-delà du ×2 affiché :

  • Tokens. Adaptive thinking toujours actif → sessions complexes 500 k–1 M tokens en routine. Le coût par workflow grimpait plus vite que le prix unitaire ne le suggère — Simon Willison a mesuré 110 $ pour une seule journée (~5 h 30) de travail réel (de quoi acheter 500 h sur Opus).
  • Timeouts. Sur une revue tierce de 33 tâches : 19 timeouts, 6 succès, 4 échecs, 4 annulations — le modèle explorait plus longtemps que le harness ne le supportait. Bornez temps / étapes / tokens (--max-turns, task_budget).
  • Pas livrable d'un trait. Les premiers jets étaient profonds mais demandaient souvent tests, gestion d'état plus sûre et gardes sur les entrées invalides avant la prod.
  • Garde-fous sensibles. Le classifieur se déclenchait « au moindre soupçon » de sécurité et reroutait vers Opus 4.8 — la recherche défensive légitime pouvait être entravée.

Leçon : puissance, coût et géopolitique

À retenir :

  1. Fable 5 aurait été justifié pour les tâches réellement longues et ouvertes, bornées et mesurées (/cost, cf. M2 · M11) — surdimensionné et coûteux en routine.
  2. Du 12 juin au 1er juillet 2026, accès suspendu pour ressortissants non-US (export control) ; Opus 4.8 était alors la couche accessible. Accès restauré depuis le 1er juillet — l'arbitrage redevient purement économique (2× le prix d'Opus).
  3. Leçon de géopolitique : un modèle frontière puissant en cybersécurité peut subir des restrictions opérationnelles imprédictibles (export control, embargo). À intégrer dans l'architecture long-terme (cf. M9 RSP, M11 Sécurité opérationnelle) — pensez abstraction multi-modèles et fallback déterministe.

Sources : annonce Anthropic (avant 12 juin), benchmarks Vellum, revue CodeRabbit, E. Mollick — One Useful Thing, S. Willison — Initial impressions, Anthropic Fable/Mythos suspension statement.

Coûts + latence : comparatif 2026

Personne réfléchissant face à plusieurs options et chemins, symbolisant la prise de décision entre alternatives
Matrice de décision : choisir le modèle optimal selon les KPIs d'accuracy, latence et budget

Coûts (par million de tokens)

ModèleInputOutputRatioCas d'usage
Fable 5 🆕$10$505 ×Frontière : tâches longues/dures (≈ 2× Opus) — accès restauré le 1er juillet 2026
Opus 4.8$5$255 ×Raisonnement complexe
Sonnet 5 🆕$2 promo (puis $3)$10 promo (puis $15)5 ×Défaut Claude Code — agentique proche d'Opus, promo jusqu'au 31 août 2026
Sonnet 4.6$3$155 ×Équilibré, raisonnement court (génération précédente)
Haiku 4.5$1$55 ×Classification, point de départ
GPT-5 miniTier éco OpenAI (vérifier tarif courant)
Gemini 3 Flash Lite$0.25$1.506 ×Classification ultra-bon-marché
DeepSeek V3$0.27$1.104 ×Bon rapport (réserves sur les données)
Llama 4 (auto-hébergé)~$0.50~$0.501 ×Pas d'API, infra variable
Mistral Large 3$2$63 ×Option UE, coût moyen

Latence (temps de réponse moyen, 2K input + 500 output)

ModèleP50P95Notes
Fable 5 🆕variablevariableAdaptive thinking long-horizon : peut réfléchir longuement avant de répondre (taillé pour les tâches longues, pas le temps réel)
Opus 4.810–15 s20 s+Lent ; préférer le batch
Sonnet 5 🆕4–6 s8–10 sProfil latence comparable à 4.6, qualité agentique supérieure
Sonnet 4.64–6 s8–10 sBon pour le temps réel
Haiku 4.51–2 s3–4 sRapide et régulier
GPT-5.58–12 s15–20 sProche d'Opus
Gemini 3 Flash2–3 s5–6 sLe plus rapide
DeepSeek V34–6 s8–10 sCompétitif
Llama 4 (self)3–8 svariableDépend du matériel

🧩 Au-delà du modèle brut. Le choix ne se joue pas que sur (qualité × coût × latence) : les features de scaling côté Claude pèsent aussi — effort/adaptive thinking (réglage coût/qualité par requête), tool search (découverte d'outils sans saturer le contexte) et programmatic tool calling (composer N appels d'outils en un script) pour les agents à nombreux outils. Détail dans M7 et M2.

Vendor lock-in : patterns d'abstraction

Risque : prompts spécifiques à Claude

# Mauvais : syntaxe spécifique Claude (nuit à la généralité)
response = client.messages.create(
    model="claude-opus-4-8",
    max_tokens=500,
    messages=[
        {
            "role": "user",
            "content": "Utilise ton raisonnement étendu et tes valeurs constitutionnelles pour..."
            # ^^ Suppose que Claude existe, propriétés spécifiques
        }
    ]
)

Abstraction : wrapper agnostique au LLM

class LLMProvider:
    def query(self, prompt: str, model: str = "default", **kwargs) -> str:
        """Interface abstraite, fonctionne avec tout fournisseur."""
        if provider == "anthropic":
            return self._query_anthropic(prompt, model, **kwargs)
        elif provider == "openai":
            return self._query_openai(prompt, model, **kwargs)
        elif provider == "gemini":
            return self._query_gemini(prompt, model, **kwargs)
        else:
            raise ValueError(f"Unknown provider: {provider}")

provider = LLMProvider()
result = provider.query("Classe cet email", model="sonnet")
# On pourra basculer vers GPT-5, Gemini plus tard sans changer le code

Repli natif Claude Code : fallbackModel

Depuis Claude Code v2.1.166, le repli intra-Claude (overload, 429/529) n'a plus besoin de code : le setting fallbackModel accepte jusqu'à trois modèles de repli essayés en séquence quand le modèle principal est saturé. À privilégier pour la résilience côté Claude — le circuit breaker custom ci-dessous ne sert que pour un repli cross-provider (Claude → GPT-5/Gemini).

// .claude/settings.json
{
  "model": "claude-opus-4-8",
  "fallbackModel": ["claude-sonnet-4-6", "claude-haiku-4-5-20251001"]
  // overload Opus → bascule Sonnet, puis Haiku ; transparent pour la session
}

Circuit breaker cross-provider (repli hors écosystème Claude)

Utile uniquement si vous voulez basculer vers un autre fournisseur (panne Anthropic globale, contrainte contractuelle multi-vendeur) — au-delà de ce que couvre fallbackModel.

import anthropic
import openai

def query_with_fallback(prompt):
    """Essaie Claude, repli sur GPT-5 (cross-provider, hors fallbackModel)."""
    try:
        response = anthropic_client.messages.create(
            model="claude-opus-4-8",
            max_tokens=500,
            messages=[{"role": "user", "content": prompt}]
        )
        return response.content[0].text
    except (anthropic.APIError, anthropic.Timeout):
        # Repli
        response = openai_client.chat.completions.create(
            model="gpt-5",
            messages=[{"role": "user", "content": prompt}],
            max_tokens=500
        )
        return response.choices[0].message.content

# Si l'API Claude est down, GPT-5 répond. Coût + latence plus élevés, mais disponible.

Cas pratique : audit "devrions-nous switcher?"

Scénario

Vous êtes une startup fintech qui utilise Claude Opus pour 10 k appels API/jour de classification de risque (détection de fraude). Voici le processus de décision :

Chargement du schéma…

Audit switch : Opus → Sonnet économise 40% pour 0.8% quality loss
Setup actuel :
- Modèle : Claude Opus
- Volume : 10k appels/jour = 300k/mois
- Input : 500 tokens (données de transaction)
- Output : 100 tokens (score de risque + explication)

Coût/mois : 300k × (500 × $0.000005 + 100 × $0.000025) = 300k × $0.005 = $1500/mois
(10k/jour × 30 j = 300k appels/mois)

Qualité : 94 % d'accuracy (taux de détection de fraude vs vérité terrain)
Latence : 10–15 s en moyenne (acceptable ; un contrôle anti-fraude peut attendre quelques s)

Étape 1 : Analyser les besoins

Indispensables :
- Accuracy >= 92 % (1-2 % de perte acceptable)
- Latence < 20 s (acceptable)
- Coût < actuel ou < $3000/mois
- Disponible 24/7

Confort :
- Plus rapide (les transactions temps réel préfèrent une latence basse)
- Explicabilité (pourquoi marqué comme fraude ?)

Étape 2 : Tester les alternatives sur données réelles

Échantillon de 500 transactions réelles. Les passer dans Sonnet, Haiku, GPT-5, Gemini Flash. Mesurer l'accuracy.

Résultats :
- Claude Opus : 94,0 % ✅ (baseline)
- Claude Sonnet : 93,2 % (−0,8 %) ✅
- Claude Haiku : 89,5 % (−4,5 %) ❌ (trop bas pour la fraude)
- GPT-5 : 94,5 % (+0,5 %) ✅ mais plus lent
- Gemini Flash : 91,2 % (−2,8 %) ⚠ limite
- DeepSeek V3 : 92,8 % (−1,2 %) ⚠

Étape 3 : Comparaison des coûts (à qualité acceptable)

Candidats acceptables : Opus (actuel), Sonnet, GPT-5

Claude Sonnet (93,2 %) :
Coût = 300k × (0.5 × $0.000003 + 0.1 × $0.000015) = 300k × 0.000003 = $900/mois
Économie : $1500 → $900 = −40 % ✅ (perte qualité 0,8 %, acceptable)

GPT-5 (94,5 %) :
Coût = 300k × (0.5 × $0.000006 + 0.1 × $0.000020) = 300k × 0.000005 = $1500/mois
Économie : $1500 → $1500 = 0 % (coût égal à Opus, qualité +0,5 %)
Latence : 8–12 s (−3 s vs Opus)

Étape 4 : Décider

Recommandation : basculer sur Sonnet.

Pourquoi Sonnet (et pas GPT-5) :
- Coût $900 vs $1500 (−40 %)
- Perte de qualité de seulement 0,8 % (acceptable pour la fraude)
- Latence 4–8 s vs 8–12 s (plus rapide)
- Éprouvé (pas encore de doute sur la stabilité de GPT-5)
- Constitutional AI = refus plus prévisible (conformité fintech)

Mise en œuvre :
- Semaine 1 : déployer Sonnet en shadow mode (en parallèle, sans écrire les décisions)
- Semaine 2 : comparer 7 jours de données shadow, valider < 1 % de perte qualité
- Semaine 3 : router 10 % du trafic vers Sonnet (circuit breaker vers Opus si souci)
- Semaine 4 : bascule complète, surveiller 2 semaines

Atelier : construire votre matrice de décision (90 min)

Étape 1 (15 min) : Documenter cas d'usage

Cas d'usage : [nom]
Modèle actuel : [Opus/Sonnet/autre]
Volume : [N appels/mois]
Tokens input (moy.) : [?]
Tokens output (moy.) : [?]
Coût actuel/mois : [?]
Latence actuelle : [?]
Métrique d'accuracy : [% ou « non mesuré »]
Exigence de disponibilité : [critique / standard / batch-OK]

Étape 2 (20 min) : Définir critères qualité

Indispensables (KPI non-négociables) :
- Accuracy >= X %
- Latence <= Y s
- Coût <= Z $ / mois
- Disponibilité >= 99,9 %

Confort :
- Explicabilité (pourquoi cette décision ?)
- Conformité (RGPD, sécurité)
- Multimodal (images, audio)

Étape 3 (30 min) : Test sur sample

Préparer 100 requêtes représentatives (vraies données). Tester 5 modèles.

import anthropic
import openai
import google.generativeai as genai

models_to_test = [
    ("claude-opus-4-8", anthropic_client),
    ("claude-sonnet-4-6", anthropic_client),
    ("gpt-5.5", openai_client),
    ("gemini-3-pro", genai_client),
    ("claude-haiku-4-5-20251001", anthropic_client)
]

results = {}
for model_name, client in models_to_test:
    accuracy, latency_avg, cost = evaluate_model(
        model=model_name,
        samples=my_100_test_samples,
        ground_truth=my_labeled_data
    )
    results[model_name] = {
        "accuracy": accuracy,
        "latency": latency_avg,
        "cost": cost
    }

print(results)

Étape 4 (15 min) : Construire la matrice

| Modèle | Accuracy | Latence | Coût/mois | Perte qualité | Recommandation |
|---|---|---|---|---|---|
| Claude Opus (actuel) | 94,0 % | 12s | $1500 | baseline | Garder pour le critique |
| Claude Sonnet | 93,2 % | 5s | $900 | -0,8 % | BASCULER ICI |
| Claude Haiku | 89,5 % | 1,2s | $375 | -4,5 % | ❌ trop bas |
| GPT-5 | 94,5 % | 10s | $1500 | +0,5 % | Alternative (coût égal) |
| Gemini Flash | 91,2 % | 2s | $250 | -2,8 % | Option de repli |

DÉCISION FINALE :
Principal : Claude Sonnet (meilleur équilibre)
Repli : Gemini Flash (si Sonnet indisponible)
Secours : Claude Opus (si la qualité est critique)

Étape 5 (10 min) : Plan de déploiement

Semaine 1 : déployer Sonnet en shadow (no-op)
Semaine 2 : valider 7 jours de données, < 1 % de perte qualité confirmée
Semaine 3 : router 10 % du trafic vers Sonnet, 90 % Opus (circuit breaker)
Semaine 4 : split 50 %
Semaine 5 : tout Sonnet, repli Gemini Flash si erreurs
Semaine 6 : surveiller 2 semaines, finaliser

Pour aller plus loin