L’Échelle Authoritaire répond à une question simple : pour ce que vous voulez faire — coder, automatiser, rédiger, analyser des tableurs — quel modèle d’IA est le meilleur aujourd’hui ? Chaque score (0 à 100) est calculé à partir des benchmarks officiels des laboratoires, vérifiés un par un, puis normalisés et pondérés selon le besoin. L’échelle est relative : 100 = le meilleur modèle suivi, 0 = le moins bon.

Échelle v1.0 — bornes gelées le 1er octobre 2026. Quand les données sont insuffisantes, aucun score n’est affiché : nous préférons un trou honnête à un chiffre inventé.










Polyvalence

Moyenne des scores publiés par besoin (minimum 4 besoins notés). Le classement généraliste, pour ceux qui veulent un seul chiffre.

1Claude Opus 5.587Excellent
2Claude Opus 536Limité

Modèles non classés (moins de 4 besoins notés) :

–Claude Fable 5.1—Données insuffisantes
–Claude Sonnet 5 (référence)—Données insuffisantes
–Claude Sonnet 5.5—Données insuffisantes
–GPT-5.6 Sol—Données insuffisantes
–GPT-6.1 Sol—Données insuffisantes
–GPT-6 Sol—Données insuffisantes
–Grok 4.7—Données insuffisantes
–Xiaomi MiMo-V2.6—Données insuffisantes

Automatiser & agents autonomes

Workflows multi-étapes, usage d'outils, tâches agentiques longues
Confiance forte

1Xiaomi MiMo-V2.689Excellent
Détail du calcul

AutomationBench 1.0.6 : 100 · DeepSWE v1.1 : 66 (scores normalisés 0–100, moyenne pondérée)

Détail du calcul

AutomationBench 1.0.6 : 50 · DeepSWE v1.1 : 100 · Terminal-Bench 4.0 : 87 (scores normalisés 0–100, moyenne pondérée)

3Claude Opus 515Limité
Détail du calcul

AutomationBench 1.0.6 : 0 · Terminal-Bench 4.0 : 45 (scores normalisés 0–100, moyenne pondérée)

Données insuffisantes pour :

–Claude Fable 5.1—Données insuffisantes
–Claude Sonnet 5 (référence)—Données insuffisantes
–Claude Sonnet 5.5—Données insuffisantes
–GPT-5.6 Sol—Données insuffisantes
–GPT-6.1 Sol—Données insuffisantes
–GPT-6 Sol—Données insuffisantes
–Grok 4.7—Données insuffisantes

Discuter & assistant quotidien

Chat généraliste : questions-réponses, suivi d'instructions, culture générale
Confiance moyenne

Aucun score publié pour ce besoin en v1.0.

Les benchmarks qui mesureraient vraiment ce besoin (tâches à valeur économique réelle, indice d’intelligence générale, usage d’ordinateur) n’ont pas encore de bornes de normalisation gelées. Nous ne publierons un score que sur des données vérifiées — voir la méthodologie ci-dessous.

Coder & développer

Générer, compléter, débugger du code ; travailler dans un IDE ou un terminal
Confiance forte

1Claude Opus 5.597Exceptionnel
Détail du calcul

CursorBench 4.0 : 100 · DeepSWE v1.1 : 100 · FrontierCode 1.1 (Main) : 100 · Terminal-Bench 4.0 : 87 (scores normalisés 0–100, moyenne pondérée)

2Claude Sonnet 5.587Excellent
Détail du calcul

CursorBench 4.0 : 80 · FrontierCode 1.1 (Main) : 81 · Terminal-Bench 4.0 : 100 (scores normalisés 0–100, moyenne pondérée)

3Claude Fable 5.140Correct
Détail du calcul

CursorBench 4.0 : 48 · DeepSWE v1.1 : 0 · FrontierCode 1.1 (Main) : 66 · Terminal-Bench 4.0 : 55 (scores normalisés 0–100, moyenne pondérée)

4Claude Opus 533Limité
Détail du calcul

CursorBench 4.0 : 3 · FrontierCode 1.1 (Main) : 47 · Terminal-Bench 4.0 : 45 (scores normalisés 0–100, moyenne pondérée)

5Grok 4.721Limité
Détail du calcul

CursorBench 4.0 : 0 · DeepSWE v1.1 : 53 · Terminal-Bench 4.0 : 0 (scores normalisés 0–100, moyenne pondérée)

Données insuffisantes pour :

–Claude Sonnet 5 (référence)—Données insuffisantes
–GPT-5.6 Sol—Données insuffisantes
–GPT-6.1 Sol—Données insuffisantes
–GPT-6 Sol—Données insuffisantes
–Xiaomi MiMo-V2.6—Données insuffisantes

Créer images & vidéos

Génération d'images et de vidéos
Non noté en v1.0

Aucun score publié pour ce besoin en v1.0.

Les benchmarks qui mesureraient vraiment ce besoin (tâches à valeur économique réelle, indice d’intelligence générale, usage d’ordinateur) n’ont pas encore de bornes de normalisation gelées. Nous ne publierons un score que sur des données vérifiées — voir la méthodologie ci-dessous.

Résoudre des problèmes complexes

Maths, sciences, raisonnement expert de niveau doctoral
Confiance forte

1Claude Opus 5.595Exceptionnel
Détail du calcul

AutomationBench 1.0.6 : 50 · DeepSWE v1.1 : 100 · FrontierCode 1.1 (Main) : 100 · Humanity's Last Exam (with tools) : 100 (scores normalisés 0–100, moyenne pondérée)

2Claude Sonnet 5.576Excellent
Détail du calcul

FrontierCode 1.1 (Main) : 81 · Humanity's Last Exam (with tools) : 75 (scores normalisés 0–100, moyenne pondérée)

3Claude Fable 5.167Bon
Détail du calcul

DeepSWE v1.1 : 0 · FrontierCode 1.1 (Main) : 66 · Humanity's Last Exam (with tools) : 84 (scores normalisés 0–100, moyenne pondérée)

4Claude Opus 556Correct
Détail du calcul

AutomationBench 1.0.6 : 0 · FrontierCode 1.1 (Main) : 47 · Humanity's Last Exam (with tools) : 68 (scores normalisés 0–100, moyenne pondérée)

5Claude Sonnet 5 (référence)0Limité
Détail du calcul

FrontierCode 1.1 (Main) : 0 · Humanity's Last Exam (with tools) : 0 (scores normalisés 0–100, moyenne pondérée)

Données insuffisantes pour :

–GPT-5.6 Sol—Données insuffisantes
–GPT-6.1 Sol—Données insuffisantes
–GPT-6 Sol—Données insuffisantes
–Grok 4.7—Données insuffisantes
–Xiaomi MiMo-V2.6—Données insuffisantes

Rechercher & synthétiser

Recherche approfondie, synthèse de documents, deep research
Confiance faible

Aucun score publié pour ce besoin en v1.0.

Les benchmarks qui mesureraient vraiment ce besoin (tâches à valeur économique réelle, indice d’intelligence générale, usage d’ordinateur) n’ont pas encore de bornes de normalisation gelées. Nous ne publierons un score que sur des données vérifiées — voir la méthodologie ci-dessous.

Rédiger long (livre, rapports)

Textes longs et cohérents : structure, tenue sur la durée
Confiance faible

Aucun score publié pour ce besoin en v1.0.

Les benchmarks qui mesureraient vraiment ce besoin (tâches à valeur économique réelle, indice d’intelligence générale, usage d’ordinateur) n’ont pas encore de bornes de normalisation gelées. Nous ne publierons un score que sur des données vérifiées — voir la méthodologie ci-dessous.

Rédiger e-mails & communication pro

E-mails, messages, documents professionnels : ton, clarté, efficacité
Confiance moyenne

Aucun score publié pour ce besoin en v1.0.

Les benchmarks qui mesureraient vraiment ce besoin (tâches à valeur économique réelle, indice d’intelligence générale, usage d’ordinateur) n’ont pas encore de bornes de normalisation gelées. Nous ne publierons un score que sur des données vérifiées — voir la méthodologie ci-dessous.

Excel / Sheets : formules & modélisation

Formules complexes, modèles financiers, analyse de données tabulaires
Confiance moyenne

1Claude Opus 5.582Excellent
Détail du calcul

AutomationBench 1.0.6 : 50 · FrontierCode 1.1 (Main) : 100 · Humanity's Last Exam (with tools) : 100 (scores normalisés 0–100, moyenne pondérée)

2Claude Fable 5.178Excellent
Détail du calcul

FrontierCode 1.1 (Main) : 66 · Humanity's Last Exam (with tools) : 84 (scores normalisés 0–100, moyenne pondérée)

3Claude Sonnet 5.577Excellent
Détail du calcul

FrontierCode 1.1 (Main) : 81 · Humanity's Last Exam (with tools) : 75 (scores normalisés 0–100, moyenne pondérée)

4Claude Opus 540Correct
Détail du calcul

AutomationBench 1.0.6 : 0 · FrontierCode 1.1 (Main) : 47 · Humanity's Last Exam (with tools) : 68 (scores normalisés 0–100, moyenne pondérée)

5Claude Sonnet 5 (référence)0Limité
Détail du calcul

FrontierCode 1.1 (Main) : 0 · Humanity's Last Exam (with tools) : 0 (scores normalisés 0–100, moyenne pondérée)

Données insuffisantes pour :

–GPT-5.6 Sol—Données insuffisantes
–GPT-6.1 Sol—Données insuffisantes
–GPT-6 Sol—Données insuffisantes
–Grok 4.7—Données insuffisantes
–Xiaomi MiMo-V2.6—Données insuffisantes
Méthodologie — comment sont calculés les scores

1. Normalisation. Pour chaque benchmark, le meilleur modèle suivi vaut 100, le moins bon 0 (bornes gelées le 1er octobre 2026, tableau ci-dessous). Formule : 100 × (score − min) / (max − min).

2. Score par besoin. Moyenne pondérée des benchmarks qui mesurent vraiment le besoin (poids ci-dessous). Si un benchmark manque pour un modèle, les poids sont renormalisés.

3. Règle anti-score-bancal. Aucun score publié si moins de 2 benchmarks disponibles ou moins de 60 % du poids couvert.

Labels : 90–100 Exceptionnel · 75–89 Excellent · 60–74 Bon · 40–59 Correct · 0–39 Limité.

Poids par besoin

Besoin Benchmarks et poids
Automatiser & agents autonomes AutomationBench 1.0.6 50 %, DeepSWE v1.1 25 %, Terminal-Bench 4.0 25 %
Discuter & assistant quotidien GDPval-AA 30 %, Humanity's Last Exam (with tools) 30 %, Intelligence Index 40 %
Coder & développer CursorBench 4.0 20 %, DeepSWE v1.1 30 %, FrontierCode 1.1 (Main) 25 %, Terminal-Bench 4.0 25 %
Créer images & vidéos
Résoudre des problèmes complexes AutomationBench 1.0.6 10 %, DeepSWE v1.1 15 %, FrontierCode 1.1 (Main) 15 %, Humanity's Last Exam (with tools) 60 %
Rechercher & synthétiser GDPval-AA 40 %, Humanity's Last Exam (with tools) 35 %, Intelligence Index 25 %
Rédiger long (livre, rapports) GDPval-AA 20 %, Humanity's Last Exam (with tools) 55 %, Intelligence Index 25 %
Rédiger e-mails & communication pro GDPval-AA 35 %, Humanity's Last Exam (with tools) 40 %, Intelligence Index 25 %
Excel / Sheets : formules & modélisation AutomationBench 1.0.6 35 %, FrontierCode 1.1 (Main) 20 %, Humanity's Last Exam (with tools) 45 %

Bornes gelées (v1.0)

Benchmark Min (0) Max (100)
AutomationBench 1.0.6 26,9 53,1
CursorBench 4.0 46,3 57,8
DeepSWE v1.1 67,4 74,2
FrontierCode 1.1 (Main) 42,4 54,4
GDPval-AA — —
Humanity's Last Exam (with tools) 54,9 67,7
Intelligence Index — —
OSWorld 2.1 — —
Terminal-Bench 4.0 37,6 70,6

Données brutes vérifiées une par une contre les publications officielles des laboratoires (audit du 1er octobre 2026). Re-gel des bornes à chaque version : un nouveau modèle qui bat un record fait recalculer toute l’échelle. Chaque score affiché est décomposable — cliquez sur « Détail du calcul ».