L’Échelle Authoritaire répond à une question simple : pour ce que vous voulez faire — coder, automatiser, rédiger, analyser des tableurs — quel modèle d’IA est le meilleur aujourd’hui ? Chaque score (0 à 100) est calculé à partir des benchmarks officiels des laboratoires, vérifiés un par un, puis normalisés et pondérés selon le besoin. L’échelle est relative : 100 = le meilleur modèle suivi, 0 = le moins bon.
Échelle v1.0 — bornes gelées le 1er octobre 2026. Quand les données sont insuffisantes, aucun score n’est affiché : nous préférons un trou honnête à un chiffre inventé.
Polyvalence
Moyenne des scores publiés par besoin (minimum 4 besoins notés). Le classement généraliste, pour ceux qui veulent un seul chiffre.
Modèles non classés (moins de 4 besoins notés) :
Automatiser & agents autonomes
Workflows multi-étapes, usage d'outils, tâches agentiques longues
Confiance forte
Détail du calcul
AutomationBench 1.0.6 : 100 · DeepSWE v1.1 : 66 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
AutomationBench 1.0.6 : 50 · DeepSWE v1.1 : 100 · Terminal-Bench 4.0 : 87 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
AutomationBench 1.0.6 : 0 · Terminal-Bench 4.0 : 45 (scores normalisés 0–100, moyenne pondérée)
Données insuffisantes pour :
Discuter & assistant quotidien
Chat généraliste : questions-réponses, suivi d'instructions, culture générale
Confiance moyenne
Aucun score publié pour ce besoin en v1.0.
Les benchmarks qui mesureraient vraiment ce besoin (tâches à valeur économique réelle, indice d’intelligence générale, usage d’ordinateur) n’ont pas encore de bornes de normalisation gelées. Nous ne publierons un score que sur des données vérifiées — voir la méthodologie ci-dessous.
Coder & développer
Générer, compléter, débugger du code ; travailler dans un IDE ou un terminal
Confiance forte
Détail du calcul
CursorBench 4.0 : 100 · DeepSWE v1.1 : 100 · FrontierCode 1.1 (Main) : 100 · Terminal-Bench 4.0 : 87 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
CursorBench 4.0 : 80 · FrontierCode 1.1 (Main) : 81 · Terminal-Bench 4.0 : 100 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
CursorBench 4.0 : 48 · DeepSWE v1.1 : 0 · FrontierCode 1.1 (Main) : 66 · Terminal-Bench 4.0 : 55 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
CursorBench 4.0 : 3 · FrontierCode 1.1 (Main) : 47 · Terminal-Bench 4.0 : 45 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
CursorBench 4.0 : 0 · DeepSWE v1.1 : 53 · Terminal-Bench 4.0 : 0 (scores normalisés 0–100, moyenne pondérée)
Données insuffisantes pour :
Créer images & vidéos
Génération d'images et de vidéos
Non noté en v1.0
Aucun score publié pour ce besoin en v1.0.
Les benchmarks qui mesureraient vraiment ce besoin (tâches à valeur économique réelle, indice d’intelligence générale, usage d’ordinateur) n’ont pas encore de bornes de normalisation gelées. Nous ne publierons un score que sur des données vérifiées — voir la méthodologie ci-dessous.
Résoudre des problèmes complexes
Maths, sciences, raisonnement expert de niveau doctoral
Confiance forte
Détail du calcul
AutomationBench 1.0.6 : 50 · DeepSWE v1.1 : 100 · FrontierCode 1.1 (Main) : 100 · Humanity's Last Exam (with tools) : 100 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
FrontierCode 1.1 (Main) : 81 · Humanity's Last Exam (with tools) : 75 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
DeepSWE v1.1 : 0 · FrontierCode 1.1 (Main) : 66 · Humanity's Last Exam (with tools) : 84 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
AutomationBench 1.0.6 : 0 · FrontierCode 1.1 (Main) : 47 · Humanity's Last Exam (with tools) : 68 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
FrontierCode 1.1 (Main) : 0 · Humanity's Last Exam (with tools) : 0 (scores normalisés 0–100, moyenne pondérée)
Données insuffisantes pour :
Rechercher & synthétiser
Recherche approfondie, synthèse de documents, deep research
Confiance faible
Aucun score publié pour ce besoin en v1.0.
Les benchmarks qui mesureraient vraiment ce besoin (tâches à valeur économique réelle, indice d’intelligence générale, usage d’ordinateur) n’ont pas encore de bornes de normalisation gelées. Nous ne publierons un score que sur des données vérifiées — voir la méthodologie ci-dessous.
Rédiger long (livre, rapports)
Textes longs et cohérents : structure, tenue sur la durée
Confiance faible
Aucun score publié pour ce besoin en v1.0.
Les benchmarks qui mesureraient vraiment ce besoin (tâches à valeur économique réelle, indice d’intelligence générale, usage d’ordinateur) n’ont pas encore de bornes de normalisation gelées. Nous ne publierons un score que sur des données vérifiées — voir la méthodologie ci-dessous.
Rédiger e-mails & communication pro
E-mails, messages, documents professionnels : ton, clarté, efficacité
Confiance moyenne
Aucun score publié pour ce besoin en v1.0.
Les benchmarks qui mesureraient vraiment ce besoin (tâches à valeur économique réelle, indice d’intelligence générale, usage d’ordinateur) n’ont pas encore de bornes de normalisation gelées. Nous ne publierons un score que sur des données vérifiées — voir la méthodologie ci-dessous.
Excel / Sheets : formules & modélisation
Formules complexes, modèles financiers, analyse de données tabulaires
Confiance moyenne
Détail du calcul
AutomationBench 1.0.6 : 50 · FrontierCode 1.1 (Main) : 100 · Humanity's Last Exam (with tools) : 100 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
FrontierCode 1.1 (Main) : 66 · Humanity's Last Exam (with tools) : 84 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
FrontierCode 1.1 (Main) : 81 · Humanity's Last Exam (with tools) : 75 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
AutomationBench 1.0.6 : 0 · FrontierCode 1.1 (Main) : 47 · Humanity's Last Exam (with tools) : 68 (scores normalisés 0–100, moyenne pondérée)
Détail du calcul
FrontierCode 1.1 (Main) : 0 · Humanity's Last Exam (with tools) : 0 (scores normalisés 0–100, moyenne pondérée)
Données insuffisantes pour :
Méthodologie — comment sont calculés les scores
1. Normalisation. Pour chaque benchmark, le meilleur modèle suivi vaut 100, le moins bon 0 (bornes gelées le 1er octobre 2026, tableau ci-dessous). Formule : 100 × (score − min) / (max − min).
2. Score par besoin. Moyenne pondérée des benchmarks qui mesurent vraiment le besoin (poids ci-dessous). Si un benchmark manque pour un modèle, les poids sont renormalisés.
3. Règle anti-score-bancal. Aucun score publié si moins de 2 benchmarks disponibles ou moins de 60 % du poids couvert.
Labels : 90–100 Exceptionnel · 75–89 Excellent · 60–74 Bon · 40–59 Correct · 0–39 Limité.
Poids par besoin
| Besoin | Benchmarks et poids |
|---|---|
| Automatiser & agents autonomes | AutomationBench 1.0.6 50 %, DeepSWE v1.1 25 %, Terminal-Bench 4.0 25 % |
| Discuter & assistant quotidien | GDPval-AA 30 %, Humanity's Last Exam (with tools) 30 %, Intelligence Index 40 % |
| Coder & développer | CursorBench 4.0 20 %, DeepSWE v1.1 30 %, FrontierCode 1.1 (Main) 25 %, Terminal-Bench 4.0 25 % |
| Créer images & vidéos | |
| Résoudre des problèmes complexes | AutomationBench 1.0.6 10 %, DeepSWE v1.1 15 %, FrontierCode 1.1 (Main) 15 %, Humanity's Last Exam (with tools) 60 % |
| Rechercher & synthétiser | GDPval-AA 40 %, Humanity's Last Exam (with tools) 35 %, Intelligence Index 25 % |
| Rédiger long (livre, rapports) | GDPval-AA 20 %, Humanity's Last Exam (with tools) 55 %, Intelligence Index 25 % |
| Rédiger e-mails & communication pro | GDPval-AA 35 %, Humanity's Last Exam (with tools) 40 %, Intelligence Index 25 % |
| Excel / Sheets : formules & modélisation | AutomationBench 1.0.6 35 %, FrontierCode 1.1 (Main) 20 %, Humanity's Last Exam (with tools) 45 % |
Bornes gelées (v1.0)
| Benchmark | Min (0) | Max (100) |
|---|---|---|
| AutomationBench 1.0.6 | 26,9 | 53,1 |
| CursorBench 4.0 | 46,3 | 57,8 |
| DeepSWE v1.1 | 67,4 | 74,2 |
| FrontierCode 1.1 (Main) | 42,4 | 54,4 |
| GDPval-AA | — | — |
| Humanity's Last Exam (with tools) | 54,9 | 67,7 |
| Intelligence Index | — | — |
| OSWorld 2.1 | — | — |
| Terminal-Bench 4.0 | 37,6 | 70,6 |
Données brutes vérifiées une par une contre les publications officielles des laboratoires (audit du 1er octobre 2026). Re-gel des bornes à chaque version : un nouveau modèle qui bat un record fait recalculer toute l’échelle. Chaque score affiché est décomposable — cliquez sur « Détail du calcul ».