Annonce et contexte
Le 05/10/2026, Reflection AI a dévoilé Beam, son premier modèle de langage, via un billet du blog officiel intitulé « Introducing Beam: Reflection’s 501B open-weight model ». La promesse officielle, selon le laboratoire : « We are introducing Beam, Reflection’s first open-weight model. Beam is a sparse Mixture-of-Experts model with 501 billion total parameters, 23 billion active, built for coding, reasoning, and agentic workloads. » (« Nous présentons Beam, le premier modèle à poids ouverts de Reflection. Beam est un modèle sparse mixture-of-experts de 501 milliards de paramètres au total, 23 milliards actifs, conçu pour le code, le raisonnement et les charges agentiques. »)
Reflection AI n’est pas un laboratoire comme les autres : fondé en 2024 à Brooklyn par Misha Laskin (ex-DeepMind, ex-responsable du reward modeling de Gemini) et Ioannis Antonoglou (ex-DeepMind, co-créateur d’AlphaGo), soutenu par Nvidia, il a levé environ 4,7 milliards de dollars (valorisation de 25 milliards) et sécurisé plus de 7 milliards de dollars d’accords de calcul avec SpaceX et Nebius pour des GPU GB300 jusqu’en 2029. L’annonce confirmait les informations d’Axios publiées le week-end précédent.
Le positionnement est frontal : la réponse occidentale aux poids ouverts chinois (DeepSeek, Qwen, GLM, Kimi). Là où les modèles chinois gagnent sur la capacité brute, Beam joue l’efficacité — des scores comparables à GLM-5.2 avec 3 à 4 fois moins de calcul d’inférence, selon le laboratoire. Nuance importante : les poids ne sont pas encore publics — red-teaming final en cours, accès anticipé sur liste d’attente, publication des poids, du rapport technique et de la model card « plus tard en octobre ».
Découvrir Beam
Lien officiel
Fiche technique
| Caractéristique | Valeur |
|---|---|
| Éditeur | Reflection AI (Brooklyn, États-Unis) |
| Date d’annonce | 05/10/2026 (blog officiel) |
| Date de disponibilité | 05/10/2026 — accès anticipé sur liste d’attente ; poids publics « plus tard en octobre » (non publiés au 06/10/2026) |
| Famille / gamme | Beam (premier modèle — « le premier d’une série » selon le laboratoire) |
| Type | LLM texte seul, sparse mixture-of-experts, code / raisonnement / agentique, effort de raisonnement réglable |
| Architecture | 52 couches ; attention locale et globale entrelacée ; experts routés fins ; 501 Md de paramètres au total, 23 Md actifs par token |
| Fenêtre de contexte (entrée) | 1 000 000 tokens (étendue en midtraining) |
| Tokens max en sortie | Non communiqué |
| Cutoff des connaissances | Non communiqué |
| Modalités d’entrée / sortie | Entrée : texte ; sortie : texte (modèle texte seul — pas de multimodal) |
| Entraînement | 23 800 Md de tokens (web + données propriétaires sous licence) ; pré-entraînement en moins de 4 semaines sur 6 144 GPU NVIDIA GB300 NVL72 ; RL : plus de 100 millions de rollouts sur 10 500 GPU GB300 pendant 4 semaines |
| Licence | Apache 2.0 (annoncée pour la publication des poids) |
| ID API | Sans objet — aucune API officielle |
| Disponibilités | Liste d’attente (platform.reflection.ai) ; poids + rapport technique + model card « plus tard en octobre » ; écosystème de partenaires de distribution annoncé (hyperscalers, neoclouds, bibliothèques open source) |
Nouveautés : Beam face à la référence chinoise
Beam étant le premier modèle du laboratoire, il n’y a pas de « modèle précédent » : la comparaison pertinente est celle que Reflection AI organise elle-même, face à GLM-5.2 (Z.ai) — le modèle ouvert chinois que Beam vise directement.
| Critère | Beam | GLM-5.2 (Z.ai) |
|---|---|---|
| Paramètres (total / actifs) | 501 Md / 23 Md | 744 Md / 40 Md |
| Tokens d’entraînement | 23 800 Md | Non communiqué |
| Contexte | 1M tokens | Non communiqué |
| DeepSWE v1.1 (constructeur) | 44,4 | 44,0 |
| SWE-Bench Pro v1 (constructeur) | 65,5 | 62,1 |
| Terminal-Bench 2.1 (constructeur) | 80,1 | 81,0 |
| Positionnement | Efficacité — 3 à 4× moins de calcul d’inférence à score comparable | Capacité brute — plus grand, plus gourmand |
Le tableau est honnête — et c’est à mettre au crédit de Reflection : le laboratoire publie aussi les scores où il perd (GLM-5.3, Kimi K3 et DeepSeek V4.1 Flash le devancent nettement sur la plupart des tests, voir §4). Le pari n’est pas la couronne des benchmarks, mais le coût par point d’intelligence : un « workhorse model » pour les entreprises qui font tourner des agents à fort volume.
Techniquement, l’originalité revendiquée est ailleurs — dans l’entraînement : plus de 100 millions de rollouts de reinforcement learning, 1,3 milliard de sandbox, un million d’environnements de code et d’agents. Reflection affirme qu’il s’agit de l’un des plus gros entraînements RL jamais menés par un laboratoire ouvert, et que les capacités continuaient de progresser sans plafonner.
Benchmarks
Tous les chiffres ci-dessous sont communiqués par Reflection AI dans son billet d’annonce (aucune mesure indépendante publiée à ce jour — les poids ne sont pas encore disponibles). « NR » = score non reporté par le laboratoire.
| Benchmark | Beam | GLM-5.2 | Kimi K3 | DeepSeek V4.1 Flash | Inkling |
|---|---|---|---|---|---|
| DeepSWE v1.1 | 44,4 | 44,0 | 68,0 | 74,2 | NR |
| SWE-Bench Pro v2 (Hard) | 77,2 | NR | 88,2 | NR | 56,9 |
| SWE-Bench Pro v1 | 65,5 | 62,1 | NR | NR | 54,3 |
| Terminal-Bench 2.1 | 80,1 | 81,0 | 88,3 | 90,6 | 63,8 |
| SWE-Bench Verified | 80,9 | NR | NR | NR | 77,6 |
| SWE-Bench Multilingue | 78,0 | NR | NR | NR | NR |
| Sources : billet officiel Reflection AI, 05/10/2026 (mesures constructeur, non reproduites indépendamment). | |||||
Le billet publie aussi les scores de raisonnement : 86,7 à GPQA Diamond (contre 85,6 pour GLM-5.2 et 88,0 pour Kimi K3), 33,0 à Humanity’s Last Exam sans outils (41,9 avec outils), 20,9 à ARC-AGI-2 et 79,7 à IFBench. Deux réserves s’imposent : tous ces scores sont constructeur, et Beam reste derrière la génération chinoise la plus récente (GLM-5.3, Kimi K3, DeepSeek V4.1 Flash) sur la capacité brute — le laboratoire le reconnaît lui-même : « Where frontier open models like Kimi K3 remain ahead on raw capability, Beam’s advantage is efficiency at inference time. » (« Là où des modèles ouverts frontières comme Kimi K3 restent devant en capacité brute, l’avantage de Beam est l’efficacité à l’inférence. »).
Comparatif : les poids ouverts « code et agents »
| Modèle | Éditeur | Prix entrée /1M | Prix sortie /1M | Contexte | Point fort | Score de référence |
|---|---|---|---|---|---|---|
| Beam | Reflection AI | Non communiqué (pas d’API ; poids à venir) | Non communiqué | 1M | Efficacité d’inférence (3-4× moins de calcul) | 80,9 SWE-Bench Verified (constructeur) |
| GLM-5.2 | Z.ai | Non communiqué (poids ouverts) | Non communiqué | Non communiqué | La référence chinoise visée par Beam | 81,0 Terminal-Bench 2.1 (mesuré par Reflection) |
| DeepSeek V4.1 Flash | DeepSeek | Non communiqué (poids ouverts) | Non communiqué | 1M (selon la presse tech) | Le meilleur score du tableau (90,6) | 90,6 Terminal-Bench 2.1 (mesuré par Reflection) |
| Inkling | Thinking Machines Lab | Non communiqué (poids ouverts) | Non communiqué | Non communiqué | Le rival américain direct (multimodal) | 77,6 SWE-Bench Verified (mesuré par Reflection) |
| Qwen 3.8-Max | Alibaba | Non communiqué (poids ouverts) | Non communiqué | Non communiqué | Le plus massif (famille des 2T+ paramètres) | 86,6 Terminal-Bench 2.1 (mesuré par Reflection) |
Le positionnement de Beam est limpide : le seul poids ouvert occidental de cette génération dont l’argument central est le coût d’inférence, pas le score brut. Face à lui, les modèles chinois dominent les benchmarks mais viennent avec des questions de souveraineté que les entreprises et États occidentaux se posent de plus en plus — c’est exactement la faille que Reflection veut exploiter, avec un modèle « construit en Amérique ». Son talon d’Achille immédiat : les poids ne sont pas encore téléchargeables, donc personne ne peut vérifier les promesses aujourd’hui.
Cas d’usage
- Code agentique en entreprise : le cas d’usage premier — 80,9 à SWE-Bench Verified, 77,2 à SWE-Bench Pro v2 (Hard), avec un paramètre d’effort de raisonnement réglable pour arbitrer coût et qualité.
- Automatisation du développement logiciel : le laboratoire d’origine (agents de code autonomes) vise les workflows où des agents exécutent des tâches longues en sandbox.
- Secteur public et souveraineté : poids Apache 2.0 (à venir) et entraînement américain — l’argument « pas de modèle chinois » pour les administrations occidentales.
- Charges « workhorse » à fort volume : là où le coût par token domine — l’efficacité 3-4× revendiquée change l’équation économique des déploiements massifs.
- Fine-tuning et recherche : poids ouverts + pile complète d’exécution, d’évaluation et de fine-tuning promises avec la sortie — un terrain pour les équipes qui adaptent les modèles.
- Recherche sur le RL à grande échelle : 100M+ de rollouts documentés, une référence méthodologique pour les laboratoires ouverts.
Tarifs et accès
| Offre | Entrée /1M | Sortie /1M | Notes |
|---|---|---|---|
| Beam — accès anticipé | Gratuit (inscription) | Liste d’attente sur platform.reflection.ai — version en cours de red-teaming final | |
| Poids open source | Gratuit (à paraître) | Licence Apache 2.0 annoncée — publication « plus tard en octobre », avec rapport technique, model card et pile développeur | |
| API hébergée officielle | Sans objet | Aucune API annoncée à ce jour | |
| Partenaires de distribution | Non communiqué | Écosystème annoncé (hyperscalers, neoclouds, intégrations open source) | |
Rejoindre la liste d’attente
Lien officiel
Accès développeur : pour l’instant, uniquement la liste d’attente. À la publication des poids (octobre 2026), Reflection promet la pile complète — exécution, évaluation, fine-tuning — et des intégrations avec les bibliothèques et harnais open source existants. Aucun tarif d’API n’est publié : le modèle économique (entreprises et « AI factories » souveraines) reste à préciser.
Déploiement local
Les poids n’étant pas encore publiés, aucune configuration matérielle officielle n’existe pour l’instant. Avec 501 milliards de paramètres au total, il faudra de toute évidence une infrastructure de classe datacenter (grappes multi-GPU) — ce n’est pas un modèle pour poste de travail. La bonne nouvelle est architecturale : seuls 23 Md de paramètres sont actifs par token, donc le coût de calcul par token généré est celui d’un modèle ~20× plus petit — c’est tout l’argument économique de Beam.
- Licence : Apache 2.0 annoncée — usage commercial, modification et redistribution autorisés dès la publication.
- Écosystème : intégrations prévues avec les bibliothèques open source et les harnais d’évaluation existants ; partenaires de distribution (hyperscalers, neoclouds) annoncés pour le lancement.
- À surveiller : la taille réelle des poids (quantifications), la configuration minimale recommandée et les moteurs d’inférence supportés — attendus avec le rapport technique en octobre.
FAQ
Quand Beam a-t-il été annoncé ?
Le 05/10/2026, par Reflection AI (Brooklyn) via son blog officiel, dans le billet « Introducing Beam: Reflection’s 501B open-weight model ». L’annonce confirmait les informations d’Axios publiées le week-end précédent.
Puis-je télécharger Beam aujourd’hui ?
Non : au 06/10/2026, les poids ne sont pas encore publics. Le modèle est en cours de red-teaming final, avec un accès anticipé sur liste d’attente (platform.reflection.ai). La publication des poids, du rapport technique et de la model card est annoncée pour « plus tard en octobre ».
Beam est-il open source ?
La licence Apache 2.0 est annoncée pour la publication des poids — usage commercial, modification et redistribution seront autorisés. Comme pour la plupart des poids ouverts, les données et l’infrastructure d’entraînement resteront propriétaires.
Combien coûte l’utilisation de Beam ?
Aucun tarif n’est publié et aucune API n’est annoncée. L’accès anticipé (liste d’attente) est gratuit, et les poids seront gratuits sous Apache 2.0. Le modèle économique de Reflection (entreprises, « AI factories » souveraines) reste à préciser.
Beam est-il meilleur que les modèles chinois ?
Selon les mesures de Reflection : Beam fait jeu égal avec GLM-5.2 (44,4 contre 44,0 à DeepSWE v1.1) pour 3 à 4 fois moins de calcul d’inférence, mais reste derrière GLM-5.3, Kimi K3 (88,3 à Terminal-Bench 2.1) et DeepSeek V4.1 Flash (90,6) en capacité brute. Tous ces chiffres viennent du constructeur — aucune évaluation indépendante n’existe encore.
Qui est derrière Reflection AI ?
Un laboratoire fondé en 2024 à Brooklyn par Misha Laskin (ex-DeepMind, reward modeling de Gemini) et Ioannis Antonoglou (ex-DeepMind, co-créateur d’AlphaGo), soutenu par Nvidia, avec environ 4,7 milliards de dollars levés et des accords de calcul de plus de 7 milliards avec SpaceX et Nebius.
Qu’est-ce que le « high-compute RL » de Beam ?
L’entraînement par renforcement à très grande échelle revendiqué par Reflection : plus de 100 millions de rollouts sur 10 500 GPU NVIDIA GB300 pendant 4 semaines, avec ~1,3 milliard d’exécutions en sandbox et un million d’environnements. Le laboratoire affirme que c’est l’un des plus gros entraînements RL jamais menés par un lab ouvert — et que les performances progressaient encore sans plafonner.
Verdict
Pour qui — OUI :
- les entreprises qui font tourner des agents de code à fort volume et regardent d’abord le coût par token ;
- les organisations occidentales qui veulent des poids ouverts sans dépendance aux modèles chinois ;
- les équipes qui préparent déjà leur pile (vLLM, harnais) pour la sortie des poids en octobre.
Pour qui — NON :
- ceux qui veulent tester aujourd’hui — les poids ne sont pas encore téléchargeables ;
- ceux qui cherchent le meilleur score brut — Kimi K3 et DeepSeek V4.1 Flash sont devant, selon Reflection elle-même ;
- ceux qui attendent des évaluations indépendantes — tout vient du constructeur pour l’instant.
Note de la rédaction : 7/10. Un premier modèle prometteur sur l’axe qui compte le plus en production — l’efficacité — porté par un entraînement RL d’une ampleur inédite pour un lab ouvert, et une honnêteté rare sur les défaites. Retranchés : des poids encore non publiés (impossible de vérifier quoi que ce soit) et un modèle économique encore flou.
Rejoindre la liste d’attente Beam
Lien officiel