Annonce et contexte

Le 05/10/2026, Reflection AI a dévoilé Beam, son premier modèle de langage, via un billet du blog officiel intitulé « Introducing Beam: Reflection’s 501B open-weight model ». La promesse officielle, selon le laboratoire : « We are introducing Beam, Reflection’s first open-weight model. Beam is a sparse Mixture-of-Experts model with 501 billion total parameters, 23 billion active, built for coding, reasoning, and agentic workloads. » (« Nous présentons Beam, le premier modèle à poids ouverts de Reflection. Beam est un modèle sparse mixture-of-experts de 501 milliards de paramètres au total, 23 milliards actifs, conçu pour le code, le raisonnement et les charges agentiques. »)

Reflection AI n’est pas un laboratoire comme les autres : fondé en 2024 à Brooklyn par Misha Laskin (ex-DeepMind, ex-responsable du reward modeling de Gemini) et Ioannis Antonoglou (ex-DeepMind, co-créateur d’AlphaGo), soutenu par Nvidia, il a levé environ 4,7 milliards de dollars (valorisation de 25 milliards) et sécurisé plus de 7 milliards de dollars d’accords de calcul avec SpaceX et Nebius pour des GPU GB300 jusqu’en 2029. L’annonce confirmait les informations d’Axios publiées le week-end précédent.

Le positionnement est frontal : la réponse occidentale aux poids ouverts chinois (DeepSeek, Qwen, GLM, Kimi). Là où les modèles chinois gagnent sur la capacité brute, Beam joue l’efficacité — des scores comparables à GLM-5.2 avec 3 à 4 fois moins de calcul d’inférence, selon le laboratoire. Nuance importante : les poids ne sont pas encore publics — red-teaming final en cours, accès anticipé sur liste d’attente, publication des poids, du rapport technique et de la model card « plus tard en octobre ».

Découvrir Beam
Lien officiel

Fiche technique

Caractéristique Valeur
Éditeur Reflection AI (Brooklyn, États-Unis)
Date d’annonce 05/10/2026 (blog officiel)
Date de disponibilité 05/10/2026 — accès anticipé sur liste d’attente ; poids publics « plus tard en octobre » (non publiés au 06/10/2026)
Famille / gamme Beam (premier modèle — « le premier d’une série » selon le laboratoire)
Type LLM texte seul, sparse mixture-of-experts, code / raisonnement / agentique, effort de raisonnement réglable
Architecture 52 couches ; attention locale et globale entrelacée ; experts routés fins ; 501 Md de paramètres au total, 23 Md actifs par token
Fenêtre de contexte (entrée) 1 000 000 tokens (étendue en midtraining)
Tokens max en sortie Non communiqué
Cutoff des connaissances Non communiqué
Modalités d’entrée / sortie Entrée : texte ; sortie : texte (modèle texte seul — pas de multimodal)
Entraînement 23 800 Md de tokens (web + données propriétaires sous licence) ; pré-entraînement en moins de 4 semaines sur 6 144 GPU NVIDIA GB300 NVL72 ; RL : plus de 100 millions de rollouts sur 10 500 GPU GB300 pendant 4 semaines
Licence Apache 2.0 (annoncée pour la publication des poids)
ID API Sans objet — aucune API officielle
Disponibilités Liste d’attente (platform.reflection.ai) ; poids + rapport technique + model card « plus tard en octobre » ; écosystème de partenaires de distribution annoncé (hyperscalers, neoclouds, bibliothèques open source)

Nouveautés : Beam face à la référence chinoise

Beam étant le premier modèle du laboratoire, il n’y a pas de « modèle précédent » : la comparaison pertinente est celle que Reflection AI organise elle-même, face à GLM-5.2 (Z.ai) — le modèle ouvert chinois que Beam vise directement.

Critère Beam GLM-5.2 (Z.ai)
Paramètres (total / actifs) 501 Md / 23 Md 744 Md / 40 Md
Tokens d’entraînement 23 800 Md Non communiqué
Contexte 1M tokens Non communiqué
DeepSWE v1.1 (constructeur) 44,4 44,0
SWE-Bench Pro v1 (constructeur) 65,5 62,1
Terminal-Bench 2.1 (constructeur) 80,1 81,0
Positionnement Efficacité — 3 à 4× moins de calcul d’inférence à score comparable Capacité brute — plus grand, plus gourmand

Le tableau est honnête — et c’est à mettre au crédit de Reflection : le laboratoire publie aussi les scores où il perd (GLM-5.3, Kimi K3 et DeepSeek V4.1 Flash le devancent nettement sur la plupart des tests, voir §4). Le pari n’est pas la couronne des benchmarks, mais le coût par point d’intelligence : un « workhorse model » pour les entreprises qui font tourner des agents à fort volume.

Techniquement, l’originalité revendiquée est ailleurs — dans l’entraînement : plus de 100 millions de rollouts de reinforcement learning, 1,3 milliard de sandbox, un million d’environnements de code et d’agents. Reflection affirme qu’il s’agit de l’un des plus gros entraînements RL jamais menés par un laboratoire ouvert, et que les capacités continuaient de progresser sans plafonner.

Benchmarks

Tous les chiffres ci-dessous sont communiqués par Reflection AI dans son billet d’annonce (aucune mesure indépendante publiée à ce jour — les poids ne sont pas encore disponibles). « NR » = score non reporté par le laboratoire.

Benchmark Beam GLM-5.2 Kimi K3 DeepSeek V4.1 Flash Inkling
DeepSWE v1.1 44,4 44,0 68,0 74,2 NR
SWE-Bench Pro v2 (Hard) 77,2 NR 88,2 NR 56,9
SWE-Bench Pro v1 65,5 62,1 NR NR 54,3
Terminal-Bench 2.1 80,1 81,0 88,3 90,6 63,8
SWE-Bench Verified 80,9 NR NR NR 77,6
SWE-Bench Multilingue 78,0 NR NR NR NR
Sources : billet officiel Reflection AI, 05/10/2026 (mesures constructeur, non reproduites indépendamment).

Le billet publie aussi les scores de raisonnement : 86,7 à GPQA Diamond (contre 85,6 pour GLM-5.2 et 88,0 pour Kimi K3), 33,0 à Humanity’s Last Exam sans outils (41,9 avec outils), 20,9 à ARC-AGI-2 et 79,7 à IFBench. Deux réserves s’imposent : tous ces scores sont constructeur, et Beam reste derrière la génération chinoise la plus récente (GLM-5.3, Kimi K3, DeepSeek V4.1 Flash) sur la capacité brute — le laboratoire le reconnaît lui-même : « Where frontier open models like Kimi K3 remain ahead on raw capability, Beam’s advantage is efficiency at inference time. » (« Là où des modèles ouverts frontières comme Kimi K3 restent devant en capacité brute, l’avantage de Beam est l’efficacité à l’inférence. »).

Comparatif : les poids ouverts « code et agents »

Modèle Éditeur Prix entrée /1M Prix sortie /1M Contexte Point fort Score de référence
Beam Reflection AI Non communiqué (pas d’API ; poids à venir) Non communiqué 1M Efficacité d’inférence (3-4× moins de calcul) 80,9 SWE-Bench Verified (constructeur)
GLM-5.2 Z.ai Non communiqué (poids ouverts) Non communiqué Non communiqué La référence chinoise visée par Beam 81,0 Terminal-Bench 2.1 (mesuré par Reflection)
DeepSeek V4.1 Flash DeepSeek Non communiqué (poids ouverts) Non communiqué 1M (selon la presse tech) Le meilleur score du tableau (90,6) 90,6 Terminal-Bench 2.1 (mesuré par Reflection)
Inkling Thinking Machines Lab Non communiqué (poids ouverts) Non communiqué Non communiqué Le rival américain direct (multimodal) 77,6 SWE-Bench Verified (mesuré par Reflection)
Qwen 3.8-Max Alibaba Non communiqué (poids ouverts) Non communiqué Non communiqué Le plus massif (famille des 2T+ paramètres) 86,6 Terminal-Bench 2.1 (mesuré par Reflection)

Le positionnement de Beam est limpide : le seul poids ouvert occidental de cette génération dont l’argument central est le coût d’inférence, pas le score brut. Face à lui, les modèles chinois dominent les benchmarks mais viennent avec des questions de souveraineté que les entreprises et États occidentaux se posent de plus en plus — c’est exactement la faille que Reflection veut exploiter, avec un modèle « construit en Amérique ». Son talon d’Achille immédiat : les poids ne sont pas encore téléchargeables, donc personne ne peut vérifier les promesses aujourd’hui.

Cas d’usage

  • Code agentique en entreprise : le cas d’usage premier — 80,9 à SWE-Bench Verified, 77,2 à SWE-Bench Pro v2 (Hard), avec un paramètre d’effort de raisonnement réglable pour arbitrer coût et qualité.
  • Automatisation du développement logiciel : le laboratoire d’origine (agents de code autonomes) vise les workflows où des agents exécutent des tâches longues en sandbox.
  • Secteur public et souveraineté : poids Apache 2.0 (à venir) et entraînement américain — l’argument « pas de modèle chinois » pour les administrations occidentales.
  • Charges « workhorse » à fort volume : là où le coût par token domine — l’efficacité 3-4× revendiquée change l’équation économique des déploiements massifs.
  • Fine-tuning et recherche : poids ouverts + pile complète d’exécution, d’évaluation et de fine-tuning promises avec la sortie — un terrain pour les équipes qui adaptent les modèles.
  • Recherche sur le RL à grande échelle : 100M+ de rollouts documentés, une référence méthodologique pour les laboratoires ouverts.

Tarifs et accès

Offre Entrée /1M Sortie /1M Notes
Beam — accès anticipé Gratuit (inscription) Liste d’attente sur platform.reflection.ai — version en cours de red-teaming final
Poids open source Gratuit (à paraître) Licence Apache 2.0 annoncée — publication « plus tard en octobre », avec rapport technique, model card et pile développeur
API hébergée officielle Sans objet Aucune API annoncée à ce jour
Partenaires de distribution Non communiqué Écosystème annoncé (hyperscalers, neoclouds, intégrations open source)

Rejoindre la liste d’attente
Lien officiel

Accès développeur : pour l’instant, uniquement la liste d’attente. À la publication des poids (octobre 2026), Reflection promet la pile complète — exécution, évaluation, fine-tuning — et des intégrations avec les bibliothèques et harnais open source existants. Aucun tarif d’API n’est publié : le modèle économique (entreprises et « AI factories » souveraines) reste à préciser.

Déploiement local

Les poids n’étant pas encore publiés, aucune configuration matérielle officielle n’existe pour l’instant. Avec 501 milliards de paramètres au total, il faudra de toute évidence une infrastructure de classe datacenter (grappes multi-GPU) — ce n’est pas un modèle pour poste de travail. La bonne nouvelle est architecturale : seuls 23 Md de paramètres sont actifs par token, donc le coût de calcul par token généré est celui d’un modèle ~20× plus petit — c’est tout l’argument économique de Beam.

  • Licence : Apache 2.0 annoncée — usage commercial, modification et redistribution autorisés dès la publication.
  • Écosystème : intégrations prévues avec les bibliothèques open source et les harnais d’évaluation existants ; partenaires de distribution (hyperscalers, neoclouds) annoncés pour le lancement.
  • À surveiller : la taille réelle des poids (quantifications), la configuration minimale recommandée et les moteurs d’inférence supportés — attendus avec le rapport technique en octobre.

FAQ

Quand Beam a-t-il été annoncé ?

Le 05/10/2026, par Reflection AI (Brooklyn) via son blog officiel, dans le billet « Introducing Beam: Reflection’s 501B open-weight model ». L’annonce confirmait les informations d’Axios publiées le week-end précédent.

Puis-je télécharger Beam aujourd’hui ?

Non : au 06/10/2026, les poids ne sont pas encore publics. Le modèle est en cours de red-teaming final, avec un accès anticipé sur liste d’attente (platform.reflection.ai). La publication des poids, du rapport technique et de la model card est annoncée pour « plus tard en octobre ».

Beam est-il open source ?

La licence Apache 2.0 est annoncée pour la publication des poids — usage commercial, modification et redistribution seront autorisés. Comme pour la plupart des poids ouverts, les données et l’infrastructure d’entraînement resteront propriétaires.

Combien coûte l’utilisation de Beam ?

Aucun tarif n’est publié et aucune API n’est annoncée. L’accès anticipé (liste d’attente) est gratuit, et les poids seront gratuits sous Apache 2.0. Le modèle économique de Reflection (entreprises, « AI factories » souveraines) reste à préciser.

Beam est-il meilleur que les modèles chinois ?

Selon les mesures de Reflection : Beam fait jeu égal avec GLM-5.2 (44,4 contre 44,0 à DeepSWE v1.1) pour 3 à 4 fois moins de calcul d’inférence, mais reste derrière GLM-5.3, Kimi K3 (88,3 à Terminal-Bench 2.1) et DeepSeek V4.1 Flash (90,6) en capacité brute. Tous ces chiffres viennent du constructeur — aucune évaluation indépendante n’existe encore.

Qui est derrière Reflection AI ?

Un laboratoire fondé en 2024 à Brooklyn par Misha Laskin (ex-DeepMind, reward modeling de Gemini) et Ioannis Antonoglou (ex-DeepMind, co-créateur d’AlphaGo), soutenu par Nvidia, avec environ 4,7 milliards de dollars levés et des accords de calcul de plus de 7 milliards avec SpaceX et Nebius.

Qu’est-ce que le « high-compute RL » de Beam ?

L’entraînement par renforcement à très grande échelle revendiqué par Reflection : plus de 100 millions de rollouts sur 10 500 GPU NVIDIA GB300 pendant 4 semaines, avec ~1,3 milliard d’exécutions en sandbox et un million d’environnements. Le laboratoire affirme que c’est l’un des plus gros entraînements RL jamais menés par un lab ouvert — et que les performances progressaient encore sans plafonner.

Verdict

Pour qui — OUI :

  • les entreprises qui font tourner des agents de code à fort volume et regardent d’abord le coût par token ;
  • les organisations occidentales qui veulent des poids ouverts sans dépendance aux modèles chinois ;
  • les équipes qui préparent déjà leur pile (vLLM, harnais) pour la sortie des poids en octobre.

Pour qui — NON :

  • ceux qui veulent tester aujourd’hui — les poids ne sont pas encore téléchargeables ;
  • ceux qui cherchent le meilleur score brut — Kimi K3 et DeepSeek V4.1 Flash sont devant, selon Reflection elle-même ;
  • ceux qui attendent des évaluations indépendantes — tout vient du constructeur pour l’instant.

Note de la rédaction : 7/10. Un premier modèle prometteur sur l’axe qui compte le plus en production — l’efficacité — porté par un entraînement RL d’une ampleur inédite pour un lab ouvert, et une honnêteté rare sur les défaites. Retranchés : des poids encore non publiés (impossible de vérifier quoi que ce soit) et un modèle économique encore flou.

Rejoindre la liste d’attente Beam
Lien officiel