Techonologie

“Le DeepSeek américain” : Reflection AI dévoile son premier modèle open-weight avec l’ambition de dépasser la Chine

Soutenue par Nvidia, la start-up américaine Reflection AI a dévoilé Beam, son premier modèle open-weight. Avec 501 milliards de paramètres, dont seulement 23 milliards activés, elle veut surtout s’imposer sur le code et les usages agentiques, avec une promesse de sobriété en inférence face aux modèles open-weight chinois.

Cette fois, le modèle est là. Après plusieurs rumeurs courant sur l’arrivée prochaine d’un modèle développé par la start-up, Reflection AI a dévoilé le 5 octobre Beam, son premier modèle open-weight. Il s’agit d’un modèle Mixture-of-Experts de 501 milliards de paramètres au total, dont 23 milliards actifs, conçu en priorité pour l’agentic coding, le raisonnement et les tâches agentiques. La start-up présente cette sortie comme la première étape d’une série de modèles destinés à faire émerger une « open intelligence » occidentale.

Se mesurer aux meilleurs modèles du marché

Beam n’est toutefois pas présenté comme le nouveau champion absolu des benchmarks. Reflection reconnaît que des modèles comme Kimi K3 restent devant sur les capacités brutes, tandis que Beam se positionne au niveau de modèles ouverts plus importants comme GLM-5.2 et se rapproche de Qwen 3.8-Max sur les tâches de code et d’agents. Sa carte maîtresse serait ailleurs : l’efficacité à l’inférence.

Reflection affirme que Beam atteint des performances comparables à GLM-5.2 sur certains benchmarks de raisonnement avec trois à quatre fois moins de calcul à l’inférence.

Sur les tâches de développement logiciel, Beam obtient notamment 80,9% sur SWE-Bench Verified, 77,2% sur SWE-Bench Pro v2-Hard et 80,1% sur Terminal-Bench 2.1. Le modèle atteint également 97,8% à AIME 2026 et 90,5% à GPQA Diamond selon les résultats publiés par Reflection. Ces comparaisons sont toutefois à lire avec prudence puisqu’elles reposent en partie sur les évaluations que l’entreprise a réalisées ou compilées elle-même.

Un entraînement sur plus de 10 000 puces GB300

La particularité de Beam réside surtout dans les moyens déployés pour l’entraîner. Reflection indique avoir utilisé 23 800 milliards de tokens provenant du web et de jeux de données propriétaires sous licence pour le pré-entraînement. Le modèle a ensuite bénéficié d’un entraînement par renforcement à grande échelle : plus de 100 millions de rollouts, générés pendant quatre semaines avec 10 500 GPU Nvidia GB300. Le pré-entraînement lui-même a été réalisé en moins de quatre semaines sur un cluster de 6 144 GB300 NVL72.

Le recours massif au renforcement (reinforcement learning ou RL) est au cœur de la stratégie technique de Reflection. L’entreprise affirme avoir construit près d’un million d’environnements pour entraîner Beam sur des tâches de programmation, de terminal, de raisonnement, de recherche web ou d’utilisation d’outils. Pendant l’entraînement, son infrastructure a pu gérer en moyenne 110 000 rollouts simultanément, jusqu’à 170 000 environnements en parallèle. Reflection dit avoir ainsi pu augmenter progressivement le calcul consacré au RL sans observer de plateau des performances.

La promesse d’une meilleure efficacité

Cette obsession pour l’efficacité n’est pas anodine. Reflection veut faire de Beam un modèle particulièrement adapté aux entreprises qui souhaitent exécuter leurs propres systèmes d’IA. L’entreprise promet à terme des poids sous licence Apache 2.0, accompagnés d’un rapport technique, d’une model card et des outils nécessaires pour exécuter, évaluer et fine-tune le modèle. La version complète doit être publiée plus tard en octobre, avec des intégrations à l’écosystème open source.

Cette stratégie s’inscrit dans un projet beaucoup plus large. En octobre 2025, Reflection annonçait vouloir construire une « frontier open intelligence », avec l’ambition explicite de sortir les modèles de pointe du cercle des laboratoires fermés. La société expliquait alors avoir réuni une équipe issue notamment des travaux autour de PaLM, Gemini, AlphaGo, AlphaCode ou AlphaProof et avoir développé sa propre infrastructure d’entraînement de grands modèles Mixture-of-Experts. Elle avait également annoncé avoir levé 2 milliards de dollars. Nvidia faisait partie de ses investisseurs.

Nvidia, Nebius, SpaceX… Reflection AI sait s’entourer

Depuis, Reflection a progressivement constitué les briques nécessaires à cette ambition. Son actualité récente est révélatrice : un accord avec SpaceX pouvant atteindre 6,3 milliards de dollars pour de la capacité de calcul en juin 2026, puis un contrat d’environ 1 milliard de dollars avec Nebius annoncé en juillet.

Le projet avec le groupe sud-coréen Shinsegae doit, lui, déboucher sur une infrastructure d’IA souveraine de 250 MW reposant sur les modèles de Reflection et des GPU Nvidia. Reflection indique également fournir ses modèles à la Genesis Mission du département américain de l’Energie, pour les 17 laboratoires nationaux américains.

Beam constitue donc moins un coup destiné à détrôner immédiatement OpenAI, Anthropic ou les meilleurs modèles chinois qu’une première démonstration de sa stratégie. Reflection cherche à installer un champion occidental de l’open-weight capable de combiner performances, personnalisation et efficacité de calcul. Pour Nvidia, dont les GPU constituent une part essentielle de cette équation, l’enjeu est tout aussi stratégique : accompagner l’émergence d’un écosystème de modèles ouverts suffisamment puissant pour faire face aux acteurs chinois et nourrir une nouvelle génération d’« AI factories ».

Source : usine-digitale.fr