IA ouverte et locale

Reflection AI lance Beam, un modèle à poids ouverts et faible coût pour le raisonnement

Reflection AI a dévoilé Beam, un modèle à poids ouverts qui prétend rivaliser avec les concurrents chinois en matière de raisonnement tout en nécessitant nettement moins de puissance de calcul pour l'inférence.

A metallic cube with glowing circuits floating above server racks.
Illustration générée pour cet article

Traduit automatiquement depuis l'original anglais.

Reflection AI, une startup basée à Brooklyn fondée en 2024, a officiellement lancé Beam, son premier modèle d'intelligence artificielle frontière à poids ouverts. Cette sortie marque une entrée significative dans le paysage concurrentiel des grands modèles de langage, positionnant Beam comme une alternative économique aux systèmes propriétaires ainsi qu'aux options existantes à poids ouverts provenant de Chine et d'Occident.

Ce qui s'est passé

L'entreprise décrit Beam comme un modèle texte uniquement de type mixture-of-experts (mélange d'experts), conçu spécifiquement pour le raisonnement avancé, la programmation et les tâches agentiques. Selon Reflection, le modèle offre des performances comparables aux principaux modèles chinois à poids ouverts sur des benchmarks complexes, mais fonctionne à une fraction du coût par token et du temps de calcul d'inférence requis par ses rivaux. Cette annonce confirme des rapports antérieurs indiquant que la startup approchait de son lancement public.

Beam compte au total 501 milliards de paramètres, dont 23 milliards sont actifs lors de l'inférence. Il a été pré-entraîné sur un vaste jeu de données de 23,8 billions de tokens et prend en charge une fenêtre de contexte d'un million de tokens. À titre de comparaison, le modèle GLM-5.2 de Z.ai contient environ 744 milliards de paramètres totaux avec 40 milliards actifs. Reflection affirme que bien que ses métriques de performance n'aient pas encore été vérifiées indépendamment, les benchmarks internes montrent que Beam obtient des scores équivalents à ceux de GLM-5.2 et surpasse les principaux modèles occidentaux à poids ouverts actuels.

La startup positionne Beam directement contre des acteurs majeurs tels qu'Anthropic, OpenAI, Mistral, Meta et Cohere. Son concurrent domestique le plus immédiat pourrait être Inkling, le modèle ouvert publié en juillet par Thinking Machines Lab. Les données de Reflection suggèrent que Beam surpasse Inkling sur quatre tests de codage spécifiques, bien qu'il soit important de noter qu'Inkling est multimodal tandis que Beam est limité au texte. L'entreprise prévoit de publier les poids du modèle et tous les détails techniques plus tard ce mois-ci, avec une distribution prévue via les hyperscalers, les neoclouds et les bibliothèques open source.

Comment cela fonctionne

Beam utilise une architecture mixture-of-experts, un choix de conception qui permet au modèle d'activer seulement un sous-ensemble de ses paramètres totaux pour chaque entrée donnée. Cette éparsité permet au modèle de maintenir un nombre élevé de paramètres totaux pour la rétention des connaissances tout en gardant un nombre faible de paramètres actifs pendant le fonctionnement. Le résultat est une réduction de la charge de calcul lors de l'inférence, ce qui, selon Reflection, entraîne une utilisation de la puissance de calcul d'inférence 3 à 4 fois inférieure par rapport aux concurrents.

Le modèle a été entraîné à l'aide de techniques d'apprentissage par renforcement à haute intensité de calcul. Cette approche de formation se concentre sur l'optimisation de la capacité du modèle à raisonner face à des problèmes complexes plutôt que de simplement prédire le mot suivant dans une séquence. En privilégiant les capacités de raisonnement, le modèle vise à gérer les tâches agentiques et les défis de codage plus efficacement que ne le permettraient les méthodes de pré-entraînement traditionnelles seules.

Détails clés

  • Beam est un modèle de 501 milliards de paramètres avec 23 milliards de paramètres actifs par étape d'inférence.
  • Le modèle a été pré-entraîné sur 23,8 billions de tokens et prend en charge une fenêtre de contexte d'un million de tokens.
  • Reflection affirme que Beam utilise 3 à 4 fois moins de puissance de calcul d'inférence que les modèles concurrents tout en égalant leurs performances sur les benchmarks de raisonnement.
  • La startup a levé environ 4,7 milliards de dollars, avec des investisseurs incluant Nvidia, Sequoia Capital et Lightspeed Venture Partners.
  • Reflection a sécurisé plus de 7 milliards de dollars d'accords avec SpaceX et Nebius pour accéder aux puces Nvidia GB300 jusqu'en 2029.
  • L'entreprise promeut le concept d'« usine IA », permettant aux entreprises et aux nations souveraines d'entraîner des systèmes d'IA locaux personnalisés sur des données propriétaires.

Pourquoi c'est important

Pour les ingénieurs logiciels et les leaders techniques, la promesse de coûts d'inférence réduits est cruciale. À mesure que les applications d'IA passent des prototypes expérimentaux aux environnements de production, le coût d'exécution des grands modèles peut devenir prohibitif. Un modèle offrant des capacités de raisonnement de niveau frontière à un coût de calcul nettement inférieur pourrait rendre les fonctionnalités d'IA avancées viables pour un éventail plus large de produits et de services. Ce gain d'efficacité est particulièrement pertinent pour les équipes développant des workflows agentiques ou des assistants de codage complexes où la latence et le coût sont les principales contraintes.

De plus, le lancement intensifie la concurrence entre les modèles à poids ouverts occidentaux et chinois. Les développeurs qui dépendaient des modèles issus des laboratoires chinois pour obtenir des performances rentables disposent désormais d'une alternative nationale revendiquant une efficacité similaire. Cette diversification réduit la dépendance à une seule région géographique pour l'infrastructure fondamentale de l'IA. Elle exerce également une pression sur les autres fournisseurs occidentaux pour qu'ils optimisent leurs propres modèles en termes d'efficacité, accélérant potentiellement l'innovation dans les architectures éparses et les méthodes d'entraînement par apprentissage par renforcement à travers l'industrie.

Ce que vous pouvez faire

  • Surveillez la publication officielle des poids de Beam et de sa documentation technique plus tard ce mois-ci pour évaluer la compatibilité avec votre infrastructure actuelle.
  • Évaluez la réduction revendiquée de 3 à 4 fois de la puissance de calcul d'inférence par rapport aux exigences spécifiques de votre charge de travail, en gardant à l'esprit que ces chiffres sont actuellement auto-déclarés.
  • Comparez les capacités texte uniquement de Beam avec des alternatives multimodales comme Inkling si vos besoins incluent d'autres types de médias.

Outils de la Boutique Bytechap

$89

DocBento

Gestion documentaire auto-hébergée qui analyse chaque scan et répond avec des citations de pages.

Démo en ligne

Continuer la lecture

Tous les articles