Développer avec l’IA

Ember-1 offre la précision de Kimi K3 avec une latence nettement inférieure

Des benchmarks indépendants montrent que Ember-1 de Fireworks Research égale la précision de Kimi K3 tout en utilisant moins de jetons de raisonnement et en fonctionnant 3,4 fois plus vite.

Traduit automatiquement depuis l'original anglais.

Fireworks Research a publié Ember-1 le 23 septembre sous forme d'aperçu de recherche, construit sur le modèle à poids ouverts Kimi K3 de Moonshot. Des tests indépendants révèlent qu'Ember-1 atteint une précision quasi identique à celle de son modèle de base, tout en réduisant l'utilisation de jetons de raisonnement et en améliorant drastiquement la vitesse d'inférence. Ces résultats suggèrent une voie viable pour les développeurs recherchant un raisonnement de haute qualité sans la latence extrême souvent associée aux modèles de réflexion profonde.

Ce qui s'est passé

L'affirmation centrale derrière Ember-1 est qu'il apprend à éliminer les étapes de raisonnement inutiles tout en préservant la réflexion critique requise pour les tâches complexes. Puisque les jetons de raisonnement sont facturés comme sortie, leur réduction devrait diminuer les coûts. Fireworks facture Ember-1 à 3 $ par million de jetons d'entrée et 15 $ par million de jetons de sortie sur sa plateforme. Bien que cela corresponde au prix de Kimi K3 chez Fireworks, d'autres fournisseurs proposent Kimi K3 dès 1 $ par million de jetons d'entrée et 9 $ par million de jetons de sortie. Cette disparité tarifaire signifie que les économies brutes dépendent fortement du fournisseur choisi, faisant de la performance et de la vitesse les principaux différenciateurs pour Ember-1.

Pour évaluer ces affirmations, un benchmark indépendant a testé les deux modèles sur trois tâches de difficulté progressive : énigmes logiques, planification de déploiement et calculs de probabilité. Chaque test a été exécuté cinq fois par modèle pour assurer la cohérence. Les énigmes logiques impliquaient l'attribution de serveurs à des ingénieurs selon des contraintes spécifiques, avec une complexité croissant de quatre à sept ingénieurs. La tâche de planification de déploiement exigeait de trouver le déploiement le plus rapide pour douze services avec des dépendances et des fenêtres d'indisponibilité. Le test de probabilité demandait des fractions exactes concernant un système de nouvelle tentative avec disjoncteur, vérifié contre une simulation de deux millions de requêtes.

Les résultats ont montré qu'Ember-1 a résolu parfaitement 14 des 15 exécutions, tandis que Kimi K3 a obtenu un score parfait de 15 sur 15. La seule erreur d'Ember-1 s'est produite dans le test de probabilité, où une légère erreur arithmétique a entraîné des réponses incorrectes subséquentes. Malgré cette parité quasi parfaite en matière de précision, Ember-1 a démontré un avantage significatif en efficacité. Il a utilisé 23 % de jetons de raisonnement en moins au total et a terminé la suite de tests 3,4 fois plus vite que Kimi K3. Sur la plateforme Fireworks, cette efficacité s'est traduite par un coût total de 2,48 $ pour Ember-1 contre 3,26 $ pour Kimi K3.

Comment ça fonctionne

Ember-1 est construit directement sur Kimi K3 de Moonshot, un modèle à poids ouverts connu pour ses fortes capacités de raisonnement mais aussi pour ses vitesses d'inférence lentes. La technique d'optimisation se concentre sur la génération de jetons pendant la phase de raisonnement. Au lieu de générer de longues chaînes de pensée pour chaque problème, Ember-1 tente d'identifier et de sauter les étapes logiques redondantes. Ce processus réduit le nombre de jetons de sortie générés, ce qui impacte directement la facturation et la latence.

Puisque les jetons de raisonnement sont facturés comme sortie, toute réduction de la longueur de la réflexion diminue le coût immédiat par requête lors de l'utilisation de fournisseurs facturants par jeton. Cependant, les changements architecturaux semblent également simplifier le graphe de calcul, conduisant à un temps réel plus court. Dans le benchmark, le temps de réponse moyen d'Ember-1 pour les énigmes logiques complexes était inférieur à quatre minutes, tandis que Kimi K3 a pris plus de douze minutes. Cette différence de vitesse est cruciale pour les applications interactives où les temps d'attente utilisateur doivent être minimisés.

Détails clés

  • Ember-1 a terminé la suite de tests complète 3,4 fois plus vite que Kimi K3.
  • Le modèle a utilisé 23 % de jetons de raisonnement en moins en moyenne sur tous les tests.
  • Ember-1 a réalisé 14 exécutions parfaites sur 15, avec une mineure erreur arithmétique dans la section probabilité.
  • Kimi K3 a réalisé 15 exécutions parfaites sur 15, démontrant une cohérence légèrement supérieure dans ce benchmark spécifique.
  • Sur Fireworks, Ember-1 a coûté 2,48 $ pour la suite de tests, contre 3,26 $ pour Kimi K3.
  • Si routé via des fournisseurs moins chers, Kimi K3 pourrait coûter aussi peu que 1,96 $ pour la même charge de travail, battant le prix d'Ember-1.

Pourquoi c'est important

Pour les équipes d'ingénierie construisant des produits pilotés par l'IA, le compromis entre précision, coût et latence est constant. Les modèles de raisonnement profond comme Kimi K3 offrent souvent une précision supérieure sur les problèmes difficiles mais souffrent d'une latence et d'un coût élevés dus à une génération extensive de jetons. Ember-1 démontre qu'il est possible de conserver la plupart des avantages en précision tout en améliorant considérablement la vitesse. Un gain de vitesse de 3,4x peut faire la différence entre une fonctionnalité interactive utilisable et un processus batch en arrière-plan, élargissant la gamme d'applications où les modèles de raisonnement profond sont viables.

Cependant, le bénéfice en coût n'est pas universel. Les développeurs qui privilégient le coût absolu le plus bas plutôt que la vitesse peuvent toujours obtenir de meilleurs tarifs en routant Kimi K3 via des fournisseurs économiques sur des plateformes comme OpenRouter. La proposition de valeur d'Ember-1 est plus forte pour les cas d'usage où le temps de réponse est critique. Si une application nécessite des réponses de raisonnement quasi instantanées, Ember-1 offre une alternative convaincante au modèle de base plus lent, même si le prix par jeton est plus élevé que les options les moins chères disponibles pour Kimi K3.

Ce que vous pouvez faire

  • Évaluez Ember-1 pour les fonctionnalités interactives nécessitant une latence inférieure à cinq minutes.
  • Comparez le coût total de possession en intégrant le temps de développement économisé grâce à des cycles d'itération plus rapides.
  • Testez Kimi K3 sur des fournisseurs à faible coût si votre priorité est le prix minimal plutôt que la vitesse.
  • Utilisez Ember-1 lorsque le temps de réponse est un facteur décisif pour l'expérience utilisateur.

Outils de la Boutique Bytechap

$89

DocBento

Gestion documentaire auto-hébergée qui analyse chaque scan et répond avec des citations de pages.

Démo en ligne

Continuer la lecture

Tous les articles