IA ouverte et locale

Bespoke Labs lance Nimble, un modèle de décision rapide de 9 milliards de paramètres pour l'inférence locale

Bespoke Labs a lancé Nimble, un modèle de décision ouvert de 9 milliards de paramètres, affiné à partir de Qwen3.5-9B, qui fournit des réponses probabilistes à des questions structurées en moins de 100 ms sur du matériel local.

A metallic cube with glowing circuits representing the Nimble AI model on a desk.
Illustration générée pour cet article

Traduit automatiquement depuis l'original anglais.

Bespoke Labs a lancé Nimble, un nouveau modèle de décision à poids ouverts conçu pour une inférence locale rapide. Affiné à partir de l'architecture Qwen3.5-9B, ce modèle de 9 milliards de paramètres permet aux développeurs d'envoyer du texte et un ensemble de questions structurées, recevant des réponses probabilistes sans étape de raisonnement traditionnelle. La publication inclut une documentation API claire et des métriques de performance, ciblant les ingénieurs ayant besoin de capacités efficaces de traitement en périphérie (edge).

Ce qui s'est passé

Nimble représente un tournant vers des modèles de décision spécialisés qui privilégient la vitesse et la sortie structurée plutôt que la créativité générative. Contrairement aux grands modèles de langage standards qui génèrent du texte token par token via un processus de raisonnement, Nimble est optimisé pour choisir des réponses parmi un ensemble défini d'options. Il lit le prompt d'entrée une fois par question et évalue directement les tokens de réponse. Ce choix architectural élimine la latence associée au raisonnement en chaîne de pensée (chain-of-thought), permettant au modèle de renvoyer des résultats en moins de 100 millisecondes sur un MacBook Pro équipé d'une puce M5 Max.

Le modèle est disponible sous licence Apache 2.0, ce qui le rend adapté aussi bien aux projets commerciaux qu'open source. Bespoke Labs a entraîné Nimble sur des paires contrastives, une méthode de construction de dataset où deux exemples ne diffèrent que par un fait spécifique qui inverse la bonne réponse. Cette stratégie d'entraînement aide le modèle à se concentrer sur des distinctions factuelles précises plutôt que sur des schémas linguistiques généraux. Les développeurs peuvent récupérer le modèle directement via Ollama avec la commande ollama pull nimble, l'intégrant dans leurs workflows locaux existants avec une configuration minimale.

Comment ça fonctionne

Nimble opère via l'endpoint /v1/systemone d'Ollama, qui respecte la norme Jev API de TypeSafe. Le modèle d'interaction diffère des interfaces de chat typiques. Les utilisateurs fournissent le texte à évaluer dans un champ appelé state, qui peut être une simple chaîne de caractères ou un objet JSON structuré. En parallèle de l'état, les utilisateurs soumettent jusqu'à 64 questions nommées dans une seule requête. Le modèle traite ces questions par rapport au texte fourni et renvoie les réponses dans le même ordre qu'elles ont été posées.

Le système prend en charge trois types principaux de questions : choix, vérification binaire de vérité et notation par grille d'évaluation (rubric). Pour les questions à choix, l'utilisateur définit une liste d'options, et le modèle renvoie le choix sélectionné ainsi que les probabilités pour toutes les options. Les questions binaires, désignées par noul dans l'API, renvoient un verdict vrai ou faux avec une probabilité associée. Les questions de notation permettent aux utilisateurs de définir des niveaux ordonnés avec des critères spécifiques, renvoyant une note pondérée par probabilité. Dans tous les cas, le modèle fournit une métrique de confiance entre 0 et 1, indiquant la concentration des probabilités, bien que cela ne soit pas une mesure directe de la justesse.

Détails clés

  • Taille et base du modèle : Nimble est un modèle de 9 milliards de paramètres affiné à partir de Qwen3.5-9B.
  • Performance : Il délivre des réponses en moins de 100 ms sur un MacBook Pro avec une puce M5 Max.
  • Capacité de traitement par lots : Un seul appel API peut gérer jusqu'à 64 questions sur le même texte.
  • Données d'entraînement : Le modèle a été entraîné sur des paires contrastives où un changement unique de fait inverse la réponse.
  • Licence : Publiée sous licence Apache 2.0, autorisant un usage commercial et privé large.
  • Format de sortie : Renvoie des données structurées incluant choix, notes, probabilités et métriques de confiance.

Pourquoi c'est important

Pour les ingénieurs logiciels construisant des systèmes de production, l'élimination de l'étape de raisonnement offre des avantages significatifs en termes de latence et de coût. Les grands modèles de langage traditionnels ont souvent du mal à produire des sorties structurées cohérentes, nécessitant une ingénierie de prompt complexe ou un post-traitement pour extraire des décisions fiables. La conception de Nimble garantit que chaque réponse correspond à un schéma prédéfini, réduisant le besoin de couches de validation et de gestion d'erreurs dans les applications en aval. Cette fiabilité est cruciale pour des tâches comme le routage des tickets de support client, l'application de politiques de conformité ou l'évaluation de la qualité du contenu, où un comportement déterministe est préféré à la génération créative.

La capacité d'exécuter ce modèle localement à grande vitesse répond également aux préoccupations croissantes concernant la confidentialité des données et les coûts opérationnels. En traitant des textes sensibles sur l'appareil sans les envoyer à des API externes, les organisations peuvent maintenir un contrôle plus strict sur leurs données. De plus, la faible latence permet une prise de décision en temps réel dans les applications destinées aux utilisateurs, telles que la validation instantanée de formulaires ou le filtrage dynamique de contenu, sans introduire de retards perceptibles. La nature ouverte des poids du modèle permet aux équipes d'auditer son comportement et de l'affiner davantage pour des exigences spécifiques à leur domaine.

Ce que vous pouvez faire

  • Installez Ollama et récupérez le modèle Nimble en utilisant la commande ollama pull nimble pour tester les vitesses d'inférence locale.
  • Expérimentez avec l'endpoint /v1/systemone en envoyant des états JSON structurés et en définissant jusqu'à 64 questions par requête.
  • Implémentez un système de routage qui utilise le type de choix de Nimble pour diriger les demandes des utilisateurs vers les départements appropriés en fonction des scores de probabilité.
  • Construisez un outil d'application de politique qui utilise le type de notation pour évaluer le contenu généré par les utilisateurs contre une grille d'évaluation définie de niveaux acceptables.
  • Utilisez le type de question binaire noul pour créer des pipelines automatisés de vérification des faits qui valident des conditions spécifiques dans les documents.
  • Surveillez la métrique de confiance renvoyée par le modèle pour signaler les décisions à faible certitude à une revue humaine, améliorant ainsi la fiabilité globale du système.

Outils de la Boutique Bytechap

$89

DocBento

Gestion documentaire auto-hébergée qui analyse chaque scan et répond avec des citations de pages.

Démo en ligne

Continuer la lecture

Tous les articles