Offene & lokale KI

Bespoke Labs veröffentlicht Nimble: ein schnelles 9B-Entscheidungsmodell für lokale Inferenz

Bespoke Labs hat Nimble veröffentlicht, ein Open-Weight-Entscheidungsmodell mit 9 Milliarden Parametern, das auf Qwen3.5-9B feinabgestimmt wurde und probabilistische Antworten auf strukturierte Fragen in unter 100 ms auf lokaler Hardware liefert.

A metallic cube with glowing circuits representing the Nimble AI model on a desk.
Für diesen Artikel generierte Illustration

Automatisch aus dem englischen Original übersetzt.

Bespoke Labs hat Nimble veröffentlicht, ein neues Open-Weight-Entscheidungsmodell, das für schnelle lokale Inferenz konzipiert ist. Das auf der Qwen3.5-9B-Architektur feinabgestimmte Modell mit 9 Milliarden Parametern ermöglicht es Entwicklern, Text und eine Reihe strukturierter Fragen zu senden und probabilistische Antworten ohne einen traditionellen Reasoning-Schritt zu erhalten. Die Veröffentlichung umfasst klare API-Dokumentation und Leistungsmetriken und richtet sich an Ingenieure, die effiziente Edge-Verarbeitungsfähigkeiten benötigen.

Was passiert ist

Nimble stellt einen Wandel hin zu spezialisierten Entscheidungsmodellen dar, die Geschwindigkeit und strukturierte Ausgabe vor generative Kreativität stellen. Im Gegensatz zu herkömmlichen großen Sprachmodellen, die Text tokenweise durch einen Reasoning-Prozess generieren, ist Nimble darauf optimiert, Antworten aus einer definierten Menge von Optionen auszuwählen. Es liest den Eingabe-Prompt einmal pro Frage und bewertet die Antwort-Tokens direkt. Diese architektonische Entscheidung eliminiert die Latenz, die mit Chain-of-Thought-Reasoning verbunden ist, und ermöglicht es dem Modell, Ergebnisse in unter 100 Millisekunden auf einem MacBook Pro mit M5 Max Chip zurückzugeben.

Das Modell steht unter der Apache 2.0 Lizenz zur Verfügung und eignet sich daher sowohl für kommerzielle als auch für Open-Source-Projekte. Bespoke Labs trainierte Nimble auf kontrastiven Paaren, einer Methode zur Datensatzerstellung, bei der sich zwei Beispiele nur durch eine spezifische Tatsache unterscheiden, die die korrekte Antwort umkehrt. Diese Trainingsstrategie hilft dem Modell, sich auf präzise faktische Unterscheidungen statt auf allgemeine Sprachmuster zu konzentrieren. Entwickler können das Modell direkt über Ollama mit dem Befehl ollama pull nimble abrufen und es mit minimalem Aufwand in bestehende lokale Workflows integrieren.

Wie es funktioniert

Nimble arbeitet über den /v1/systemone-Endpunkt von Ollama, der dem Jev-API-Standard von TypeSafe entspricht. Das Interaktionsmodell unterscheidet sich von typischen Chat-Oberflächen. Benutzer geben den zu bewertenden Text in einem Feld namens state an, das entweder ein einfacher String oder ein strukturiertes JSON-Objekt sein kann. Zusammen mit dem State reichen Benutzer bis zu 64 benannte Fragen in einer einzigen Anfrage ein. Das Modell verarbeitet diese Fragen gegen den bereitgestellten Text und gibt die Antworten in derselben Reihenfolge zurück, in der sie gestellt wurden.

Das System unterstützt drei primäre Fragetypen: Auswahl, binäre Wahrheitsverifizierung und Rubrik-Bewertung. Bei Auswahlfragen definiert der Benutzer eine Liste von Optionen, und das Modell gibt die ausgewählte Option zusammen mit Wahrscheinlichkeiten für alle Optionen zurück. Binäre Fragen, in der API als noul bezeichnet, geben ein wahr oder falsch Urteil mit einer zugehörigen Wahrscheinlichkeit zurück. Score-Fragen ermöglichen es Benutzern, geordnete Ebenen mit spezifischen Kriterien zu definieren, wobei ein wahrscheinlichkeitsgewichteter Score zurückgegeben wird. In allen Fällen stellt das Modell eine Konfidenzmethode zwischen 0 und 1 bereit, die angibt, wie konzentriert die Wahrscheinlichkeiten sind, obwohl dies kein direktes Maß für die Korrektheit ist.

Wichtige Details

  • Modellgröße und Basis: Nimble ist ein Modell mit 9 Milliarden Parametern, das auf Qwen3.5-9B feinabgestimmt wurde.
  • Leistung: Es liefert Antworten in unter 100 ms auf einem MacBook Pro mit M5 Max Chip.
  • Batching-Fähigkeit: Ein einzelner API-Aufruf kann bis zu 64 Fragen zum selben Text bearbeiten.
  • Trainingsdaten: Das Modell wurde auf kontrastiven Paaren trainiert, bei denen eine einzelne Faktenänderung die Antwort umkehrt.
  • Lizenz: Veröffentlicht unter der Apache 2.0 Lizenz, die breite kommerzielle und private Nutzung erlaubt.
  • Ausgabeformat: Gibt strukturierte Daten zurück, einschließlich Optionen, Scores, Wahrscheinlichkeiten und Konfidenzmethode.

Warum es wichtig ist

Für Software-Ingenieure, die Produktionssysteme entwickeln, bietet die Eliminierung des Reasoning-Schritts erhebliche Vorteile in Bezug auf Latenz und Kosten. Herkömmliche große Sprachmodelle haben oft Schwierigkeiten mit konsistenter strukturierter Ausgabe und erfordern komplexes Prompt Engineering oder Nachverarbeitung, um zuverlässige Entscheidungen zu extrahieren. Nimbles Design stellt sicher, dass jede Antwort einem vordefinierten Schema entspricht, was die Notwendigkeit von Validierungsebenen und Fehlerbehandlung in nachgelagerten Anwendungen reduziert. Diese Zuverlässigkeit ist entscheidend für Aufgaben wie das Routing von Kundensupport-Tickets, die Anwendung von Compliance-Richtlinien oder die Bewertung der Inhaltsqualität, wo deterministisches Verhalten gegenüber kreativer Generierung bevorzugt wird.

Die Fähigkeit, dieses Modell lokal mit hohen Geschwindigkeiten auszuführen, adressiert zudem wachsende Bedenken hinsichtlich Datenschutz und Betriebskosten. Durch die Verarbeitung sensibler Texte auf dem Gerät, ohne sie an externe APIs zu senden, können Organisationen strengere Kontrolle über ihre Daten behalten. Darüber hinaus ermöglicht die niedrige Latenz Echtzeitentscheidungen in benutzerseitigen Anwendungen, wie sofortige Formularvalidierung oder dynamische Inhaltsfilterung, ohne spürbare Verzögerungen einzuführen. Die Open-Weight-Natur des Modells ermöglicht es Teams, sein Verhalten zu überprüfen und es weiter für spezifische Domänenanforderungen feinabzustimmen.

Was Sie tun können

  • Installieren Sie Ollama und rufen Sie das Nimble-Modell mit dem Befehl ollama pull nimble ab, um lokale Inferenzgeschwindigkeiten zu testen.
  • Experimentieren Sie mit dem /v1/systemone-Endpunkt, indem Sie strukturierte JSON-States senden und bis zu 64 Fragen pro Anfrage definieren.
  • Implementieren Sie ein Routing-System, das Nimbles Auswahlfunktion nutzt, um Benutzeranfragen basierend auf Wahrscheinlichkeitswerten an geeignete Abteilungen zu leiten.
  • Erstellen Sie ein Policy-Enforcement-Tool, das den Score-Typ verwendet, um nutzergenerierte Inhalte gegen eine definierte Rubrik akzeptabler Ebenen zu bewerten.
  • Verwenden Sie den binären noul-Fragetyp, um automatisierte Fact-Checking-Pipelines zu erstellen, die spezifische Bedingungen innerhalb von Dokumenten verifizieren.
  • Überwachen Sie die vom Modell zurückgegebene Konfidenzmethode, um Entscheidungen mit geringer Sicherheit für die menschliche Überprüfung zu kennzeichnen und so die Gesamtzuverlässigkeit des Systems zu verbessern.

Tools aus dem Bytechap-Shop

$89

DocBento

Selbst gehostetes Dokumentenmanagement, das jeden Scan liest und mit Seitenzitaten antwortet.

Live-Demo

Weiterlesen

Alle Artikel