KI-Agenten

AWS veröffentlicht Strands Decider 2B zur lokalen Validierung von Agenten

AWS hat Strands Decider 2B vorgestellt, ein herunterladbares Entscheidungsmodell, das Aktionen von KI-Agenten lokal mit einer Latenz unter 100 ms validiert.

Automatisch aus dem englischen Original übersetzt.

Amazon Web Services hat Strands Decider 2B eingeführt, ein kompaktes Entscheidungsmodell, das für den lokalen Betrieb konzipiert ist und die Aktionen von KI-Agenten vor der Ausführung validiert. Dieses am 1. Oktober 2026 veröffentlichte Tool bietet Entwicklern einen schnellen und zuverlässigen Mechanismus zur Überprüfung von Agentenausgaben, ohne auf externe APIs angewiesen zu sein oder ungültige Texte zu generieren.

Was passiert ist

Der Launch positioniert AWS direkt gegen aufkommende Entscheidungsmodelle wie Jev von TypeSafe, das kürzlich eine Welle ähnlicher Tools großer KI-Anbieter ausgelöst hat. Während OpenAI kürzlich seine gehostete Decisions API unter Verwendung des Luna-Modells in einer Vorschau präsentierte, ging AWS einen anderen Weg und veröffentlichte ein vollständig herunterladbares Modell. Dieses Paket umfasst nicht nur die Gewichte, sondern auch die Trainingsdaten und Skripte, sodass Ingenieure das zugrunde liegende Rezept inspizieren und anpassen können.

Strands Decider 2B ist Teil des breiteren Strands-Ökosystems, das bei Strands Labs inkubiert wurde, dem experimentellen Hub von AWS für agentische KI. Es folgt auf die kürzliche Veröffentlichung von Strands Harness, das die Infrastruktur für den Betrieb langlebigerer Agenten bereitstellt. Indem AWS eine offene, lokale Alternative zu gehosteten Diensten anbietet, möchte es Entwicklern mehr Kontrolle über die kritischen Validierungsschritte in ihren Agent-Workflows geben.

Wie es funktioniert

Entscheidungsmodelle unterscheiden sich von standardmäßigen großen Sprachmodellen dadurch, dass sie ihren Ausgaberaum einschränken. Anstatt freiformatigen Text zu generieren, wählen sie aus vom Entwickler bereitgestellten Optionen aus oder geben numerische Bewertungen zurück. Strands Decider nutzt Qwen3.5-2B als Basis, bezeichnet als „Torso“. Das Team entfernte den Standard-Sprachmodell-Kopf, der für die Textgenerierung verantwortlich ist, und ersetzte ihn durch einen Pointer-Kopf mit etwas mehr als einer Million Parametern. Dieser Kopf bewertet die bereitgestellten Antwortoptionen.

Das Rückgrat nutzt einen Low-Rank-Adaptation-(LoRA)-Adapter mit Rang 16. Durch die Beschränkung der möglichen Ausgaben auf nur jene, die vom Entwickler geliefert werden, kann das Modell keine Optionen erfinden, die nicht existieren. Diese Architektur stellt sicher, dass jede Ausgabe im definierten Kontext gültig ist, garantiert jedoch nicht in jedem Fall Korrektheit. Der Kompromiss führt zu schnelleren Entscheidungen und kalibrierten Konfidenzwerten, die Anwendungen nutzen können, um die nächsten Schritte zu bestimmen.

In der Praxis ermöglicht dies Prüfungen vor der Ausführung. Wenn beispielsweise ein Agent vorschlägt, ein Wetter-Tool ohne angegebene Stadt aufzurufen, evaluiert der Decider, ob die Argumente im Gespräch verankert sind. Falls Informationen fehlen, kann das System den Agenten zurückleiten, um den Benutzer nach Klärung zu fragen, anstatt einen fehlerhaften Tool-Aufruf auszuführen. Dieser Prozess läuft über das Interventionssystem von Strands, das es Entwicklern ermöglicht, Richtlinien für das Fortfahren, Verweigern oder Anfordern menschlicher Bestätigung zu definieren.

Wichtige Details

  • Das Modell basiert auf Qwen3.5-2B mit einem benutzerdefinierten Pointer-Kopf, der die Textgenerierungsebene ersetzt.
  • Es erreicht Entscheidungszeiten unter 100 Millisekunden auf einer Nvidia RTX 3090 GPU.
  • Auf einem M3 MacBook liegen die medianen Antwortzeiten für kleine Aufgaben bei etwa 150 Millisekunden.
  • Strands Decider 2B belegt auf JevBench den zweiten Platz unter öffentlichen Modellen mit rund 2 Milliarden Parametern.
  • Es belegt den ersten Platz unter öffentlichen Modellen, die ein vollständiges Trainingsrezept und Daten bereitstellen.
  • Die Veröffentlichung enthält alle früheren architektonischen Iterationen im Repository zur Transparenz.

Warum es wichtig ist

Für Software-Ingenieure, die autonome Agenten entwickeln, ist Zuverlässigkeit oft die größte Hürde. Generative Modelle können Tool-Argumente halluzinieren oder kritische Einschränkungen übersehen, was zu Fehlern führt, die schwer zu debuggen sind. Strands Decider 2B adressiert dies, indem es einen schnellen, deterministischen Check zwischen die Schlussfolgerungen des Agenten und seine Aktionen schaltet. Diese Trennung der Zuständigkeiten ermöglicht es generativen Modellen, komplexe Konversationen und Kreativität zu handhaben, während das Entscheidungsmodell Routing und Validierung übernimmt.

Die lokale Natur des Modells ist signifikant für latenzkritische Anwendungen und Datenschutz. Die Validierung auf dem Gerät eliminiert die Netzwerk-Round-Trip-Zeit, die mit gehosteten APIs verbunden ist. Darüber hinaus unterstützt die Einbeziehung von Trainingsdaten und Skripten das Fine-Tuning für spezifische Domänen. Entwickler sind nicht länger in die proprietäre Logik eines Anbieters gezwungen; sie können das Modell an ihre einzigartigen betrieblichen Einschränkungen anpassen und sein Verhalten über die bereitgestellten Benchmarks überprüfen.

Was Sie tun können

  • Laden Sie das Strands Decider 2B Modell herunter und integrieren Sie es in Ihre lokale Umgebung.
  • Nutzen Sie die bereitgestellten Trainingsdaten und Skripte, um das Modell für Ihre spezifischen Anwendungsfälle anzupassen.
  • Implementieren Sie Vorabprüfungen in Ihren Agent-Workflows, um die Zuverlässigkeit der Tool-Aufrufe zu erhöhen.
  • Überprüfen Sie die Leistung des Modells auf Ihrer Hardware unter Verwendung der genannten Benchmark-Metriken.

Tools aus dem Bytechap-Shop

Weiterlesen

Alle Artikel