Mit KI entwickeln

OpenAI startet Decisions API zur Senkung der Kosten für die Agentenüberwachung

OpenAI hat auf dem Dev Day eine neue Decisions API vorgestellt, die schnelle und kostengünstige Klassifizierung ermöglicht – ähnlich dem Jev-Modell von TypeSafe AI zur Absicherung von KI-Agenten.

Automatisch aus dem englischen Original übersetzt.

Auf seiner Dev-Day-Veranstaltung am Dienstag stellte OpenAI-CEO Sam Altman die Decisions API vor, ein neues Tool, das die Entscheidungsfindung für Software-Agenten optimieren soll. Diese Ankündigung folgt auf die kürzliche Veröffentlichung von Jev durch TypeSafe AI und deutet auf einen Trend hin zu spezialisierten Hochgeschwindigkeitsmodellen für Automatisierungsaufgaben.

Was passiert ist

Die Decisions API ermöglicht es Entwicklern, dem Luna-Modell einen vordefinierten Satz von Optionen bereitzustellen, wie etwa Bildkategorien oder spezifische Agentenverhalten. Das Modell wählt dann mit hoher Geschwindigkeit und geringeren Rechenkosten als bei der herkömmlichen Inferenz großer Sprachmodelle aus diesen Optionen. Altman erklärte, dass dieser Ansatz Fähigkeiten wie Bildverständnis und Sicherheitsvorkehrungen beibehält, während sich das Modell auf spezifische Entscheidungen konzentriert.

TypeSafe AI, das Startup hinter Jev, reagierte nicht auf Anfragen zu Kommentaren über das neue Produkt. Diogo Almeida, CEO von TypeSafe und ehemaliger Ingenieur bei OpenAI, äußerte sich jedoch in sozialen Medien über das Aufkommen ähnlicher Technologien. Er schlug vor, dass der Schritt von OpenAI das Konzept der "System One"-kompatiblen Architekturen bestätigt, die eine schnelle, intuitive Verarbeitung gegenüber einer bewussten, langsamen Schlussfolgerung priorisieren.

Der Markt verzeichnet eine zunehmende Aktivität in dieser Nische, wobei auch andere Startups Modelle veröffentlichen, die als leistungsstarke Klassifikatoren fungieren. Während die genauen technischen Ähnlichkeiten zwischen der Decisions API und Jev aufgrund des eingeschränkten Preview-Status des Tools von OpenAI unklar bleiben, ist das Brancheninteresse offensichtlich. Der Kernwert beider Tools liegt darin, die Latenz und die Kosten anzugehen, die mit der Verwendung von allgemeinen LLMs für routinemäßige Softwareautomatisierungsaufgaben verbunden sind.

Wie es funktioniert

Diese Entscheidungsmodelle arbeiten als spezialisierte Klassifikatoren, die auf Grundlagen großer Sprachmodelle aufgebaut sind. Anstatt offenen Text zu generieren, bewerten sie eine gegebene Eingabe gegen eine eingeschränkte Liste möglicher Ausgaben. Das System weist jeder Option Wahrscheinlichkeiten zu, sodass die Anwendung die wahrscheinlichste korrekte Aktion oder Kategorie auswählen kann.

Dieser Mechanismus unterscheidet sich von standardmäßiger generativer KI dadurch, dass er den Ausgaberaum einschränkt. Indem das Modell darauf beschränkt wird, aus einem festen Satz von Alternativen zu wählen, sinkt die Rechenlast erheblich. Dies führt zu schnelleren Antwortzeiten und geringeren Kosten pro Abfrage, wodurch es machbar wird, diese Prüfungen bei jeder einzelnen Aktion eines autonomen Agenten durchzuführen.

TypeSafe betont, dass die Intelligenz dieser Modelle aus der Qualität der synthetischen Daten stammt, die während des Trainings verwendet werden. Almeida merkte an, dass es zwar einfach sei, Geschwindigkeit und niedrige Kosten zu erreichen, aber die Aufrechterhaltung hoher Genauigkeit und statistischer Nützlichkeit die primäre Herausforderung darstelle. Das Ziel besteht darin, das Verhältnis von Intelligenz zu Kosten zu optimieren, um sicherzustellen, dass die schnellen Entscheidungen zuverlässig bleiben und auf reale Szenarien kalibriert sind.

Wichtige Details

  • OpenAI hat die Decisions API als eingeschränkte Vorschau während seiner Dev-Day-Veranstaltung am Dienstag gestartet.
  • Die API ermöglicht es dem Luna-Modell, aus vordefinierten Optionen wie Bildkategorien oder Agentenverhalten zu wählen.
  • TypeSafe AI hat Anfang dieses Monats Jev veröffentlicht, ein Modell, das für ähnliche hochschnelle, kostengünstige Softwareautomatisierung entwickelt wurde.
  • Shapor Naghibzadeh demonstrierte, dass die Überwachung von Agentenaktionen mit Jev 2,94 $ kostet, im Vergleich zu 372 $ mit einem Frontier-LLM.
  • Diogo Almeida beschrieb den Trend als Bewegung hin zum "System One"-Denken, das schnelle, intuitive Verarbeitung bevorzugt.
  • Die Technologie wird als Sicherheitsmaßnahme untersucht, um fehlverhaltende KI-Agenten in Echtzeit zu überwachen und zu blockieren.

Warum es wichtig ist

Für Ingenieure, die autonome Agenten entwickeln, sind Kosten und Latenz kritische Engpässe. Traditionelle LLMs sind oft zu langsam und teuer, um als Echtzeit-Monitore für jeden Schritt zu dienen, den ein Agent unternimmt. Die Einführung dedizierter Entscheidungs-APIs bietet einen gangbaren Weg, kontinuierliche Aufsicht ohne prohibitiv hohe Kosten zu implementieren. Dieser Wandel könnte es wirtschaftlich machbar machen, Agenten gegen unbeabsichtigtes Verhalten abzusichern, wie es bei früheren Vorfällen auf Plattformen wie Hugging Face beobachtet wurde.

Der Wettbewerb zwischen etablierten Laboren und spezialisierten Startups hebt einen breiteren Trend in der KI-Infrastruktur hervor. Da Agenten komplexer werden, wächst die Notwendigkeit für leichtgewichtige, spezialisierte Komponenten. Entwickler können sich nicht mehr ausschließlich auf monolithische Modelle für alle Aufgaben verlassen. Stattdessen werden sie wahrscheinlich hybride Architekturen adoptieren, bei denen schwere Schlussfolgerungen für komplexe Probleme reserviert sind, während schnelle Klassifikatoren routinemäßige Entscheidungen und Sicherheitsprüfungen übernehmen.

Diese Entwicklung wirft auch Fragen nach Kalibrierung und Zuverlässigkeit auf. Wenn immer mehr Anbieter mit ähnlichen Angeboten in den Raum treten, wird der Differenzierer darin liegen, wie gut diese Modelle mit realen Ergebnissen übereinstimmen. Ingenieure müssen nicht nur Geschwindigkeit und Preis bewerten, sondern auch die statistische Robustheit der von diesen Systemen getroffenen Entscheidungen. Die Fähigkeit, diesen schnellen Klassifikatoren zu vertrauen, wird ihre Adoption in kritischen Sicherheits- und Automatisierungsworkflows bestimmen.

Was Sie tun können

  • Bewerten Sie, ob Ihre aktuelle Agentenarchitektur eine Echtzeitüberwachung für jede Aktion erfordert.
  • Testen Sie die OpenAI Decisions API in der eingeschränkten Vorschau, um ihre Leistung mit Ihren bestehenden Klassifikatoren zu vergleichen.
  • Experimentieren Sie mit TypeSafes Jev oder ähnlichen Angeboten von Startups, um Verbesserungen bei Kosten und Latenz zu benchmarken.
  • Definieren Sie klare, eingeschränkte Sets von Optionen für Ihre Agenten, um Mehrdeutigkeiten zu reduzieren und die Entscheidungsgeschwindigkeit zu verbessern.
  • Überwachen Sie die Kalibrierung dieser schnellen Modelle, indem Sie ihre Ausgaben gegen Ground-Truth-Daten in Ihrer Domäne vergleichen.
  • Erwägen Sie die Implementierung eines hybriden Ansatzes, bei dem schnelle Entscheidungsmodelle routinemäßige Prüfungen durchführen und größere LLMs komplexe Ausnahmen behandeln.

Tools aus dem Bytechap-Shop

$89

DocBento

Selbst gehostetes Dokumentenmanagement, das jeden Scan liest und mit Seitenzitaten antwortet.

Live-Demo

Weiterlesen

Alle Artikel