Eigene KI-Modelle für unter 40 US-Dollar mit autonomen Agenten erstellen
Ein Ingenieur nutzte den ML Intern-Agenten von Hugging Face, um sechs spezialisierte Modelle zu feinabzustimmen, darunter Vision-LoRAs und destillierte Rewriter, mit einer gesamten Rechenleistungskosten von etwa 103 US-Dollar.
Automatisch aus dem englischen Original übersetzt.
Ein Entwickler hat kürzlich demonstriert, wie man spezialisierte KI-Modelle mit geringem Speicherbedarf unter Verwendung eines autonomen Agenten namens ML Intern erstellt. Im Oktober 2026 baute der Ingenieur im Laufe weniger Tage sechs unterschiedliche Modelle, die von Erkennern für Pflanzenkrankheiten bis hin zu Beschleunigern für Bildgenerierung reichten, mit einer gesamten Rechenleistungskosten von ungefähr 103 US-Dollar. Der Prozess stützte sich auf sorgfältiges Prompt Engineering und strenge Budgetkontrollen innerhalb des Hugging-Face-Ökosystems.
Was passiert ist
Das Projekt begann mit einem spezifischen Bedarf: einer leichtgewichtigen Version des in Qwen-Image 2.1 enthaltenen Prompt-Rewriters. Das offizielle Modell ist groß und erfordert etwa 20 GB Arbeitsspeicher sowie erhebliche Verarbeitungszeit. Bestehende Alternativen im Hugging Face Hub waren lediglich komprimierte Versionen desselben schweren Modells. Um dies zu lösen, beauftragte der Entwickler ML Intern, einen in HuggingChat verfügbaren Agenten, damit dieser eine kleinere, effiziente Alternative erstellte. Der Agent produzierte ein Modell mit 0,8 Milliarden Parametern, das auf einer CPU läuft, nur ein Viertel der Tokens des Lehrmodells verwendet und in 99,7 % der Fälle gültige Ausgaben erzeugt. Der gesamte Prozess, einschließlich der Datenbeschriftung durch das größere Modell, kostete nur 16 US-Dollar.
Ermutigt durch dieses Ergebnis, erstellte der Entwickler fünf weitere Modelle mit demselben Workflow. Jedes Projekt begann als Konversation in HuggingChat mit aktiviertem ML Intern. Der Agent übernahm Planung, Budgetierung, Testen, Training, Bewertung und Veröffentlichung. Er operierte auf der Hardware von Hugging Face, wodurch jeder Schritt nachverfolgt und die Kosten verwaltet wurden. Die resultierenden Modelle wurden öffentlich mit detaillierten Bewertungsmetriken in ihren Model Cards veröffentlicht, was eine wiederholbare Pipeline für die Entwicklung eigener KI demonstriert.
Wie es funktioniert
Der Kern dieses Workflows ist strukturiertes Prompting. Der Entwickler investierte erheblichen Aufwand in die Verfeinerung der anfänglichen Anweisungen, die sich über sechs Projekte hinweg von 450 auf fast 2.000 Wörter ausweiteten. Jeder Prompt beginnt mit einer klaren Darstellung des Ziels und der Begründung. Anschließend werden der Datensatz, das Basismodell und das Trainings-Skript spezifiziert. Entscheidend ist, dass der Prompt einen Abschnitt mit der Bezeichnung "Verified facts, do not re-derive" (Verifizierte Fakten, nicht erneut ableiten) enthält, der bekannte Einschränkungen und technische Details auflistet. Dies verhindert, dass der Agent Ressourcen verschwendet, indem er Informationen neu entdeckt, die der Benutzer bereits besitzt, wie etwa spezifische Fähigkeiten des Trainers oder bekannte Probleme mit Fallback-Tools.
Zwei spezifische Anweisungen sind für den Erfolg entscheidend. Erstens muss der Prompt vor Beginn des Trainings einen Basisleistungs-Score anfordern. Dies ermöglicht einen klaren Vergleich zur Messung der Verbesserung. Zweitens verlangt er einen Smoke Test – einen kleinen, kostengünstigen Probelauf –, um zu überprüfen, ob der Trainingsprozess funktioniert, bevor man sich auf den vollständigen Job festlegt. Zum Beispiel könnte der Agent 50 Trainingsschritte ausführen und prüfen, ob sich die Modellgewichte geändert haben. Schließlich legt der Prompt eine harte Ausgabengrenze fest, z. B. 12 US-Dollar, und verlangt vom Agenten, um Erlaubnis zu bitten, bevor diese überschritten wird. Da ML Intern mit einem Null-Dollar-Budget startet, stellt dieser Kontrollmechanismus sicher, dass die Kosten vorhersehbar bleiben.
Wichtige Details
- Der Entwickler baute sechs Modelle, darunter einen Zitruskrankheits-Detektor, eine charakter-spezifische LoRA und einen 4-Schritt-Bildgenerator.
- Die gesamten Rechenkosten für alle sechs Projekte beliefen sich auf ungefähr 103 US-Dollar, wobei einzelne Projekte zwischen 1,90 und 37 US-Dollar lagen.
- ML Intern arbeitet innerhalb von HuggingChat und benötigt eine ausdrückliche Genehmigung, um Geld auszugeben, beginnend mit einem Null-Dollar-Budget.
- Der Agent automatisiert die Erstellung von Datensätzen, das Training, die Bewertung und die Veröffentlichung im Hugging Face Hub.
- Prompts enthalten einen Abschnitt "Verified facts", um redundante Recherchen zu verhindern und technische Einschränkungen durchzusetzen.
- Basis-Metriken und Smoke Tests sind obligatorische Bestandteile des Prompts, um Qualität und Kosteneffizienz sicherzustellen.
Warum es wichtig ist
Für Software-Ingenieure und ML-Praktiker senkt dieser Ansatz die Hürde für die Erstellung eigener Modelle. Traditionell erfordert das Fine-Tuning tiefgreifendes Fachwissen im Infrastrukturmanagement, in der Hyperparameter-Optimierung und im Aufbau von Datenpipelines. Indem diese Aufgaben an einen Agenten delegiert werden, können sich Entwickler darauf konzentrieren, das Problem zu definieren und die Daten zu kuratieren. Die Fähigkeit, spezialisierte Modelle für unter 40 US-Dollar zu produzieren, macht Experimente für Einzelpersonen und kleine Teams zugänglich, die sich große GPU-Cluster nicht leisten können.
Darüber hinaus adressiert der Fokus auf kleine, effiziente Modelle ein wachsendes Bedürfnis nach Edge-Bereitstellung und kosteneffektiver Inferenz. Der Rewriter mit 0,8 Milliarden Parametern läuft beispielsweise auf einer CPU, was ihn für Anwendungen geeignet macht, bei denen Latenz und Hardware-Einschränkungen kritisch sind. Dieser Wandel hin zu Destillation und spezialisierten LoRAs ermöglicht es Entwicklern, KI-Fähigkeiten auf bestimmte Domänen zuzuschneiden, wie Landwirtschaft oder markenspezifische Bildgenerierung, ohne auf generische, ressourcenintensive Foundation-Modelle angewiesen zu sein.
Was Sie tun können
- Greifen Sie über HuggingChat auf ML Intern zu und aktivieren Sie den Agentenmodus, um mit automatisiertem Modellbau zu experimentieren.
- Prüfen Sie die vom Entwickler auf GitHub bereitgestellten Beispiel-Prompts unter yvrjsharma/ml-intern-prompts, um effektive Strukturierung zu verstehen.
- Beginnen Sie mit einer kleinen Budgetgrenze, z. B. 10 US-Dollar, um die Fähigkeiten des Agenten bei einer einfachen Aufgabe zu testen, bevor Sie skalieren.
- Nehmen Sie eine Anfrage für Basis-Metriken in Ihre Prompts auf, um sicherzustellen, dass Sie die Verbesserung Ihres feinabgestimmten Modells quantifizieren können.
- Definieren Sie ein Smoke-Test-Verfahren, wie etwa einen kurzen Trainingslauf, um die Pipeline zu verifizieren, bevor Sie sich auf das Training im vollen Maßstab festlegen.
- Teilen Sie Ihre resultierenden Modelle in sozialen Medien und taggen Sie relevante Communities, um zum Open-Source-Ökosystem beizutragen.



