Mit KI entwickeln

Cloudflare AI Search ist jetzt allgemein verfügbar mit nativen Bild-Einbettungen und OCR

Cloudflares KI-Suche ist jetzt allgemein verfügbar und bietet native Bild-Einbettungen, OCR für PDFs sowie Unterstützung für größere Dateien. Die Abrechnung beginnt am 1. November 2026.

Automatisch aus dem englischen Original übersetzt.

Cloudflare hat sein Produkt „AI Search“ von der Vorschau- in die allgemeine Verfügbarkeit überführt. Dies markiert einen wichtigen Schritt für Entwickler, die Pipelines für Retrieval-Augmented Generation (RAG) erstellen. Das Update führt native multimodale Funktionen ein, darunter direkte Bild-Einbettungen und optische Zeichenerkennung (OCR) für gescannte Dokumente. Die Abrechnung des Dienstes beginnt am 1. November 2026, wobei eine kostenlose Stufe für kleinere Workloads weiterhin verfügbar bleibt.

Was passiert ist

Der Start erweitert die Fähigkeit der Plattform, komplexe Datentypen über einfachen Text hinaus zu verarbeiten. Bisher basierte die Bildersuche darauf, aus visuellen Inhalten Textbeschreibungen zu generieren und diese dann einzubetten. Dieser Ansatz führte oft zum Verlust feingranularer visueller Details wie Textur, Farbpaletten oder räumlicher Beziehungen in Diagrammen und Grafiken. Das neue System bewahrt sowohl das textuelle Verständnis durch Beschreibungen als auch direkte visuelle Signale durch native Bild-Einbettungen.

Neben der multimodalen Unterstützung hat Cloudflare die maximale Dateigröße für die Aufnahme von 4 MiB auf 10 MiB erhöht. Diese Änderung ermöglicht die Verarbeitung größerer Dokumentensammlungen und reichhaltigerer Medienassets. Das Unternehmen hat zudem die optische Zeichenerkennung für PDFs aktiviert, die aus gescannten Bildern bestehen, anstatt aus auswählbarem Text. Wenn diese Funktion aktiviert ist, extrahiert das System den Text von jeder Seite vor dem Chunking und der Einbettung, sodass ältere gescannte Dokumente durchsuchbar werden.

Der Übergang zur allgemeinen Verfügbarkeit bringt auch finalisierte Preisstrukturen mit sich. Während der Agents Week im August 2026 kündigte Cloudflare Preise für die Vorschauversion an, aber das endgültige Modell enthält eine leichte Anpassung der kostenlosen Stufe. Anstelle eines gemeinsamen Pools für Abfragen erhalten Nutzer nun separate Kontingente für semantische und Volltextsuchen. Die Abrechnungsengine berechnet die Kosten basierend auf Aufnahmetokens, Speichervolumen und Abfragetypen, wodurch die Notwendigkeit einer vorausschauenden Kapazitätsplanung entfällt.

Wie es funktioniert

Die wesentliche Verbesserung bei der Bildverarbeitung basiert auf Matryoshka Representation Learning. Diese Technik ermöglicht es dem System, Einbettungen zu erstellen, die nützliche Informationen auf unterschiedlichen Granularitätsebenen beibehalten. Dadurch bleiben die Speicheranforderungen überschaubar, während die Suchgeschwindigkeit erhalten wird. Das Qwen3-VL-Embedding-Modell treibt die native multimodale Suche an und platziert Bildpixel und Text im selben Vektorraum.

Wenn ein Benutzer eine Abfrage sendet, prüft das System, ob das ausgewählte Einbettungsmodell Bilder unterstützt. Falls ja, wird das Abfragebild direkt eingebettet. Ist das Modell nur auf Text ausgelegt, konvertiert das System das Bild mithilfe eines Tools namens ToMarkdown in Text und sucht anhand der resultierenden Beschreibung. Dieser duale Ansatz stellt die Kompatibilität über verschiedene Modellkonfigurationen hinweg sicher und bietet gleichzeitig eine höhere Präzision für Nutzer von multimodalen Modellen.

Bei gescannten Dokumenten fungiert die optische Zeichenerkennung als Vorverarbeitungsschritt. Sie liest den Text aus bildbasierten PDFs, bevor die Standard-Indizierungspipeline beginnt. Dieser Prozess verbraucht Tokens für die Bildverarbeitungs-Aufnahme, die separat von der Basis-Textaufnahme abgerechnet werden. Der Rest der Pipeline, einschließlich Parsen, Chunking und Reranking, ist weiterhin in den Basis-Aufnahmekosten enthalten.

Wichtige Details

  • Native Bild-Einbettungen nutzen das Qwen3-VL-Embedding-Modell, um visuelle Details wie Textur und Layout zu erhalten.
  • Die maximale Dateigröße für die Aufnahme wurde für Textdateien und PDFs von 4 MiB auf 10 MiB erhöht.
  • Optische Zeichenerkennung ist für gescannte PDFs verfügbar und wird als Tokens für die Bildverarbeitungs-Aufnahme abgerechnet.
  • Die Abrechnung beginnt am 1. November 2026, ohne dass Instanzstunden oder monatliche Mindestumsätze erforderlich sind.
  • Die kostenlose Stufe umfasst 5 Mio. Aufnahmetokens, 10 GB Speicherplatz, 1.000 semantische Abfragen und 1.000 Volltextabfragen pro Monat.
  • Die Basis-Aufnahme kostet 0,75 USD pro 1 Million Tokens, mit zusätzlichen 0,50 USD pro 1 Million Tokens für die Bildverarbeitung.

Warum das wichtig ist

Für Engineering-Teams, die Suchschnittstellen entwickeln, reduziert der Wechsel von beschreibungsbasierter zu nativer Bildsuche den Aufwand bei der Pflege von Metadaten. Entwickler müssen keine erschöpfenden Beschreibungen mehr schreiben, um visuelle Nuancen zu erfassen, was besonders für E-Commerce-Kataloge, technische Diagramme oder Screenshot-Bibliotheken wertvoll ist. Die Möglichkeit, nach visueller Ähnlichkeit oder kombinierten Text-und-Bild-Abfragen zu suchen, eröffnet neue Anwendungsfälle, die zuvor ohne benutzerdefinierte Computer-Vision-Pipelines schwer umzusetzen waren.

Die Transparenz des Preismodells hilft Teams, Kosten genauer vorherzusagen. Indem Cloudflare nur für Aufnahme, Speicherung und Abfragen abrechnet, entfällt der operative Overhead für die Verwaltung von Serverinstanzen oder die Skalierung von Kapazitätseinheiten. Diese Pay-as-you-go-Struktur senkt die Einstiegshürde für Startups und Nebenprojekte, während die großzügige kostenlose Stufe umfangreiche Experimente erlaubt, bevor man sich zu kostenpflichtiger Nutzung verpflichtet.

Die Unterstützung für größere Dateien und gescannte Dokumente adressiert häufige Schmerzpunkte in Unternehmens-Wissensdatenbanken. Viele Organisationen verlassen sich auf Legacy-PDFs, die im Wesentlichen Bilder von Text sind. Die integrierte Aktivierung von OCR bedeutet, dass diese Dokumente ohne externe Vorverarbeitungstools in moderne KI-Such-Workflows integriert werden können. Dies vereinfacht die Architektur, die für den Aufbau umfassender interner Suchmaschinen erforderlich ist.

Was Sie tun können

  • Prüfen Sie Ihr aktuelles Dokumentenrepository, um gescannte PDFs zu identifizieren, die von der neuen OCR-Funktion profitieren würden.
  • Testen Sie das Qwen3-VL-Embedding-Modell mit einer Teilmenge Ihrer Bildassets, um die Präzision der nativen visuellen Suche zu bewerten.
  • Berechnen Sie Ihre erwarteten monatlichen Kosten anhand der veröffentlichten Tarife für Aufnahme, Speicherung und Abfragen, um das Budget für den Rechnungsstart im November zu planen.
  • Aktualisieren Sie Ihre Aufnahmepipelines, um Dateien bis zu 10 MiB zu verarbeiten, und nutzen Sie das erhöhte Größenlimit für reichhaltigere Inhalte.
  • Überprüfen Sie die Limits der kostenlosen Stufe, um festzustellen, ob Ihr aktueller Entwicklungs- und Testaufwand innerhalb des Kontingents von 5 Mio. Tokens und 10 GB Speicher passt.
  • Erkunden Sie hybride Suchabfragen, die Textbeschreibungen mit Bildeingaben kombinieren, um die Relevanz für visuell lastige Datensätze zu verbessern.

Tools aus dem Bytechap-Shop

Weiterlesen

Alle Artikel