Cloudflare AI Search passe en GA avec embeddings d'images natifs et OCR
La recherche IA de Cloudflare est désormais disponible en version générale, ajoutant des embeddings d'images natifs, l'OCR pour les PDF et la prise en charge de fichiers plus volumineux. La facturation débutera le 1er novembre 2026.
Traduit automatiquement depuis l'original anglais.
Cloudflare a fait passer son produit AI Search de la phase de préversion à la disponibilité générale, marquant une étape significative pour les développeurs qui construisent des pipelines de génération augmentée par récupération (RAG). Cette mise à jour introduit des capacités multimodales natives, notamment des embeddings d'images directs et la reconnaissance optique de caractères (OCR) pour les documents scannés. La facturation du service commencera le 1er novembre 2026, bien qu'une offre gratuite reste disponible pour les charges de travail plus légères.
Ce qui s'est passé
Le lancement élargit la capacité de la plateforme à gérer des types de données complexes au-delà du simple texte. Auparavant, la recherche d'images reposait sur la génération de légendes textuelles à partir du contenu visuel, puis sur l'intégration de ces légendes. Cette approche perdait souvent des détails visuels fins tels que la texture, les palettes de couleurs ou les relations spatiales dans les graphiques et les diagrammes. Le nouveau système préserve à la fois la compréhension textuelle via les légendes et les signaux visuels directs grâce aux embeddings d'images natifs.
En parallèle du support multimodal, Cloudflare a augmenté la taille maximale des fichiers pour l'ingestion, passant de 4 MiB à 10 MiB. Ce changement permet d'accueillir des ensembles de documentation plus vastes et des ressources médiatiques plus riches. L'entreprise a également activé la reconnaissance optique de caractères pour les PDF composés d'images scannées plutôt que de texte sélectionnable. Une fois activée, le système extrait le texte de chaque page avant le découpage et l'intégration, garantissant ainsi que les anciens documents scannés deviennent consultables.
La transition vers la disponibilité générale apporte également des structures tarifaires définitives. Lors de la Agents Week d'août 2026, Cloudflare avait annoncé des tarifs de préversion, mais le modèle final inclut un léger ajustement de l'offre gratuite. Au lieu d'un pool partagé de requêtes, les utilisateurs reçoivent désormais des quotas séparés pour les recherches sémantiques et les recherches plein texte. Le moteur de facturation calcule les coûts en fonction des jetons d'ingestion, du volume de stockage et des types de requêtes, supprimant ainsi le besoin de planification de capacité préalable.
Comment cela fonctionne
L'amélioration principale dans le traitement des images repose sur l'apprentissage de représentation Matryoshka. Cette technique permet au système de créer des embeddings qui conservent des informations utiles à différents niveaux de granularité. Ce faisant, elle maintient les exigences de stockage à un niveau gérable tout en préservant la vitesse de recherche. Le modèle Qwen3-VL-Embedding alimente la récupération multimodale native, plaçant les pixels d'image et le texte dans le même espace vectoriel.
Lorsqu'un utilisateur soumet une requête, le système vérifie si le modèle d'embedding sélectionné prend en charge les images. Si c'est le cas, l'image de la requête est intégrée directement. Si le modèle est uniquement textuel, le système convertit l'image en texte à l'aide d'un outil appelé ToMarkdown et effectue la recherche en utilisant la légende résultante. Cette approche à double voie assure la compatibilité entre différentes configurations de modèles tout en offrant une précision accrue pour ceux qui utilisent des modèles multimodaux.
Pour les documents scannés, la fonctionnalité de reconnaissance optique de caractères agit comme une étape de prétraitement. Elle lit le texte des PDF basés sur des images avant le début du pipeline d'indexation standard. Ce processus consomme des jetons d'ingestion de traitement d'image, facturés séparément de l'ingestion de texte de base. Le reste du pipeline, y compris l'analyse, le découpage et le reclassement, reste inclus dans le coût d'ingestion de base.
Détails clés
- Les embeddings d'images natifs utilisent le modèle Qwen3-VL-Embedding pour préserver les détails visuels tels que la texture et la mise en page.
- La taille maximale des fichiers pour l'ingestion est passée de 4 MiB à 10 MiB pour les fichiers texte et les PDF.
- La reconnaissance optique de caractères est disponible pour les PDF scannés et facturée sous forme de jetons d'ingestion de traitement d'image.
- La facturation commence le 1er novembre 2026, sans heures d'instance ni minimum mensuel requis.
- L'offre gratuite comprend 5 millions de jetons d'ingestion, 10 Go de stockage, 1 000 requêtes sémantiques et 1 000 requêtes plein texte par mois.
- L'ingestion de base coûte 0,75 $ par million de jetons, avec un supplément de 0,50 $ par million de jetons pour le traitement d'image.
Pourquoi c'est important
Pour les équipes d'ingénierie qui construisent des interfaces de recherche, le passage de la récupération basée sur les légendes à la récupération d'images native réduit la friction liée à la curation des métadonnées. Les développeurs n'ont plus besoin de rédiger des descriptions exhaustives pour capturer les nuances visuelles, ce qui est particulièrement précieux pour les catalogues e-commerce, les diagrammes techniques ou les bibliothèques de captures d'écran. La possibilité de rechercher par similarité visuelle ou par requêtes combinées texte-image ouvre de nouveaux cas d'usage qui étaient auparavant difficiles à implémenter sans pipelines de vision par ordinateur personnalisés.
La transparence du modèle de tarification aide les équipes à prévoir les coûts plus précisément. En ne facturant que l'ingestion, le stockage et les requêtes, Cloudflare supprime la charge opérationnelle liée à la gestion des instances de serveur ou à la mise à l'échelle des unités de capacité. Cette structure de paiement à l'usage abaisse la barrière à l'entrée pour les startups et les projets annexes, tandis que l'offre gratuite généreuse permet une expérimentation substantielle avant de s'engager dans une utilisation payante.
La prise en charge de fichiers plus volumineux et de documents scannés répond aux points de douleur courants dans les bases de connaissances d'entreprise. De nombreuses organisations dépendent de PDF hérités qui sont essentiellement des images de texte. Activer l'OCR dès le départ signifie que ces documents peuvent être intégrés dans des workflows modernes de recherche IA sans outils de prétraitement externes. Cela simplifie l'architecture nécessaire pour construire des moteurs de recherche internes complets.
Ce que vous pouvez faire
- Auditez votre dépôt de documents actuel pour identifier les PDF scannés qui bénéficieraient de la nouvelle capacité OCR.
- Testez le modèle Qwen3-VL-Embedding avec un sous-ensemble de vos ressources d'images pour évaluer la précision de la récupération visuelle native.
- Calculez vos coûts mensuels attendus en utilisant les tarifs publiés pour l'ingestion, le stockage et les requêtes afin de budgétiser le début de la facturation en novembre.
- Mettez à jour vos pipelines d'ingestion pour gérer des fichiers jusqu'à 10 MiB, profitant de la limite de taille augmentée pour des contenus plus riches.
- Examinez les limites de l'offre gratuite pour déterminer si votre charge de travail actuelle de développement et de test tient dans les quotas de 5 millions de jetons et 10 Go de stockage.
- Explorez les requêtes de recherche hybrides qui combinent des descriptions textuelles avec des entrées d'images pour améliorer la pertinence des jeux de données riches en visuels.


