Construir con IA

Cloudflare AI Search llega a la disponibilidad general con incrustaciones nativas de imágenes y OCR

El AI Search de Cloudflare ya está disponible en versión general, añadiendo incrustaciones nativas de imágenes, OCR para PDFs y soporte para archivos más grandes. La facturación comienza el 1 de noviembre de 2026.

Traducido automáticamente del original en inglés.

Cloudflare ha trasladado su producto AI Search de la fase de vista previa a la disponibilidad general, marcando un paso significativo para los desarrolladores que construyen pipelines de generación aumentada por recuperación (RAG). La actualización introduce capacidades multimodales nativas, incluyendo incrustaciones directas de imágenes y reconocimiento óptico de caracteres (OCR) para documentos escaneados. La facturación del servicio comenzará el 1 de noviembre de 2026, aunque sigue disponible un nivel gratuito para cargas de trabajo menores.

Qué ha ocurrido

El lanzamiento expande la capacidad de la plataforma para manejar tipos de datos complejos más allá del texto simple. Anteriormente, la búsqueda de imágenes dependía de generar subtítulos de texto a partir del contenido visual y luego crear incrustaciones de esos subtítulos. Este enfoque a menudo perdía detalles visuales finos como texturas, paletas de colores o relaciones espaciales dentro de gráficos y diagramas. El nuevo sistema preserva tanto la comprensión textual mediante subtítulos como las señales visuales directas a través de incrustaciones nativas de imágenes.

Junto con el soporte multimodal, Cloudflare aumentó el tamaño máximo de archivo para la ingesta de 4 MiB a 10 MiB. Este cambio acomoda conjuntos de documentación más grandes y activos multimedia más ricos. La empresa también habilitó el reconocimiento óptico de caracteres para PDFs que consisten en imágenes escaneadas en lugar de texto seleccionable. Cuando se activa, el sistema extrae texto de cada página antes de trocear e incrustar, asegurando que los documentos escaneados heredados sean buscables.

La transición a la disponibilidad general también trae estructuras de precios finalizadas. Durante la Agents Week de agosto de 2026, Cloudflare anunció precios de vista previa, pero el modelo final incluye un ligero ajuste al nivel gratuito. En lugar de un pool compartido de consultas, los usuarios ahora reciben asignaciones separadas para búsquedas semánticas y de texto completo. El motor de facturación calcula los costos basándose en tokens de ingesta, volumen de almacenamiento y tipos de consulta, eliminando la necesidad de planificación de capacidad anticipada.

Cómo funciona

La mejora central en el manejo de imágenes se basa en el Matryoshka Representation Learning. Esta técnica permite al sistema crear incrustaciones que retienen información útil en diversos niveles de granularidad. Al hacerlo, mantiene los requisitos de almacenamiento manejables mientras conserva la velocidad de búsqueda. El modelo Qwen3-VL-Embedding impulsa la recuperación multimodal nativa, colocando píxeles de imagen y texto en el mismo espacio vectorial.

Cuando un usuario envía una consulta, el sistema verifica si el modelo de incrustación seleccionado soporta imágenes. Si lo hace, la imagen de consulta se incrusta directamente. Si el modelo es solo de texto, el sistema convierte la imagen a texto usando una herramienta llamada ToMarkdown y busca utilizando el subtítulo resultante. Este enfoque de doble ruta asegura compatibilidad entre diferentes configuraciones de modelos mientras ofrece precisión mejorada para aquellos que usan modelos multimodales.

Para documentos escaneados, la función de reconocimiento óptico de caracteres actúa como un paso de preprocesamiento. Lee el texto de PDFs basados en imágenes antes de que comience el pipeline estándar de indexación. Este proceso consume tokens de ingesta de procesamiento de imágenes, que se facturan por separado de la ingesta base de texto. El resto del pipeline, incluyendo análisis, troceo y reordenamiento, permanece incluido en el costo de ingesta base.

Detalles clave

  • Las incrustaciones nativas de imágenes utilizan el modelo Qwen3-VL-Embedding para preservar detalles visuales como textura y diseño.
  • El tamaño máximo de archivo para la ingesta ha aumentado de 4 MiB a 10 MiB para archivos de texto y PDFs.
  • El reconocimiento óptico de caracteres está disponible para PDFs escaneados y se factura como tokens de ingesta de procesamiento de imágenes.
  • La facturación comienza el 1 de noviembre de 2026, sin requerir horas de instancia ni mínimos mensuales.
  • El nivel gratuito incluye 5M de tokens de ingesta, 10 GB de almacenamiento, 1.000 consultas semánticas y 1.000 consultas de texto completo al mes.
  • La ingesta base cuesta $0.75 por cada 1 millón de tokens, con un adicional de $0.50 por cada 1 millón de tokens para el procesamiento de imágenes.

Por qué importa

Para equipos de ingeniería que construyen interfaces de búsqueda, el cambio de recuperación basada en subtítulos a recuperación nativa de imágenes reduce la fricción de curar metadatos. Los desarrolladores ya no necesitan escribir descripciones exhaustivas para capturar matices visuales, lo cual es particularmente valioso para catálogos de comercio electrónico, diagramas técnicos o bibliotecas de capturas de pantalla. La capacidad de buscar por similitud visual o consultas combinadas de texto e imagen abre nuevos casos de uso que previamente eran difíciles de implementar sin pipelines personalizados de visión por computadora.

La transparencia del modelo de precios ayuda a los equipos a pronosticar costos con mayor precisión. Al cobrar solo por ingesta, almacenamiento y consultas, Cloudflare elimina la sobrecarga operativa de gestionar instancias de servidor o unidades de escalado de capacidad. Esta estructura de pago por uso baja la barrera de entrada para startups y proyectos secundarios, mientras que el generoso nivel gratuito permite experimentación sustancial antes de comprometerse con el uso pagado.

El soporte para archivos más grandes y documentos escaneados aborda puntos de dolor comunes en bases de conocimiento empresariales. Muchas organizaciones dependen de PDFs heredados que son esencialmente imágenes de texto. Habilitar OCR desde el inicio significa que estos documentos pueden integrarse en flujos de trabajo modernos de búsqueda con IA sin herramientas externas de preprocesamiento. Esto simplifica la arquitectura requerida para construir motores de búsqueda internos comprehensivos.

Qué puedes hacer

  • Audita tu repositorio actual de documentos para identificar PDFs escaneados que se beneficiarían de la nueva capacidad de OCR.
  • Prueba el modelo Qwen3-VL-Embedding con un subconjunto de tus activos de imagen para evaluar la precisión de la recuperación visual nativa.
  • Calcula tus costos mensuales esperados usando las tarifas publicadas para ingesta, almacenamiento y consultas para presupuestar el inicio de la facturación en noviembre.
  • Actualiza tus pipelines de ingesta para manejar archivos de hasta 10 MiB, aprovechando el límite de tamaño aumentado para contenido más rico.
  • Revisa los límites del nivel gratuito para determinar si tu carga de trabajo actual de desarrollo y pruebas cabe dentro de la asignación de 5M de tokens y 10 GB de almacenamiento.
  • Explora consultas de búsqueda híbrida que combinen descripciones de texto con entradas de imagen para mejorar la relevancia en conjuntos de datos visualmente intensivos.

Herramientas de la Tienda de Bytechap

$79

WorkBento

Suite de RR. HH. y gestión del entorno laboral impulsada por IA que puedes alojar tú mismo.

Demo en vivo

Seguir leyendo

Todos los artículos