Cloudflare lanza Clef, un modelo de decisión multimodal para tareas de IA estructuradas
Cloudflare ha lanzado Clef, un modelo de 27 mil millones de parámetros optimizado para la extracción y el enrutamiento de documentos. Procesa texto e imágenes en una sola pasada a través de Ollama.
Traducido automáticamente del original en inglés.
Cloudflare ha presentado Clef, un nuevo modelo de decisión multimodal diseñado para gestionar tareas estructuradas como la extracción de campos de documentos y el enrutamiento de solicitudes. Lanzado a principios de octubre de 2026, este modelo de 27 mil millones de parámetros está ajustado finamente (fine-tuned) desde Qwen3.8-27B y se integra directamente en los flujos de trabajo existentes de ingeniería de IA mediante APIs estándar.
Qué ha ocurrido
Clef representa un cambio hacia modelos de toma de decisiones especializados en lugar de chatbots de propósito general. El modelo es capaz de procesar simultáneamente texto, estructuras JSON e imágenes. Esto le permite analizar capturas de pantalla, recibos, formularios y fotografías junto con datos textuales para tomar decisiones deterministas. Cloudflare afirma que Clef lidera actualmente el Decision Index, su tabla de clasificación interna para modelos de decisión, y supera a su predecesor, Jev, en la mayoría de las suites de pruebas de referencia (benchmarks).
El lanzamiento incluye compatibilidad total con las APIs de Jev y System One. Esto significa que los desarrolladores pueden desplegar Clef utilizando el endpoint /v1/systemone de Ollama sin reescribir su lógica de integración. También está disponible una variante más pequeña y rápida llamada clef-flash para casos de uso donde la latencia es más crítica que la máxima precisión. Ambas versiones se publican bajo la licencia Apache 2.0, lo que permite una amplia adopción comercial y de código abierto.
Cómo funciona
A diferencia de los modelos de lenguaje autoregresivos tradicionales que generan texto token por token, Clef opera en una única pasada hacia adelante no autoregresiva. Evalúa conjuntamente todas las opciones posibles para cada pregunta. Esta arquitectura reduce significativamente el tiempo de inferencia para tareas de clasificación y extracción porque el modelo no necesita generar explicaciones verbosas antes de llegar a una conclusión. En su lugar, emite probabilidades estructuradas para opciones predefinidas.
El modelo admite una ventana de contexto de 64K, que duplica la capacidad de la ventana de 32K de Jev. Este mayor contexto permite a Clef procesar documentos más largos o conjuntos de instrucciones más complejos de una sola vez. Cuando se incluyen imágenes en la solicitud, estas se codifican y evalúan junto con el texto. Esta evaluación conjunta garantiza que las pistas visuales, como el diseño de un formulario o un sello en un recibo, influyan en la decisión final junto con el contenido textual.
Los desarrolladores interactúan con Clef enviando un state (los datos a juzgar) y una lista de questions. Las preguntas definen el tipo de decisión requerida, como una selección de opción múltiple, una comprobación binaria verdadero/falso o una calificación puntuada. El modelo devuelve la opción elegida junto con distribuciones de probabilidad y una métrica de confianza. Esta puntuación de confianza indica cuán concentradas están las probabilidades, ayudando a los ingenieros a determinar cuándo confiar en la salida o escalar a un revisor humano.
Detalles clave
- Tamaño del modelo: 27 mil millones de parámetros, ajustado finamente desde Qwen3.8-27B.
- Ventana de contexto: 64K tokens, soportando documentos largos e instrucciones complejas.
- Tipos de entrada: Texto, JSON e imágenes codificadas en base64 (PNG, JPEG, WebP).
- Despliegue: Compatible con Ollama a través del endpoint
/v1/systemone; instalable medianteollama pull clef. - Licencia: Apache 2.0, permitiendo el uso comercial gratuito y la modificación.
- Formato de salida: JSON estructurado con opciones, probabilidades y puntuaciones de confianza.
Por qué importa
Para los ingenieros de software que construyen agentes de IA, Clef ofrece una alternativa más fiable al uso de prompts en grandes modelos de lenguaje para tareas simples de clasificación. Los LLMs de propósito general a menudo alucinan o proporcionan formatos inconsistentes cuando se les pide extraer campos específicos de documentos. El diseño no autoregresivo de Clef y su formato de salida estructurado reducen estos errores al forzar al modelo a elegir entre opciones predefinidas. Esto facilita integrar decisiones de IA en lógica empresarial determinista, como enrutar tickets de soporte o aprobar informes de gastos.
La capacidad de procesar imágenes y texto en una sola pasada también simplifica las pipelines multimodales. Anteriormente, los ingenieros podrían haber necesitado herramientas OCR separadas y modelos de lenguaje, encadenándolos con manejo de errores frágil. Clef unifica este proceso, permitiendo que una sola llamada API interprete una factura escaneada y extraiga valores clave como fecha y monto total. La licencia de código abierto reduce aún más la barrera de entrada, permitiendo a los equipos alojar el modelo por sí mismos para cumplir con la privacidad de datos sin cuotas de licencia.
Qué puedes hacer
- Instala Clef localmente usando Ollama ejecutando
ollama pull clefen tu terminal. - Reemplaza los prompts de clasificación existentes con el formato de preguntas estructuradas de Clef para mejorar la precisión.
- Utiliza el campo
imagespara enviar capturas de pantalla o documentos escaneados para análisis conjunto de texto-imagen. - Implementa umbrales de confianza en tu aplicación para marcar decisiones de baja certeza para revisión humana.
- Prueba la variante clef-flash si tu aplicación requiere menor latencia para tareas de alto volumen.
- Revisa la documentación de la API System One para mapear tus integraciones actuales de Jev a Clef.



