IA abierta y local

Bespoke Labs lanza Nimble, un modelo de decisión rápido de 9B para inferencia local

Bespoke Labs ha lanzado Nimble, un modelo de decisión abierto de 9B parámetros ajustado a partir de Qwen3.5-9B que ofrece respuestas probabilísticas a preguntas estructuradas en menos de 100 ms en hardware local.

A metallic cube with glowing circuits representing the Nimble AI model on a desk.
Ilustración generada para este artículo

Traducido automáticamente del original en inglés.

Bespoke Labs ha lanzado Nimble, un nuevo modelo de decisión de pesos abiertos diseñado para una inferencia rápida y local. Ajustado a partir de la arquitectura Qwen3.5-9B, este modelo de 9 mil millones de parámetros permite a los desarrolladores enviar texto y un conjunto de preguntas estructuradas, recibiendo respuestas probabilísticas sin un paso tradicional de razonamiento. El lanzamiento incluye documentación clara de la API y métricas de rendimiento, dirigido a ingenieros que necesitan capacidades eficientes de procesamiento en el borde (edge).

Qué ha ocurrido

Nimble representa un cambio hacia modelos de decisión especializados que priorizan la velocidad y la salida estructurada sobre la creatividad generativa. A diferencia de los grandes modelos de lenguaje estándar que generan texto token por token mediante un proceso de razonamiento, Nimble está optimizado para elegir respuestas de un conjunto definido de opciones. Lee el prompt de entrada una vez por pregunta y puntúa directamente los tokens de respuesta. Esta elección arquitectónica elimina la latencia asociada al razonamiento de cadena de pensamiento (chain-of-thought), permitiendo que el modelo devuelva resultados en menos de 100 milisegundos en un MacBook Pro equipado con un chip M5 Max.

El modelo está disponible bajo una licencia Apache 2.0, lo que lo hace adecuado tanto para proyectos comerciales como de código abierto. Bespoke Labs entrenó a Nimble con pares contrastivos, un método de construcción de conjuntos de datos donde dos ejemplos difieren solo en un hecho específico que invierte la respuesta correcta. Esta estrategia de entrenamiento ayuda al modelo a centrarse en distinciones factuales precisas en lugar de patrones generales del lenguaje. Los desarrolladores pueden descargar el modelo directamente usando Ollama con el comando ollama pull nimble, integrándolo en flujos de trabajo locales existentes con una configuración mínima.

Cómo funciona

Nimble opera a través del endpoint /v1/systemone de Ollama, que se adhiere al estándar Jev API de TypeSafe. El modelo de interacción es distinto de las interfaces de chat típicas. Los usuarios proporcionan el texto a evaluar en un campo llamado state, que puede ser una simple cadena o un objeto JSON estructurado. Junto con el estado, los usuarios envían hasta 64 preguntas nombradas en una sola solicitud. El modelo procesa estas preguntas contra el texto proporcionado y devuelve las respuestas en el mismo orden en que fueron planteadas.

El sistema admite tres tipos principales de preguntas: elección, verificación binaria de verdad y puntuación por rúbrica. Para las preguntas de elección, el usuario define una lista de opciones, y el modelo devuelve la opción seleccionada junto con las probabilidades para todas las opciones. Las preguntas binarias, denominadas noul en la API, devuelven un veredicto verdadero o falso con una probabilidad asociada. Las preguntas de puntuación permiten a los usuarios definir niveles ordenados con criterios específicos, devolviendo una puntuación ponderada por probabilidad. En todos los casos, el modelo proporciona una métrica de confianza entre 0 y 1, indicando qué tan concentradas están las probabilidades, aunque esto no es una medida directa de corrección.

Detalles clave

  • Tamaño y base del modelo: Nimble es un modelo de 9 mil millones de parámetros ajustado a partir de Qwen3.5-9B.
  • Rendimiento: Ofrece respuestas en menos de 100 ms en un MacBook Pro con un chip M5 Max.
  • Capacidad de agrupamiento: Una sola llamada a la API puede manejar hasta 64 preguntas sobre el mismo texto.
  • Datos de entrenamiento: El modelo fue entrenado con pares contrastivos donde un cambio en un solo hecho invierte la respuesta.
  • Licencia: Lanzado bajo la licencia Apache 2.0, permitiendo un amplio uso comercial y privado.
  • Formato de salida: Devuelve datos estructurados incluyendo elecciones, puntuaciones, probabilidades y métricas de confianza.

Por qué importa

Para los ingenieros de software que construyen sistemas de producción, la eliminación del paso de razonamiento ofrece ventajas significativas en latencia y costo. Los grandes modelos de lenguaje tradicionales a menudo tienen dificultades con la salida estructurada consistente, requiriendo ingeniería compleja de prompts o post-procesamiento para extraer decisiones fiables. El diseño de Nimble asegura que cada respuesta se ajuste a un esquema predefinido, reduciendo la necesidad de capas de validación y manejo de errores en aplicaciones posteriores. Esta fiabilidad es crucial para tareas como el enrutamiento de tickets de soporte al cliente, la aplicación de políticas de cumplimiento o la calificación de la calidad del contenido, donde se prefiere un comportamiento determinista sobre la generación creativa.

La capacidad de ejecutar este modelo localmente a altas velocidades también aborda las crecientes preocupaciones sobre la privacidad de los datos y los costos operativos. Al procesar texto sensible en el dispositivo sin enviarlo a APIs externas, las organizaciones pueden mantener un control más estricto sobre sus datos. Además, la baja latencia permite la toma de decisiones en tiempo real en aplicaciones orientadas al usuario, como la validación instantánea de formularios o el filtrado dinámico de contenido, sin introducir retrasos notables. La naturaleza de pesos abiertos del modelo permite a los equipos auditar su comportamiento y ajustarlo aún más para requisitos específicos de dominio.

Qué puedes hacer

  • Instala Ollama y descarga el modelo Nimble usando el comando ollama pull nimble para probar las velocidades de inferencia local.
  • Experimenta con el endpoint /v1/systemone enviando estados JSON estructurados y definiendo hasta 64 preguntas por solicitud.
  • Implementa un sistema de enrutamiento que use el tipo de elección de Nimble para dirigir las solicitudes de los usuarios a los departamentos apropiados basándose en las puntuaciones de probabilidad.
  • Construye una herramienta de aplicación de políticas que use el tipo de puntuación para calificar el contenido generado por usuarios contra una rúbrica definida de niveles aceptables.
  • Usa el tipo de pregunta binaria noul para crear pipelines automatizados de verificación de hechos que comprueben condiciones específicas dentro de documentos.
  • Monitorea la métrica de confianza devuelta por el modelo para marcar decisiones de baja certeza para revisión humana, mejorando la fiabilidad general del sistema.

Herramientas de la Tienda de Bytechap

$89

DocBento

Gestión documental autoalojada que lee cada escaneo y responde con citas de página.

Demo en vivo

Seguir leyendo

Todos los artículos