Microsoft lanza el modelo Decision-1 sobre la base Qwen para competir con OpenAI y TypeSafe
Microsoft ha lanzado Microsoft-Decision-1 en Foundry, construido sobre Qwen3.5-9B de Alibaba, igualando los precios de la competencia pero omitiendo soporte para imágenes y pesos abiertos.
Traducido automáticamente del original en inglés.
Microsoft lanzó Microsoft-Decision-1 en su plataforma Foundry el viernes 10 de octubre de 2026, entrando en el mercado de rápido crecimiento de modelos de decisión de IA. El lanzamiento se produce solo tres días después de que OpenAI hiciera disponible su API Decisions en beta pública y semanas después de que la startup TypeSafe introdujera su modelo Jev. Al saltarse la arquitectura de OpenAI y post-entrenar en cambio un modelo basado en Qwen3.5-9B de Alibaba, Microsoft señala un cambio hacia una infraestructura independiente para la lógica de agentes, incluso mientras planea eventualmente rebasar sus propios modelos MAI y la tecnología de OpenAI.
Qué pasó
El nuevo modelo llega a un precio de $0.042 por millón de tokens de entrada con salida gratuita, coincidiendo exactamente con la tarifa cobrada por TypeSafe para su modelo Jev. Este movimiento de precios coincide con el anuncio de TypeSafe de una ronda de financiación Serie A de $870 millones liderada por a16z, valorando la startup en $7.5 mil millones. TypeSafe afirma que casi el 30% de las empresas Fortune 500 han probado Jev en las tres semanas desde su lanzamiento, una métrica de tracción que probablemente presionó a Microsoft para responder rápidamente. En el mismo período, competidores incluyendo Upstage, Perplexity, Cloudflare y AWS también han lanzado sus propios modelos centrados en la toma de decisiones.
El Presidente y CEO de Microsoft, Satya Nadella, anunció el lanzamiento en X, declarando que la empresa ya está probando el modelo internamente. Cuatro equipos internos están utilizando actualmente Decision-1: Xbox Research lo usa para clasificar más de 10,000 piezas de retroalimentación de jugadores, el equipo de Copilot lo emplea para calificar respuestas de chat y agentes, ingenieros de guardia lo usan para extraer contexto durante incidentes en vivo, y Microsoft Discovery lo usa para puntuar experimentos antes de que un agente replanifique. Las pruebas internas sugieren que el modelo es más de 14 veces más rápido que GPT-6 Sol para tareas de Xbox y 46 veces más consistente para flujos de trabajo de Discovery.
Cómo funciona
Decision-1 es un modelo especializado diseñado para tareas de decisión estructuradas en lugar de contenido generativo general. Acepta hasta 32,768 tokens de entrada de texto y devuelve salidas en formato JSON, haciéndolo adecuado para la integración en agentes automatizados y flujos de trabajo. A diferencia de algunos competidores, esta versión inicial es solo de texto y no admite entradas de imagen. Microsoft post-entrenó el modelo sobre la base Qwen3.5-9B de Alibaba, una elección que se alinea con las tendencias de la industria donde los desarrolladores están portando modelos de código abierto para crear capas de decisión rentables. Jared Palmer, vicepresidente de ingeniería de Cognition, señaló que portar modelos similares a Qwen3.5 requirió recursos mínimos de cómputo, destacando la eficiencia de este enfoque.
El modelo está diseñado para proporcionar probabilidades calibradas, lo que significa que una puntuación de confianza del 90% debería corresponder a decisiones correctas nueve de cada diez veces en datos representativos. Sin embargo, Microsoft aconseja a los clientes validar estas puntuaciones de calibración en sus propios conjuntos de datos específicos. Mientras que el modelo apunta a una alta consistencia, investigaciones recientes sobre modelos competidores como Jev muestran que las entradas adversarias pueden sesgar significativamente las puntuaciones de confianza. Microsoft probó Decision-1 contra ocho tipos de perturbaciones, como opciones reordenadas, encontrando que solo el 1.3% de las respuestas cambiaron en promedio, aunque aún no se ha publicado una prueba adversaria independiente.
Detalles clave
- Modelo Base: Post-entrenado sobre Qwen3.5-9B de Alibaba, con planes para rebasar sobre modelos Microsoft MAI y OpenAI más adelante.
- Precios: $0.042 por millón de tokens de entrada con salida gratuita, igualando los precios de Jev de TypeSafe.
- Rendimiento: Reportado como 14 veces más rápido que GPT-6 Sol para la clasificación de retroalimentación de Xbox y 46 veces más consistente para Microsoft Discovery.
- Límites de Entrada: Acepta hasta 32,768 tokens de texto; actualmente no admite entradas de imagen.
- Disponibilidad: Lanzado en Microsoft Foundry; aún no se han liberado pesos abiertos.
- Uso Interno: Actualmente probado por equipos de Xbox Research, Copilot, ingeniería de guardia y Microsoft Discovery.
Por qué importa
Para los ingenieros de software que construyen agentes de IA, el surgimiento de modelos de decisión dedicados representa un alejamiento del uso de grandes y costosos modelos de lenguaje para el enrutamiento lógico simple. Decision-1 permite a los desarrolladores descargar elecciones estructuradas—como determinar si una tarea debe ejecutarse en el dispositivo o en la nube—a un modelo especializado de baja latencia. Esta separación de responsabilidades puede reducir costos y mejorar los tiempos de respuesta para flujos de trabajo complejos de agentes. Con importantes proveedores de nube y startups lanzando herramientas similares, el estándar para la arquitectura de agentes se está cristalizando alrededor de un sistema jerárquico donde modelos pequeños y rápidos manejan la lógica y los modelos más grandes manejan la generación.
Sin embargo, la falta de soporte para imágenes y pesos abiertos coloca a Decision-1 detrás de algunos competidores como Clef de Cloudflare, que soporta codificadores de visión y se libera bajo Apache 2.0. Además, aunque el código de ejemplo de Foundry de Microsoft hace referencia a un endpoint /systemone, la empresa no ha confirmado la compatibilidad total con la API System One adoptada por AWS, Upstage y Ollama. Esta incertidumbre podría afectar la interoperabilidad para desarrolladores que dependen de interfaces estandarizadas para cambiar entre proveedores. La dependencia de probabilidades calibradas también requiere una validación cuidadosa, ya que los prompts adversarios aún pueden manipular los resultados de las decisiones, un riesgo destacado por investigaciones académicas recientes sobre modelos similares.
Qué puedes hacer
- Evalúa Decision-1 en Microsoft Foundry para tareas de enrutamiento basadas en texto dentro de tus flujos de trabajo de agentes existentes.
- Valida la calibración de probabilidades del modelo usando tus propios datos históricos para asegurar la fiabilidad en producción.
- Compara la latencia y el costo contra otros modelos de decisión como Jev, Kev o Clef para tu caso de uso específico.
- Prueba la robustez del modelo introduciendo entradas paráfrasis o opciones reordenadas para verificar la consistencia.
- Monitorea los anuncios de Microsoft para futuras actualizaciones respecto al soporte de imágenes y la compatibilidad con la API System One.
- Considera usar el modelo para tareas de triaje interno, como clasificar retroalimentación o calificar respuestas de agentes, antes de desplegarlo en funciones orientadas al cliente.



