Agentes de IA

AWS lanza Strands Decider 2B para la validación local de agentes

AWS ha lanzado Strands Decider 2B, un modelo de decisión descargable que valida las acciones de los agentes de IA localmente con una latencia inferior a 100 ms.

Traducido automáticamente del original en inglés.

Amazon Web Services ha presentado Strands Decider 2B, un compacto modelo de decisión diseñado para ejecutarse localmente y validar las acciones de los agentes de IA antes de su ejecución. Publicado el 1 de octubre de 2026, esta herramienta ofrece a los desarrolladores un mecanismo rápido y fiable para comprobar las salidas del agente sin depender de APIs externas ni generar texto inválido.

Qué ha ocurrido

El lanzamiento posiciona a AWS directamente frente a modelos de decisión emergentes como Jev de TypeSafe, que recientemente provocó una ola de herramientas similares por parte de los principales proveedores de IA. Mientras que OpenAI presentó recientemente su API de Decisiones alojada utilizando el modelo Luna, AWS adoptó un enfoque diferente al liberar un modelo totalmente descargable. Este paquete incluye no solo los pesos, sino también los datos de entrenamiento y los scripts, lo que permite a los ingenieros inspeccionar y adaptar la receta subyacente.

Strands Decider 2B forma parte del ecosistema más amplio de Strands, incubado en Strands Labs, el centro experimental de AWS para la IA agéntica. Sigue al reciente lanzamiento de Strands Harness, que proporciona la infraestructura para ejecutar agentes de mayor duración. Al ofrecer una alternativa abierta y local a los servicios alojados, AWS busca dar a los desarrolladores un mayor control sobre los pasos críticos de validación en sus flujos de trabajo de agentes.

Cómo funciona

Los modelos de decisión difieren de los grandes modelos de lenguaje estándar al restringir su espacio de salida. En lugar de generar texto libre, seleccionan entre opciones proporcionadas por el desarrollador o devuelven puntuaciones numéricas. Strands Decider utiliza Qwen3.5-2B como base, referido como el "torso". El equipo eliminó la cabeza estándar del modelo de lenguaje responsable de la generación de texto y la reemplazó con una cabeza de puntero que contiene poco más de un millón de parámetros. Esta cabeza puntúa las opciones de respuesta proporcionadas.

La columna vertebral utiliza un adaptador de baja jerarquía (LoRA) de rango 16. Al limitar las posibles salidas únicamente a las suministradas por el desarrollador, el modelo no puede inventar opciones que no existen. Esta arquitectura garantiza que cada salida sea válida dentro del contexto definido, aunque no asegura la corrección en todos los casos. La compensación resulta en decisiones más rápidas y puntuaciones de confianza calibradas, que las aplicaciones pueden utilizar para determinar los siguientes pasos.

En la práctica, esto permite realizar comprobaciones previas a la ejecución. Por ejemplo, si un agente propone llamar a una herramienta meteorológica sin especificar una ciudad, el Decider evalúa si los argumentos están fundamentados en la conversación. Si falta información, el sistema puede redirigir al agente para que pida aclaraciones al usuario en lugar de ejecutar una llamada a la herramienta defectuosa. Este proceso se realiza a través del sistema de intervención de Strands, permitiendo a los desarrolladores definir políticas para proceder, denegar o solicitar confirmación humana.

Detalles clave

  • El modelo está construido sobre Qwen3.5-2B con una cabeza de puntero personalizada que reemplaza la capa de generación de texto.
  • Logra tiempos de decisión inferiores a 100 milisegundos en una GPU Nvidia RTX 3090.
  • En un MacBook M3, los tiempos de respuesta medianos para tareas pequeñas son aproximadamente 150 milisegundos.
  • Strands Decider 2B ocupa el segundo lugar entre los modelos públicos con aproximadamente 2 mil millones de parámetros en JevBench.
  • Ocupa el primer lugar entre los modelos públicos que proporcionan una receta completa de entrenamiento y datos.
  • La versión incluye todas las iteraciones arquitectónicas anteriores en el repositorio para garantizar la transparencia.

Por qué es importante

Para los ingenieros de software que construyen agentes autónomos, la fiabilidad suele ser el mayor obstáculo. Los modelos generativos pueden alucinar argumentos de herramientas o pasar por alto restricciones críticas, lo que lleva a errores difíciles de depurar. Strands Decider 2B aborda esto insertando una comprobación rápida y determinista entre el razonamiento del agente y sus acciones. Esta separación de responsabilidades permite que los modelos generativos manejen la complejidad de la conversación y la creatividad, mientras que el modelo de decisión gestiona el enrutamiento y la validación.

La naturaleza local del modelo es significativa para aplicaciones sensibles a la latencia y la privacidad de datos. Ejecutar la validación en el dispositivo elimina el tiempo de ida y vuelta de la red asociado con las APIs alojadas. Además, la inclusión de datos de entrenamiento y scripts admite el ajuste fino para dominios específicos. Los desarrolladores ya no quedan encerrados en la lógica propietaria de un proveedor; pueden adaptar el modelo a sus restricciones operativas únicas y verificar su comportamiento mediante los benchmarks proporcionados.

Qué puedes hacer

  • Descarga el modelo Strands Decider 2B, los datos de entrenamiento y los scripts desde el repositorio de AWS.
  • Integra el modelo en tu flujo de trabajo de agentes para validar los argumentos de las herramientas antes de la ejecución.
  • Utiliza la estructura del adaptador LoRA proporcionada para ajustar el modelo a tus tareas de decisión específicas.
  • Realiza pruebas de referencia de la latencia del modelo en tu hardware local para asegurar que cumple con tus requisitos en tiempo real.
  • Revisa las iteraciones históricas en el repositorio para entender la evolución arquitectónica y las compensaciones de rendimiento.
  • Experimenta con el sistema de intervención para definir políticas personalizadas para manejar decisiones de baja confianza.

Herramientas de la Tienda de Bytechap

$79

WorkBento

Suite de RR. HH. y gestión del entorno laboral impulsada por IA que puedes alojar tú mismo.

Demo en vivo

Seguir leyendo

Todos los artículos