Construir con IA

Ajuste fino de agentes de búsqueda mediante aprendizaje por refuerzo multi-turno en SageMaker

Amazon demuestra cómo el ajuste fino con RL multi-turno optimiza un agente de búsqueda Qwen3.6-27B, reduciendo las tasas de fallo del 22% a menos del 1% y mejorando la calidad de recuperación.

Ilustración de aprendizaje por refuerzo multi-turno conectando herramientas de búsqueda a un modelo central de IA
Ilustración generada para este artículo

Traducido automáticamente del original en inglés.

Amazon Web Services ha publicado un análisis técnico detallado sobre el uso de Amazon SageMaker AI para ajustar modelos de lenguaje grandes (LLM) como agentes de búsqueda mediante aprendizaje por refuerzo multi-turno. Publicado en octubre de 2026, esta guía detalla cómo los ingenieros pueden optimizar modelos más pequeños para tareas complejas de recuperación sin la alta latencia y el costo de los modelos de frontera. El enfoque se centra en entrenar agentes para tomar mejores decisiones a lo largo de secuencias completas de conversación, en lugar de pasos aislados.

Qué ocurrió

Los agentes de búsqueda impulsados por LLM son cada vez más comunes en entornos empresariales, pero enfrentan una brecha de confiabilidad. Si bien los grandes modelos de frontera pueden manejar razonamiento en múltiples pasos, son costosos y lentos. Los modelos más pequeños son más rápidos y económicos, pero a menudo fallan al navegar entornos de herramientas complejos cuando se les solicita directamente. El ajuste fino supervisado tradicional requiere demostraciones costosas de expertos que rara vez existen para herramientas internas específicas, mientras que el aprendizaje por refuerzo de un solo turno pasa por alto las dependencias entre acciones secuenciales.

Para abordar esto, AWS introdujo un flujo de trabajo utilizando el aprendizaje por refuerzo multi-turno (MTRL) de Amazon SageMaker AI. Este método trata las tareas agénticas como una secuencia de decisiones, optimizando el modelo basándose en el resultado final de una interacción multi-turno. El equipo ajustó finamente un modelo Qwen3.6-27B, demostrando que este enfoque permite a los modelos más pequeños alcanzar la confiabilidad de los más grandes aprendiendo comportamientos específicos del entorno directamente. El proceso utiliza infraestructura sin servidor, eliminando la necesidad de gestionar clústeres de GPU manualmente.

Los resultados mostraron mejoras significativas tanto en la calidad de recuperación como en la estabilidad operativa. Al entrenar al agente para maximizar una señal de recompensa a nivel de trayectoria, el sistema aprendió a evitar modos de fallo comunes como excedir los presupuestos de tokens o quedar atrapado en bucles. Esto permite a las organizaciones desplegar agentes de búsqueda eficientes y especializados que comprenden sus paisajes de datos y conjuntos de herramientas específicos sin depender de modelos generales masivos.

Cómo funciona

El MTRL de Amazon SageMaker AI plantea la tarea del agente como una serie de decisiones dentro de un entorno. En lugar de puntuar respuestas individuales, evalúa toda la trayectoria multi-turno. El sistema genera datos de entrenamiento mediante despliegues multi-turno, donde el agente interactúa con herramientas como búsqueda léxica (BM25) y búsqueda vectorial. Luego optimiza el modelo utilizando algoritmos de gradiente de política como Proximal Policy Optimization (PPO) o Clipped Importance Sampling Policy Optimization (CISPO).

Un componente clave es la función de recompensa. En esta implementación, el equipo utilizó nDCG@10 (Normalized Discounted Cumulative Gain at rank 10) como métrica principal. Esta puntuación estándar de recuperación de información mide qué tan bien coinciden los diez documentos recuperados principales con la clasificación ideal. Si el agente no completa la tarea dentro de los turnos permitidos o límites de tokens, recibe una penalización de -1. Esta retroalimentación negativa enseña explícitamente al modelo a ser eficiente y evitar estados de error sin requerir un modelado complejo de recompensas intermedias.

La infraestructura realiza el trabajo pesado de forma asincrónica. La generación de despliegues y las actualizaciones de gradientes se ejecutan en paralelo, manteniendo el entrenamiento rápido mientras se limita la obsolescencia fuera de política. Los ingenieros configuran el trabajo con hiperparámetros mínimos, como el tamaño del lote y los límites de concurrencia, mientras que el servicio gestiona la selección de algoritmos y los valores predeterminados de estimación de ventaja. Esta interfaz de bajo código permite a los equipos centrarse en definir sus herramientas y recompensas en lugar de gestionar la logística de entrenamiento distribuido.

Detalles clave

  • Modelo utilizado: El experimento ajustó finamente el modelo Qwen3.6-27B, soportado en la región US West (Oregon).
  • Mejora de rendimiento: En el benchmark BrowseComp-Plus, nDCG@10 mejoró un 23.7%, pasando de 0.5136 a 0.6354.
  • Impulso de confiabilidad: La tasa de fallos en BrowseComp-Plus cayó drásticamente del 22.89% a solo el 0.68% después del ajuste fino.
  • Métrica de recompensa: El sistema optimizó directamente para nDCG@10, penalizando los tiempos de espera excesivos o los desbordamientos de tokens con una recompensa de -1.
  • Infraestructura: Las ejecuciones de entrenamiento son sin servidor con precios por token, apoyando trabajos reanudables si se alcanzan los límites de tiempo.
  • Conjuntos de datos: El entrenamiento incluyó datasets FRAMES, BRIGHT y Enterprise RAG, mientras que las pruebas utilizaron FreshStack, WixQA y Wands.

Por qué importa

Para los ingenieros de software que construyen sistemas de generación aumentada por recuperación (RAG), este enfoque ofrece un camino para reducir costos sin sacrificar calidad. Muchos equipos dependen actualmente de modelos grandes y costosos porque los modelos abiertos más pequeños tienen dificultades con el uso de herramientas en múltiples pasos. Al ajustar finamente un modelo de 27 mil millones de parámetros con MTRL, los desarrolladores pueden lograr una confiabilidad comparable a una fracción del costo de inferencia. Esto es particularmente valioso para aplicaciones de búsqueda empresarial donde el volumen de consultas es alto y los requisitos de latencia son estrictos.

La reducción en las tasas de fallos es igualmente crítica para los sistemas de producción. Un agente que frecuentemente excede su límite de turnos o presupuesto de tokens crea malas experiencias de usuario y aumenta el desperdicio computacional. El diseño de recompensa basado en penalizaciones resultó eficaz para enseñar al modelo a reconocer y evitar estos límites. Esto significa que los agentes desplegados son más predecibles y fáciles de monitorear, reduciendo la carga operativa para los equipos de ingeniería que de otra manera tendrían que construir salvaguardas complejas alrededor de modelos base inestables.

Además, la capacidad de entrenar contra métricas de tarea directas como nDCG@10 alinea la optimización del modelo con los objetivos comerciales. En lugar de optimizar para la probabilidad genérica del lenguaje, el modelo aprende a recuperar documentos relevantes específicamente para la estructura de datos de la empresa. Esta especificidad permite un mejor rendimiento en consultas de dominio específico, como documentación técnica interna o catálogos de productos, donde la similitud semántica genérica podría pasar por alto coincidencias cruciales de palabras clave o matices estructurales.

Qué puedes hacer

  • Comienza definiendo las herramientas disponibles para tu agente, como endpoints de búsqueda BM25 y vectorial, y asegúrate de que sean accesibles vía API.
  • Prepara tus conjuntos de datos de entrenamiento y validación en el formato requerido por Amazon SageMaker AI MTRL, reservando el cinco por ciento para validación.
  • Define una función de recompensa a nivel de trayectoria que refleje tu métrica de éxito específica, como nDCG@10 o precisión de coincidencia exacta.
  • Configura el SDK MultiTurnRLTrainer con hiperparámetros predeterminados inicialmente, ajustando el tamaño del lote y la concurrencia solo si es necesario.
  • Monitorea el progreso del entrenamiento usando la integración con MLflow para inspeccionar trayectorias y asegurar que el agente está aprendiendo patrones de búsqueda eficientes.
  • Evalúa el modelo ajustado finamente en benchmarks retenidos antes de desplegarlo en producción para verificar mejoras tanto en calidad como en tasas de fallos.

Herramientas de la Tienda de Bytechap

$79

WorkBento

Suite de RR. HH. y gestión del entorno laboral impulsada por IA que puedes alojar tú mismo.

Demo en vivo

Seguir leyendo

Todos los artículos