Construir con IA

Los modelos de trayectoria normalizadora permiten una verosimilitud exacta en la difusión con pocos pasos

Investigadores de Apple presentan los Modelos de Trayectoria Normalizadora para lograr una generación de imágenes de alta calidad en cuatro pasos, manteniendo el entrenamiento de verosimilitud exacta.

Ilustración de pasos de difusión comprimidos representados por circuitos luminosos en un cubo de vidrio junto a un cronómetro
Ilustración generada para este artículo

Traducido automáticamente del original en inglés.

Investigadores de Apple, la Universidad de Pensilvania y UIUC han presentado los Modelos de Trayectoria Normalizadora (NTM), una nueva arquitectura para la IA generativa que acelera la síntesis de imágenes. Publicado el 8 de octubre de 2026, este trabajo aborda el cuello de botella de eficiencia en los modelos de difusión al permitir una salida de alta fidelidad en solo cuatro pasos de muestreo. A diferencia de los métodos anteriores de generación rápida, NTM mantiene un marco de verosimilitud exacta durante todo el proceso.

Qué ocurrió

Los modelos de difusión estándar generan imágenes invirtiendo un proceso de adición de ruido mediante muchos pequeños pasos de desruido gaussiano. Este enfoque es computacionalmente costoso porque requiere cientos de pasadas secuenciales para producir un resultado coherente. Cuando los ingenieros intentan acelerar la inferencia comprimiendo estos pasos en transiciones menos numerosas y más gruesas, las suposiciones matemáticas subyacentes a menudo se rompen, lo que lleva a una degradación de la calidad de la imagen o a artefactos.

Para resolver esto, el equipo de investigación desarrolló NTM, que trata cada paso inverso como un flujo normalizador condicional expresivo. Esto permite entrenar el modelo con verosimilitud exacta, preservando el rigor probabilístico que típicamente se pierde en los métodos acelerados. La arquitectura combina bloques invertibles superficiales dentro de cada paso con un predictor paralelo profundo que opera sobre toda la trayectoria. Este diseño crea una red de extremo a extremo que puede entrenarse desde cero o inicializarse a partir de modelos de coincidencia de flujo preentrenados existentes.

El sistema resultante logra un rendimiento comparable a las líneas base fuertes en puntos de referencia de texto a imagen, pero requiere solo cuatro pasos de muestreo. Una característica clave de este enfoque es la auto destilación, donde un desruidor ligero se entrena sobre la función de puntuación inducida por el propio modelo. Este mecanismo permite que NTM produzca muestras de alta calidad rápidamente sin sacrificar los beneficios teóricos del entrenamiento basado en verosimilitud.

Cómo funciona

Los flujos normalizadores son una clase de modelos generativos que transforman una distribución de probabilidad simple en una compleja mediante una serie de funciones invertibles. En NTM, cada paso de la trayectoria de generación se modela como dicho flujo. Debido a que estas transformaciones son invertibles, el modelo puede calcular la verosimilitud exacta de los datos en cada etapa. Esto contrasta con la destilación de difusión estándar o el entrenamiento adversarial, que a menudo aproximan la distribución y pierden la capacidad de calcular probabilidades precisas.

La arquitectura utiliza una estructura dual para gestionar la complejidad y la velocidad. Los bloques invertibles superficiales manejan las transformaciones locales dentro de cada paso, asegurando que se mantengan las propiedades matemáticas del flujo. Simultáneamente, un predictor paralelo profundo analiza toda la trayectoria, permitiendo que el modelo comprenda el contexto global del proceso de generación. Esta capacidad de procesamiento paralelo es crucial para reducir el número de pasos requeridos de cientos a solo cuatro.

La auto destilación mejora aún más la eficiencia. En lugar de depender de maestros externos o pérdidas adversariales complejas, NTM utiliza su propia función de puntuación inducida para entrenar un desruidor más ligero. Este bucle de retroalimentación interna refina el proceso de generación, asegurando que la salida de pocos pasos permanezca consistente con las distribuciones de alta calidad aprendidas durante el entrenamiento. El resultado es un sistema que equilibra velocidad, calidad y solidez teórica.

Detalles clave

  • NTM reduce la generación de imágenes a cuatro pasos de muestreo igualando o superando a las líneas base fuertes.
  • El modelo retiene la verosimilitud exacta sobre la trayectoria generativa, a diferencia de la mayoría de los métodos de destilación con pocos pasos.
  • La arquitectura combina bloques invertibles superficiales por paso con un predictor paralelo profundo a lo largo de la trayectoria.
  • Admite el entrenamiento desde cero o la inicialización a partir de modelos de coincidencia de flujo preentrenados.
  • Utiliza la auto destilación mediante un desruidor ligero entrenado sobre la función de puntuación inducida por el propio modelo.
  • Investigación realizada por equipos de Apple, la Universidad de Pensilvania y UIUC, publicada el 8 de octubre de 2026.

Por qué importa

Para los ingenieros que construyen aplicaciones generativas, el costo de inferencia es una restricción primaria. Reducir el número de pasos de muestreo de cientos a cuatro disminuye drásticamente la latencia y el gasto computacional, haciendo que la generación en tiempo real sea más viable. Sin embargo, los intentos anteriores de acelerar la difusión a menudo comprometían la calidad o eliminaban la capacidad de medir la verosimilitud, útil para tareas como la detección de anomalías y la evaluación de modelos. NTM ofrece un camino hacia la velocidad sin perder estas capacidades analíticas.

La retención de la verosimilitud exacta también abre nuevas posibilidades para la optimización y depuración de modelos. Los desarrolladores pueden cuantificar precisamente qué tan bien se ajusta el modelo a los datos, algo difícil con métodos adversariales o aproximados. Esta transparencia puede conducir a sistemas más robustos, particularmente en dominios donde la confiabilidad y la interpretabilidad son críticas. Al combinar la velocidad de los modelos destilados con el rigor de los flujos normalizadores, NTM representa un paso significativo hacia una IA generativa más eficiente y confiable.

Qué puedes hacer

  • Revisa la arquitectura NTM para entender cómo se pueden integrar los bloques invertibles en los pipelines de difusión existentes.
  • Experimenta con técnicas de auto destilación utilizando la función de puntuación de tu propio modelo para reducir los pasos de inferencia.
  • Evalúa si el cálculo de la verosimilitud exacta es beneficioso para tu caso de uso específico, como la detección de valores atípicos.
  • Considera inicializar nuevos modelos a partir de puntos de control de coincidencia de flujo preentrenados para aprovechar el conocimiento existente.
  • Realiza pruebas comparativas de la generación en cuatro pasos contra tu línea base actual para evaluar posibles mejoras en la latencia.
  • Explora los predictores paralelos en tu modelado de trayectorias para mejorar la conciencia del contexto global durante la generación.

Herramientas de la Tienda de Bytechap

$89

DocBento

Gestión documental autoalojada que lee cada escaneo y responde con citas de página.

Demo en vivo
$79

WorkBento

Suite de RR. HH. y gestión del entorno laboral impulsada por IA que puedes alojar tú mismo.

Demo en vivo

Seguir leyendo

Todos los artículos