Construir con IA

Ember-1 iguala la precisión de Kimi K3 con una latencia significativamente menor

Benchmarks independientes muestran que Ember-1, de Fireworks Research, iguala la precisión de Kimi K3 mientras utiliza menos tokens de razonamiento y funciona 3,4 veces más rápido.

Traducido automáticamente del original en inglés.

Fireworks Research lanzó Ember-1 el 23 de septiembre como una vista previa de investigación construida sobre el modelo de pesos abiertos Kimi K3 de Moonshot. Las pruebas independientes revelan que Ember-1 logra una precisión casi idéntica a su modelo base, reduciendo el uso de tokens de razonamiento y mejorando drásticamente la velocidad de inferencia. Los resultados sugieren un camino viable para los desarrolladores que buscan razonamientos de alta calidad sin la extrema latencia asociada habitualmente con los modelos de pensamiento profundo.

Qué ocurrió

La afirmación central detrás de Ember-1 es que aprende a eliminar pasos de razonamiento innecesarios preservando el pensamiento crítico requerido para tareas complejas. Dado que los tokens de razonamiento se facturan como salida, reducirlos debería disminuir los costos. Fireworks fija el precio de Ember-1 en $3 por millón de tokens de entrada y $15 por millón de tokens de salida en su plataforma. Si bien esto coincide con el precio de Fireworks para Kimi K3, otros proveedores ofrecen Kimi K3 desde tan solo $1 por millón de tokens de entrada y $9 por millón de tokens de salida. Esta disparidad de precios significa que el ahorro bruto de costos depende en gran medida del proveedor elegido, lo que convierte al rendimiento y la velocidad en los principales diferenciadores de Ember-1.

Para evaluar estas afirmaciones, un benchmark independiente probó ambos modelos en tres tareas de dificultad progresiva: acertijos lógicos, programación de despliegues y cálculos de probabilidad. Cada prueba se ejecutó cinco veces por modelo para garantizar la consistencia. Los acertijos lógicos implicaban asignar servidores a ingenieros basándose en restricciones específicas, aumentando la complejidad de cuatro a siete ingenieros. La tarea de programación de despliegues requería encontrar el rollout más rápido para doce servicios con dependencias y ventanas de inactividad. La prueba de probabilidad solicitaba fracciones exactas respecto a un sistema de reintentos con un interruptor de circuito (circuit breaker), verificadas contra una simulación de dos millones de solicitudes.

Los resultados mostraron que Ember-1 resolvió perfectamente 14 de las 15 ejecuciones, mientras que Kimi K3 logró un perfecto 15 de 15. El único error de Ember-1 ocurrió en la prueba de probabilidad, donde un pequeño desliz aritmético llevó a respuestas incorrectas posteriores. A pesar de esta paridad casi perfecta en precisión, Ember-1 demostró una ventaja significativa en eficiencia. Utilizó un 23% menos de tokens de razonamiento en general y completó la suite de pruebas 3,4 veces más rápido que Kimi K3. En la plataforma de Fireworks, esta eficiencia se tradujo en un costo total de $2,48 para Ember-1 frente a $3,26 para Kimi K3.

Cómo funciona

Ember-1 está construido directamente sobre Kimi K3 de Moonshot, un modelo de pesos abiertos conocido por sus fuertes capacidades de razonamiento pero también por sus lentas velocidades de inferencia. La técnica de optimización se centra en la generación de tokens durante la fase de razonamiento. En lugar de generar largas cadenas de pensamiento para cada problema, Ember-1 intenta identificar y omitir pasos lógicos redundantes. Este proceso reduce la cantidad de tokens de salida generados, lo que impacta directamente tanto en la facturación como en la latencia.

Debido a que los tokens de razonamiento se cobran como salida, cualquier reducción en la longitud del pensamiento disminuye el costo inmediato por consulta al usar proveedores que cobran por token. Sin embargo, los cambios arquitectónicos también parecen agilizar el grafo computacional, lo que conduce a un tiempo real (wall-clock time) más rápido. En el benchmark, el tiempo promedio de respuesta de Ember-1 para acertijos lógicos complejos fue inferior a cuatro minutos, mientras que Kimi K3 tardó más de doce minutos. Esta diferencia de velocidad es crítica para aplicaciones interactivas donde los tiempos de espera del usuario deben minimizarse.

Detalles clave

  • Ember-1 completó la suite de pruebas completa 3,4 veces más rápido que Kimi K3.
  • El modelo utilizó un 23% menos de tokens de razonamiento en promedio en todas las pruebas.
  • Ember-1 logró 14 ejecuciones perfectas de 15, con un pequeño error aritmético en la sección de probabilidad.
  • Kimi K3 logró 15 ejecuciones perfectas de 15, demostrando una consistencia ligeramente mayor en este benchmark específico.
  • En Fireworks, Ember-1 costó $2,48 por la suite de pruebas, comparado con $3,26 para Kimi K3.
  • Si se enruta a través de proveedores más baratos, Kimi K3 podría costar tan solo $1,96 para la misma carga de trabajo, superando en precio a Ember-1.

Por qué importa

Para los equipos de ingeniería que construyen productos impulsados por IA, el equilibrio entre precisión, costo y latencia es constante. Los modelos de razonamiento profundo como Kimi K3 a menudo proporcionan una precisión superior en problemas difíciles, pero sufren de alta latencia y costo debido a la extensa generación de tokens. Ember-1 demuestra que es posible retener la mayoría de los beneficios de precisión mientras se mejora significativamente la velocidad. Una aceleración de 3,4x puede marcar la diferencia entre una función interactiva utilizable y un proceso por lotes en segundo plano, ampliando el rango de aplicaciones donde los modelos de razonamiento profundo son viables.

Sin embargo, el beneficio de costo no es universal. Los desarrolladores que priorizan el costo absoluto más bajo sobre la velocidad aún pueden lograr mejores precios enrutando Kimi K3 a través de proveedores económicos en plataformas como OpenRouter. La propuesta de valor de Ember-1 es más fuerte para casos de uso donde el tiempo de respuesta es crítico. Si una aplicación requiere respuestas de razonamiento casi instantáneas, Ember-1 ofrece una alternativa convincente al modelo base más lento, incluso si el precio por token es más alto que las opciones más baratas disponibles para Kimi K3.

Qué puedes hacer

  • Evalúa Ember-1 para funciones interactivas donde se requiera una latencia inferior a cinco minutos.
  • Compara el costo total de propiedad considerando el tiempo de desarrollo ahorrado gracias a ciclos de iteración más rápidos.
  • Prueba Kimi K3 en proveedores de bajo costo si tu aplicación puede tolerar una mayor latencia a cambio de facturas más bajas.
  • Implementa lógica de reintentos o pasos de verificación si usas Ember-1 para cálculos matemáticos de alto riesgo.
  • Ejecuta tus propios benchmarks específicos del dominio utilizando las estructuras de prompt proporcionadas para validar la precisión.
  • Monitorea las actualizaciones de Fireworks Research a medida que Ember-1 pasa de vista previa de investigación a disponibilidad general.

Herramientas de la Tienda de Bytechap

$89

DocBento

Gestión documental autoalojada que lee cada escaneo y responde con citas de página.

Demo en vivo
$79

WorkBento

Suite de RR. HH. y gestión del entorno laboral impulsada por IA que puedes alojar tú mismo.

Demo en vivo

Seguir leyendo

Todos los artículos