El reto de la codificación con un único modelo en Wagtail: lecciones aprendidas de 2 mil millones de tokens
Un desarrollador de Wagtail intentó utilizar exclusivamente GLM 5.3 Flash durante un mes de programación. Las limitaciones de infraestructura y los costes de prototipado obligaron a cambiar a otros modelos a mitad del periodo.
Traducido automáticamente del original en inglés.
En septiembre de 2026, un desarrollador principal de Wagtail CMS intentó restringir todas las tareas de codificación a un único modelo eficiente de pesos abiertos, GLM 5.3 Flash. El experimento consumió 2 mil millones de tokens, pero no logró mantener la restricción de un solo modelo debido a cuellos de botella en la infraestructura y a los elevados costes del prototipado.
Qué ocurrió
El objetivo era sencillo: pasar todo el mes utilizando únicamente GLM 5.3 Flash para el trabajo de desarrollo. Durante la primera quincena de septiembre, la estrategia se mantuvo firme. El uso permaneció dentro de un presupuesto ajustado de 68 dólares, consumiendo aproximadamente 4 kWh de energía y generando 365 gramos de emisiones de carbono. Este éxito inicial demostró que los modelos ligeros y eficientes podían gestionar tareas de ingeniería estándar sin desbordar el presupuesto ni impactar negativamente al medio ambiente.
Sin embargo, la segunda mitad del mes mostró una desviación significativa. Aproximadamente 1 mil millones de tokens se gastaron en modelos alternativos, dividiendo el uso total por igual entre el modelo objetivo y otros. El desarrollador señaló que, aunque el reto fracasó técnicamente en cumplir sus estrictos criterios de modelo único, los datos recopilados proporcionaron información crucial sobre las limitaciones prácticas de depender de un proveedor de inferencia o arquitectura de modelo específico en un entorno similar a producción.
Varios factores contribuyeron a este cambio. El equipo encontró problemas inesperados de disponibilidad de infraestructura con sus proveedores elegidos. Dado que GLM 5.3 Flash se sitúa alto en la frontera de Pareto para su carga de trabajo específica, también se convirtió en una opción popular entre otros usuarios. Los proveedores de inferencia más pequeños carecían de la capacidad de GPU de los grandes laboratorios, lo que provocó una degradación del rendimiento. Para mantener la productividad, el desarrollador cambió a alternativas comparables como DeepSeek V4.1 Flash y Qwen 3.8 Flash, disponibles en centros de datos europeos.
Cómo funciona
El experimento dependía de herramientas de monitorización como AgentsView para rastrear la distribución de tokens, el coste y el consumo de energía entre diferentes modelos. El flujo de trabajo implicaba usar el asistente de IA para diversas tareas, incluyendo la implementación de interfaces de usuario (UI), la redacción de documentación y la ejecución de evaluaciones sobre la base de código de Wagtail. El modelo seleccionado, GLM 5.3 Flash, ofrece una ventana de contexto de 1 millón de tokens y soporte visual, lo que le permite procesar capturas de pantalla y gestionar sesiones de codificación extendidas.
Una parte significativa del agotamiento de recursos provino del "vibe coding" de un servidor experimental de Protocolo de Contexto de Modelo (MCP). Este enfoque prioriza el prototipado rápido sobre una estructura de código optimizada. El desarrollador seleccionó una configuración de modelo subóptima para este prototipo, resultando en un pico repentino de 450 millones de tokens, costando 150 dólares y consumiendo 5 kWh de energía en una sola noche. Aunque el prototipo tuvo éxito funcionalmente, destacó cómo los patrones agénticos y una mala selección de modelos pueden inflar drásticamente los costes en comparación con enfoques de ingeniería más deliberados.
Detalles clave
- Consumo total: El experimento procesó 2 mil millones de tokens en septiembre de 2026.
- Adherencia al presupuesto: La primera mitad se mantuvo dentro de un presupuesto de 68 dólares, pero el mes completo superó los objetivos iniciales de eficiencia.
- Impacto energético: El uso total de energía alcanzó aproximadamente 35 kWh, significativamente superior a los 10 kWh proyectados para un flujo de trabajo puramente eficiente.
- Límites de infraestructura: La degradación del rendimiento en GLM 5.3 Flash forzó un cambio a DeepSeek V4.1 Flash y Qwen 3.8 Flash.
- Coste del prototipo: Un prototipo de servidor MCP consumió 450 millones de tokens y 150 dólares durante la noche debido a una selección ineficiente de modelos.
- Capacidades del modelo: Se elogió a GLM 5.3 Flash por su ventana de contexto de 1M, soporte visual y disponibilidad multi-proveedor.
Por qué es importante
Para los equipos de software que adoptan el desarrollo asistido por IA, este caso de estudio subraya la diferencia entre la eficiencia teórica y la realidad operativa. Si bien los modelos de nivel flash son rentables para tareas rutinarias, no son inmunes a las restricciones de la cadena de suministro. Confiar en un único modelo o proveedor crea un punto único de fallo cuando la demanda se dispara. Los ingenieros deben reconocer que los modelos "abiertos" aún dependen de infraestructura física, que puede ser limitada en comparación con los gigantes propietarios.
Además, la distinción entre la codificación de producción y la investigación y desarrollo (I+D) es crítica para la presupuestación. El trabajo experimental, especialmente cuando se utilizan flujos de trabajo agénticos o técnicas de prototipado rápido, consume recursos a una tasa mucho más alta. Sin presupuestos separados y monitorización para I+D, estos experimentos pueden descarrilar las iniciativas de ahorro de costes. Los equipos necesitan medir el éxito no solo en los tokens generados, sino en la energía utilizada y los resultados concretos logrados.
Qué puedes hacer
- Implementar herramientas locales de medición de uso para rastrear tokens, consumo de energía y gastos en tiempo real.
- Crear presupuestos separados para las tareas de ingeniería diarias y los proyectos experimentales de I+D.
- Evaluar técnicas multi-agente, como separar los roles de orquestador, explorador y revisor, para reducir el uso redundante de tokens.
- Mantener una lista de respaldo de modelos compatibles, como variantes de DeepSeek o Qwen, para manejar cortes de infraestructura.
- Priorizar modelos con amplia disponibilidad de proveedores para aprovechar la competencia del mercado y garantizar el tiempo de actividad.
- Centrarse en métricas de eficiencia como la energía por tarea en lugar de los recuentos brutos de tokens al evaluar el rendimiento del modelo.


