El nuevo enrutamiento local de GitHub Copilot deja sin respuesta las preguntas sobre la privacidad de los datos
Microsoft planea enrutar las tareas de GitHub Copilot entre modelos locales y en la nube a finales de octubre, pero no ha aclarado qué datos salen del dispositivo ni cómo restringirlos.
Traducido automáticamente del original en inglés.
GitHub se prepara para enrutar automáticamente las tareas de codificación entre modelos locales y en la nube para los usuarios de Copilot, con una función que se espera llegue a finales de octubre de 2026. Aunque Microsoft describe esto como una optimización del rendimiento, la empresa no ha revelado exactamente qué datos de contexto se envían a la nube ni ha proporcionado una forma para que los desarrolladores fuerce la inferencia exclusivamente local.
Qué ocurrió
Microsoft detalló su plan en una publicación coescrita por Patrick Nikoletich, gerente de producto de GitHub, y Stuart Schaefer, arquitecto asociado de plataforma de Windows. El anuncio coincide con la disponibilidad general de nuevos controles de sandboxing para Copilot, aunque el nivel de protección varía según las herramientas específicas utilizadas. El cambio principal implica expandir Project HydraFusion, un sistema que ya selecciona qué modelo usar, para que ahora también decida dónde se ejecuta ese modelo.
La nueva función de enrutamiento automático evaluará el contexto de la tarea y el estado de la caché para alternar entre la inferencia local y la de la nube, incluso durante sesiones de múltiples turnos. Esta funcionalidad estará disponible en Copilot CLI, la aplicación de Copilot y VS Code. Los desarrolladores pueden elegir el enrutamiento automático o seleccionar manualmente un modelo local, como MAI Code 1.1 Flash mediante el proveedor de Windows ML u otros endpoints locales compatibles con OpenAI. Sin embargo, Microsoft reconoce explícitamente que la inferencia local no hace que la sesión sea totalmente offline.
Esta ambigüedad ha generado preocupaciones entre equipos con políticas estrictas de manejo de datos. Problemas similares surgieron recientemente cuando Anthropic admitió haber enrutado solicitudes de Claude Sonnet 5.5 a una versión anterior del modelo para actividades de mayor riesgo. Para los usuarios de GitHub, la falta de transparencia significa que no saben cuánto contexto del repositorio o historial de conversación envía Auto a la nube, ni pueden inspeccionar actualmente estas decisiones de enrutamiento.
Cómo funciona
Para hacer viable la inferencia local, Microsoft empleó cuantización agresiva y decodificación especulativa. El modelo MAI Code 1.1 Flash tiene una arquitectura de mezcla de expertos con 137 mil millones de parámetros totales, pero solo 6.8 mil millones están activos en cualquier momento dado. Microsoft utilizó cuantización de precisión mixta a aproximadamente 3.3 bits por peso para reducir el tamaño del modelo desde su versión original bfloat16 en la nube a 53 GB, una reducción del 80%. La decodificación especulativa acelera aún más el proceso al hacer que un modelo borrador más pequeño proponga bloques de tokens para que el modelo principal los verifique.
A pesar de estas optimizaciones, los requisitos de hardware siguen siendo elevados. El despliegue inicial está dirigido a PCs Windows con NVIDIA RTX Spark, como el Surface Laptop Ultra, que ofrece hasta 128 GB de memoria unificada. Microsoft midió un uso pico de memoria de 75.5 GB con un contexto de 256K tokens. Esta cifra excluye la memoria necesaria para el sistema operativo, las aplicaciones, el tiempo de ejecución de inferencia y la caché clave-valor, que crece a medida que el agente lee archivos. En consecuencia, la mayoría de las laptops de desarrollo con 16 GB o 32 GB de RAM no pueden soportar este modo local.
La aplicación de seguridad depende de la biblioteca de código abierto Execution Containers (MXC) de Microsoft. En Windows, utiliza el nivel BaseContainer del backend ProcessContainer; en macOS, usa Seatbelt; y en Linux, bubblewrap. Estas restricciones a nivel de SO se aplican a los comandos de shell y a los servidores MCP locales, independientemente de si la tarea se ejecuta localmente o en la nube. Sin embargo, las herramientas de archivos integradas dependen de comprobaciones dentro del harness del agente en lugar del aislamiento del SO, y los servidores MCP remotos quedan completamente fuera del sandbox de proceso local.
Detalles clave
- Se espera que el enrutamiento automático para GitHub Copilot se lance a finales de octubre de 2026.
- Microsoft no ha especificado cuánto contexto del repositorio o historial de conversación se envía a la nube durante el enrutamiento automático.
- El modelo MAI Code 1.1 Flash requiere 53 GB para los pesos y alcanza un pico de uso de memoria de 75.5 GB, lo que descarta la mayoría de las laptops estándar.
- La inferencia local no garantiza una sesión offline, ya que los agentes aún pueden acceder a servicios externos o herramientas de red.
- Los servidores MCP remotos no están cubiertos por el sandbox de proceso local, dependiendo en su lugar de comprobaciones de política de conexión.
- El modelo local cuantizado obtuvo un 70.8% en SWE-Bench Verified, ligeramente por debajo del 72.6% obtenido por la versión completa en precisión de la nube.
Por qué importa
Para ingenieros de software y líderes técnicos, la preocupación principal es la soberanía de los datos. Muchas organizaciones prohíben enviar código propietario o documentación interna a modelos públicos en la nube. Sin visibilidad sobre lo que el enrutamiento automático envía a la nube, o la capacidad de restringir la inferencia a modelos locales, los equipos de cumplimiento no pueden aprobar el uso de Copilot para proyectos sensibles. La afirmación de que la inferencia local no es offline socava la suposición de que elegir un modelo local garantiza la privacidad de los datos.
Además, la barrera de hardware limita la accesibilidad de esta función. Requerir 128 GB de memoria unificada y hardware NVIDIA de gama alta significa que solo una pequeña fracción de los desarrolladores puede beneficiarse de la inferencia local. Esto crea una disparidad donde solo aquellos con estaciones de trabajo de primer nivel pueden potencialmente mantener más datos en el dispositivo, mientras que otros permanecen dependientes del enrutamiento en la nube sin salvaguardas claras. La complejidad de gestionar políticas de sandbox entre diferentes herramientas y sistemas operativos también añade sobrecarga operativa para los líderes de TI.
Qué puedes hacer
- Audita tu uso actual de Copilot para identificar flujos de trabajo que involucren código sensible o repositorios internos.
- Monitorea la documentación de Microsoft para ver si se añadirá una opción de restricción exclusiva local al enrutamiento automático.
- Evalúa las capacidades de hardware de tu equipo frente al requisito de memoria pico de 75.5 GB antes de planificar la adopción de la inferencia local.
- Revisa las políticas de sandbox para comandos de shell, servidores MCP locales y servidores MCP remotos para entender dónde existen brechas en el aislamiento.
- Considera seleccionar manualmente modelos locales si están disponibles, pero verifica que el acceso a herramientas esté bloqueado para evitar solicitudes de red no deseadas.
- Involucra a tu equipo de seguridad para definir niveles de riesgo aceptables para la fuga de datos dada la actual falta de transparencia de Microsoft.



