Le nouveau routage local de GitHub Copilot laisse des questions ouvertes sur la confidentialité des données
Microsoft prévoit de router les tâches GitHub Copilot entre modèles locaux et cloud d'ici fin octobre, mais n'a pas précisé quelles données quittent l'appareil ni comment les restreindre.
Traduit automatiquement depuis l'original anglais.
GitHub se prépare à router automatiquement les tâches de codage entre modèles locaux et cloud pour les utilisateurs de Copilot, une fonctionnalité attendue d'ici la fin octobre 2026. Bien que Microsoft présente cela comme une optimisation des performances, l'entreprise n'a pas divulgué exactement quelles données contextuelles sont envoyées dans le cloud ni fourni de moyen permettant aux développeurs de forcer une inférence uniquement locale.
Ce qui s'est passé
Microsoft a exposé son plan dans un article co-écrit par Patrick Nikoletich, chef de produit GitHub, et Stuart Schaefer, architecte partenaire plateforme Windows. Cette annonce coïncide avec la disponibilité générale de nouveaux contrôles de sandboxing pour Copilot, bien que le niveau de protection varie selon les outils spécifiques utilisés. Le changement central consiste à étendre Project HydraFusion, un système qui sélectionne déjà quel modèle utiliser, afin qu'il décide désormais où ce modèle s'exécute.
La nouvelle fonctionnalité de routage Auto évaluera le contexte de la tâche et l'état du cache pour basculer entre l'inférence locale et celle dans le cloud, même lors de sessions multi-tours. Cette fonctionnalité sera disponible dans Copilot CLI, l'application Copilot et VS Code. Les développeurs peuvent choisir le routage Auto ou sélectionner manuellement un modèle local, tel que MAI Code 1.1 Flash via le fournisseur Windows ML ou d'autres points de terminaison locaux compatibles OpenAI. Cependant, Microsoft reconnaît explicitement que l'inférence locale ne rend pas la session entièrement hors ligne.
Cette ambiguïté a suscité des inquiétudes parmi les équipes ayant des politiques strictes en matière de traitement des données. Des problèmes similaires ont récemment émergé lorsque Anthropic a admis avoir routé les requêtes Claude Sonnet 5.5 vers une version plus ancienne du modèle pour les activités à risque élevé. Pour les utilisateurs de GitHub, le manque de transparence signifie qu'ils ignorent quelle quantité de contexte de dépôt ou d'historique de conversation Auto envoie au cloud, et ils ne peuvent actuellement pas inspecter ces décisions de routage.
Comment cela fonctionne
Pour rendre l'inférence locale réalisable, Microsoft a eu recours à une quantification agressive et à un décodage spéculatif. Le modèle MAI Code 1.1 Flash est une architecture mixture-of-experts comptant 137 milliards de paramètres au total, mais seulement 6,8 milliards sont actifs à tout moment. Microsoft a utilisé une quantification à précision mixte d'environ 3,3 bits par poids pour réduire la taille du modèle de sa version cloud bfloat16 originale à 53 Go, soit une réduction de 80 %. Le décodage spéculatif accélère davantage le processus en faisant proposer des blocs de tokens par un petit modèle drafter, que le modèle principal vérifie ensuite.
Malgré ces optimisations, les exigences matérielles restent élevées. Le déploiement initial cible les PC Windows NVIDIA RTX Spark, tels que le Surface Laptop Ultra, qui offre jusqu'à 128 Go de mémoire unifiée. Microsoft a mesuré une utilisation maximale de la mémoire à 75,5 Go avec un contexte de 256K tokens. Ce chiffre exclut la mémoire nécessaire pour le système d'exploitation, les applications, le runtime d'inférence et le cache clé-valeur, qui augmente à mesure que l'agent lit des fichiers. Par conséquent, la plupart des ordinateurs portables de développement disposant de 16 Go ou 32 Go de RAM ne peuvent pas prendre en charge ce mode local.
L'application de la sécurité repose sur la bibliothèque open source Execution Containers (MXC) de Microsoft. Sous Windows, elle utilise le niveau BaseContainer du backend ProcessContainer ; sous macOS, elle utilise Seatbelt ; et sous Linux, elle utilise bubblewrap. Ces restrictions au niveau du système d'exploitation s'appliquent aux commandes shell et aux serveurs MCP locaux, que la tâche s'exécute localement ou dans le cloud. Cependant, les outils de fichiers intégrés reposent sur des vérifications effectuées à l'intérieur du harnais de l'agent plutôt que sur l'isolation du système d'exploitation, et les serveurs MCP distants restent entièrement en dehors du sandbox de processus local.
Détails clés
- Le routage Auto pour GitHub Copilot devrait être lancé d'ici la fin octobre 2026.
- Microsoft n'a pas spécifié la quantité de contexte de dépôt ou d'historique de conversation envoyée au cloud lors du routage Auto.
- Le modèle MAI Code 1.1 Flash nécessite 53 Go pour les poids et atteint un pic d'utilisation mémoire de 75,5 Go, excluant la plupart des ordinateurs portables standard.
- L'inférence locale ne garantit pas une session hors ligne, car les agents peuvent toujours accéder à des services externes ou à des outils réseau.
- Les serveurs MCP distants ne sont pas couverts par le sandbox de processus local, reposant plutôt sur des vérifications de politique de connexion.
- Le modèle local quantifié a obtenu un score de 70,8 % sur SWE-Bench Verified, légèrement inférieur au score de 72,6 % de la version cloud à pleine précision.
Pourquoi c'est important
Pour les ingénieurs logiciels et les responsables techniques, la préoccupation principale est la souveraineté des données. De nombreuses organisations interdisent l'envoi de code propriétaire ou de documentation interne vers des modèles cloud publics. Sans visibilité sur ce que le routage Auto envoie au cloud, ou la capacité de restreindre l'inférence aux modèles locaux, les équipes de conformité ne peuvent approuver l'utilisation de Copilot pour des projets sensibles. La déclaration selon laquelle l'inférence locale n'est pas hors ligne mine l'hypothèse selon laquelle le choix d'un modèle local assure la confidentialité des données.
De plus, la barrière matérielle limite l'accessibilité de cette fonctionnalité. Exiger 128 Go de mémoire unifiée et du matériel NVIDIA haut de gamme signifie qu'une petite fraction seulement des développeurs peut bénéficier de l'inférence locale. Cela crée une disparité où seuls ceux disposant de stations de travail haut de gamme peuvent potentiellement garder plus de données sur l'appareil, tandis que les autres restent dépendants du routage cloud sans garanties claires. La complexité de la gestion des politiques de sandbox à travers différents outils et systèmes d'exploitation ajoute également une charge opérationnelle pour les responsables IT.
Ce que vous pouvez faire
- Auditez votre utilisation actuelle de Copilot pour identifier les flux de travail impliquant du code sensible ou des dépôts internes.
- Surveillez la documentation de Microsoft pour suivre les mises à jour concernant l'ajout éventuel d'une option de restriction locale uniquement au routage Auto.
- Évaluez les capacités matérielles de votre équipe par rapport à l'exigence de pic de mémoire de 75,5 Go avant de planifier l'adoption de l'inférence locale.
- Passez en revue les politiques de sandbox pour les commandes shell, les serveurs MCP locaux et les serveurs MCP distants afin de comprendre où existent des lacunes en matière d'isolation.
- Envisagez de sélectionner manuellement des modèles locaux si disponibles, mais vérifiez que l'accès aux outils est verrouillé pour empêcher les requêtes réseau involontaires.
- Collaborez avec votre équipe de sécurité pour définir les niveaux de risque acceptables en matière de fuite de données compte tenu du manque actuel de transparence de Microsoft.



