GitHub Copilots neues lokales Routing lässt Fragen zum Datenschutz offen
Microsoft plant, GitHub-Copilot-Aufgaben bis Ende Oktober zwischen lokalen und Cloud-Modellen zu routen, hat aber nicht geklärt, welche Daten das Gerät verlassen oder wie man dies einschränken kann.
Automatisch aus dem englischen Original übersetzt.
GitHub bereitet sich darauf vor, Codierungsaufgaben für Copilot-Nutzer automatisch zwischen lokalen und Cloud-Modellen zu verteilen. Diese Funktion soll voraussichtlich bis Ende Oktober 2026 verfügbar sein. Während Microsoft dies als Leistungsoptimierung beschreibt, hat das Unternehmen nicht genau offengelegt, welche Kontextdaten an die Cloud gesendet werden, noch bietet es Entwicklern eine Möglichkeit, ausschließlich lokale Inferenz zu erzwingen.
Was passiert ist
Microsoft skizzierte seinen Plan in einem Beitrag, der gemeinsam von Patrick Nikoletich, Produktmanager bei GitHub, und Stuart Schaefer, Windows-Plattformpartner-Architekt, verfasst wurde. Die Ankündigung fällt mit der allgemeinen Verfügbarkeit neuer Sandboxing-Kontrollen für Copilot zusammen, wobei das Schutzlevel je nach den spezifisch verwendeten Tools variiert. Die Kernänderung besteht darin, Project HydraFusion auszuweiten – ein System, das bereits auswählt, welches Modell verwendet wird, und nun auch entscheidet, wo dieses Modell ausgeführt wird.
Die neue Auto-Routing-Funktion wägt Aufgabenkontext und Cache-Status ab, um zwischen lokaler und Cloud-Inferenz zu wechseln, sogar während Multi-Turn-Sitzungen. Diese Funktionalität wird in Copilot CLI, der Copilot-App und VS Code verfügbar sein. Entwickler können Auto-Routing wählen oder manuell ein lokales Modell auswählen, wie etwa MAI Code 1.1 Flash über den Windows ML Provider oder andere OpenAI-kompatible lokale Endpunkte. Allerdings erkennt Microsoft ausdrücklich an, dass lokale Inferenz die Sitzung nicht vollständig offline macht.
Diese Unklarheit hat Bedenken bei Teams mit strengen Datenverarbeitungsrichtlinien geweckt. Ähnliche Probleme traten kürzlich auf, als Anthropic zugab, Anfragen an Claude Sonnet 5.5 für risikoreichere Aktivitäten an eine ältere Modellversion zu leiten. Für GitHub-Nutzer bedeutet der Mangel an Transparenz, dass sie nicht wissen, wie viel Repository-Kontext oder Gesprächshistorie Auto an die Cloud sendet, noch können sie diese Routing-Entscheidungen derzeit überprüfen.
Wie es funktioniert
Um lokale Inferenz machbar zu machen, setzte Microsoft auf aggressive Quantisierung und spekulatives Decoding. Das MAI Code 1.1 Flash Modell ist eine Mixture-of-Experts-Architektur mit insgesamt 137 Milliarden Parametern, von denen jedoch nur 6,8 Milliarden gleichzeitig aktiv sind. Microsoft verwendete Mixed-Precision-Quantisierung mit etwa 3,3 Bits pro Gewicht, um die Modellgröße von der ursprünglichen bfloat16-Cloud-Version auf 53 GB zu reduzieren, was einer Verringerung von 80 % entspricht. Spekulatives Decoding beschleunigt den Prozess weiter, indem ein kleineres Drafter-Modell Tokenblöcke vorschlägt, die vom Hauptmodell überprüft werden.
Trotz dieser Optimierungen bleiben die Hardwareanforderungen hoch. Der erste Rollout zielt auf NVIDIA RTX Spark Windows PCs ab, wie das Surface Laptop Ultra, das bis zu 128 GB einheitlichen Speicher bietet. Microsoft maß eine Spitzen-Speichernutzung von 75,5 GB bei einem 256K-Token-Kontext. Diese Zahl schließt den Speicherbedarf für das Betriebssystem, Anwendungen, die Inferenz-Laufzeitumgebung und den Key-Value-Cache aus, der wächst, wenn der Agent Dateien liest. Folglich können die meisten Entwickler-Laptops mit 16 GB oder 32 GB RAM diesen lokalen Modus nicht unterstützen.
Die Durchsetzung der Sicherheit basiert auf Microsofts Open-Source-Bibliothek Execution Containers (MXC). Unter Windows nutzt sie die BaseContainer-Ebene des ProcessContainer-Backends; unter macOS Seatbelt; und unter Linux bubblewrap. Diese OS-seitigen Einschränkungen gelten für Shell-Befehle und lokale MCP-Server, unabhängig davon, ob die Aufgabe lokal oder in der Cloud ausgeführt wird. Allerdings verlassen sich integrierte Dateitools auf Prüfungen innerhalb des Agent-Harness statt auf OS-Isolation, und Remote-MCP-Server bleiben vollständig außerhalb des lokalen Prozess-Sandboxes.
Wichtige Details
- Auto-Routing für GitHub Copilot soll voraussichtlich bis Ende Oktober 2026 starten.
- Microsoft hat nicht spezifiziert, wie viel Repository-Kontext oder Gesprächshistorie während des Auto-Routings an die Cloud gesendet wird.
- Das MAI Code 1.1 Flash Modell benötigt 53 GB für Gewichte und erreicht eine Spitzen-Speichernutzung von 75,5 GB, was die meisten Standard-Laptops ausschließt.
- Lokale Inferenz garantiert keine Offline-Sitzung, da Agenten weiterhin auf externe Dienste oder Netzwerktools zugreifen können.
- Remote-MCP-Server werden nicht vom lokalen Prozess-Sandbox abgedeckt und verlassen sich stattdessen auf Verbindungsrichtlinien-Prüfungen.
- Das quantisierte lokale Modell erzielte 70,8 % auf SWE-Bench Verified, leicht unter dem Score von 72,6 % der Vollpräzisions-Cloud-Version.
Warum das wichtig ist
Für Software-Ingenieure und technische Leiter ist die Hauptsorge die Datensouveränität. Viele Organisationen verbieten das Senden proprietären Codes oder interner Dokumentation an öffentliche Cloud-Modelle. Ohne Einsicht darin, was Auto-Routing an die Cloud sendet, oder die Fähigkeit, die Inferenz auf lokale Modelle zu beschränken, können Compliance-Teams die Nutzung von Copilot für sensible Projekte nicht genehmigen. Die Aussage, dass lokale Inferenz nicht offline ist, untergräbt die Annahme, dass die Wahl eines lokalen Modells die Datensicherheit gewährleistet.
Darüber hinaus begrenzt die Hardware-Hürde die Zugänglichkeit dieser Funktion. Die Anforderung von 128 GB einheitlichem Speicher und High-End-NVIDIA-Hardware bedeutet, dass nur ein kleiner Teil der Entwickler von lokaler Inferenz profitieren kann. Dies schafft eine Ungleichheit, bei der nur jene mit Top-Workstations potenziell mehr Daten auf dem Gerät behalten können, während andere ohne klare Schutzvorkehrungen auf Cloud-Routing angewiesen bleiben. Die Komplexität der Verwaltung von Sandbox-Richtlinien über verschiedene Tools und Betriebssysteme hinweg erhöht zudem den operativen Aufwand für IT-Leiter.
Was Sie tun können
- Prüfen Sie Ihre aktuelle Copilot-Nutzung, um Workflows zu identifizieren, die sensiblen Code oder interne Repositories betreffen.
- Beobachten Sie Microsofts Dokumentation auf Updates hin, ob eine Option zur Beschränkung auf rein lokale Inferenz hinzugefügt wird.
- Erwägen Sie die Implementierung zusätzlicher Sicherheitsmaßnahmen für Umgebungen, in denen Copilot eingesetzt wird.
- Informieren Sie Ihr Team über die aktuellen Einschränkungen bezüglich lokaler Inferenz und Datenschutz.



