GitHub Copilotの新ローカルルーティング、データプライバシーに関する疑問は未解決
Microsoftは10月末までにGitHub Copilotのタスクをローカルモデルとクラウドモデル間で自動的に振り分ける計画ですが、デバイスから送信されるデータの範囲や制限方法については明確にしていません。
英語の原文から自動翻訳されました。
GitHubは、Copilotユーザー向けにコーディングタスクをローカルモデルとクラウドモデル間で自動的に振り分ける機能の準備を進めており、2026年10月末までに提供開始される見込みです。Microsoftはこの機能をパフォーマンス最適化として説明していますが、どのコンテキストデータがクラウドに送信されるのかは詳細を開示しておらず、開発者が推論処理を強制的にローカルのみで実行する方法も提供していません。
何が起きたか
Microsoftの計画は、GitHubのプロダクトマネージャーであるPatrick Nikoletich氏とWindowsプラットフォームパートナーアーキテクトのStuart Schaefer氏が共同執筆した投稿で概要が示されました。この発表は、Copilot向けの新しいサンドボックス制御機能の一般公開と同時期に行われましたが、保護レベルは使用される特定のツールによって異なります。今回の変更の核心は、すでにどのモデルを使用するかを選択しているシステム「Project HydraFusion」を拡張し、そのモデルを実行する場所(ローカルかクラウドか)も決定するようにすることです。
新しい「Auto routing(自動ルーティング)」機能は、タスクのコンテキストとキャッシュ状態を考慮して、マルチターンセッション中であってもローカル推論とクラウド推論の間を切り替えます。この機能は、Copilot CLI、Copilotアプリ、およびVS Codeで利用可能になります。開発者はAuto routingを選択するか、MAI Code 1.1 Flash(Windows MLプロバイダー経由)やその他のOpenAI互換のローカルエンドポイントなど、ローカルモデルを手動で選択できます。しかし、Microsoftはローカル推論でもセッションが完全にオフラインになるわけではないことを明確に認めています。
この曖昧さは、厳格なデータ取り扱いポリシーを持つチームの間で懸念を生んでいます。同様の問題は最近、Anthropicが高リスクな活動においてClaude Sonnet 5.5のリクエストを古いモデルバージョンへルーティングしていたことを認めた際にも発生しました。GitHubユーザーにとって、透明性の欠如は、Auto routingがどの程度のリポジトリコンテキストや会話履歴をクラウドに送信するのか不明であり、これらのルーティング判断を現在確認できないことを意味します。
仕組み
ローカル推論を実現するため、Microsoftは積極的な量子化(quantization)と投機的デコード(speculative decoding)を採用しました。MAI Code 1.1 Flashモデルは混合専門家(mixture-of-experts)アーキテクチャであり、総パラメータ数は1370億ですが、同時にアクティブになるのは68億のみです。Microsoftは約3.3ビット/重みの混合精度量子化を使用し、元のbfloat16クラウド版からモデルサイズを53GBに削減しました(80%の削減)。投機的デコードにより、より小さなドラフターモデルがトークンブロックを提案し、メインモデルがそれを検証することで、処理速度がさらに向上します。
これらの最適化にもかかわらず、ハードウェア要件は依然として高いままです。初期展開は、最大128GBの統合メモリを搭載したSurface Laptop UltraなどのNVIDIA RTX Spark Windows PCを対象としています。Microsoftは、256Kトークンのコンテキストでのピークメモリ使用量を75.5GBと測定しました。この数値には、オペレーティングシステム、アプリケーション、推論ランタイム、およびエージェントがファイルを読むにつれて増加するキーバリューストアキャッシュに必要なメモリは含まれていません。したがって、RAMが16GBまたは32GBのほとんどの開発者用ノートパソコンでは、このローカルモードをサポートできません。
セキュリティの実施は、Microsoftのオープンソースライブラリ「Execution Containers (MXC)」に基づいています。WindowsではProcessContainerバックエンドのBaseContainerティアを使用し、macOSではSeatbelt、Linuxではbubblewrapを使用します。これらのOSレベルの制限は、タスクがローカルで実行されている場合でもクラウドで実行されている場合でも、シェルコマンドとローカルMCPサーバーに適用されます。しかし、組み込みのファイルツールはOSの分離ではなく、エージェントハーネス内のチェックに依存しており、リモートMCPサーバーはローカルプロセスサンドボックスの外側に完全に置かれています。
主要な詳細
- GitHub CopilotのAuto routingは2026年10月末までに開始される予定です。
- Microsoftは、Auto routing中にどの程度のリポジトリコンテキストや会話履歴がクラウドに送信されるかを指定していません。
- MAI Code 1.1 Flashモデルは重み用に53GBを必要とし、メモリ使用量のピークは75.5GBに達するため、標準的なノートパソコンの多くでは動作しません。
- エージェントが外部サービスやネットワークツールにアクセスする可能性があるため、ローカル推論はオフラインセッションを保証しません。
- リモートMCPサーバーはローカルプロセスサンドボックスの対象外であり、代わりに接続ポリシーチェックに依存しています。
- 量子化されたローカルモデルはSWE-Bench Verifiedで70.8%のスコアを記録し、フル精度クラウド版の72.6%をやや下回りました。
なぜ重要なのか
ソフトウェアエンジニアや技術リードにとって、主な懸念はデータ主権です。多くの組織では、独自コードや内部ドキュメントをパブリッククラウドモデルに送信することを禁止しています。Auto routingがクラウドに何を送信するのか、あるいは推論をローカルモデルに制限できるかの可視性がない限り、コンプライアンスチームは機密プロジェクトでのCopilotの使用を承認できません。「ローカル推論はオフラインではない」という声明は、ローカルモデルを選択すればデータプライバシーが確保されるという前提を覆すものです。
さらに、ハードウェアの障壁がこの機能へのアクセスを制限しています。128GBの統合メモリとハイエンドのNVIDIAハードウェアが必要であるため、ローカル推論の恩恵を受けられる開発者はごく一部に限られます。これにより、トップクラスのワークステーションを持つ人だけがオンデバイスでデータを保持できる可能性があり、他の人は明確な安全策なしにクラウドルーティングに依存し続けるという格差が生じます。異なるツールやオペレーティングシステム間でサンドボックスポリシーを管理する複雑さも、ITリードにとって運用オーバーヘッドを増加させます。
対応策
- 現在のCopilotの使用状況を監査し、機密コードや内部リポジトリに関わるワークフローを特定してください。
- ローカル推論の制限オプションに関する更新について、Microsoftのドキュメントを監視してください。
- 128GBの統合メモリと高性能NVIDIAハードウェアが必要なため、自社のハードウェア環境がローカル推論に対応可能か評価してください。
- ツールやOSごとに異なるサンドボックスポリシーの管理に伴う運用負担を考慮に入れてください。
- リモートMCPサーバーがローカルサンドボックスの対象外であることを理解し、接続ポリシーによる制御を確認してください。
- ローカルモデルのパフォーマンス(SWE-Bench Verifiedで70.8%)とクラウド版(72.6%)の差を踏まえた上で、利用方針を決めてください。



