GitHub Copilot 目前依赖云端托管模型,由协调器根据性能、成本与准确性路由请求。微软计划在本月底扩展该机制,允许 Copilot 自动选择云端模型与本地 AI 模型,后台协调推理任务。
本地模型选择支持指定提供程序、模型或端点,开发者可通过 Windows ML 选择 MAI Code 1.1 Flash,或连接 OpenAI 兼容的本地端点并选用其暴露的模型。
微软推出 MAI Code 1.1 Flash“混合专家”模型,总参数 1370 亿,活跃参数 68 亿,采用量化与推测解码技术优化响应速度与内存占用。
该模型在 Surface Laptop Ultra 上实测显示,复杂任务中的峰值内存使用率、Token 利用率与处理速度均显著提升。解码吞吐量测试显示,提示长度从 2K 到 256K Token 时,吞吐介于每秒 40 至 63 个词元。附上相关如下:










