MAI-Code-1-Flash:來自真實開發人員工作流程的早期成果
2026年7月29日,作者:Faith Xu
在 VS Code 中,我們致力於透過 AI 輔助編碼來協助你完成更多工作,同時精打細算每一個 token。這意味著我們正全面改善使用體驗,從我們所採用的模型,到其背後的產品與基礎設施,提供能符合各種工作流程、效能需求及預算的選項。在《VS Code 中 GitHub Copilot 背後的編碼框架》一文中,我們說明瞭 VS Code 的編碼框架如何將模型、工具與編輯器體驗連結起來,以協助模型發揮最高的工作效率。
在這篇文章中,我們將探討針對 VS Code 框架專門訓練模型如何能進一步提升品質與效率。我們關注的模型是 MAI-Code-1-Flash,這是微軟針對開發人員在 GitHub Copilot 中每天執行的快速、疊代式編碼任務所打造的輕量級編碼模型。自該模型在 Build 大會上推出以來,它便一直在正式環境中與領先的編碼模型一同運行,讓我們得以搶先觀察它在真實開發人員工作流程中的效能表現。
結果顯示,將 MAI-Code-1-Flash 與 VS Code 編碼框架搭配使用,能夠以較低的 token 用量提供出色的編碼品質,幫助開發人員從其使用額度中獲得更多價值。
正式環境中的品質與效率
在評估編碼模型時,品質與效率至關重要。使用較少 token 的模型可以降低成本,但如果開發人員仍能有效率地完成任務,這樣的節省才更有價值。我們的目標是取得正確的平衡:在有效使用 token 的同時,維持強大的編碼品質。
為了瞭解 MAI-Code-1-Flash 在這項權衡中的表現,我們分析了在 VS Code Copilot Chat 中選擇各模型的開發人員所產生的彙整數據。我們同時檢視了生成程式碼的品質,以及開發人員達到持久成果的效率。在品質方面,我們衡量瞭開發人員是否接受生成的建議,以及該程式碼在經過主動編輯後與提交(commit)時是否仍被保留。在效率方面,我們衡量瞭每輪對話生成的 token 中位數,以及達到提交所需的對話輪數中位數。
結果顯示,MAI-Code-1-Flash 在品質與效率之間取得了良好的平衡。在品質方面,它的表現優於 Claude Haiku 4.5 與 GPT-5.4 Mini。較大尺寸的 GPT-5.6 Luna 與 Kimi K2.7 Code 雖然在品質上具有優勢,但每輪需要多出 67% 至 94% 的 token,且每次提交所需的對話輪數也更多。

| 模型 | 程式碼存活率 | 提交存活率 | 接受率 | 每輪 token 數 | 每次提交的輪數 |
|---|---|---|---|---|---|
| MAI-Code-1-Flash | 基準線 (0%) | 基準線 (0%) | 基準線 (0%) | 基準線 (0%) | 基準線 (0%) |
| Claude Haiku 4.5 | -2% | -8% | -10% | -10% | +28% |
| GPT 5.4 Mini | -3% | -8% | -7% | +7% | +17% |
| GPT 5.6 Luna | +3% | +3% | +4% | +67% | +17% |
| Kimi K2.7 Code | +4% | +6% | -6% | +94% | +11% |
資料來源為 2026/6/2 至 2026/7/24 期間在 VS Code Copilot Chat 中選擇各模型的使用者。 指標定義:程式碼存活率 = 經過 10 分鐘的主動編輯後仍保留的 AI 生成程式碼百分比。提交存活率 = 在 Git 提交時仍保留的 AI 生成程式碼百分比。接受率 = 使用者接受的 AI 生成建議百分比。每輪 token 數 = 模型在每輪對話(單次請求-回應互動)中生成的 token 數中位數。每次提交的輪數 = 使用者在達到 Git 提交前完成的對話輪數中位數。
透過 Auto 實驗分流驗證結果
作為驗證彙整使用數據的另一種方式,我們在 VS Code Copilot Chat 的 Auto 模型體驗中執行了 A/B 實驗分流。Auto 會自動指派模型,不需要開發人員手動選擇,這有助於我們將模型的影響,與不同使用者選擇不同模型或使用任務差異所造成的影響隔離開來。接著,我們觀察參與度與重複使用率,以此作為判斷開發人員是否覺得該體驗實用到願意持續使用的訊號。
結果再次印證了相同的結論。MAI-Code-1-Flash 帶動了更高的參與度,同時比其他輕量級模型更具 token 效率。與 GPT-5.4 Mini 相比,使用者在兩天內回訪的可能性高出 6%;與 Claude Haiku 4.5 相比則高出 11%。儘管參與度更高,但其 token 使用量中位數卻比 GPT-5.4 Mini 低 13%,比 Claude Haiku 4.5 低 11%。換句話說,人們更頻繁地使用 MAI-Code-1-Flash,而且運作成本依然較低。
| 比較 | 使用者發起的對話輪數 | 2 天重複使用率 | 4 天重複使用率 | 總 token 數 |
|---|---|---|---|---|
| Claude Haiku 4.5 | -5% | -11% | -37% | +11% |
| GPT 5.4 Mini | 無統計學上的顯著差異 | -6% | -13% | +13% |
綜合來看,正式環境指標與 Auto 實驗分流突顯了 MAI-Code-1-Flash 旨在扮演的角色:在有效使用 token 的同時,在簡單的編碼任務上交出強大的成果。最後,讓我們更深入地檢視這個模型以及它所支援的工作流程。
專為開發人員的工作方式而設計
MAI-Code-1-Flash 的開發是為了與 VS Code 編碼框架及其支援的實際工作流程緊密配合。它特別適合用於輕量級的疊代工作,例如探索程式碼、進行漸進式變更、生成或精進測試,以及修復錯誤。其具備適應性的解決方案長度,能針對簡單的請求保持簡潔的回應,並僅在需要時才深入探討。這意味著它能更快地提供有用的輸出,同時提升 token 的使用效率。
該模型是使用乾淨、可追溯的資料從頭開始訓練的,未採用第三方模型的蒸餾。隨著時間過去,該模型將根據來自消費者方案的彙整使用訊號持續改進,同時 Copilot Business 與 Copilot Enterprise 客戶的資料則不會用於訓練。
立即試用,共同塑造未來
MAI-Code-1-Flash 現已在 GitHub Copilot 中推出。請將它與你目前慣用的模型搭配試用,感受它在你的工作流程中的表現,並在 Community Discussion 分享哪些功能運作良好,或你希望看到哪些改進,開發團隊正密切關注大家的意見。
你的意見回饋也有助於塑造未來。MAI-Code-1-Flash 只是 MAI 編碼模型旅程中的第一步。今年稍晚推出的較大型 MAI 編碼模型將把此產品線擴展至更複雜的任務,具備更強大的智慧、更深度的推理能力,以及足以與最強大的前端模型競爭的品質。
祝開發愉快! 💙