問問貓 › AI 工具總表 › GitHub Copilot
GitHub HydraFusion 實測表攤開看:三個基準只有一個贏過 Opus 5,但成本低 36%~67%(2026-09 實查)
文章最後更新:2026-09-08
GitHub 在 2026-09-04 發布 Project HydraFusion 研究預覽。一句話講它做什麼:你不再是挑一個模型,而是讓它替每一個任務組出一條執行路線——先讓便宜模型草擬、再決定要不要送去給更強的模型,或找另一家模型當審稿人。
官方部落格把三個基準的數字整張表列出來了,而這張表比標題誠實。查核日 2026-09-08。
一、官方基準表(對照 Opus 5)
| 基準 | 成本 vs Opus 5 | 品質 vs Opus 5 |
|---|---|---|
| TerminalBench 2.1 | 低 67% | +4.9 分 |
| DeepSWE | 低 36% | −1.5 分 |
| CheckpointBench(GitHub 內部) | 低 65% | −0.1 分 |
也就是說:三個基準裡只有一個的品質真的贏過 Opus 5,另外兩個是「略輸一點點,但便宜三分之一到三分之二」。官方文中對 DeepSWE 的說法是「在 1.5 個百分點以內、成本低 36%」,對 CheckpointBench 是「0.1 個百分點以內、成本低 65%」——用字是 within,不是 better。
官方同時標明限制:這些是離線受控評測,只適用於「所評測的基準版本、工作流設定、模型池與定價假設」,而且所有模型都在同一個 medium reasoning 等級下評測。換句話說,這不是你在自己 repo 上會拿到的數字。
二、它省的不是價目表,是「呼叫組合」
這一點最容易誤會。官方寫得很清楚:HydraFusion 在 所有 GitHub Copilot 方案都能用,透過 Copilot CLI 的 /experimental 開啟;用量按它實際用到的模型、以各模型的標準費率計算。
所以:
- 沒有專屬折扣。 你不會因為選了 HydraFusion 而拿到比較便宜的單價。
- 省下來的是「不必每一題都動用最貴的模型」。 便宜模型草擬能過關就不升級,過不了才升級。
- 失敗的分支也要算錢。 官方列的五個運作原則第一條就是「完整計費」:草擬、批評、修訂、升級、重試、備援,每一段都計入成本。
這代表一件事:如果你的任務大多需要升級,帳單不會比較便宜。 官方基準的省錢幅度,建立在「很多任務其實不需要最強模型」這個前提上。
三、三種執行模式,各自解決不同問題
官方目前列出三種:
- Single(單一):一個模型直接解完。適用一次就能解的任務,保留速度。
- Cascade(級聯):便宜模型先草擬,一道品質關卡決定接受或升級到更強的模型。
- Critique(批評):一個模型草擬,另一個模型家族的獨立審稿人(無工具、唯讀)審查,草擬者再修訂一次。
第三種的設計細節值得注意:審查步驟跑在「隔離、沒有工具」的環境,所以審稿模型不能動你的 repo,只能評。而且官方寫明 失敗或取消時不套用任何 patch——不會留下改到一半的檔案。
四、對一般使用者的實際影響
現在就能做的:
- 要試的話,Copilot CLI 裡依序執行
/update安裝最新版、/experimental on、/model選 HydraFusion (Research Preview)。 - 官方建議先從「單一提示、第一輪就能講完」的完整任務開始——多輪長對話是他們下一階段才要優化的。
現在還不能期待的:
- 看不到中間過程。 官方明說它會壓住中間草稿、只回一份結果,理由是那些草稿可能被改掉或丟掉,先給你看會讓未完成的東西看起來像定稿。官方也承認「等待期間缺乏可見度」是真實的取捨,正在想辦法。
- 結果會變。 官方原文:模型、工作流、可用性、名稱與產品行為都可能隨預覽調整。
五、這件事的意義
過去一年 AI 編碼工具的競爭是「誰家模型強」。HydraFusion 是另一個方向:同一批模型,靠調度方式把成本壓下來。 GitHub 自己的話是——從「選出最好的模型」轉向「動態組出解這一題最好的方式」。
值得盯的是:如果調度真的能在品質幾乎不掉的前提下省掉一半以上成本,那麼**「訂閱制的 AI 額度還夠不夠用」這個問題,會從模型單價轉移到調度效率上**。對每月被額度卡住的人來說,這比降價更實際。
Copilot 額度怎麼算、什麼時候會被扣,見Copilot AI credits 的計算方式;方案比較見 GitHub Copilot 工具頁。
本文依據 GitHub 官方部落格 Project HydraFusion: Frontier quality via multi-model orchestration(GitHub Staff,2026-09-04)於 2026-09-08 直讀整理。所有基準數字(67%/+4.9、36%/−1.5、65%/−0.1)為 GitHub 自行公布之離線受控評測結果,本站未獨立重跑,亦無法驗證其評測環境。官方明示結果僅適用於所評測的基準版本與定價假設。
阿莫和皮米怎麼看
學生:認證後 Pro 免費,沒理由不用。一般開發者:免費版 2,000 次補全先上手,每天寫就升 Pro US$10/月。但免費和學生方案只能 Auto 選模是事實,介意就付費。

