Gemini API 帳單在漲價前先砍一半:Batch 五折、快取一折的實際開法,還有一條回本計算式
文章最後更新:2026-09-03
Gemini API 目前這組單價是促銷價,官方定價頁寫明只到 2026-12-31,2027-01-01 起翻倍。與其到時候再來調整,不如現在就把成本結構整理好——同樣的工作量,官方本來就提供了打到五折甚至一折的合法路徑,只是預設不會幫你開。
這篇是操作面:三個開關各自的門檻、限制、適合的工作型態,以及一條「快取到底划不划算」的計算式。
一、先看單價表,才知道要砍哪一塊
以 Gemini 3.8 Flash 為例(官方定價頁,2026-09-03 直讀):
| 項目 | 2026-12-31 前 | 2027-01-01 起 |
|---|---|---|
| 輸入 | US$0.75/百萬 token | US$1.50 |
| 輸出(含 thinking token) | US$3.75/百萬 token | US$7.50 |
| 快取命中 | US$0.075/百萬 token | US$0.15 |
| 快取儲存 | US$0.50/百萬 token/小時 | US$1.00 |
| Batch/Flex | 上列標準價的五折 | 同樣五折 |
三個立刻能看出來的事實:
- 輸出比輸入貴五倍(US$3.75 vs US$0.75)。多數人第一直覺是縮短提示,但帳單的大頭通常在輸出,而 thinking token 算輸出。
- 快取命中價是輸入價的十分之一(US$0.075 vs US$0.75)。重複送同一段長前綴的人,這裡省最多。
- Batch 直接打五折,而且不需要改模型、不需要換供應商。
二、開關一:能等就走 Batch API(五折)
官方寫明:Batch API 的計價是同款模型互動式 API 標準價的 50%。
規格重點:
- 完成時間目標 24 小時內(官方寫 designed to complete within a 24-hour turnaround,實際常更快,視批次大小與系統負載)。
- 兩種送法:inline 請求(適合 20MB 以下)與 JSONL 輸入檔(走 File API,單檔上限 2GB,大批次建議走這條)。
- 工作狀態:PENDING、RUNNING、SUCCEEDED、FAILED、CANCELLED、EXPIRED,用 job name 輪詢。
- 結果預設保存 6 週可下載,之後永久刪除——這是最容易踩的坑,排程一定要在 6 週內把結果拉走。
哪些工作該搬去 Batch:
- 既有資料的批次標註、分類、抽取
- 大量文件翻譯與摘要
- 評測集(eval)跑分
- 夜間重算的推薦理由、商品描述
哪些不行: 任何使用者在等畫面的請求。24 小時的目標值不能拿來當線上服務。
三、開關二:內容快取(命中只要一折)
先搞懂兩種快取:
- 隱式快取(implicit):Gemini 2.5 之後預設開啟,你不必做任何事;官方說法是「如果請求命中快取,會自動把節省傳遞給你」。
- 顯式快取(explicit):自己建立快取物件並重複引用,命中率可控。官方註明 Interactions API 只支援隱式快取,要用顯式快取得走
generateContentAPI。
最低 token 門檻(官方文件現行值):
| 模型 | 最低快取 token |
|---|---|
| Gemini 3.8/3.7/3.6/3.5 Flash | 4,096 |
| Gemini 3.1 Pro Preview | 4,096 |
| Gemini 2.5 Flash/Pro | 2,048 |
低於門檻不會形成快取——這是「我明明重複送同一段,怎麼沒省到」的第一名原因。你的系統提示只有 1,500 token 的話,在 3.8 Flash 上永遠不會命中。
怎麼確認真的有命中: 看回應裡的 usage.total_cached_tokens 欄位。沒有量測就不要宣稱省到錢——這是本站的規矩,也適用在你自己的帳單上。
四、一條計算式:快取幾次命中才回本
顯式快取除了命中省錢,還要付儲存費(US$0.50/百萬 token/小時)。所以它不是無腦開。用官方單價推算(以下算式為本站依官方公布單價的推導,官方未提供此對照表):
- 每命中一次,每百萬 token 省:US$0.75 − US$0.075 = US$0.675
- 每存一小時,每百萬 token 付:US$0.50
結論:快取存活的每一個小時,至少要被命中一次才回本(0.675 > 0.50);一小時內命中兩次以上,就是明顯獲利。
實務推論:
- 高頻服務(客服機器人、固定長系統提示、共用知識前綴):顯式快取幾乎穩賺。
- 一天只跑幾次的內部工具:讓隱式快取自己運作就好,自己建長 TTL 的顯式快取反而虧儲存費。
- 前綴會變動的(每次都塞不同文件在最前面):先把固定的部分挪到最前面、變動的挪到後面,才可能命中。這是最常見的重構動作。
五、開關三:Flex
官方定價表裡,Batch 與 Flex 同列為標準價的五折。Flex 的定位是延遲較不敏感、但比 Batch 即時的一檔。
誠實說明:本次查核沒有取得 Gemini 官方對 Flex 的獨立說明頁(我們嘗試的文件路徑回 404),因此本文只引用定價表上「五折」這個已確認事實,Flex 的啟用參數、延遲區間與可用模型清單一律標為待查核,不從二手來源補。
六、建議的施行順序(一週內做得完)
- 先量現況:把最近一週的呼叫依「輸入 token/輸出 token/是否命中快取」分組統計。沒有這張表,後面全是猜。
- 把離線工作搬 Batch:先挑一個明確可延後的任務(例如夜間重算),跑一批對照,確認品質不變、成本折半。
- 重排提示順序:固定前綴往前、變動內容往後,讓隱式快取有機會命中;量
total_cached_tokens驗證。 - 只在高頻路徑上開顯式快取,並用第四節那條式子檢查 TTL 設定是否回本。
- 檢查輸出長度:輸出單價是輸入的五倍,限制回應長度、避免不必要的長推理,往往比省輸入更有效。
- 在 2026-12-31 前把上面跑完——跨年之後同樣的用量,帳單直接乘二。
七、這篇查不到、不寫死的部分
- Flex 檔的啟用方式、延遲區間與支援模型:官方獨立說明頁本次查核 404,待查核。
- Batch 的併發/排隊上限:官方文件未載明最大排隊工作數,待查核。
- 顯式快取的 TTL 預設值與上限:本次查核頁面未列出具體數值,待查核。
- 隱式快取的實際命中率:官方未公布,只能靠自己量
usage.total_cached_tokens。 - 免費層是否適用 Batch 五折:定價表對免費層標 Free of charge,未說明批次的額外限制,待查核。
官方連結
- Gemini API 定價(本文所有單價來源):https://ai.google.dev/gemini-api/docs/pricing
- Batch API 文件:https://ai.google.dev/gemini-api/docs/batch-api
- 內容快取文件:https://ai.google.dev/gemini-api/docs/caching
延伸閱讀
阿莫和皮米怎麼看
已在 Google 生態裡的人:免費版先試,不夠用 AI Plus US$4.99 是全站最便宜的入門付費方案。但別從 one.google.com 那個 US$9.99 入口訂,會買貴。

