累計 位不重複訪客
快速找分類 🤖 AI 對話 🎨 AI 生圖 🎬 AI 影片 🎵 語音音樂 💻 寫程式 ✍️ 寫作文案 ⚡ 辦公效率 🔍 搜尋研究 🦾 AI 代理 🎁 免費總表
首頁 問問貓說 AI

問問貓AI 工具總表Gemini

Gemini API 帳單在漲價前先砍一半:Batch 五折、快取一折的實際開法,還有一條回本計算式

文章最後更新:2026-09-03

Gemini API 目前這組單價是促銷價,官方定價頁寫明只到 2026-12-312027-01-01 起翻倍。與其到時候再來調整,不如現在就把成本結構整理好——同樣的工作量,官方本來就提供了打到五折甚至一折的合法路徑,只是預設不會幫你開。

這篇是操作面:三個開關各自的門檻、限制、適合的工作型態,以及一條「快取到底划不划算」的計算式。

一、先看單價表,才知道要砍哪一塊

以 Gemini 3.8 Flash 為例(官方定價頁,2026-09-03 直讀):

項目2026-12-31 前2027-01-01 起
輸入US$0.75/百萬 tokenUS$1.50
輸出(含 thinking token)US$3.75/百萬 tokenUS$7.50
快取命中US$0.075/百萬 tokenUS$0.15
快取儲存US$0.50/百萬 token/小時US$1.00
Batch/Flex上列標準價的五折同樣五折

三個立刻能看出來的事實:

  1. 輸出比輸入貴五倍(US$3.75 vs US$0.75)。多數人第一直覺是縮短提示,但帳單的大頭通常在輸出,而 thinking token 算輸出
  2. 快取命中價是輸入價的十分之一(US$0.075 vs US$0.75)。重複送同一段長前綴的人,這裡省最多。
  3. Batch 直接打五折,而且不需要改模型、不需要換供應商。

二、開關一:能等就走 Batch API(五折)

官方寫明:Batch API 的計價是同款模型互動式 API 標準價的 50%

規格重點:

  • 完成時間目標 24 小時內(官方寫 designed to complete within a 24-hour turnaround,實際常更快,視批次大小與系統負載)。
  • 兩種送法:inline 請求(適合 20MB 以下)與 JSONL 輸入檔(走 File API,單檔上限 2GB,大批次建議走這條)。
  • 工作狀態:PENDING、RUNNING、SUCCEEDED、FAILED、CANCELLED、EXPIRED,用 job name 輪詢。
  • 結果預設保存 6 週可下載,之後永久刪除——這是最容易踩的坑,排程一定要在 6 週內把結果拉走。

哪些工作該搬去 Batch:

  • 既有資料的批次標註、分類、抽取
  • 大量文件翻譯與摘要
  • 評測集(eval)跑分
  • 夜間重算的推薦理由、商品描述

哪些不行: 任何使用者在等畫面的請求。24 小時的目標值不能拿來當線上服務。

三、開關二:內容快取(命中只要一折)

先搞懂兩種快取:

  • 隱式快取(implicit):Gemini 2.5 之後預設開啟,你不必做任何事;官方說法是「如果請求命中快取,會自動把節省傳遞給你」。
  • 顯式快取(explicit):自己建立快取物件並重複引用,命中率可控。官方註明 Interactions API 只支援隱式快取,要用顯式快取得走 generateContent API。

最低 token 門檻(官方文件現行值):

模型最低快取 token
Gemini 3.8/3.7/3.6/3.5 Flash4,096
Gemini 3.1 Pro Preview4,096
Gemini 2.5 Flash/Pro2,048

低於門檻不會形成快取——這是「我明明重複送同一段,怎麼沒省到」的第一名原因。你的系統提示只有 1,500 token 的話,在 3.8 Flash 上永遠不會命中。

怎麼確認真的有命中: 看回應裡的 usage.total_cached_tokens 欄位。沒有量測就不要宣稱省到錢——這是本站的規矩,也適用在你自己的帳單上。

四、一條計算式:快取幾次命中才回本

顯式快取除了命中省錢,還要付儲存費(US$0.50/百萬 token/小時)。所以它不是無腦開。用官方單價推算(以下算式為本站依官方公布單價的推導,官方未提供此對照表):

  • 每命中一次,每百萬 token 省:US$0.75 − US$0.075 = US$0.675
  • 每存一小時,每百萬 token 付:US$0.50

結論:快取存活的每一個小時,至少要被命中一次才回本(0.675 > 0.50);一小時內命中兩次以上,就是明顯獲利。

實務推論:

  • 高頻服務(客服機器人、固定長系統提示、共用知識前綴):顯式快取幾乎穩賺。
  • 一天只跑幾次的內部工具:讓隱式快取自己運作就好,自己建長 TTL 的顯式快取反而虧儲存費
  • 前綴會變動的(每次都塞不同文件在最前面):先把固定的部分挪到最前面、變動的挪到後面,才可能命中。這是最常見的重構動作。

五、開關三:Flex

官方定價表裡,Batch 與 Flex 同列為標準價的五折。Flex 的定位是延遲較不敏感、但比 Batch 即時的一檔。

誠實說明:本次查核沒有取得 Gemini 官方對 Flex 的獨立說明頁(我們嘗試的文件路徑回 404),因此本文只引用定價表上「五折」這個已確認事實,Flex 的啟用參數、延遲區間與可用模型清單一律標為待查核,不從二手來源補。

六、建議的施行順序(一週內做得完)

  1. 先量現況:把最近一週的呼叫依「輸入 token/輸出 token/是否命中快取」分組統計。沒有這張表,後面全是猜。
  2. 把離線工作搬 Batch:先挑一個明確可延後的任務(例如夜間重算),跑一批對照,確認品質不變、成本折半。
  3. 重排提示順序:固定前綴往前、變動內容往後,讓隱式快取有機會命中;量 total_cached_tokens 驗證。
  4. 只在高頻路徑上開顯式快取,並用第四節那條式子檢查 TTL 設定是否回本。
  5. 檢查輸出長度:輸出單價是輸入的五倍,限制回應長度、避免不必要的長推理,往往比省輸入更有效。
  6. 在 2026-12-31 前把上面跑完——跨年之後同樣的用量,帳單直接乘二。

七、這篇查不到、不寫死的部分

  • Flex 檔的啟用方式、延遲區間與支援模型:官方獨立說明頁本次查核 404,待查核
  • Batch 的併發/排隊上限:官方文件未載明最大排隊工作數,待查核
  • 顯式快取的 TTL 預設值與上限:本次查核頁面未列出具體數值,待查核
  • 隱式快取的實際命中率:官方未公布,只能靠自己量 usage.total_cached_tokens
  • 免費層是否適用 Batch 五折:定價表對免費層標 Free of charge,未說明批次的額外限制,待查核

官方連結

延伸閱讀

阿莫和皮米怎麼看

AMO 阿莫 專挑毛病
皮米妳先聽我講完再反駁——這個方案命名混亂到我頭痛:gemini.google 跟 one.google.com 同時列出同名「Google AI Plus」,一個 US$4.99/400GB、一個 US$9.99/2TB,我們查了十幾次兩個 SKU 是真的並存,連 Google 自己都沒統一是不是很扯?
PIMI 皮米 說優勢
扯是扯,但你別只挑名字亂就跳過重點——AI Plus 從 US$7.99 降到 US$4.99,是真降價不是促銷噱頭,還送儲存空間從 200GB 加到 400GB 誒!免費版就含基本生圖跟少量 Deep Research,白嫖黨照樣能玩。
所以到底要不要付錢?

已在 Google 生態裡的人:免費版先試,不夠用 AI Plus US$4.99 是全站最便宜的入門付費方案。但別從 one.google.com 那個 US$9.99 入口訂,會買貴。

接下來看這些

前往官方網站

本頁部分連結為聯盟連結,經由連結購買本站可能獲得分潤,不影響你的價格,也不影響本站的資料與評價。

🐾 3 秒找最划算:回答三題,雙貓直接推薦