【2026 實查】Groq 免費 API 的 Llama 8/16 已下架:官方 Quickstart 照抄會壞,換 gpt-oss 的完整設定教學
文章最後更新:2026-08-27
如果你這兩週照著 Groq 官方的「快速上手」貼了一段程式進去,然後它壞掉了——不是你打錯字。
Groq 在 2026-08-16 把 llama-3.1-8b-instant 和 llama-3.3-70b-versatile 兩支最常被拿來當範例的模型,對免費層與開發者層停止服務了。而官方 Quickstart 頁面的範例程式碼,到我們 2026-08-27 直讀當下,仍然寫著 llama-3.3-70b-versatile。
這篇不談 Groq 值不值得用(那是方案價格頁的事),只講實際操作:免費層現在到底能跑什麼、金鑰怎麼拿、舊程式一行怎麼改、以及怎麼在撞牆之前知道自己還剩多少。
一句話結論
- 8/16 起免費層沒有 Llama 了。官方棄用頁明寫這次調整「適用於免費層與開發者層;持有承諾消費合約的企業客戶不受影響」
- 官方指定的替代品:
llama-3.1-8b-instant→openai/gpt-oss-20b;llama-3.3-70b-versatile→openai/gpt-oss-120b或qwen/qwen3.6-27b - 舊程式要改的通常只有一行:模型 ID
- 免費層仍然不用綁卡,速度一樣跑在 LPU 上——被拿掉的是「哪些模型」,不是「快」
一、免費層現在真正跑得動的模型與上限
以下整組數字為 2026-08-27 直讀官方 console.groq.com/docs/rate-limits 的 Free 方案表格。RPM=每分鐘請求數,RPD=每日請求數,TPM/TPD=每分鐘/每日 token 數。
| 模型 ID | RPM | RPD | TPM | TPD |
|---|---|---|---|---|
openai/gpt-oss-120b | 30 | 1,000 | 8,000 | 200,000 |
openai/gpt-oss-20b | 30 | 1,000 | 8,000 | 200,000 |
openai/gpt-oss-safeguard-20b | 30 | 1,000 | 8,000 | 200,000 |
qwen/qwen3.6-27b | 30 | 1,000 | 8,000 | 200,000 |
qwen/qwen3.8-27b | 30 | 1,000 | 8,000 | 2,000,000 |
groq/compound | 30 | 250 | 70,000 | 官方未列 |
groq/compound-mini | 30 | 250 | 70,000 | 官方未列 |
whisper-large-v3 | 20 | 2,000 | — | — |
whisper-large-v3-turbo | 20 | 2,000 | — | — |
meta-llama/llama-prompt-guard-2-22m | 30 | 14,400 | 15,000 | 500,000 |
meta-llama/llama-prompt-guard-2-86m | 30 | 14,400 | 15,000 | 500,000 |
canopylabs/orpheus-v1-english | 10 | 100 | 1,200 | 3,600 |
canopylabs/orpheus-arabic-saudi | 10 | 100 | 1,200 | 3,600 |
三個值得先看懂的地方:
- 這張表上沒有任何一支 Llama 對話模型。表上兩支
llama-prompt-guard是安全分類器,不是拿來聊天或寫程式的。 qwen/qwen3.8-27b的每日 token 是 2,000,000,比同組其他模型多十倍。如果你的工作是「請求次數不多、但每次都塞很長的內容」(整理逐字稿、長文摘要),它是免費層裡最划算的一支。- RPD 1,000 這個天花板,比 TPM 8,000 難撞。實務上先卡住你的通常是每分鐘 8,000 token——一個塞了長 prompt 的迴圈,跑幾輪就滿了。
二、確認你受不受影響(30 秒)
打開你的專案,搜尋這兩個字串:
llama-3.3-70b-versatile
llama-3.1-8b-instant
有命中,而且你用的是免費金鑰或開發者方案 → 你的請求從 8/16 起就已經打不通了。沒命中 → 你不受這次影響,但下面的額度表還是值得看一眼。
順帶一提,這兩支模型在 Groq 的模型清單頁上還看得到,標籤是「Enterprise」。看得到不等於你叫得動——這是最容易誤判的一點。
三、拿免費金鑰(三步,不用綁卡)
- 到
console.groq.com註冊並登入 - 進 API Keys 頁面(
console.groq.com/keys)建立一支新金鑰 - 官方建議把它放進環境變數,不要寫死在程式裡:
export GROQ_API_KEY=你的金鑰
金鑰通常只在建立當下完整顯示一次,關掉就看不到了,先存好。
四、一行改完:把 Llama 換成 gpt-oss
官方 Quickstart 給的 Python 範例長這樣(模型 ID 就是那個過期的):
from groq import Groq
import os
client = Groq(api_key=os.environ.get("GROQ_API_KEY"))
chat_completion = client.chat.completions.create(
messages=[{"role": "user", "content": "你的提問"}],
model="llama-3.3-70b-versatile" # ← 免費層已經跑不動
)
print(chat_completion.choices[0].message.content)
照官方棄用頁的對應建議,把最後那一行換掉就好:
model="openai/gpt-oss-120b" # 原 llama-3.3-70b-versatile
小模型的對應則是:
model="openai/gpt-oss-20b" # 原 llama-3.1-8b-instant
安裝套件的指令沒變:pip install groq。
選 gpt-oss-120b 還是 qwen3.6-27b? 官方對 70B 這一支同時列了兩個替代品,沒有說哪個比較好。兩支的免費額度一模一樣(30 RPM/1,000 RPD/8,000 TPM/200,000 TPD),所以直接拿你自己的真實 prompt 各跑幾次比較輸出,比讀任何評測都準。
五、接進現有的 OpenAI 工具(不用改架構)
Groq 提供 OpenAI 相容端點,凡是能自訂 base URL 的工具(各種桌面客戶端、Open WebUI 這類前端、你自己用 OpenAI SDK 寫的程式)都能直接指過來:
- Base URL:
https://api.groq.com/openai/v1 - API Key:填你的 Groq 金鑰
- Model:填上面表格裡的模型 ID(例如
openai/gpt-oss-120b)
但官方明列了幾個還不支援的參數,踩到會出錯或行為不同,遷移前先掃一次你的程式:
logprobs、logit_bias、top_logprobs、以及messages[].name欄位N參數(若要傳,值必須等於 1)temperature不能設 0——傳 0 會被轉成1e-8。官方要求用大於 0、小於等於 2 的 float32- 音訊輸出格式
vtt與srt
那個 temperature=0 特別容易中招:很多人為了要「穩定輸出」習慣寫 0,在 Groq 這裡不會報錯,但它悄悄換成了另一個值。
六、怎麼知道還剩多少(不要等 429)
每一個回應都會帶回這幾個標頭,直接讀就知道現況,不必自己記帳:
x-ratelimit-limit-requests/x-ratelimit-remaining-requestsx-ratelimit-limit-tokens/x-ratelimit-remaining-tokensx-ratelimit-reset-requests/x-ratelimit-reset-tokensretry-after
超過上限時 API 回 HTTP 429 Too Many Requests。官方說明 retry-after 只有在真的撞到 429 時才會出現——所以正確的重試寫法是:平常讀 x-ratelimit-remaining-* 提前減速,撞到 429 才依 retry-after 等待,而不是一律固定 sleep。
七、免費層踩雷清單
- 看得到不等於叫得動:模型清單頁上的 Llama 標著「Enterprise」,免費金鑰打過去不會通
- 教學文與範例碼會過期:網路上(含官方 Quickstart)大量教學仍寫 Llama 模型 ID,複製前先對一次上面的免費層表格
- Groq 沒有 GPT-5、也沒有 Claude:它跑的是開源模型,賣點是速度不是模型陣容
- 額度是按模型各自算的:換模型不會共用同一份 RPD,但也不要指望靠輪流換模型無限繞過——每支都有自己的天花板
- 免費層仍然不用綁卡(本站 2026-08-09 查核紀錄),這點在這次調整後沒有改變
我們沒查證到的部分(照實寫)
- 快取命中的 token 是否計入上限:本站 2026-08-09 的查核紀錄寫「快取命中的 token 不計入上限」,但我們這次直讀 rate-limits 頁沒有再看到這句。可能是頁面改版,也可能是規則變了,本輪未確認,不當作現行事實。
groq/compound系列的每日 token 上限:官方表格該欄留空,未標數字。- 8/16 之後打 Llama 會回哪個錯誤碼:官方棄用頁只說「不再提供服務」,沒寫是 404 還是 400。我們沒有付費金鑰可對照,不推測。
- 免費層是否會用你的資料訓練:我們讀到的官方文件沒有針對免費層寫明這件事,因此不寫。
資料來源
本文規則與數字取自 Groq 官方文件網域,於 2026-08-27 直讀:
- Model Deprecations — 2026-08-16 兩支 Llama 停止服務、適用免費層與開發者層、企業合約不受影響、官方指定替代模型
- Rate Limits — Free 方案逐模型 RPM/RPD/TPM/TPD 表、
x-ratelimit-*標頭、429 與retry-after - Quickstart — 金鑰建立位置、環境變數、Python 範例(範例模型仍為已棄用的 Llama)
- OpenAI Compatibility — base URL
https://api.groq.com/openai/v1與不支援參數清單 - Models — Llama 兩支現況標籤「Enterprise」
「免費層不需綁卡」取自本站對 Groq 的既有查核紀錄(2026-08-09)。
額度與模型清單隨時可能變動,實際以官方公告為準。完整方案與價格見我們的 Groq 工具頁與 Groq 方案完整指南。想比較另外兩條「不用綁卡就能跑模型」的路,可看 OpenRouter 免費模型每日上限教學與 Google AI Studio 免費層;各家免費額度的重置邏輯差很多,整理在 AI 免費額度三種制度。
阿莫和皮米怎麼看
要最快推論速度的開發者:免費金鑰先試,量大了用 Batch API 省一半。但免費層速率不透明,生產環境要有備案。
