累計 位不重複訪客
快速找分類 🤖 AI 對話 🎨 AI 生圖 🎬 AI 影片 🎵 語音音樂 💻 寫程式 ✍️ 寫作文案 ⚡ 辦公效率 🔍 搜尋研究 🦾 AI 代理 🎁 免費總表
首頁 問問貓說 AI

問問貓AI 工具總表ChatGPT

【2026 實查】GPT-6 Astra 機器手臂 19/20 被瘋傳:原作者自己列了四個限制,先別當成定論

文章最後更新:2026-09-07

2026-09-04,一份叫做「GPT-6 Astra on robotic manipulation」的實測報告在 Hacker News 上衝到 229 分。標題數字非常搶眼:OpenAI 的新旗艦 GPT-6 Astra 讓機器手臂把方塊放進碗裡,20 次成功 19 次;Claude Fable 5.1 只有 8 次。

這種數字最容易被轉貼成「某某模型完勝」。我們直接去讀原始報告頁,把它的完整表格、成本、耗時抄下來,也把作者自己寫在文章裡的四個限制一起列出來。查核日 2026-09-07。

一、這個實驗到底怎麼做的

報告來自 Robocurve,是他們先前比較 Claude Fable 5 與 Fable 5.1 的後續篇——也就是說,硬體、任務、代理策略都沿用上一輪,只是把 GPT-6 Astra 放進同一組條件再跑一次。

  • 硬體:雙臂 I2RT YAM arms,每隻手臂 6 個自由度,平行夾爪。
  • 代理策略:Inspect Robots agent policy(與前一輪相同)。
  • 任務一:把桌上的紅色方塊撿起來放進碗裡。
  • 任務二:抓住藍色圓形拼圖片中央的把手,放進板子上對應的圓形凹槽。
  • 規模:三個模型 × 兩個任務 × 各 20 次,合計 120 次試驗。
  • 評分:由人類評分者依「最高完成階段」計分(0 沒有有意義的接近、1 碰到物件、2 離開桌面、3 移到放置點上方、4 放進最終位置),所以失敗的試驗也會記錄它走到哪一步。

二、完整數字(不是只有那個 19/20)

任務模型平均階段完成數完成率每次輸出 token每次估計成本每次分鐘
方塊進碗Fable 51.301/205%19.2kUS$2.698.2
方塊進碗Fable 5.12.408/2040%12.9kUS$2.126.8
方塊進碗GPT-6 Astra3.9519/2095%2.1kUS$0.942.5
拼圖進凹槽Fable 51.500/200%16.3kUS$2.637.9
拼圖進凹槽Fable 5.12.352/2010%10.5kUS$2.185.9
拼圖進凹槽GPT-6 Astra2.002/2010%2.7kUS$1.363.4

被瘋傳的只有第一組。但第二組任務三個模型全部不行:Astra 2/20、Fable 5.1 也是 2/20,完成率同樣是 10%。報告原文寫得很直白——Astra 會走到凹槽前面,然後卡在跟 Fable 一模一樣的最後一步

換句話說,這份報告真正說的是:簡單的抓放,Astra 明顯拉開差距;需要對位精度的插入動作,目前誰都做不到。

三、比完成率更值得看的是 token 用量

表格裡最容易被略過、但其實最有訊息量的一欄是「每次輸出 token」:

  • 方塊進碗:Astra 每次 2.1k,Fable 5.1 是 12.9k、Fable 5 是 19.2k——差了 6 到 9 倍
  • 耗時也跟著差:2.5 分鐘 vs 6.8 分鐘 vs 8.2 分鐘。

報告因此得到「約 2.3 倍便宜、2.4 倍完成率」的結論。對想把模型接進真實工作流程的人來說,這一欄比完成率更實際:同樣一件事,話少的模型不只比較快,帳單也比較短。

四、作者自己承認的四個限制(這段才是重點)

原始報告有一段明列限制,轉貼的人幾乎都沒帶到:

  1. Astra 的試驗是在 Fable 那批做完兩天後才跑的,而且沒有交錯進行。 兩批之間的環境差異無法排除。
  2. 評分是人工評的,而且評分者知道當下跑的是哪一個模型——作者原文寫「scores are open to unconscious bias」,也就是無意識偏誤的空間存在。
  3. 成本用的是牌價(list price)。作者自己補了一句:若有偏差,Astra 的成本反而是被高估的。
  4. 所有模型都只跑 medium reasoning effort(中等推理強度)。 沒有測高強度設定下的表現。

第 1 點和第 2 點在任何一份正式基準測試裡都會被要求改掉(交錯執行、盲評)。作者願意主動寫出來,這份報告的誠實度其實高於多數行銷型評測——但也正因為他寫了,引用它的人就不該把 19/20 當成定案結論。

五、對一般使用者的實際意義

三件事:

  • 這不是 OpenAI 官方的機器人基準。它是第三方在自己的硬體與代理策略下跑出來的結果,不代表官方宣稱的能力範圍。
  • 「機器手臂」不等於你買得到的產品。這裡測的是「模型能不能透過代理策略操控既有手臂」,不是 OpenAI 出了機器人。
  • 真正可以拿來用的是成本與耗時那兩欄。如果你正在評估要不要把工作流程換到新模型,「同一任務輸出 token 少 6 倍」比「完成率 95%」更能換算成你的帳單。

至於 GPT-6 Astra 本身現在誰能用、API 怎麼算錢,我們另外實查過官方模型頁與計價門檻,整理在 GPT-6 Astra 上線:訂閱戶還拿不到,API 超過 272K 直接雙倍計價


本文依據 Robocurve 原始報告(2026-09-04 發布)直讀整理,並對照 Hacker News 討論串熱度,查核日 2026-09-07。本報告為第三方實測、非 OpenAI 官方基準,且作者已自行揭露四項實驗限制,引用時請一併說明。方案與模型價格整理見 ChatGPT 工具頁

阿莫和皮米怎麼看

AMO 阿莫 專挑毛病
皮米,你等一下要誇免費版功能全對吧?我先講一個更陰的:GPT-5.3 用完約 10 則就自動偷偷降級成小模型,回答品質明顯變差,但介面完全不會告訴你已經換人回答了。額度也不是每天午夜歸零,是滾動式 5 小時窗,用完得乖乖等。更少人知道的是——你在設定裡關掉個人化廣告,額度會被砍到每 3 小時只剩 5 則。方案命名也亂,Pro 和 Pro Max 官網文案其實只寫「From US$100/month」,第三方說有兩檔不同價,我們查到現在都沒能一手確認。
PIMI 皮米 說優勢
你講的降級是真的,但整體來看免費版還是功能最完整的一個——對話、搜尋、生圖、語音、檔案上傳全都給,別家通常挑一兩樣就開始收費了。額度用完也不是斷線,降級後照樣能用,臨時問一句話很夠。中文支援是完整等級,台灣用信用卡直接付。而且免費版產出可商用、沒有浮水印——阿莫你剛剛講降級講得很兇,但這點很多生圖工具連付費版都做不到。
所以到底要不要付錢?

偶爾用問一兩句:免費版就夠。每天工作用、又受不了中途降級:US$20 的 Plus 是全站最保險的入門選擇。台灣官網已改台幣計價,Plus 是 NT$690/月,跟 App Store 內購同價,哪邊訂都一樣;想省一點就走 App Store 年繳 NT$6,990(約 NT$583/月)。

接下來看這些

前往官方網站

本頁部分連結為聯盟連結,經由連結購買本站可能獲得分潤,不影響你的價格,也不影響本站的資料與評價。

🐾 3 秒找最划算:回答三題,雙貓直接推薦