問問貓 › AI 工具總表 › OpenRouter
AI2 拆了 34,000 道題發現:測「社會偏見」的榜單,其實在測推理能力(BenchMIRT,2026-09-01)
- 免費版:有
- 最低付費方案:US$0/月起
- 免費額度:25 個以上的免費模型、4 個免費供應商,每日上限 50 次請求,社群支援(2026-07-31 …
- 最後查核:2026-09-21
文章最後更新:2026-09-08
Allen Institute for AI(AI2)在 2026-09-01 發表 BenchMIRT,做了一件很少人做的事:不是用榜單去評模型,而是回頭評榜單本身。 查核日 2026-09-08。
規模:100 個 LLM、16 個榜單、超過 34,000 道題目。方法是把心理計量學的**多維試題反應理論(multidimensional Item Response Theory, MIRT)**搬過來,逐題分析每一道題實際上在區分什麼能力。
一、最值得記住的一個發現
分析沒有事先告訴它「應該有幾個維度」,結果自己浮出兩個主要維度:安全(safety)與通用推理(general reasoning)。
然後出現了這一句最尖銳的結論:榜單量到的東西,不一定是它想量的東西。
官方舉的例子是 BBQ——一個設計來測社會偏見的評測。分析結果是它跟通用推理的關聯,明顯強過跟安全的關聯。
用白話講:一個模型在 BBQ 上分數高,比較可能代表它題目讀得懂、推理夠好,而不見得代表它比較沒有偏見。
二、兩個對選模型的人有用的數字
除了方法本身,有兩個數字很實際:
| 數字 | 意思 |
|---|---|
| 只留 10% 的題目 | 能力排名幾乎跟跑完整榜單一樣 |
| 79% 準確率 | 用這套方法預測模型在「沒看過的題目」上的表現 |
第一個數字對讀者的意義是:榜單裡有九成的題目,對區分模型強弱其實沒什麼貢獻。 它們大多數模型都答得出來,或大多數模型都答不出來——兩種都無法區分。
這解釋了一件你可能早就感覺到的事:兩個模型的榜單分數差一兩分,通常不代表什麼。 差距很可能來自那少數幾道真的有區別力的題目,甚至來自雜訊。
三、分析涵蓋了哪些榜單
官方列出的包含六個推理類(如 MMLU-Pro、GPQA、MATH、BBH)與十個安全類(如 HarmBench、StrongReject、WildJailbreak、BBQ、WMDP、XSTest)。
這份名單本身就有參考價值:你在廠商的宣傳圖上看到的分數,多半就出自這幾個榜。
四、看到榜單分數時該怎麼想
這篇研究不是要你不看榜單,而是給了三個更聰明的看法:
- 先問這個榜在量什麼維度,而不是只看分數高低。「安全榜」不一定量到安全。
- 小幅領先當作沒有領先。 除非差距很大,否則排名順序對你的實際任務多半沒有意義。
- 自己的任務自己測。 這是最實在的一條:你手上十題真實工作情境的題目,比一個 14,000 題的公開榜單更能告訴你哪個模型適合你。 公開榜單的題目不是照你的用途設計的。
五、對讀者的實際影響
如果你是在多個模型之間挑(尤其是用 OpenRouter 這類一次接多家模型的服務),這篇研究的價值是降低你對排行榜的信任度到合理水準——不是不信,是知道它的解析度沒有你以為的那麼高。
最省時間的做法:選 2~3 個候選模型,用你自己真實的十個工作情境跑一遍,看哪個順。 這件事花不了一小時,但比讀十篇榜單分析更能決定你該用誰。
多模型怎麼一次比較,見 OpenRouter 工具頁;同期另一份「第三方實測方法論」的討論,見GPT-6 Astra 機械手臂實測的四個保留。
本文依據 Allen Institute for AI 發表於 Hugging Face 的 BenchMIRT: What are LLM benchmarks actually measuring?(2026-09-01)於 2026-09-08 直讀整理。100 個 LLM、16 個榜單、34,000+ 題、兩個浮現維度、BBQ 更貼近推理維度、10% 題目保留排名、79% 預測準確率,皆為該文所載。本站未重跑其分析,也未獨立驗證這些數字。 第四、五節的建議為本站觀點。
阿莫和皮米怎麼看
開發者要一次接多模型:免費版每日 50 次先試。穩定用量:Pay-as-you-go 最彈性,但 5.5% 手續費是隱形成本,大量使用前算清楚。
接下來看這些
同一工具的其他實查文
- 讓 AI 代理碰錢之前該設的五道煞車:從 US$12,431 假帳單事件反推的檢查清單(2026-09)
- GPT-6 Astra 上架 OpenRouter:同一個模型五個供應商,最貴的比最便宜的貴 4 倍(2026-09 實查)
- OpenRouter 怎麼指定便宜的供應商?order/only/sort/max_price 四招,附可以直接貼的 JSON(2026 教學)
