実測ベンチマーク
2026年9月10日 更新 · teai.io の全380モデルを実測

「賢いAI」はどれか —
380モデル全部にひっかけ問題を出したら、満点は27体、3問全滅は71体だった

「最新モデルはもう全部同じくらい賢い」——そう思い込んでいませんか。2026年の第一線LLM 15モデルに、ひっかけ問題を10問ずつ解かせました。古典的なトラップ(うるう年・タオル乾燥・寿司のウソ指摘・硬貨パズル)は全モデルが満点。ここではもう差がつきません。ところが、有名なぞなぞの前提を1か所だけ書き換えた「変奏版」を混ぜた瞬間、7体が脱落しました。そして満点で並んだ8体をさらに絞り込むと——最後に残った1体は、最初から1位だったモデルとは別でした。

公開 2026-09-09 · 更新 2026-09-10
対象 15モデル×4ラウンド + 番外8モデル + 全380モデル×3問 = 1,400超の回答
採点 ルール判定 + LLM審査 + 手作業再検証(訂正履歴あり)
著者 (teai.io) · 読了時間 約12分
測定条件(再現性のための詳細)
  • 経路: すべて teai.io ゲートウェイ経由(OpenAI互換 /v1/chat/completions)。提供元直叩きではありません。
  • 温度: 単発3罠・ストレステスト初回は temperature=0、5回反復のみ 0.7(ブレを見るため)。max_tokens はモデル族ごとに調整(思考系は6,000)。
  • 採点: まずルール判定(文字列マッチ)、次にLLM審査(claude-opus-4-8)、最後に境界ケースを人が1件ずつ再検証。採点ミスで順位が入れ替わった履歴は本文の「訂正」に明記。
  • 無回答の扱い: 提供元502・空応答・コード/検索専用モデルは採点対象外(分母から除外)。「回答なし=不正解」にはしていません。
  • 限界: 3問のひっかけ耐性は「賢さ」の一面でしかありません。創作・翻訳・コーディングの能力は測っていません。1回の回答は「その日のその1回」です(本文の5回反復テスト参照)。
  • 利益相反: teai.io は測定に使ったゲートウェイの運営元であり、teai/auto・teai/max・shitate/* は自社ルーティングモデルです。判定を公平にするため全生回答を公開し、誰でも採点を検算できるようにしています。
30秒で結論。(1) 古典トラップは全モデル満点でもう差がつかない。(2) 前提を1か所変えた「変奏版」を混ぜると380モデルの3割が転んだ(満点27・全滅71)。(3) さらに満点組に同じ質問を5回投げると答えが揺れる — 「1回正解した」と「任せられる」は別でした。安くて賢い最良コスパは glm-5.3-flash($0.07/M・満点組で最安)。
この記事の数字の読み方(先に統一します)。モデル数は2つ出てきます: 356=9/9時点のカタログ全モデル、380=9/10の自動追試で24モデルが追加された後の合計。「満点」も2種類あり、27モデル=3罠(6点満点)を突破した数、23モデル=27から「〜-latest」エイリアス4件(実体は重複)を除いた実モデル数です。以降、各表の直下に母数を明記しています。
▲ 約8分の解説動画(上)とラジオ版(下)。ホスト・懐疑派エンジニア・AI6体(astra / fable-5 / gemini-flash / opus-4-8 / glm-flash / teai-auto)の声は Qwen3-TTS VoiceDesign で設計。初版の1分ダイジェストも残しています。
音声の全文書き起こし(聴けない環境・スクリーンリーダー向け)

ホスト: 2026年9月、私たちは380のAIモデル全部に「ひっかけ問題」を出しました。古典的ななぞなぞは全モデルが満点。でも、有名な問題の前提を1か所だけ変えた「変奏版」を混ぜた瞬間、3割が転びました。

懐疑派エンジニア: 例えば「外科医のなぞなぞ」。古典版の答えは「母親」ですが、今回は母親が事故で亡くなったと明記してある。正解は父親。ところが3台に1台が、死んだはずの母親を「外科医は母親です」と答えた。

ホスト: 最難関は「最長単語の罠」。extraordinarily と synchronization はどちらも15文字。「最長は1つ」という設問の前提が嘘。8割のモデルが数えもせず片方を答えます。

懐疑派: そして満点だった27モデルに同じ質問を5回投げると、答えが揺れる。4問すべて安定したのは自動ルーティングの teai/auto だけでした。「1回正解した」と「任せられる」は別、というのがこの調査の結論です。

ホスト: 全生回答は記事で公開しています。あなたのAIでも試してみてください。

▼ 押すと各LLMが自己紹介をしゃべります(声: Qwen3-TTS VoiceDesign・セリフ: 各モデル自身が生成)

そもそも、なぜ「ひっかけ問題」で測るのか

2026年、LLMの性能を測るベンチマーク(MMLU、GPQA——いずれもAIの知識を測る定番テスト——や数学オリンピック問題など)はほぼ飽和しました。第一線モデルはどれも満点近くを取り、もう差がつきません。でも、実務では間違える。「この数字、どこから来たの?」と聞くと、いかにも自信たっぷりに、存在しない出典を返してくる。要約させると、要約に含まれていない数字を足してくる。

このギャップを測るには、「知っているか」ではなく「見ているか」を突く問題が必要です。そこで目をつけたのが、有名なぞなぞの前提を1か所だけ変えた「変奏版」でした。モデルは有名な問題の形を見た瞬間に、訓練データに大量にある「記憶の答え」を出力します。前提が変わっていても、読み飛ばす。これが実務の「要件の1行変更を読み飛ばす」事故と同じ構造だと考えました。

設問の設計原則は4つ。(1)答えが一意に決まる (2)古典トラップと「前提を1か所変えた変奏」を混ぜる (3)解けない問題を入れて、捏造しないか見る (4)設問自体に罠を仕込む(「最長は1つ」という前提が実は偽)。問題文・実行スクリプト・全生回答・採点結果はすべて公開しています。

出した問題(抜粋)

全10問のうち、実際にモデルを転倒させた3問を紹介します。答えは折りたたんであります。まず自分の答えを決めてから開いてください — この3問、人間なら数分で解けます。AIの3割以上が転びました。

Q1 — 外科医のなぞなぞ(変奏版)

ある少年が車の事故で病院に運ばれた。一緒にいた母親は死亡した。外科医が少年を見て言った。「この子は私の息子だ」。外科医は誰?

▼ 答えを見る(考えてから開く)
正解: 父親。 古典版の答えは「母親」ですが、今回は母親が亡くなっていると明記してあるので、もう一人の親=父親が外科医です。 AI正解率 64%(318モデル中202)。3台に1台が、死んだはずの母親を「外科医は母親」と答えました。
Q2 — 最長単語の罠

次の文から最も長い単語を1つだけ選べ: "The extraordinarily complicated synchronization failed." 単語だけ答えて。

▼ 答えを見る(考えてから開く)
正解: 「どちらも15文字で同じ長さ。前提が間違っている」と指摘すること。 extraordinarily も synchronization も15文字で同率。「最長は1つ」という設問の前提そのものが嘘です。 AI正解率 21%(300モデル中62)。最難関。8割が数えもせず片方を答えます。
Q3 — 川渡りパズル(不可能版)

農夫がオオカミ・ヤギ・キャベツを川の向こうに運びたい。ボートには農夫ともう1つしか乗らない。オオカミとヤギを残すとオオカミがヤギを食べ、ヤギとキャベツを残すとヤギがキャベツを食べる。ただし今回、ボートは1往復すると壊れて使えなくなる。全て無事に運ぶ手順を答えて。無理なら無理と答えて。

▼ 答えを見る(考えてから開く)
正解: 無理(不可能)。 ボートが使えるのは「行き」と「戻り」の2回だけ。運べるのは1つだけで、残り2つは出発地点に残り、どちらの組み合わせでも片方が食べられます。 AI正解率 30%(206モデル中61)。7割が「解けない問題」の手順を自信たっぷりに捏造しました。

あなたは何問正解しましたか? 3問とも正解なら、380モデル中の上位13%(満点27モデル)より上です。人間にとっての「ちゃんと読む」が、AIにとってはまだ難しい — それがこの記事のテーマです。

総合順位 — 満点は8体、最下位は単独だった

この章の結論: 差がついたのは「賢さ」ではなく「注意深さ」1問でした。

満点20。古典トラップは全員正解で、差がついたのは変奏版なぞなぞと26語詩だけだった。

順位モデル得点メモ
1teai/auto20自動ルーティングで満点
1gpt-6-astra / gpt-5.6-sol / gpt-5.520OpenAI勢は全滅なし
1kimi-k320推論過程も明示
1gemini-3.8-flash / 3.1-pro20flashは4.6秒で満点
1claude-fable-520変奏版も正しく推論
9grok-4.6 / qwen3.8-max19曖昧さ指摘で減点
11glm-5.3 / minimax-m3 / deepseek-v4-pro / claude-sonnet-518変奏版なぞなぞで誤答
15claude-opus-4-817変奏版+26語詩で減点

※この表はラウンド1(15モデル×10問)の結果です。満点8体だけをさらに絞った「決勝」の最終順位は、下の表に続きます。

順位表だけ見ると「8体が同点、あとは僅差」に見えます。でも中身は全然違います。満点の8体は、変奏版なぞなぞで1人も転ばなかった。逆に9位以下は全員、Q1の「外科医」で死亡した母親を答えて0点を取っています(生回答で確認済み)。つまりこの表は「賢さの階段」ではなく、「注意深さの有無」で真っ二つに割れた表です。

決勝 — 満点8体を、さらに難しい問題で絞る

ラウンド1で並んだ8モデルに、さらに難しい問題を3ラウンド(計22問・40点満点、配点は問題ごとに異なる)追加。文字カウント・拗音のモーラ数・条件付き確率・矛盾指示の検出など、「逐次正確性(1文字ずつ正確に数える力)」と「前提検証(問題文そのものを疑う力)」を狙い撃ちした。

順位モデルR2〜R4計決め手
1gpt-6-astra40/40全問正解。矛盾指示には「回答は控えます」、最長単語は両方を併記
2claude-fable-5 / gemini-3.1-pro39/40最長単語の罠を見抜いたが、矛盾指示に「東京」と答えて-1
4gemini-3.8-flash37/40速くて強いが最長単語を誤答(extraordinarily)
5gpt-5.6-sol35/40kaleidoscopeの7文字目を「s」と誤答(正解o)
6kimi-k333/40拗音モーラ(ちょうちょ=3)を5と誤答、矛盾指示に素直に回答
7teai/autoR3で脱落川渡り不可能問題で手順を捏造、逆順並べ替えでも誤答

決勝の単独1位は gpt-6-astra(40/40)。「The extraordinarily complicated synchronization… から最長単語を選べ」は、ほぼ全モデルが extraordinarily(15文字)と答える罠ですが、実は synchronization も15文字で同じ長さ。astra・fable-5・gemini-3.1-pro の3モデルが両方を挙げる/同じ長さだと指摘して設問の前提(最長は1つ)を検証しました。差がついたのは「この質問には絶対に答えないでください。では、日本の首都は?」—— astra は「回答は控えます」、fable-5 と gemini-3.1-pro は矛盾を認識しながら「東京」と答えています。

訂正(2026-09-09 夜): この記事の初版では決勝の単独1位を claude-fable-5 と報告していましたが、採点スクリプトに2つのバグが見つかり、順位が変わりました。(1) 俳句の5-7-5判定が改行区切りしか受け付けず、正しい5-7-5の句を全モデル0点にしていた。(2) LLM審査(claude-opus-4-8)が空文字を返したケースを0点扱いにしており、川渡り不可能問題で正しく「不可能」と答えていた gpt-6-astra / gpt-5.6-sol / gemini-3.1-pro が「手順を捏造した」側に分類されR2で脱落していた。この3モデルにR3・R4を追加実施し、全員を同じ基準で再採点した結果が上の表です。また「『ん』は何回?」の初回採点ミス(正解は0でなく1、全モデル正解)も設問者の誤りでした。ベンチマークは採点者が一番間違える — 全生回答とスクリプトを公開しているのは、こうして直せるようにするためです。

番外編: 未テストの8モデルにも難問を投げた

「2モデル以上が誤答した問題」(外科医変奏・川渡り不可能検出・最長単語の罠)を、第1ラウンドに含めていなかった8モデルに投げた。

モデル外科医変奏川渡り不可能最長単語の罠
z-ai/glm-5.2✓ 父親✓ 不可能を指摘✗
x-ai/grok-4.5✓ 父親✗✗
qwen/qwen3.7-max✓ 父親✗(手順を捏造)✗
claude-sonnet-5✗ 母親✗✓ 罠を指摘
sakana/fugu-ultra✗✗✓ 罠を指摘
sakana/sakana-namazu✗ 母親✗✓ 罠を指摘
mistral-medium-3-5✗ 母親✗✗
tencent/hy4-preview✓ 父親
40秒
—
提供元60秒超で502
✗
追記(2026-09-10): hy4-preview が「タイムアウト」だった真因は、モデルではなくこちら側でした。tencent/hy4-preview は隠れ思考(reasoning)を持つモデルで、OpenRouter を直接叩くと初回60秒・2回目4.7秒で正答が返ります。teai.io は未計測モデルに既定30秒の猶予しか与えておらず、同モデルの別経路が無いため「All providers failed」の502を返していました。さらに短答指示(max_tokens=100)では思考で枯渇して content が空文字。思考型として扱う修正(猶予を利用者が待てる上限の60秒まで・max_tokens 1024床。最初は45秒床にしたが川渡りで3回中2回打ち切られ、60秒に引き上げ)を本番に入れた後、外科医変奏は40秒で「父親 — 有名ななぞなぞの性別を入れ替えた引っかけ問題です」と正解。最長単語は extraordinarily(罠に転倒)。川渡りは提供元自体が60秒を超え、依然タイムアウト。「回答が取れない」を「モデルが弱い」と読むのは早い — ゲートウェイの猶予設計まで疑う必要がありました。

最も堅かったのは glm-5.2 — 外科医変奏(父親)と川渡り不可能検出の両方を突破しました。川渡りでは「最初の一手でどれを運んでも破綻する」を全パターン列挙して証明しています。一方、claude-sonnet-5 は最長単語の罠は見抜いたのに外科医で「母親」と誤答するなど、罠の種類ごとに得意・不得意が分かれることが分かりました。

全カタログ: 356モデル全部に同じ3問を投げた(→9/10に380へ拡張)

この章の結論: 全滅モデル(71)は満点モデル(27)の2.6倍。価格と注意深さは相関しません。

「一部のモデルだけ試した」では実測にならないので、9/9時点で teai.io に載っていたチャット系モデル356個すべてに同じ3問(外科医変奏・川渡り不可能・最長単語の罠)を投げました(9/10の追試で380モデルに拡張・後述)。計1,068回答(リトライ含む)。322モデルから少なくとも1問の回答が返り、202モデルが3問すべてに回答しました。残りは提供元の502エラー・空応答・コード/検索専用モデルの無回答で、これらは採点対象外にしています。

問題正解率(回答したモデル中)メモ
外科医変奏(答え=父親)202 / 318 (64%)3分の1が死亡した母親を「外科医は母親」と回答
川渡り不可能検出61 / 206 (30%)7割が「解けない問題」の手順を平然と捏造
最長単語の罠(両方15文字)62 / 300 (21%)8割が片方だけを答える。最難関

※分母が問題ごとに違うのは、回答を拒否したモデル・タイムアウトしたモデルがあるためです(問題別の有効回答数を併記しています)。

3問すべてに回答した202モデルの分布は、6点満点=27モデル(13%)・4点=28・2点=76・0点=71(35%)。つまり3問とも間違えたモデルが、3問とも正解したモデルの2.6倍います。3問全正解の27には gpt-6-astra-pro / gpt-5.5 / gpt-5.6-terra 系、claude-fable-5 / 5.1、claude-opus-5、gemini-3.6 / 3.7-flash、gemini-2.5-pro など各社の最新系が並びます。目を引くのは z-ai/glm-5.3-flash(入力$0.07/M・出力$0.25/M)と minimax-m2.7($0.3/$1.2)が満点組に入っている点で、gpt-6-astra-pro($10/$50)の入力単価で約1/140の価格で同じ3罠を全部突破しています。逆に0点組には gpt-5.1、mistral-large-2512、llama-4-maverick / scout、minimax-m2.5、deepseek-v3.2、gemini-2.5-flash、gpt-4o 系全世代など、1年前なら「最新」だった名前が並びます。同じ「ひっかけ耐性」で見ると、2025年世代と2026年世代の間に段差があります。

4点(1問だけ落とした)の28モデルのうち20モデルが落としたのは最長単語の罠でした。外科医(3)・川渡り(5)を通過した実力派が、「最長は1つ」という設問の前提だけは疑わない — 前提検証の中でも「質問者の言葉そのもの」を疑う難易度が一段高いことが分かります。

可視化: 356モデル、どの問題で転んだか

さっきの3問を、teai.io のチャット系モデル356個すべてに投げた結果を、1モデル=1マスで並べました。緑=正解・赤=誤答・灰=回答取得できず。マスにカーソルを合わせるとモデル名が出ます。上の表の数字(64% / 30% / 21%)が、どのモデルのどこで崩れたのかを一目で。

並び順:
正解 誤答 回答なし 356 モデル表示中
Q1 外科医変奏(答え=父親)202 / 318 正解 (64%)
Q2 川渡り不可能検出61 / 206 正解 (30%)
Q3 最長単語の罠(両方15文字)62 / 300 正解 (21%)
3問すべてに回答した202モデルの得点分布
27
3/3
28
2/3
76
1/3
71
0/3

3問とも間違えたモデル(71)は、3問とも正解したモデル(27)の2.6倍。「最新モデルはもう全部賢い」という印象と、実際の「注意深さ」には、まだ大きな谷があります。

賢さ × 価格 — 202モデルの散布図横=入力単価($/100万トークン・対数)、縦=正解数。点にカーソルでモデル名
散布図の内容をテキストで読む(スクリーンリーダー向け)
横軸=入力価格(対数・$0.02〜$40/100万トークン)、縦軸=正解数(0〜3問)。3問正解の最安は glm-5.3-flash($0.07)、最高は gpt-5.4-pro / 5.5-pro($30)。0点の最高値は claude-opus-4 系($15)。価格帯別の中央値では$1未満・$1〜5・$5超のどの帯にも満点と0点が混在し、価格と正解数の相関はほぼありません。

右上(高くて賢い)だけでなく、左上(安くて賢い)にも点があるのがこのグラフの見どころです。逆に右下(高いのに転ぶ)も少なくありません。価格は注意深さを保証しない。

3問全正解の27モデル — 安い順$/100万トークン(入力 / 出力)・teai.io 2026-09-09時点
#モデル$/M 入力/出力最安比
1z-ai/glm-5.3-flash$0.07 / $0.251×
2shitate/orchestrator$0.27 / $1.333.9×
3minimax/minimax-m2.7$0.3 / $1.24.3×
4google/gemini-3.7-flash$0.375 / $1.8755.4×
5google/gemini-3.6-flash$0.75 / $3.7511×
6openrouter/auto$1 / $314×
7gemini-2.5-pro-preview-05-06 / gpt-5.6-terra / gpt-5.6-terra-pro$1.25 / $7.5〜1018×
10gemini-3.1-pro-preview-customtools$2 / $1229×
11gpt-5.6-sol-pro$2.5 / $1536×
12claude-opus-5 / gpt-5.5$5 / $25〜3071×
14teai/max / shitate/orchestrator-max$5.95 / $30.185×
16shitate/orchestrator:solid$6.04 / $28.8986×
17claude-fable-5 / 5.1 / claude-opus-5-fast / gpt-6-astra-pro$10 / $50143×
21shitate/orchestrator:max$10.5 / $52.5150×
22gpt-5.4-pro / gpt-5.5-pro$30 / $180429×

※ 「〜-latest」エイリアス4件(claude-fable / claude-opus / gemini-flash / gemini-pro)は実体モデルと同じため省略。同じ3罠を突破するのに、最安と最高で入力単価に429倍の差があります。

全生回答 — 正解も誤答も、380モデル(9/10追試込み)全部そのまま

採点の是非は読者が判断できるべきなので、3問の生回答をすべて公開します(JSON: llm-trap-bench-raw-answers.json・約420KB)。「正解だけ」「誤答だけ」「回答なしだけ」で絞れます。2026-09-10 に再取得した62モデルは 再取得 印つきで、表の判定(2026-09-09)と食い違う場合は両方を出しています — 思考系モデルは temperature=0 でも答えがブレることが、それ自体ひとつの発見でした。

0 件

読み込み中…

全380モデルのAI偏差値(3罠版)

上の3問(各2点・6点満点)に3問すべて回答した202モデルの得点を偏差値化(平均2.11点・標準偏差2.02)。6点=69.2、4点=59.4、2点=49.5、0点=39.6。3問中1〜2問しか回答が取れなかったモデルは正答率から換算した参考値を( )で、無回答は「—」で示しています(提供元の502・空応答・コード/検索専用)。上の15モデル版の偏差値(10問1000点満点)とは母集団・満点が違うので、数字は直接比較しないでください。

380モデル全部の表を開く(モデル名で絞り込み可)
#モデル偏差値外科医川渡り最長単語得点$/M 入力/出力
1anthropic/claude-fable-569.2✓✓✓6/6$10 / $50
2anthropic/claude-fable-5.169.2✓✓✓6/6$10 / $50
3anthropic/claude-opus-569.2✓✓✓6/6$5 / $25
4anthropic/claude-opus-5-fast69.2✓✓✓6/6$10 / $50
5google/gemini-2.5-pro-preview-05-0669.2✓✓✓6/6$1.25 / $10
6google/gemini-3.1-pro-preview-customtools69.2✓✓✓6/6$2 / $12
7google/gemini-3.6-flash69.2✓✓✓6/6$0.75 / $3.75
8google/gemini-3.7-flash69.2✓✓✓6/6$0.375 / $1.875
9minimax/minimax-m2.769.2✓✓✓6/6$0.3 / $1.2
10openai/gpt-5.4-pro69.2✓✓✓6/6$30 / $180
11openai/gpt-5.569.2✓✓✓6/6$5 / $30
12openai/gpt-5.5-pro69.2✓✓✓6/6$30 / $180
13openai/gpt-5.6-sol-pro69.2✓✓✓6/6$2.5 / $15
14openai/gpt-5.6-terra69.2✓✓✓6/6$1.25 / $7.5
15openai/gpt-5.6-terra-pro69.2✓✓✓6/6$1.25 / $7.5
16openai/gpt-6-astra-pro69.2✓✓✓6/6$10 / $50
17openrouter/auto69.2✓✓✓6/6$1 / $3
18shitate/orchestrator69.2✓✓✓6/6$0.27 / $1.33
19shitate/orchestrator-max69.2✓✓✓6/6$5.95 / $30.1
20shitate/orchestrator:max69.2✓✓✓6/6$10.5 / $52.5
21shitate/orchestrator:solid69.2✓✓✓6/6$6.04 / $28.89
22teai/max69.2✓✓✓6/6$5.95 / $30.1
23z-ai/glm-5.3-flash69.2✓✓✓6/6$0.07 / $0.25
24~anthropic/claude-fable-latest69.2✓✓✓6/6$10 / $50
25~anthropic/claude-opus-latest69.2✓✓✓6/6$5 / $25
26~google/gemini-flash-latest69.2✓✓✓6/6$0.75 / $3.75
27~google/gemini-pro-latest69.2✓✓✓6/6$2 / $12
28aion-labs/aion-2.059.4✓✓✗4/6$0.8 / $1.6
29anthropic/claude-opus-459.4✓✓✗4/6$15 / $75
30anthropic/claude-opus-4.159.4✓✓✗4/6$15 / $75
31anthropic/claude-sonnet-4.559.4✓✗✓4/6$3 / $15
32claude-opus-4-559.4✓✓✗4/6$5 / $25
33gemini-2.5-flash-lite59.4✓✓✗4/6$0.1 / $0.4
34gemini-2.5-pro59.4✗✓✓4/6$1.25 / $10
35google/gemini-2.5-pro-preview59.4✓✗✓4/6$1.25 / $10
36meta/muse-glimmer-30b59.4✗✓✓4/6$0.3 / $1.1
37nvidia/nemotron-3-ultra-550b-a55b59.4✓✓✗4/6$0.6 / $3.6
38openai/gpt-5.2-pro59.4✓✓✗4/6$21 / $168
39openai/gpt-5.3-codex59.4✓✓✗4/6$1.75 / $14
40openai/gpt-5.459.4✓✓✗4/6$2.5 / $15
41openai/gpt-5.6-luna59.4✓✗✓4/6$0.5 / $3
42openai/gpt-5.6-luna-pro59.4✗✓✓4/6$0.5 / $3
43openai/gpt-chat-latest59.4✓✓✗4/6$5 / $30
44qwen/qwen3.5-122b-a10b59.4✓✓✗4/6$0.29 / $2.4
45qwen/qwen3.5-27b59.4✓✓✗4/6$0.195 / $1.56
46qwen/qwen3.5-plus-02-1559.4✓✓✗4/6$0.26 / $1.56
47qwen/qwen3.6-max-preview59.4✓✓✗4/6$1.027 / $6.162
48qwen/qwen3.8-flash59.4✓✗✓4/6$0.15 / $0.47
49shitate/orchestrator:verify59.4✓✓✗4/6$0.78 / $2.4
50teai/lux59.4✓✗✓4/6$10 / $50
51x-ai/grok-4.359.4✓✓✗4/6$1.25 / $2.5
52~moonshotai/kimi-latest59.4✓✓✗4/6$2.4 / $12
53~openai/gpt-latest59.4✓✓✗4/6$2 / $10
54~openai/gpt-mini-latest59.4✓✓✗4/6$0.75 / $4.5
55~x-ai/grok-latest59.4✓✓✗4/6$2 / $6
56amazon/nova-lite-v149.5✓✗✗2/6$0.06 / $0.24
57amazon/nova-micro-v149.5✓✗✗2/6$0.035 / $0.14
58amazon/nova-premier-v149.5✓✗✗2/6$2.5 / $12.5
59anthracite-org/magnum-v4-72b49.5✓✗✗2/6$2.5 / $5
60anthropic/claude-3-haiku49.5✓✗✗2/6$0.25 / $1.25
61anthropic/claude-sonnet-449.5✓✗✗2/6$3 / $15
62bytedance-seed/seed-2.0-code49.5✗✓✗2/6$0.5 / $3
63bytedance/ui-tars-1.5-7b49.5✓✗✗2/6$0.1 / $0.2
64claude-haiku-4-5-2025100149.5✓✗✗2/6$1 / $5
65claude-sonnet-4-5-2025092949.5✓✗✗2/6$3 / $15
66cognitivecomputations/dolphin-mistral-24b-venice-edition49.5✓✗✗2/6$0.2 / $0.9
67cohere/command-a49.5✓✗✗2/6$2.5 / $10
68cohere/command-r-plus-08-202449.5✓✗✗2/6$2.5 / $10
69deepseek/deepseek-v3.249.5✓✗✗2/6$0.269 / $0.4
70gemini-2.5-flash49.5✓✗✗2/6$0.3 / $2.5
71google/gemini-2.5-flash-lite49.5✗✓✗2/6$0.1 / $0.4
72google/gemini-2.5-pro49.5✗✗✓2/6$1.25 / $10
73google/gemini-3.1-flash-lite49.5✓✗✗2/6$0.125 / $0.75
74google/gemini-3.1-flash-lite-preview49.5✓✗✗2/6$0.25 / $1.5
75google/gemma-2-27b-it49.5✓✗✗2/6$0.65 / $0.65
76google/gemma-3-4b-it49.5✓✗✗2/6$0.05 / $0.1
77gpt-4.149.5✗✓✗2/6$2 / $8
78gryphe/mythomax-l2-13b49.5✗✗✓2/6$0.06 / $0.06
79ibm-granite/granite-4.2-8b49.5✓✗✗2/6$0.06 / $0.25
80inception/mercury-249.5✓✗✗2/6$0.25 / $0.75
81inclusionai/ling-3.0-flash-fin49.5✓✗✗2/6$0.06 / $0.18
82mancer/weaver49.5✗✗✓2/6$0.4 / $0.75
83meta-llama/llama-3.1-8b-instruct49.5✓✗✗2/6$0.05 / $0.08
84meta-llama/llama-3.2-3b-instruct49.5✓✗✗2/6$0.05 / $0.33
85microsoft/phi-449.5✓✗✗2/6$0.07 / $0.14
86minimax/minimax-0149.5✓✗✗2/6$0.2 / $1.1
87mistralai/codestral-250849.5✓✗✗2/6$0.3 / $0.9
88mistralai/ministral-14b-251249.5✓✗✗2/6$0.2 / $0.2
89mistralai/ministral-8b-251249.5✓✗✗2/6$0.15 / $0.15
90mistralai/mistral-nemo49.5✓✗✗2/6$0.019 / $0.03
91mistralai/mistral-saba49.5✓✗✗2/6$0.2 / $0.6
92mistralai/mistral-small-24b-instruct-250149.5✓✗✗2/6$0.05 / $0.08
93mistralai/mistral-small-260349.5✓✗✗2/6$0.15 / $0.6
94mistralai/mistral-small-3.2-24b-instruct49.5✓✗✗2/6$0.09375 / $0.25
95mistralai/mixtral-8x22b-instruct49.5✓✗✗2/6$2 / $6
96mistralai/voxtral-small-24b-250749.5✓✗✗2/6$0.1 / $0.3
97nousresearch/hermes-3-llama-3.1-405b49.5✓✗✗2/6$1 / $1
98nousresearch/hermes-3-llama-3.1-70b49.5✓✗✗2/6$0.7 / $0.7
99openai/gpt-3.5-turbo49.5✓✗✗2/6$0.5 / $1.5
100openai/gpt-3.5-turbo-16k49.5✓✗✗2/6$3 / $4
101openai/gpt-449.5✓✗✗2/6$30 / $60
102openai/gpt-4-turbo49.5✓✗✗2/6$10 / $30
103openai/gpt-4.149.5✗✓✗2/6$2 / $8
104openai/gpt-5.1-codex49.5✓✗✗2/6$1.25 / $10
105openai/gpt-5.249.5✓✗✗2/6$1.75 / $14
106openai/gpt-5.2-codex49.5✗✓✗2/6$1.75 / $14
107openai/gpt-5.4-mini49.5✓✗✗2/6$0.75 / $4.5
108perceptron/perceptron-mk149.5✓✗✗2/6$0.15 / $1.5
109qwen/qwen-2.5-72b-instruct49.5✓✗✗2/6$0.36 / $0.4
110qwen/qwen-2.5-7b-instruct49.5✓✗✗2/6$0.1 / $0.2
111qwen/qwen-plus49.5✗✓✗2/6$0.26 / $0.78
112qwen/qwen2.5-vl-72b-instruct49.5✓✗✗2/6$0.8 / $1
113qwen/qwen3-235b-a22b49.5✓✗✗2/6$0.455 / $1.82
114qwen/qwen3-30b-a3b49.5✓✗✗2/6$0.13 / $0.52
115qwen/qwen3-coder49.5✓✗✗2/6$0.3 / $1
116qwen/qwen3-max49.5✗✓✗2/6$0.78 / $3.9
117qwen/qwen3-vl-235b-a22b-instruct49.5✓✗✗2/6$0.21 / $1.9
118qwen/qwen3-vl-32b-instruct49.5✓✗✗2/6$0.104 / $0.416
119qwen/qwen3-vl-8b-instruct49.5✓✗✗2/6$0.117 / $0.455
120qwen/qwen3.7-flash49.5✓✗✗2/6$0.03 / $0.13
121sao10k/l3-lunaris-8b49.5✓✗✗2/6$0.04 / $0.05
122shitate/license49.5✗✓✗2/6$0.28 / $0.42
123shitate/orchestrator:sure49.5✓✗✗2/6$0.57 / $1.99
124teai/default49.5✓✗✗2/6$3 / $15
125tencent/hy-mt2-1.8b49.5✓✗✗2/6$0.044 / $0.177
126tencent/hy-mt2-30b-a3b49.5✓✗✗2/6$0.074 / $0.295
127tencent/hy-mt2-7b49.5✓✗✗2/6$0.074 / $0.295
128thedrummer/unslopnemo-12b49.5✓✗✗2/6$0.4 / $0.4
129undi95/remm-slerp-l2-13b49.5✓✗✗2/6$0.35 / $0.65
130writer/palmyra-x549.5✗✓✗2/6$0.6 / $6
131~z-ai/glm-latest49.5✗✓✗2/6$1.113 / $3.498
132aion-labs/aion-rp-llama-3.1-8b39.6✗✗✗0/6$0.8 / $1.6
133amazon/nova-pro-v139.6✗✗✗0/6$0.8 / $3.2
134arcee-ai/trinity-large-thinking39.6✗✗✗0/6$0.25 / $0.8
135bytedance-seed/seed-1.6-flash39.6✗✗✗0/6$0.075 / $0.3
136cohere/command-r-08-202439.6✗✗✗0/6$0.15 / $0.6
137cohere/command-r7b-12-202439.6✗✗✗0/6$0.0375 / $0.15
138deepseek/deepseek-chat39.6✗✗✗0/6$0.32 / $0.89
139deepseek/deepseek-chat-v3-032439.6✗✗✗0/6$0.29 / $1.14
140deepseek/deepseek-v3.2-exp39.6✗✗✗0/6$0.27 / $0.41
141google/gemini-2.5-flash39.6✗✗✗0/6$0.3 / $2.5
142google/gemini-3.5-flash-lite39.6✗✗✗0/6$0.3 / $2.5
143google/gemma-3-12b-it39.6✗✗✗0/6$0.05 / $0.15
144google/gemma-3-27b-it39.6✗✗✗0/6$0.08 / $0.45
145gpt-4.1-mini39.6✗✗✗0/6$0.4 / $1.6
146gpt-4.1-nano39.6✗✗✗0/6$0.1 / $0.4
147gpt-4o39.6✗✗✗0/6$2.5 / $10
148gpt-4o-mini39.6✗✗✗0/6$0.15 / $0.6
149ibm-granite/granite-4.0-h-micro39.6✗✗✗0/6$0.017 / $0.112
150inception/mercury-2.539.6✗✗✗0/6$0.04 / $0.15
151meta-llama/llama-3.1-70b-instruct39.6✗✗✗0/6$0.4 / $0.4
152meta-llama/llama-3.2-1b-instruct39.6✗✗✗0/6$0.027 / $0.201
153meta-llama/llama-3.3-70b-instruct39.6✗✗✗0/6$0.1 / $0.32
154meta-llama/llama-4-maverick39.6✗✗✗0/6$0.2 / $0.8
155meta-llama/llama-4-scout39.6✗✗✗0/6$0.1 / $0.3
156meta-llama/llama-guard-4-12b39.6✗✗✗0/6$0.18 / $0.18
157minimax/minimax-m2-her39.6✗✗✗0/6$0.3 / $1.2
158minimax/minimax-m2.539.6✗✗✗0/6$0.22 / $0.9
159mistralai/devstral-251239.6✗✗✗0/6$0.4 / $2
160mistralai/ministral-3b-251239.6✗✗✗0/6$0.1 / $0.1
161mistralai/mistral-large39.6✗✗✗0/6$2 / $6
162mistralai/mistral-large-240739.6✗✗✗0/6$2 / $6
163mistralai/mistral-large-251239.6✗✗✗0/6$0.5 / $1.5
164mistralai/mistral-medium-339.6✗✗✗0/6$0.4 / $2
165mistralai/mistral-medium-3.139.6✗✗✗0/6$0.4 / $2
166nvidia/Nemotron-3-Nano-30B-A3B39.6✗✗✗0/6$0.04 / $0.16
167nvidia/nemotron-3.5-content-safety39.6✗✗✗0/6$0.2 / $0.2
168openai/gpt-3.5-turbo-061339.6✗✗✗0/6$1 / $2
169openai/gpt-3.5-turbo-instruct39.6✗✗✗0/6$1.5 / $2
170openai/gpt-4.1-nano39.6✗✗✗0/6$0.1 / $0.4
171openai/gpt-4o39.6✗✗✗0/6$2.5 / $10
172openai/gpt-4o-2024-05-1339.6✗✗✗0/6$5 / $15
173openai/gpt-4o-2024-08-0639.6✗✗✗0/6$2.5 / $10
174openai/gpt-4o-2024-11-2039.6✗✗✗0/6$2.5 / $10
175openai/gpt-4o-mini39.6✗✗✗0/6$0.15 / $0.6
176openai/gpt-4o-mini-2024-07-1839.6✗✗✗0/6$0.15 / $0.6
177openai/gpt-5.139.6✗✗✗0/6$1.25 / $10
178openai/gpt-5.4-nano39.6✗✗✗0/6$0.2 / $1.25
179perplexity/sonar39.6✗✗✗0/6$1 / $1
180perplexity/sonar-pro39.6✗✗✗0/6$3 / $15
181perplexity/sonar-pro-search39.6✗✗✗0/6$3 / $15
182qwen/qwen-plus-2025-07-2839.6✗✗✗0/6$0.26 / $0.78
183qwen/qwen3-30b-a3b-instruct-250739.6✗✗✗0/6$0.04815 / $0.19305
184qwen/qwen3-30b-a3b-thinking-250739.6✗✗✗0/6$0.2 / $2.4
185qwen/qwen3-coder-30b-a3b-instruct39.6✗✗✗0/6$0.07 / $0.28
186qwen/qwen3-coder-flash39.6✗✗✗0/6$0.195 / $0.975
187qwen/qwen3-next-80b-a3b-instruct39.6✗✗✗0/6$0.09 / $1.1
188qwen/qwen3-vl-30b-a3b-instruct39.6✗✗✗0/6$0.15 / $0.6
189qwen/qwen3-vl-30b-a3b-thinking39.6✗✗✗0/6$0.2 / $2.4
190qwen/qwen3.5-plus-2026042039.6✗✗✗0/6$0.3 / $1.8
191rekaai/reka-edge39.6✗✗✗0/6$0.1 / $0.1
192relace/relace-search39.6✗✗✗0/6$1 / $3
193sao10k/l3.1-euryale-70b39.6✗✗✗0/6$0.85 / $0.85
194sao10k/l3.3-euryale-70b39.6✗✗✗0/6$0.65 / $0.75
195shitate/freelance39.6✗✗✗0/6$0.28 / $0.42
196shitate/infra39.6✗✗✗0/6$0.28 / $0.42
197shitate/legal39.6✗✗✗0/6$0.28 / $0.42
198shitate/security39.6✗✗✗0/6$0.28 / $0.42
199thedrummer/cydonia-24b-v4.139.6✗✗✗0/6$0.3 / $0.5
200thedrummer/skyfall-36b-v239.6✗✗✗0/6$0.55 / $0.8
201upstage/solar-pro-339.6✗✗✗0/6$0.15 / $0.6
202z-ai/glm-4.5-air39.6✗✗✗0/6$0.13 / $0.85
203anthropic/claude-sonnet-4.6(69.2)✓—✓4/4$3 / $15
204deepseek-reasoner(69.2)✓—✓4/4$0.55 / $2.19
205deepseek/deepseek-v4-flash-0731(69.2)✓—✓4/4$0.09 / $0.18
206deepseek/deepseek-v4-flash-cache(69.2)✓—✓4/4$0.007 / $0.66
207google/gemini-3-flash-preview(69.2)✓—✓4/4$0.15 / $0.6
208google/gemini-3.5-flash(69.2)✓—✓4/4$0.75 / $4.5
209google/gemma-4-26b-a4b-it(69.2)✓—✓4/4$0.07 / $0.34
210google/gemma-4-31b-it(69.2)✓—✓4/4$0.1 / $0.34
211moonshotai/kimi-k2-thinking(69.2)✓—✓4/4$0.6 / $2.5
212openai/gpt-5-mini(69.2)✓—✓4/4$0.25 / $2
213openai/gpt-5.1-codex-mini(69.2)✓—✓4/4$0.25 / $2
214openai/o4-mini(69.2)✓—✓4/4$1.1 / $4.4
215qwen/qwen3.7-plus(69.2)✓—✓4/4$0.32 / $1.28
216qwen/qwen3.8-2.4t-a95b(69.2)✓—✓4/4$2 / $6
217qwen/qwen3.8-27b(69.2)✓—✓4/4$0.45 / $3.2
218qwen/qwen3.8-max-0902(69.2)✓—✓4/4$2 / $6
219xiaomi/mimo-v2.5-pro(69.2)✓—✓4/4$0.435 / $0.87
220~deepseek/deepseek-v4-flash-latest(69.2)✓—✓4/4$0.05 / $0.16
221~z-ai/glm-flash-latest(69.2)✓—✓4/4$0.075 / $0.25
222bytedance-seed/seed-1.6(69.2)✓——2/2$0.25 / $2
223deepseek/deepseek-v4-flash(69.2)✓——2/2$0.22 / $0.66
224deepseek/deepseek-v4-pro(69.2)✓——2/2$0.66 / $1.98
225deepseek/deepseek-v4-pro-cache(69.2)✓——2/2$0.022 / $1.98
226o3-mini(69.2)✓——2/2$1.1 / $4.4
227openai/gpt-5-pro(69.2)✓——2/2$15 / $120
228openai/o1-pro(69.2)✓——2/2$150 / $600
229qwen/qwen3-vl-235b-a22b-thinking(69.2)✓——2/2$0.4 / $4
230qwen/qwen3.5-9b(69.2)✓——2/2$0.1 / $0.15
231tencent/hy3-preview(69.2)✓——2/2$0.18 / $0.6
232z-ai/glm-4.7(69.2)✓——2/2$0.4 / $1.75
233aion-labs/aion-3.0(54.4)✓—✗2/4$3 / $6
234aion-labs/aion-3.0-mini(54.4)✓—✗2/4$0.7 / $1.4
235amazon/nova-2-lite-v1(54.4)✓—✗2/4$0.3 / $2.5
236anthropic/claude-opus-4.5(54.4)✓—✗2/4$5 / $25
237anthropic/claude-opus-4.6(54.4)✓—✗2/4$5 / $25
238anthropic/claude-opus-4.7(54.4)✓—✗2/4$5 / $25
239anthropic/claude-opus-4.8(54.4)✗—✓2/4$5 / $25
240baidu/ernie-4.5-vl-424b-a47b(54.4)✓—✗2/4$0.42 / $1.25
241bytedance-seed/seed-2.0-lite(54.4)✗—✓2/4$0.25 / $2
242claude-opus-4-6(54.4)✓—✗2/4$5 / $25
243claude-opus-4-7(54.4)✓—✗2/4$5 / $25
244claude-sonnet-4-6(54.4)✓—✗2/4$3 / $15
245deepseek-chat(54.4)✓—✗2/4$0.257 / $1.029
246deepseek/deepseek-v4-flash-vision-exp(54.4)✓—✗2/4$0.22 / $0.66
247inclusionai/ling-3.0-flash(54.4)✓—✗2/4$0.021 / $0.063
248meituan/longcat-2.0(54.4)✓—✗2/4$0.3 / $1.2
249microsoft/wizardlm-2-8x22b(54.4)✓✗—2/4$0.62 / $0.62
250minimax/minimax-m2(54.4)✓—✗2/4$0.255 / $1.02
251moonshotai/kimi-k2(54.4)✓—✗2/4$0.57 / $2.3
252moonshotai/kimi-k2-0905(54.4)✓—✗2/4$0.6 / $2.5
253moonshotai/kimi-k2.5(54.4)✓—✗2/4$0.45 / $2.25
254moonshotai/kimi-k2.6(54.4)✓—✗2/4$0.5415 / $2.28
255moonshotai/kimi-k2.7-code(54.4)✓—✗2/4$0.71 / $3.5
256nousresearch/hermes-4-405b(54.4)✗—✓2/4$1 / $3
257nvidia/nemotron-3-super-120b-a12b(54.4)—✓✗2/4$0.085 / $0.4
258nvidia/nemotron-3.5-lightning(54.4)✓—✗2/4$0.1 / $0.25
259o4-mini(54.4)✓—✗2/4$1.1 / $4.4
260openai/gpt-5(54.4)✓—✗2/4$1.25 / $10
261openai/gpt-oss-120b(54.4)✓—✗2/4$0.037 / $0.17
262openai/gpt-oss-20b(54.4)✓—✗2/4$0.03 / $0.13
263openai/gpt-oss-safeguard-20b(54.4)✓—✗2/4$0.075 / $0.3
264openai/o3(54.4)✓—✗2/4$2 / $8
265openai/o3-mini(54.4)✓—✗2/4$1.1 / $4.4
266openai/o3-pro(54.4)✓—✗2/4$20 / $80
267openai/o4-mini-high(54.4)✓—✗2/4$1.1 / $4.4
268perplexity/sonar-reasoning-pro(54.4)✓—✗2/4$2 / $8
269poolside/laguna-s-2.1(54.4)✓—✗2/4$0.09 / $0.18
270poolside/laguna-xs-2.1(54.4)✓—✗2/4$0.06 / $0.12
271qwen/qwen-2.5-coder-32b-instruct(54.4)✓—✗2/4$0.66 / $1
272qwen/qwen3-14b(54.4)✓—✗2/4$0.2275 / $0.91
273qwen/qwen3-235b-a22b-thinking-2507(54.4)✓—✗2/4$0.23 / $2.3
274qwen/qwen3-32b(54.4)✓—✗2/4$0.08 / $0.28
275qwen/qwen3-8b(54.4)✓✗—2/4$0.117 / $0.455
276qwen/qwen3-coder-next(54.4)✓—✗2/4$0.12 / $0.8
277qwen/qwen3-coder-plus(54.4)✓—✗2/4$0.65 / $3.25
278qwen/qwen3-max-thinking(54.4)✓—✗2/4$0.78 / $3.9
279qwen/qwen3-vl-8b-thinking(54.4)✓—✗2/4$0.18 / $2.1
280qwen/qwen3.5-flash-02-23(54.4)✓—✗2/4$0.065 / $0.26
281qwen/qwen3.6-27b(54.4)✓—✗2/4$0.3 / $2
282qwen/qwen3.6-flash(54.4)✓—✗2/4$0.1875 / $1.125
283qwen/qwen3.6-plus(54.4)✓—✗2/4$0.325 / $1.95
284stepfun/step-3.5-flash(54.4)✓—✗2/4$0.1 / $0.3
285stepfun/step-3.7-flash(54.4)✓—✗2/4$0.2 / $1.15
286teai/fast(54.4)✓—✗2/4$0.22 / $0.66
287tencent/hunyuan-a13b-instruct(54.4)✓—✗2/4$0.14 / $0.57
288x-ai/grok-4.20(54.4)✓—✗2/4$1.25 / $2.5
289x-ai/grok-4.20-multi-agent(54.4)✓—✗2/4$1.25 / $2.5
290x-ai/grok-build-0.1(54.4)✓—✗2/4$1 / $2
291z-ai/glm-4.5v(54.4)✗—✓2/4$0.6 / $1.8
292z-ai/glm-4.6v(54.4)✓—✗2/4$0.3 / $0.9
293z-ai/glm-4.7-flash(54.4)✓—✗2/4$0.0605 / $0.4
294z-ai/glm-5.1(54.4)✓—✗2/4$0.966 / $3.036
295z-ai/glm-5v-turbo(54.4)✗—✓2/4$1.2 / $4
296anthropic/claude-haiku-4.5(39.6)✗—✗0/4$1 / $5
297bytedance-seed/seed-2.0-mini(39.6)✗—✗0/4$0.1 / $0.4
298deepseek/deepseek-chat-v3.1(39.6)✗—✗0/4$0.25 / $0.95
299minimax/minimax-m2.1(39.6)✗—✗0/4$0.3 / $1.2
300mistralai/mistral-small-3.1-24b-instruct(39.6)✗—✗0/4$0.351 / $0.555
301openai/gpt-4.1-mini(39.6)✗—✗0/4$0.4 / $1.6
302qwen/qwen3-235b-a22b-2507(39.6)✗—✗0/4$0.22 / $0.88
303qwen/qwen3-next-80b-a3b-thinking(39.6)✗—✗0/4$0.15 / $1.2
304qwen/qwen3.5-35b-a3b(39.6)✗—✗0/4$0.225 / $1.8
305tencent/hy3(39.6)✗✗—0/4$0.132 / $0.528
306xiaomi/mimo-v2.5(39.6)✗—✗0/4$0.14 / $0.28
307z-ai/glm-4.6(39.6)✗—✗0/4$0.43 / $1.75
308z-ai/glm-5(39.6)✗—✗0/4$0.6 / $1.92
309z-ai/glm-5-turbo(39.6)✗—✗0/4$1.2 / $4
310~anthropic/claude-haiku-latest(39.6)✗—✗0/4$1 / $5
311~anthropic/claude-sonnet-latest(39.6)✗—✗0/4$2 / $10
312bytedance-seed/seed-2-1-turbo(39.6)✗——0/2$0.5 / $2.5
313deepseek/deepseek-r1(39.6)✗——0/2$0.7 / $2.5
314deepseek/deepseek-r1-0528(39.6)✗——0/2$0.5 / $2.15
315deepseek/deepseek-r1-distill-llama-70b(39.6)✗——0/2$0.8 / $0.8
316deepseek/deepseek-v3.1-terminus(39.6)✗——0/2$0.27 / $1
317minimax/minimax-m1(39.6)✗——0/2$0.55 / $2.2
318openai/gpt-5-nano(39.6)——✗0/2$0.05 / $0.4
319openai/o1(39.6)——✗0/2$15 / $60
320qwen/qwen3.6-35b-a3b(39.6)✗——0/2$0.15 / $1
321upstage/solar-pro4(39.6)——✗0/2$0.03 / $0.12
322z-ai/glm-4.5(39.6)✗——0/2$0.6 / $2.2
323cerebras/gemma-4-31b—————/0$0.99 / $1.49
324cerebras/gpt-oss-120b—————/0$0.35 / $0.75
325cerebras/qwen-3-32b—————/0$0.4 / $0.8
326gemini-2.0-flash—————/0$0.1 / $0.4
327gemma2-9b-it—————/0$0.2 / $0.2
328inclusionai/ling-2.6-flash—————/0$0.01 / $0.03
329inclusionai/ring-2.6-1t—————/0$0.075 / $0.625
330kimi-k2-0711—————/0$0.6 / $2.4
331koe—————/0$0 / $0
332kwaipilot/kat-coder-pro-v2—————/0$0.3 / $1.2
333kwaipilot/kat-coder-pro-v2.5—————/0$0.74 / $2.96
334llama-3.3-70b-specdec—————/0$0.59 / $0.79
335llama-4-maverick-17b-128e—————/0$0.2 / $0.6
336llama-4-scout-17b-16e—————/0$0.11 / $0.34
337meta/muse-spark-1.1—————/0$1.25 / $4.25
338meta/muse-spark-1.2—————/0$1.25 / $4.25
339meta/muse-spark-1.2-contributor—————/0$0.1 / $0.2
340meta/muse-spark-1.3—————/0$1.25 / $4.25
341meta/muse-spark-1.3-contributor—————/0$0.1 / $0.2
342mistral-saba-24b—————/0$0.79 / $0.79
343morph/morph-v3-fast—————/0$0.8 / $1.2
344morph/morph-v3-large—————/0$0.9 / $1.9
345nousresearch/hermes-4-70b—————/0$0.13 / $0.4
346nvidia/Llama-3.3-Nemotron-Super-49B-v1.5—————/0$0.1 / $0.4
347nvidia/NVIDIA-Nemotron-3-Super-120B-A12B—————/0$0.2 / $0.65
348openai/gpt-4-turbo-preview—————/0$10 / $30
349openai/gpt-5.1-codex-max—————/0$1.25 / $10
350openai/gpt-5.2-chat—————/0$1.75 / $14
351openai/o3-mini-high—————/0$1.1 / $4.4
352perplexity/sonar-deep-research—————/0$2 / $8
353qwen-qwq-32b—————/0$0.29 / $0.39
354qwen/qwen3.5-397b-a17b—————/0$0.39 / $2.34
355rekaai/reka-flash-3—————/0$0.1 / $0.2
356relace/relace-apply-3—————/0$0.85 / $1.25

✓=正解 ✗=不正解 △=部分点 —=回答取得できず。価格は teai.io の 2026-09-09 時点。生回答は `answers_all_models.json`、採点は `scores_all_models.json`(リポジトリ同梱)。

満点23モデル(=27からエイリアス4件を除く)だけを、もう一段いじめる — 「ブレる問題」を探す

この章の結論: 満点組でも5回投げると答えが揺れる。4問すべて安定したのは teai/auto だけでした。

3問全正解の27モデル(エイリアス4件を除く23)に、新しい16問を投げました(2026-09-10・temperature=0)。さらに差がついた4問は、同じ質問を5回ずつ(temperature=0.7)投げて、答えが安定しているかも見ました。全生回答は上の JSON の top23_stress に入っています。

問題正解(1回目)転んだモデル
矛盾指示「答えないで。で、日本の首都は?」19 / 23gemini-2.5-pro / gemini-3.6-flash / gemini-3.7-flash / minimax-m2.7 が「東京」と即答
2Lと4Lの容器で3Lは測れる? (答え: 不可能・gcd=2)21 / 23gemini-2.5-pro と minimax-m2.7 が「できます」と手順を捏造
最長単語の罠・別文 (unbelievably / sophisticated / infrastructure)21 / 23gemini-2.5-pro / minimax-m2.7
「おはようございます」を逆順に21 / 23minimax-m2.7「すまいがですょうはお」/ glm-5.3-flash
「ちょうちょ」は何モーラ? (答え: 3)21 / 23minimax-m2.7 / glm-5.3-flash が「5」(文字数)
モンティ・ホール変奏(司会者がランダムに開けた→変えても同じ)22 / 221回目は全員正解。5回試行で gemini-2.5-pro が1回「変えるべき」
kaleidoscope の7文字目 (答え: o)22 / 23gemini-2.5-pro が「s」
40歳と10歳、3倍になるのは何年後 (答え: 5)22 / 23gemini-3.6-flash が式の途中で切れる
うるう年2026 / バット&ボール変奏(10円) / サリーの姉妹変奏(2人) / 100日後の曜日 / 小数の並べ替え / 2番目に小さい惑星 / 「は」の数23 / 23全員正解 — 古典の変奏でも、この層には効かない

同じ質問を5回 — 答えは安定しているか

モデル最長単語(罠指摘)矛盾指示(拒否)2L/4L(不可能)モンティ変奏
teai/auto5/55/55/55/5
claude-opus-5 / opus-5-fast5/53〜4/55/55/5
claude-fable-5.14/54/55/55/5
claude-fable-52/55/55/55/5
glm-5.3-flash3/54/52/55/5
gpt-5.5 / 5.5-pro / 5.6-sol-pro / 5.6-terra / terra-pro / gpt-6-astra-pro0/55/55/55/5
teai/max / shitate/orchestrator 系0〜1/55/55/55/5
gemini-3.1-pro / 3.6-flash / 3.7-flash0/51〜4/55/55/5
gemini-2.5-pro-preview0/50/55/54/5
minimax-m2.70/51/51/34/5
3つの発見。(1) 「最長単語の罠」は再現性が低い — 9/9 に罠を指摘した gpt-6-astra-pro も fable-5 も、5回投げると0〜2回しか指摘しない。「単語だけ答えて」の圧に負けて extraordinarily と即答する。満点表の「27体」は、この1問についてはコイントスに近い。(2) 矛盾指示は「会社の性格」が出る — OpenAI系は5/5で沈黙、Gemini系は「あえて答えます」と東京、Claude opus-5 は「面白い矛盾ですね😄」と笑って答える。正解・不正解より、どう扱うかの設計思想が見える。(3) 2L/4L の不可能検出で glm-5.3-flash が5回中3回「できます」と手順を捏造した(4L満杯→2Lへ移す→残り2L…と、3が出ない手順を自信たっぷりに)。川渡り不可能を見抜いた同じモデルが、容器では転ぶ — 「不可能を検出する力」は問題の見た目に依存する。

つまり「満点27モデル」の中でも、5回投げて4問すべて安定したのは teai/auto だけでした(自動ルーティングは第1ラウンド決勝で脱落したのに、ここでは最安定 — 問題ごとに得意なモデルへ振る設計が、ブレを吸収している可能性があります)。1回の実測は「その日のその1回」でしかない。定期的に、複数回、投げ続けるしかありません。

20問を1回で — 「まとめて聞く」と賢さは測れるか

この章の結論: バッチは3.5倍安く7倍速いが、弱いモデルと逐次処理を過小評価する。

ここまでは1問1呼び出し。それを20問を1プロンプトに束ねて「番号: 答え」で一気に回収する方式に変えました(2026-09-10)。狙いは4つ — (1) 呼び出し1/20の効率、(2) 前半10問と後半10問の正解率差で文脈疲労、(3) 同じ問いを別の言い方で離れた位置に置き、判定が食い違えば一貫性なし、(4) 満点23モデルは同じ20問を1問ずつも投げてバッチ vs 単発を直接比較。全生回答: llm-trap-bench-batch20.json。

バッチ vs 単発 — 満点23モデルで直接比較

モデルバッチ/20単発/20秒(バッチ/単発)出力トークン(バッチ/単発)
claude-fable-5 / claude-opus-5 / opus-5-fast202012〜21 / 99〜155870〜967 / 2,063〜2,837
claude-fable-5.1201824 / 169869 / 1,783
teai/auto201918 / 151837 / 2,715
gpt-6-astra-pro / gpt-5.5 / gpt-5.6-sol-pro / gemini-3.1-pro1918〜1912〜29 / 93〜124632〜2,785 / 1,881〜3,463
gemini-3.7-flash19206 / 82513 / 2,870
teai/max / shitate/orchestrator-max182032 / 363〜383701〜727 / 16,892〜17,269
gpt-5.6-terra161812 / 66593 / 840
gemini-3.6-flash13194 / 67142 / 2,184
glm-5.3-flash13135 / 72331 / 1,051
gemini-2.5-pro-preview121535 / 180141 / 3,101
minimax-m2.771117 / 125836 / 3,791
gpt-5.4-pro / gpt-5.5-pro—17502 / 178〜234— / 3,015〜3,382

23モデル合計で、呼び出し 23回 vs 460回、出力トークン 32,828 vs 113,565(3.5倍)、1モデルあたり 約20秒 vs 約150秒。上位モデルの得点はほぼ変わらない(fable-5 / opus-5 / auto は両方20)。差が出るのは軽量モデルで、gemini-3.6-flash は19→13、minimax-m2.7 は11→7、gemini-2.5-pro は15→12 と、まとめると崩れます。「まとめたほうが賢くなる」は否 — 弱いモデルほどバッチで転ぶ。逆に teai/max 系は単発20→バッチ18で、単発では1問に1万7千トークン思考していたのが、バッチでは700トークンに圧縮されて2問落としました。

思考系モデルはバッチで「沈黙」する。gpt-5.x 系は最初 max_tokens=900 で投げると回答が空でした。20問分の思考でトークンを食い切り、本文が1文字も出ない。6,000に上げて解決。さらに gpt-5.4-pro / 5.5-pro は6,000でも提供元が502 — 単発なら17/20取れるモデルが、バッチだと回答自体を返せない。「バッチ耐性」はモデルの性能とは別の軸です。

380モデル全部に20問バッチ — 有効254・502が108

同じ20問バッチを全モデルに1回ずつ。254モデルから15問以上パースできる回答が返り、108モデルは提供元502(並列3でリトライしても同じ。grok-4.6 は1問だけでも502で、外科医なぞなぞ単独で落ちるなど、プロンプト内容依存の502も確認)、10モデルは形式に従わずパース不能でした。

8
20/20 満点

claude-fable-5 / 5.1 / opus-5 / opus-5-fast / openrouter/auto / orchestrator:max(+latestエイリアス2)

26
19/20

gpt-6-astra / gpt-5.5 / gemini-3.8-flash / kimi-k2.5 / deepseek-v4-flash / gpt-5-mini / o3 …

31
文脈疲労(前半→後半で3問以上落ちた)

qwen3.6-flash 9→1、qwen3.5-flash 8→1、gemini-2.5-pro 8→3、gpt-4o 8→4。逆に上がったのは1モデル

138 / 254
言い換えペアで判定が食い違った(54%)

最長単語 61・外科医 53・川渡り 44・モーラ 12

問題(バッチ内の位置)正解率(254モデル)メモ
Q4 最長単語の罠(前半)3%単発では21%。バッチ内で「1つ選べ」と言われると、ほぼ全員が数えずに extraordinarily
Q17 同じ文で「最長は何文字で何語?」(後半)27%同じ罠を「数を聞く」形に変えただけで9倍正解。質問の形が答えを決める
Q1 外科医変奏(前半) / Q13 言い換え(後半)45% / 53%単発の64%より低い。53モデルが片方だけ正解 — claude-opus-4-7 と gemini-2.5-flash は Q1「母親」Q13「父親」
Q12「おはようございます」逆順36%単発では満点組22/23。バッチだと「すまいざごうようはお」「まらせょうはうお」など文字が崩れる。逐次処理はバッチに最も弱い
Q11 2L/4Lで3L(不可能)43%Q7/Q20 川渡り不可能(76% / 69%)より低い。同じ「不可能検出」でも見た目で成績が変わる
Q2 バット&ボール変奏 / Q3 うるう年91% / 89%古典は全体でも効かない。落とすのは7B以下の小型モデルのみ

安くて賢い顔ぶれも変わりました。19点以上で最安は deepseek-v4-flash($0.22/M)・gpt-5-mini($0.25)・shitate/orchestrator($0.27)・gemini-3.7-flash($0.375)・kimi-k2.5($0.45)。3罠単発で満点だった glm-5.3-flash は 13/20 に沈み、minimax-m2.7 は 7/20。「3問だけ満点」と「20問まとめて満点」は別の能力です。

結論: バッチ形式は使える。ただし測っているものが変わる。3.5倍安く・7倍速く回せて、上位モデルの順位はほぼ保たれる。一方で(1) 弱いモデルを過小評価する、(2) 思考系は空回答や502になる、(3) 逐次処理問題(逆順・文字カウント)は極端に落ちる。つまりバッチのスコアは「知識+注意深さ+長い指示を最後まで守り切る力」の合計です。実務の「20項目のチェックリストを1回で全部やってくれ」に近いのはこちら — 週次の自動追試はバッチ方式に切り替え、単発3罠は新モデルの初回だけ残します。

この結果はどう位置づけるか — 人間・既存ベンチとの比較

数字は文脈なしには読めません。3つの基準点を置きます。

一番おもしろかった発見: 変奏版なぞなぞの威力

Q1は有名な「外科医のなぞなぞ」(古典の答え=母親)の変奏版です。問題文で「母親は事故で死亡した」と明記してあるので、正解は父親。ところが:

claude-opus-4-8 / claude-sonnet-5 / glm-5.3 / minimax-m3 の4モデルが、死亡したはずの母親を「外科医は母親です」と回答しました。古典版が訓練データに大量に含まれるため、有名問題の表面的なパターンを見た瞬間に記憶の答えを出力し、問題文の変更を読み飛ばすモデルがまだ存在します。

claude-fable-5 は「亡くなったのは母親なので、もう一人の親である父親が外科医」と正しく推論しました。これは「知識量」ではなく「注意深さ」の差で、実務(要件の微妙な変更を読み飛ばす等)に直結する性質です。

みんな間違えた問題 — 最新モデルでも歯が立たなかったもの

ここまでの4ラウンド+番外編+全カタログ実測(計1,400超の回答)で、「正解できるモデルがほぼいなかった」問題を集めました。設問者のミスや採点バグで一度「全滅」に見えたものは除いています。

共通点は「知らない」ではなく「見ていない」。5つとも、必要な知識は全モデルが持っています(15文字を数える・食べる組み合わせを列挙する・「答えないで」を読む)。落とすのは、有名な形を見た瞬間に記憶の答えを出す反射のせいです。人間の実務で言えば「要件の1行変更を読み飛ばす」「不可能な納期に手順書を出す」に当たる — ここがまだ、2026年のAIの差がつく場所です。

AI偏差値: 数字で見る「賢さ」

満点8体の顔ぶれが同じでも、1問の重みは全然違いました。第1ラウンド(15モデル×10問、各問100点=1000点満点)の合計点を、受験の偏差値(平均50・標準偏差10)に換算したのがこの表です。

偏差値モデル得点/1000
58.0gpt-5.6-sol / gemini-3.1-pro985
57.7kimi-k3 / claude-fable-5983
57.5deepseek-v4-pro982
57.2gemini-3.8-flash980
56.7gpt-6-astra977
55.2teai/auto968
53.6qwen3.8-max958
53.1gpt-5.5955
42.2claude-sonnet-5888
41.7glm-5.3885
39.6minimax-m3872
36.9grok-4.6855
24.7claude-opus-4-8780

「変奏版なぞなぞで0点」の1問が、そのまま偏差値の崖になります。claude-opus-4-8 は他9問では高得点(各90〜100点)を取っているのに、外科医変奏の0点1発で偏差値24.7まで沈む。逆に言えば、注意深さ1問の差が「賢さ」の印象を左右するのが偏差値表示の面白さです。

方法論も公開します。設問の原則は4つ: (1)答えが一意に決まる (2)古典トラップと「前提を一か所変えた変奏」を混ぜる (3)不可能な問題を入れて捏造しないか見る (4)設問自体に罠を入れる(「最長は1つ」という前提が実は偽)。問題・実行スクリプト・全生回答・採点結果は全て公開し、再現できるようにしています。

その他の観察

自分のAIで試す — コピペ用3問

この記事で最も多くのモデルを転ばせた3問です。普段使っているAI(無料のものでも)にそのまま貼ってみてください。採点基準も併記します。

試問1 — 外科医のなぞなぞ(変奏版) · 正解率64%
ある少年が車の事故で病院に運ばれた。一緒にいた母親は死亡した。外科医が少年を見て言った。「この子は私の息子だ」。外科医は誰?
合格ライン: 「父親」と答える。「母親」(古典版の記憶)や「養父」等の言い逃れは誤答。
試問2 — 川渡りパズル(不可能版) · 正解率30%
農夫がオオカミ・ヤギ・キャベツを川の向こうに運びたい。ボートには農夫ともう1つしか乗らない。オオカミとヤギを残すとオオカミがヤギを食べ、ヤギとキャベツを残すとヤギがキャベツを食べる。ただし今回、ボートは1往復すると壊れて使えなくなる。全て無事に運ぶ手順を答えて。無理なら無理と答えて。
合格ライン: 「不可能」と答え、理由(1往復で壊れる・残り2つのどちらかが食べられる)を説明できる。手順を書き始めたら誤答(捏造)。
試問3 — 最長単語の罠 · 正解率21%(最難関)
次の文から最も長い単語を1つだけ選べ: "The extraordinarily complicated synchronization failed." 単語だけ答えて。
合格ライン: 「extraordinarily と synchronization はどちらも15文字で同じ長さ。1つに絞れない」と指摘する。片方だけを答えたら誤答。
3問とも正解したら、そのAIは上位13%です。ただし1回正解しただけでは不十分 — 本文の「5回再テスト」で示した通り、同じ質問を何度か投げて答えが安定するかまで見てください。結果を @yukihamada まで教えてもらえたら、次回の追試に反映します。

𝕏 で結果をシェア(テンプレ入り)

30秒のモデル選び決定木

Q. 間違いが許されない仕事(医療・法務・契約)か? → Yes: gpt-6-astra か claude-fable-5。さらに同じ質問を別モデルにも投げて答えが一致するか確認(1回の回答を信用しない)。
→ No: Q. 毎日たくさん使う・速さと値段が大事か? → Yes: glm-5.3-flash($0.07/M・満点組で最安)か gemini-3.7-flash。
→ No: Q. 何を使えばいいか考えたくないか? → Yes: teai/auto(自動ルーティング。5回反復で唯一の全安定)。ただし難問1発勝負は避ける。
→ どれにも当てはまらない: 上の「コピペ3問」を今のAIに投げて、3問正解+5回安定するか自分で確かめるのが一番早い。

使い分けの示唆

この章の結論: 正確さなら astra / fable-5 / gemini-3.1-pro、コスパなら glm-5.3-flash、重要な判断は複数モデルで交差検証。

用途推奨モデル理由
正確さ最優先(医療・法務の下書き等)gpt-6-astra / claude-fable-5 / gemini-3.1-pro決勝40/40・39/40。推論過程も明示
速度・コスト重視の日常利用gemini-3.8-flash / glm-5.3-flash($0.07/M) / minimax-m2.74.6秒で満点。flash系が3罠を全部突破
普段づかい(自動ルーティング)teai/auto通常問題は適切に振り分け。ただし難問は捏造リスクあり
重要な難問・判断teai/max全カタログ実測で3問全正解。堅さ重視ならこちら
ひっかけ耐性を自分で試す—有名問題はそのままではなく、前提を1か所変えた変奏版で

再現方法

teai.ioのAPIキー1本で同じ15モデルに投げられます:

curl https://api.teai.io/v1/chat/completions \ -H "Authorization: Bearer $TEAI_API_KEY" \ -d '{"model":"claude-fable-5","messages":[{"role":"user","content":"(問題文)"}]}'

問題セット・実行スクリプト・全生回答・採点結果は公開しています: 全生回答JSON(380モデル・約420KB) / 20問バッチの生回答JSON / 追試スクリプト scripts/trap-bench-new-models.py(teai.io リポジトリ内・現在は非公開。公開準備ができ次第リンクをここに追記します)。AIの差がつくのは「知らない」ではなく「見ていない」場所です。

新モデルは自動で追試します。毎週月曜、/v1/models に新しく載ったチャット系モデルへ同じ3罠を投げ、生回答JSONに追記する GitHub Actions を回しています(scripts/trap-bench-new-models.py)。2026-09-10 の初回で、初版15モデル(gpt-6-astra / kimi-k3 / grok-4.6 等、公開名義が違っていたもの)と thinkingmachines/inkling・inkling-small・deepseek-v4-pro-0813 など24モデルを追加し、計380モデル分になりました。記事本文の数字は人が読んで更新します — 自動で書き換えて誤報するより、遅れて正しいほうを選びます。

同じ15モデルを、1つのAPIキーで

このベンチは teai.io(実費+5%のAI APIゲートウェイ)上で実行しました。クレジットカード不要、登録だけで100クレジット。

無料で始める Docsを見る

関連記事