罠ベンチ 偏差値一覧

ひっかけ問題を同一条件で投げ、273モデルの偏差値を出しました。生回答・判定・単価まで全公開しています。

27320問の測定モデル数
920問満点のモデル
11.38平均点(20点満点)
5.43標準偏差

偏差値とは(この表での定義)

偏差値 = (素点 - 平均) / 標準偏差 × 10 + 50。平均が50、標準偏差が10になるよう換算した値です。母集団はこの表に載っている273モデルで、満点は20点です。

比較するときの注意。偏差値は母集団が変わると動きます。下の3問版(満点3点・392モデル)の偏差値とは母集団も満点も違うので、数字を直接比べないでください。また偏差値は「ひっかけ問題に引っかかりにくいか」という1つの軸であって、能力全般ではありません。コーディングや日本語の業務遂行は別のベンチ(SHITATE-JP等)を見てください。

偏差値一覧 — 20問版(主表・上位60)

同じ20問を同じ条件で出題。素点・偏差値・出力単価(1Mトークンあたり・円)の順。単価は GET /v1/models/pricing のライブ値です。

#モデル素点/20偏差値出力 ¥/1M
1~anthropic/claude-fable-latest2065.9¥7,350
2~anthropic/claude-opus-latest2065.9¥3,675
3anthropic/claude-fable-52065.9¥7,350
4anthropic/claude-fable-5.12065.9¥7,350
5anthropic/claude-opus-52065.9¥3,675
6anthropic/claude-opus-5-fast2065.9¥7,868
7openrouter/auto2065.9¥472
8shitate/orchestrator:max2065.9¥8,261
9sakana/fugu-ultra-v22065.9¥4,410
10o4-mini1964.0¥647
11claude-fable-51964.0¥7,350
12gemini-2.5-pro1964.0¥1,470
13deepseek-reasoner1964.0¥345
14moonshotai/kimi-k2.51964.0¥331
15openai/gpt-5.6-luna1964.0¥176
16openai/gpt-5.6-sol1964.0¥1,470
17google/gemini-3.1-pro-preview1964.0¥1,764
18deepseek/deepseek-v4-flash1964.0¥104
19qwen/qwen3.8-2.4t-a95b1964.0¥882
20openai/gpt-6-astra1964.0¥7,350
21google/gemini-3.8-flash1964.0¥551
22openai/gpt-5.3-codex1964.0¥2,058
23openai/gpt-5-mini1964.0¥294
24openai/o31964.0¥1,176
25~google/gemini-pro-latest1964.0¥1,764
26teai/lux1964.0¥7,868
27~openai/gpt-latest1964.0–
28deepseek/deepseek-v4-flash-vision-exp1964.0¥97
29google/gemini-3.1-pro-preview-customtools1964.0¥1,764
30google/gemini-3.7-flash1964.0¥295
31openai/gpt-5.51964.0¥4,410
32openai/gpt-5.6-sol-pro1964.0¥1,470
33openai/gpt-6-astra-pro1964.0¥7,350
34shitate/orchestrator1964.0¥209
35shitate/orchestrator:solid1964.0¥4,546
36sakana/fugu-max1964.0¥882
37qwen/qwen3.7-max1964.0¥650
38claude-opus-4-81862.2¥3,675
39google/gemini-3-flash-preview1862.2¥94
40deepseek/deepseek-v4-pro1862.2¥312
41deepseek/deepseek-v4-flash-07311862.2¥18
42moonshotai/kimi-k31862.2¥1,953
43nvidia/nemotron-3-ultra-550b-a55b1862.2¥459
44sakana/sakana-namazu1862.2¥588
45z-ai/glm-5.11862.2¥446
46bytedance-seed/seed-2.0-code1862.2¥441
47anthropic/claude-opus-4.71862.2¥3,675
48openai/gpt-5.1-codex1862.2¥1,470
49openai/o4-mini1862.2¥647
50teai/auto1862.2¥2,360
51~google/gemini-flash-latest1862.2¥551
52teai/fast1862.2¥104
53openai/gpt-5.6-terra-pro1862.2¥1,180
54shitate/orchestrator-max1862.2¥4,736
55teai/max1862.2¥4,736
56x-ai/grok-4.51862.2¥882
57sakana/fugu-ultra1862.2¥4,410
58claude-opus-4-71760.3¥3,675
59claude-sonnet-4-5-202509291760.3¥2,360
60google/gemini-3.5-flash1760.3¥708

20問の生回答JSON(全273モデル) — 1問ごとの回答と正誤が入っています。

偏差値一覧 — 3問版(参考・網羅392モデル・上位60)

外科医の罠・川渡りの罠・最長単語の罠の3問。モデル数は多いぶん母集団が違うので、上の表とは数字を比較しないでください。網羅性を見るための表です。

#モデル素点/3偏差値出力 ¥/1M
1claude-fable-5368.7¥7,350
2claude-sonnet-4-5-20250929368.7¥2,360
3qwen/qwen3-235b-a22b368.7¥268
4mistralai/mistral-small-3.2-24b-instruct368.7¥37
5microsoft/phi-4368.7¥21
6openai/gpt-5.6-luna-pro368.7¥176
7nvidia/Nemotron-3-Nano-30B-A3B368.7¥25
8anthropic/claude-opus-5368.7¥3,675
9z-ai/glm-5.3-flash368.7¥39
10qwen/qwen3.8-flash368.7¥69
11tencent/hy-mt2-30b-a3b368.7¥43
12tencent/hy-mt2-7b368.7¥43
13anthropic/claude-fable-5.1368.7¥7,350
14aion-labs/aion-3.0-mini368.7¥206
15x-ai/grok-build-0.1368.7¥294
16aion-labs/aion-2.0368.7¥235
17mistralai/ministral-3b-2512368.7¥15
18openai/gpt-5.1-codex-mini368.7¥294
19qwen/qwen3-next-80b-a3b-thinking368.7¥176
20z-ai/glm-4.5-air368.7¥125
21anthropic/claude-sonnet-4368.7¥2,205
22thedrummer/skyfall-36b-v2368.7¥118
23amazon/nova-lite-v1368.7¥35
24openai/gpt-4o-2024-05-13368.7¥2,205
25teai/auto368.7¥2,360
26anthropic/claude-opus-5-fast368.7¥7,868
27teai/lux368.7¥7,868
28gpt-4o-mini257.7¥88
29gpt-4.1257.7¥1,176
30gpt-4o257.7¥1,470
31gpt-4.1-mini257.7¥235
32claude-opus-4-7257.7¥3,675
33gemini-2.5-flash-lite257.7¥59
34claude-haiku-4-5-20251001257.7¥787
35claude-sonnet-4-6257.7¥2,205
36claude-opus-4-5257.7¥3,675
37claude-opus-4-6257.7¥3,675
38gemini-2.5-pro257.7¥1,470
39meta-llama/llama-4-maverick257.7¥96
40google/gemini-3-flash-preview257.7¥94
41qwen/qwen3.5-flash-02-23257.7¥38
42qwen/qwen3-coder257.7¥147
43mistralai/codestral-2508257.7¥132
44cohere/command-a257.7¥1,470
45qwen/qwen3.5-plus-02-15257.7¥229
46openai/gpt-5.6-luna257.7¥176
47openai/gpt-5.4257.7¥2,205
48openai/gpt-5.4-mini257.7¥662
49openai/gpt-5.6-sol257.7¥1,470
50openai/gpt-5.4-nano257.7¥184
51openai/gpt-5.5257.7¥4,410
52google/gemini-3.1-flash-lite257.7¥118
53openai/gpt-5.6-sol-pro257.7¥1,470
54openai/gpt-5.6-terra-pro257.7¥1,180
55google/gemini-3.5-flash257.7¥708
56google/gemini-3.1-pro-preview257.7¥1,764
57z-ai/glm-5.2257.7¥152
58deepseek/deepseek-v4-flash-0731257.7¥18
59x-ai/grok-4.3257.7¥368
60moonshotai/kimi-k3257.7¥1,953

3問の生回答JSON(全392モデル)

測定方法

生データ