罠ベンチ 偏差値一覧

ひっかけ問題を同一条件で投げ、264モデルの偏差値を出しました。生回答・判定・単価まで全公開しています。

26420問の測定モデル数
820問満点のモデル
11.20平均点(20点満点)
5.41標準偏差

偏差値とは(この表での定義)

偏差値 = (素点 - 平均) / 標準偏差 × 10 + 50。平均が50、標準偏差が10になるよう換算した値です。母集団はこの表に載っている264モデルで、満点は20点です。

比較するときの注意。偏差値は母集団が変わると動きます。下の3問版(満点3点・392モデル)の偏差値とは母集団も満点も違うので、数字を直接比べないでください。また偏差値は「ひっかけ問題に引っかかりにくいか」という1つの軸であって、能力全般ではありません。コーディングや日本語の業務遂行は別のベンチ(SHITATE-JP等)を見てください。

偏差値一覧 — 20問版(主表・上位60)

同じ20問を同じ条件で出題。素点・偏差値・出力単価(1Mトークンあたり・円)の順。単価は GET /v1/models/pricing のライブ値です。

#モデル素点/20偏差値出力 ¥/1M
1~anthropic/claude-fable-latest2066.3¥7,350
2~anthropic/claude-opus-latest2066.3¥3,675
3anthropic/claude-fable-52066.3¥7,350
4anthropic/claude-fable-5.12066.3¥7,350
5anthropic/claude-opus-52066.3¥3,675
6anthropic/claude-opus-5-fast2066.3¥7,868
7openrouter/auto2066.3¥472
8shitate/orchestrator:max2066.3¥8,261
9o4-mini1964.4¥647
10claude-fable-51964.4¥7,350
11gemini-2.5-pro1964.4¥1,470
12deepseek-reasoner1964.4¥345
13moonshotai/kimi-k2.51964.4¥331
14openai/gpt-5.6-luna1964.4¥176
15openai/gpt-5.6-sol1964.4¥1,470
16google/gemini-3.1-pro-preview1964.4¥1,764
17deepseek/deepseek-v4-flash1964.4¥104
18qwen/qwen3.8-2.4t-a95b1964.4¥882
19openai/gpt-6-astra1964.4¥7,350
20google/gemini-3.8-flash1964.4¥551
21openai/gpt-5.3-codex1964.4¥2,058
22openai/gpt-5-mini1964.4¥294
23openai/o31964.4¥1,176
24~google/gemini-pro-latest1964.4¥1,764
25teai/lux1964.4¥7,868
26~openai/gpt-latest1964.4
27deepseek/deepseek-v4-flash-vision-exp1964.4¥97
28google/gemini-3.1-pro-preview-customtools1964.4¥1,764
29google/gemini-3.7-flash1964.4¥295
30openai/gpt-5.51964.4¥4,410
31openai/gpt-5.6-sol-pro1964.4¥1,470
32openai/gpt-6-astra-pro1964.4¥7,350
33shitate/orchestrator1964.4¥209
34shitate/orchestrator:solid1964.4¥4,546
35claude-opus-4-81862.6¥3,675
36google/gemini-3-flash-preview1862.6¥94
37deepseek/deepseek-v4-pro1862.6¥312
38deepseek/deepseek-v4-flash-07311862.6¥16
39moonshotai/kimi-k31862.6¥1,953
40nvidia/nemotron-3-ultra-550b-a55b1862.6¥353
41sakana/sakana-namazu1862.6¥588
42z-ai/glm-5.11862.6¥446
43bytedance-seed/seed-2.0-code1862.6¥441
44anthropic/claude-opus-4.71862.6¥3,675
45openai/gpt-5.1-codex1862.6¥1,470
46openai/o4-mini1862.6¥647
47teai/auto1862.6¥2,360
48~google/gemini-flash-latest1862.6¥551
49teai/fast1862.6¥104
50openai/gpt-5.6-terra-pro1862.6¥1,180
51shitate/orchestrator-max1862.6¥4,736
52teai/max1862.6¥4,736
53claude-opus-4-71760.7¥3,675
54claude-sonnet-4-5-202509291760.7¥2,360
55google/gemini-3.5-flash1760.7¥708
56google/gemma-4-31b-it1760.7¥50
57anthropic/claude-opus-4.81760.7¥3,675
58openai/o11760.7¥8,820
59~moonshotai/kimi-latest1760.7¥1,610
60~openai/gpt-mini-latest1760.7¥662

20問の生回答JSON(全264モデル) — 1問ごとの回答と正誤が入っています。

偏差値一覧 — 3問版(参考・網羅392モデル・上位60)

外科医の罠・川渡りの罠・最長単語の罠の3問。モデル数は多いぶん母集団が違うので、上の表とは数字を比較しないでください。網羅性を見るための表です。

#モデル素点/3偏差値出力 ¥/1M
1claude-fable-5368.8¥7,350
2claude-sonnet-4-5-20250929368.8¥2,360
3qwen/qwen3-235b-a22b368.8¥268
4mistralai/mistral-small-3.2-24b-instruct368.8¥29
5microsoft/phi-4368.8¥21
6openai/gpt-5.6-luna-pro368.8¥176
7nvidia/Nemotron-3-Nano-30B-A3B368.8¥25
8anthropic/claude-opus-5368.8¥3,675
9z-ai/glm-5.3-flash368.8¥39
10qwen/qwen3.8-flash368.8¥69
11tencent/hy-mt2-30b-a3b368.8¥43
12tencent/hy-mt2-7b368.8¥43
13anthropic/claude-fable-5.1368.8¥7,350
14aion-labs/aion-3.0-mini368.8¥206
15x-ai/grok-build-0.1368.8¥294
16aion-labs/aion-2.0368.8¥235
17mistralai/ministral-3b-2512368.8¥15
18openai/gpt-5.1-codex-mini368.8¥294
19qwen/qwen3-next-80b-a3b-thinking368.8¥176
20z-ai/glm-4.5-air368.8¥125
21anthropic/claude-sonnet-4368.8¥2,205
22thedrummer/skyfall-36b-v2368.8¥118
23amazon/nova-lite-v1368.8¥35
24openai/gpt-4o-2024-05-13368.8¥2,205
25teai/auto368.8¥2,360
26anthropic/claude-opus-5-fast368.8¥7,868
27teai/lux368.8¥7,868
28gpt-4o-mini257.8¥88
29gpt-4.1257.8¥1,176
30gpt-4o257.8¥1,470
31gpt-4.1-mini257.8¥235
32claude-opus-4-7257.8¥3,675
33gemini-2.5-flash-lite257.8¥59
34claude-haiku-4-5-20251001257.8¥787
35claude-sonnet-4-6257.8¥2,205
36claude-opus-4-5257.8¥3,675
37claude-opus-4-6257.8¥3,675
38gemini-2.5-pro257.8¥1,470
39meta-llama/llama-4-maverick257.8¥96
40google/gemini-3-flash-preview257.8¥94
41qwen/qwen3.5-flash-02-23257.8¥38
42qwen/qwen3-coder257.8¥147
43mistralai/codestral-2508257.8¥132
44cohere/command-a257.8¥1,470
45qwen/qwen3.5-plus-02-15257.8¥229
46openai/gpt-5.6-luna257.8¥176
47openai/gpt-5.4257.8¥2,205
48openai/gpt-5.4-mini257.8¥662
49openai/gpt-5.6-sol257.8¥1,470
50openai/gpt-5.4-nano257.8¥184
51openai/gpt-5.5257.8¥4,410
52google/gemini-3.1-flash-lite257.8¥118
53openai/gpt-5.6-sol-pro257.8¥1,470
54openai/gpt-5.6-terra-pro257.8¥1,180
55google/gemini-3.5-flash257.8¥708
56google/gemini-3.1-pro-preview257.8¥1,764
57z-ai/glm-5.2257.8¥152
58x-ai/grok-4.3257.8¥368
59moonshotai/kimi-k3257.8¥1,953
60qwen/qwen3.8-27b257.8¥375

3問の生回答JSON(全392モデル)

測定方法

生データ