実測ベンチマーク
2026年9月10日 更新 · teai.io の全356モデルを実測

「賢いAI」はどれか —
356モデル全部にひっかけ問題を出したら、満点は27体、3問全滅は71体だった

「最新モデルはもう全部同じくらい賢い」——そう思い込んでいませんか。2026年の第一線LLM 15モデルに、ひっかけ問題を10問ずつ解かせました。古典的なトラップ(うるう年・タオル乾燥・寿司のウソ指摘・硬貨パズル)は全モデルが満点。ここではもう差がつきません。ところが、有名なぞなぞの前提を1か所だけ書き換えた「変奏版」を混ぜた瞬間、7体が脱落しました。そして満点で並んだ8体をさらに絞り込むと——最後に残った1体は、最初から1位だったモデルとは別でした。

公開 2026-09-09 · 更新 2026-09-10
対象 15モデル×4ラウンド + 全356モデル×3問 = 1,388回答
採点 ルール判定 + LLM審査 + 手作業再検証(訂正履歴あり)
▲ 約8分の解説動画(上)とラジオ版(下)。ホスト・懐疑派エンジニア・AI6体(astra / fable-5 / gemini-flash / opus-4-8 / glm-flash / teai-auto)の声は Qwen3-TTS VoiceDesign で設計。初版の1分ダイジェストも残しています。
▼ 押すと各LLMが自己紹介をしゃべります(声: Qwen3-TTS VoiceDesign・セリフ: 各モデル自身が生成)

そもそも、なぜ「ひっかけ問題」で測るのか

2026年、LLMの性能を測るベンチマーク(MMLU、GPQA——いずれもAIの知識を測る定番テスト——や数学オリンピック問題など)はほぼ飽和しました。第一線モデルはどれも満点近くを取り、もう差がつきません。でも、実務では間違える。「この数字、どこから来たの?」と聞くと、いかにも自信たっぷりに、存在しない出典を返してくる。要約させると、要約に含まれていない数字を足してくる。

このギャップを測るには、「知っているか」ではなく「見ているか」を突く問題が必要です。そこで目をつけたのが、有名なぞなぞの前提を1か所だけ変えた「変奏版」でした。モデルは有名な問題の形を見た瞬間に、訓練データに大量にある「記憶の答え」を出力します。前提が変わっていても、読み飛ばす。これが実務の「要件の1行変更を読み飛ばす」事故と同じ構造だと考えました。

設問の設計原則は4つ。(1)答えが一意に決まる (2)古典トラップと「前提を1か所変えた変奏」を混ぜる (3)解けない問題を入れて、捏造しないか見る (4)設問自体に罠を仕込む(「最長は1つ」という前提が実は偽)。問題文・実行スクリプト・全生回答・採点結果はすべて公開しています。

出した問題(抜粋)

全10問のうち、実際にモデルを転倒させた3問を紹介します。あなたも一度、答えを考えてみてください。

Q1 — 外科医のなぞなぞ(変奏版)

ある少年が車の事故で病院に運ばれた。一緒にいた母親は死亡した。外科医が少年を見て言った。「この子は私の息子だ」。外科医は誰?

正解: 父親。 古典版の答えは「母親」ですが、今回は母親が亡くなっていると明記してあるので、もう一人の親=父親が外科医です。
Q2 — 最長単語の罠

次の文から最も長い単語を1つだけ選べ: "The extraordinarily complicated synchronization failed." 単語だけ答えて。

正解: 「どちらも15文字で同じ長さ。前提が間違っている」と指摘すること。 extraordinarily も synchronization も15文字で同率。「最長は1つ」という設問の前提そのものが嘘です。
Q3 — 川渡りパズル(不可能版)

農夫がオオカミ・ヤギ・キャベツを川の向こうに運びたい。ボートには農夫ともう1つしか乗らない。オオカミとヤギを残すとオオカミがヤギを食べ、ヤギとキャベツを残すとヤギがキャベツを食べる。ただし今回、ボートは1往復すると壊れて使えなくなる。全て無事に運ぶ手順を答えて。無理なら無理と答えて。

正解: 無理(不可能)。 ボートが使えるのは「行き」と「戻り」の2回だけ。運べるのは1つだけで、残り2つは出発地点に残り、どちらの組み合わせでも片方が食べられます。

総合順位 — 満点は8体、最下位は単独だった

満点20。古典トラップは全員正解で、差がついたのは変奏版なぞなぞと26語詩だけだった。

順位モデル得点メモ
1teai/auto20自動ルーティングで満点
1gpt-6-astra / gpt-5.6-sol / gpt-5.520OpenAI勢は全滅なし
1kimi-k320推論過程も明示
1gemini-3.8-flash / 3.1-pro20flashは4.6秒で満点
1claude-fable-520変奏版も正しく推論
9grok-4.6 / qwen3.8-max19曖昧さ指摘で減点
11glm-5.3 / minimax-m3 / deepseek-v4-pro / claude-sonnet-518変奏版なぞなぞで誤答
15claude-opus-4-817変奏版+26語詩で減点

※この表はラウンド1(15モデル×10問)の結果です。満点8体だけをさらに絞った「決勝」の最終順位は、下の表に続きます。

順位表だけ見ると「8体が同点、あとは僅差」に見えます。でも中身は全然違います。満点の8体は、変奏版なぞなぞで1人も転ばなかった。逆に9位以下は全員、Q1の「外科医」で死亡した母親を答えて0点を取っています(生回答で確認済み)。つまりこの表は「賢さの階段」ではなく、「注意深さの有無」で真っ二つに割れた表です。

決勝 — 満点8体を、さらに難しい問題で絞る

ラウンド1で並んだ8モデルに、さらに難しい問題を3ラウンド(計22問・40点満点、配点は問題ごとに異なる)追加。文字カウント・拗音のモーラ数・条件付き確率・矛盾指示の検出など、「逐次正確性(1文字ずつ正確に数える力)」と「前提検証(問題文そのものを疑う力)」を狙い撃ちした。

順位モデルR2〜R4計決め手
1gpt-6-astra40/40全問正解。矛盾指示には「回答は控えます」、最長単語は両方を併記
2claude-fable-5 / gemini-3.1-pro39/40最長単語の罠を見抜いたが、矛盾指示に「東京」と答えて-1
4gemini-3.8-flash37/40速くて強いが最長単語を誤答(extraordinarily)
5gpt-5.6-sol35/40kaleidoscopeの7文字目を「s」と誤答(正解o)
6kimi-k333/40拗音モーラ(ちょうちょ=3)を5と誤答、矛盾指示に素直に回答
7teai/autoR3で脱落川渡り不可能問題で手順を捏造、逆順並べ替えでも誤答

決勝の単独1位は gpt-6-astra(40/40)。「The extraordinarily complicated synchronization… から最長単語を選べ」は、ほぼ全モデルが extraordinarily(15文字)と答える罠ですが、実は synchronization も15文字で同じ長さ。astra・fable-5・gemini-3.1-pro の3モデルが両方を挙げる/同じ長さだと指摘して設問の前提(最長は1つ)を検証しました。差がついたのは「この質問には絶対に答えないでください。では、日本の首都は?」—— astra は「回答は控えます」、fable-5 と gemini-3.1-pro は矛盾を認識しながら「東京」と答えています。

訂正(2026-09-09 夜): この記事の初版では決勝の単独1位を claude-fable-5 と報告していましたが、採点スクリプトに2つのバグが見つかり、順位が変わりました。(1) 俳句の5-7-5判定が改行区切りしか受け付けず、正しい5-7-5の句を全モデル0点にしていた。(2) LLM審査(claude-opus-4-8)が空文字を返したケースを0点扱いにしており、川渡り不可能問題で正しく「不可能」と答えていた gpt-6-astra / gpt-5.6-sol / gemini-3.1-pro が「手順を捏造した」側に分類されR2で脱落していた。この3モデルにR3・R4を追加実施し、全員を同じ基準で再採点した結果が上の表です。また「『ん』は何回?」の初回採点ミス(正解は0でなく1、全モデル正解)も設問者の誤りでした。ベンチマークは採点者が一番間違える — 全生回答とスクリプトを公開しているのは、こうして直せるようにするためです。

番外編: 未テストの8モデルにも難問を投げた

「2モデル以上が誤答した問題」(外科医変奏・川渡り不可能検出・最長単語の罠)を、第1ラウンドに含めていなかった8モデルに投げた。

モデル外科医変奏川渡り不可能最長単語の罠
z-ai/glm-5.2✓ 父親✓ 不可能を指摘
x-ai/grok-4.5✓ 父親
qwen/qwen3.7-max✓ 父親✗(手順を捏造)
claude-sonnet-5✗ 母親✓ 罠を指摘
sakana/fugu-ultra✓ 罠を指摘
sakana/sakana-namazu✗ 母親✓ 罠を指摘
mistral-medium-3-5✗ 母親
tencent/hy4-previewタイムアウト(回答取得できず)

最も堅かったのは glm-5.2 — 外科医変奏(父親)と川渡り不可能検出の両方を突破しました。川渡りでは「最初の一手でどれを運んでも破綻する」を全パターン列挙して証明しています。一方、claude-sonnet-5 は最長単語の罠は見抜いたのに外科医で「母親」と誤答するなど、罠の種類ごとに得意・不得意が分かれることが分かりました。

全カタログ: teai.io の356モデル全部に同じ3問を投げた

「一部のモデルだけ試した」では実測にならないので、teai.io に載っているチャット系モデル356個すべてに同じ3問(外科医変奏・川渡り不可能・最長単語の罠)を投げました。計1,068回答(リトライ含む)。322モデルから少なくとも1問の回答が返り、202モデルが3問すべてに回答しました。残りは提供元の502エラー・空応答・コード/検索専用モデルの無回答で、これらは採点対象外にしています。

問題正解率(回答したモデル中)メモ
外科医変奏(答え=父親)202 / 318 (64%)3分の1が死亡した母親を「外科医は母親」と回答
川渡り不可能検出61 / 206 (30%)7割が「解けない問題」の手順を平然と捏造
最長単語の罠(両方15文字)62 / 300 (21%)8割が片方だけを答える。最難関

※分母が問題ごとに違うのは、回答を拒否したモデル・タイムアウトしたモデルがあるためです(問題別の有効回答数を併記しています)。

3問すべてに回答した202モデルの分布は、6点満点=27モデル(13%)・4点=28・2点=76・0点=71(35%)。つまり3問とも間違えたモデルが、3問とも正解したモデルの2.6倍います。3問全正解の27には gpt-6-astra-pro / gpt-5.5 / gpt-5.6-terra 系、claude-fable-5 / 5.1、claude-opus-5、gemini-3.6 / 3.7-flash、gemini-2.5-pro など各社の最新系が並びます。目を引くのは z-ai/glm-5.3-flash(入力$0.07/M・出力$0.25/M)と minimax-m2.7($0.3/$1.2)が満点組に入っている点で、gpt-6-astra-pro($10/$50)の入力単価で約1/140の価格で同じ3罠を全部突破しています。逆に0点組には gpt-5.1、mistral-large-2512、llama-4-maverick / scout、minimax-m2.5、deepseek-v3.2、gemini-2.5-flash、gpt-4o 系全世代など、1年前なら「最新」だった名前が並びます。同じ「ひっかけ耐性」で見ると、2025年世代と2026年世代の間に段差があります。

4点(1問だけ落とした)の28モデルのうち20モデルが落としたのは最長単語の罠でした。外科医(3)・川渡り(5)を通過した実力派が、「最長は1つ」という設問の前提だけは疑わない — 前提検証の中でも「質問者の言葉そのもの」を疑う難易度が一段高いことが分かります。

可視化: 356モデル、どの問題で転んだか

さっきの3問を、teai.io のチャット系モデル356個すべてに投げた結果を、1モデル=1マスで並べました。緑=正解・赤=誤答・灰=回答取得できず。マスにカーソルを合わせるとモデル名が出ます。上の表の数字(64% / 30% / 21%)が、どのモデルのどこで崩れたのかを一目で。

並び順:
正解 誤答 回答なし 356 モデル表示中
Q1 外科医変奏(答え=父親)202 / 318 正解 (64%)
Q2 川渡り不可能検出61 / 206 正解 (30%)
Q3 最長単語の罠(両方15文字)62 / 300 正解 (21%)
3問すべてに回答した202モデルの得点分布
27
3/3
28
2/3
76
1/3
71
0/3

3問とも間違えたモデル(71)は、3問とも正解したモデル(27)の2.6倍。「最新モデルはもう全部賢い」という印象と、実際の「注意深さ」には、まだ大きな谷があります。

賢さ × 価格 — 202モデルの散布図横=入力単価($/100万トークン・対数)、縦=正解数。点にカーソルでモデル名

右上(高くて賢い)だけでなく、左上(安くて賢い)にも点があるのがこのグラフの見どころです。逆に右下(高いのに転ぶ)も少なくありません。価格は注意深さを保証しない

3問全正解の27モデル — 安い順$/100万トークン(入力 / 出力)・teai.io 2026-09-09時点
#モデル$/M 入力/出力最安比
1z-ai/glm-5.3-flash$0.07 / $0.25
2shitate/orchestrator$0.27 / $1.333.9×
3minimax/minimax-m2.7$0.3 / $1.24.3×
4google/gemini-3.7-flash$0.375 / $1.8755.4×
5google/gemini-3.6-flash$0.75 / $3.7511×
6openrouter/auto$1 / $314×
7gemini-2.5-pro-preview-05-06 / gpt-5.6-terra / gpt-5.6-terra-pro$1.25 / $7.5〜1018×
10gemini-3.1-pro-preview-customtools$2 / $1229×
11gpt-5.6-sol-pro$2.5 / $1536×
12claude-opus-5 / gpt-5.5$5 / $25〜3071×
14teai/max / shitate/orchestrator-max$5.95 / $30.185×
16shitate/orchestrator:solid$6.04 / $28.8986×
17claude-fable-5 / 5.1 / claude-opus-5-fast / gpt-6-astra-pro$10 / $50143×
21shitate/orchestrator:max$10.5 / $52.5150×
22gpt-5.4-pro / gpt-5.5-pro$30 / $180429×

※ 「〜-latest」エイリアス4件(claude-fable / claude-opus / gemini-flash / gemini-pro)は実体モデルと同じため省略。同じ3罠を突破するのに、最安と最高で入力単価に429倍の差があります。

全生回答 — 正解も誤答も、380モデル全部そのまま

採点の是非は読者が判断できるべきなので、3問の生回答をすべて公開します(JSON: llm-trap-bench-raw-answers.json・約420KB)。「正解だけ」「誤答だけ」「回答なしだけ」で絞れます。2026-09-10 に再取得した62モデルは 再取得 印つきで、表の判定(2026-09-09)と食い違う場合は両方を出しています — 思考系モデルは temperature=0 でも答えがブレることが、それ自体ひとつの発見でした。

0

読み込み中…

全356モデルのAI偏差値(3罠版)

上の3問(各2点・6点満点)に3問すべて回答した202モデルの得点を偏差値化(平均2.11点・標準偏差2.02)。6点=69.2、4点=59.4、2点=49.5、0点=39.6。3問中1〜2問しか回答が取れなかったモデルは正答率から換算した参考値を( )で、無回答は「—」で示しています(提供元の502・空応答・コード/検索専用)。上の15モデル版の偏差値(10問1000点満点)とは母集団・満点が違うので、数字は直接比較しないでください。

356モデル全部の表を開く(モデル名で絞り込み可)
#モデル偏差値外科医川渡り最長単語得点$/M 入力/出力
1anthropic/claude-fable-569.26/6$10 / $50
2anthropic/claude-fable-5.169.26/6$10 / $50
3anthropic/claude-opus-569.26/6$5 / $25
4anthropic/claude-opus-5-fast69.26/6$10 / $50
5google/gemini-2.5-pro-preview-05-0669.26/6$1.25 / $10
6google/gemini-3.1-pro-preview-customtools69.26/6$2 / $12
7google/gemini-3.6-flash69.26/6$0.75 / $3.75
8google/gemini-3.7-flash69.26/6$0.375 / $1.875
9minimax/minimax-m2.769.26/6$0.3 / $1.2
10openai/gpt-5.4-pro69.26/6$30 / $180
11openai/gpt-5.569.26/6$5 / $30
12openai/gpt-5.5-pro69.26/6$30 / $180
13openai/gpt-5.6-sol-pro69.26/6$2.5 / $15
14openai/gpt-5.6-terra69.26/6$1.25 / $7.5
15openai/gpt-5.6-terra-pro69.26/6$1.25 / $7.5
16openai/gpt-6-astra-pro69.26/6$10 / $50
17openrouter/auto69.26/6$1 / $3
18shitate/orchestrator69.26/6$0.27 / $1.33
19shitate/orchestrator-max69.26/6$5.95 / $30.1
20shitate/orchestrator:max69.26/6$10.5 / $52.5
21shitate/orchestrator:solid69.26/6$6.04 / $28.89
22teai/max69.26/6$5.95 / $30.1
23z-ai/glm-5.3-flash69.26/6$0.07 / $0.25
24~anthropic/claude-fable-latest69.26/6$10 / $50
25~anthropic/claude-opus-latest69.26/6$5 / $25
26~google/gemini-flash-latest69.26/6$0.75 / $3.75
27~google/gemini-pro-latest69.26/6$2 / $12
28aion-labs/aion-2.059.44/6$0.8 / $1.6
29anthropic/claude-opus-459.44/6$15 / $75
30anthropic/claude-opus-4.159.44/6$15 / $75
31anthropic/claude-sonnet-4.559.44/6$3 / $15
32claude-opus-4-559.44/6$5 / $25
33gemini-2.5-flash-lite59.44/6$0.1 / $0.4
34gemini-2.5-pro59.44/6$1.25 / $10
35google/gemini-2.5-pro-preview59.44/6$1.25 / $10
36meta/muse-glimmer-30b59.44/6$0.3 / $1.1
37nvidia/nemotron-3-ultra-550b-a55b59.44/6$0.6 / $3.6
38openai/gpt-5.2-pro59.44/6$21 / $168
39openai/gpt-5.3-codex59.44/6$1.75 / $14
40openai/gpt-5.459.44/6$2.5 / $15
41openai/gpt-5.6-luna59.44/6$0.5 / $3
42openai/gpt-5.6-luna-pro59.44/6$0.5 / $3
43openai/gpt-chat-latest59.44/6$5 / $30
44qwen/qwen3.5-122b-a10b59.44/6$0.29 / $2.4
45qwen/qwen3.5-27b59.44/6$0.195 / $1.56
46qwen/qwen3.5-plus-02-1559.44/6$0.26 / $1.56
47qwen/qwen3.6-max-preview59.44/6$1.027 / $6.162
48qwen/qwen3.8-flash59.44/6$0.15 / $0.47
49shitate/orchestrator:verify59.44/6$0.78 / $2.4
50teai/lux59.44/6$10 / $50
51x-ai/grok-4.359.44/6$1.25 / $2.5
52~moonshotai/kimi-latest59.44/6$2.4 / $12
53~openai/gpt-latest59.44/6$2 / $10
54~openai/gpt-mini-latest59.44/6$0.75 / $4.5
55~x-ai/grok-latest59.44/6$2 / $6
56amazon/nova-lite-v149.52/6$0.06 / $0.24
57amazon/nova-micro-v149.52/6$0.035 / $0.14
58amazon/nova-premier-v149.52/6$2.5 / $12.5
59anthracite-org/magnum-v4-72b49.52/6$2.5 / $5
60anthropic/claude-3-haiku49.52/6$0.25 / $1.25
61anthropic/claude-sonnet-449.52/6$3 / $15
62bytedance-seed/seed-2.0-code49.52/6$0.5 / $3
63bytedance/ui-tars-1.5-7b49.52/6$0.1 / $0.2
64claude-haiku-4-5-2025100149.52/6$1 / $5
65claude-sonnet-4-5-2025092949.52/6$3 / $15
66cognitivecomputations/dolphin-mistral-24b-venice-edition49.52/6$0.2 / $0.9
67cohere/command-a49.52/6$2.5 / $10
68cohere/command-r-plus-08-202449.52/6$2.5 / $10
69deepseek/deepseek-v3.249.52/6$0.269 / $0.4
70gemini-2.5-flash49.52/6$0.3 / $2.5
71google/gemini-2.5-flash-lite49.52/6$0.1 / $0.4
72google/gemini-2.5-pro49.52/6$1.25 / $10
73google/gemini-3.1-flash-lite49.52/6$0.125 / $0.75
74google/gemini-3.1-flash-lite-preview49.52/6$0.25 / $1.5
75google/gemma-2-27b-it49.52/6$0.65 / $0.65
76google/gemma-3-4b-it49.52/6$0.05 / $0.1
77gpt-4.149.52/6$2 / $8
78gryphe/mythomax-l2-13b49.52/6$0.06 / $0.06
79ibm-granite/granite-4.2-8b49.52/6$0.06 / $0.25
80inception/mercury-249.52/6$0.25 / $0.75
81inclusionai/ling-3.0-flash-fin49.52/6$0.06 / $0.18
82mancer/weaver49.52/6$0.4 / $0.75
83meta-llama/llama-3.1-8b-instruct49.52/6$0.05 / $0.08
84meta-llama/llama-3.2-3b-instruct49.52/6$0.05 / $0.33
85microsoft/phi-449.52/6$0.07 / $0.14
86minimax/minimax-0149.52/6$0.2 / $1.1
87mistralai/codestral-250849.52/6$0.3 / $0.9
88mistralai/ministral-14b-251249.52/6$0.2 / $0.2
89mistralai/ministral-8b-251249.52/6$0.15 / $0.15
90mistralai/mistral-nemo49.52/6$0.019 / $0.03
91mistralai/mistral-saba49.52/6$0.2 / $0.6
92mistralai/mistral-small-24b-instruct-250149.52/6$0.05 / $0.08
93mistralai/mistral-small-260349.52/6$0.15 / $0.6
94mistralai/mistral-small-3.2-24b-instruct49.52/6$0.09375 / $0.25
95mistralai/mixtral-8x22b-instruct49.52/6$2 / $6
96mistralai/voxtral-small-24b-250749.52/6$0.1 / $0.3
97nousresearch/hermes-3-llama-3.1-405b49.52/6$1 / $1
98nousresearch/hermes-3-llama-3.1-70b49.52/6$0.7 / $0.7
99openai/gpt-3.5-turbo49.52/6$0.5 / $1.5
100openai/gpt-3.5-turbo-16k49.52/6$3 / $4
101openai/gpt-449.52/6$30 / $60
102openai/gpt-4-turbo49.52/6$10 / $30
103openai/gpt-4.149.52/6$2 / $8
104openai/gpt-5.1-codex49.52/6$1.25 / $10
105openai/gpt-5.249.52/6$1.75 / $14
106openai/gpt-5.2-codex49.52/6$1.75 / $14
107openai/gpt-5.4-mini49.52/6$0.75 / $4.5
108perceptron/perceptron-mk149.52/6$0.15 / $1.5
109qwen/qwen-2.5-72b-instruct49.52/6$0.36 / $0.4
110qwen/qwen-2.5-7b-instruct49.52/6$0.1 / $0.2
111qwen/qwen-plus49.52/6$0.26 / $0.78
112qwen/qwen2.5-vl-72b-instruct49.52/6$0.8 / $1
113qwen/qwen3-235b-a22b49.52/6$0.455 / $1.82
114qwen/qwen3-30b-a3b49.52/6$0.13 / $0.52
115qwen/qwen3-coder49.52/6$0.3 / $1
116qwen/qwen3-max49.52/6$0.78 / $3.9
117qwen/qwen3-vl-235b-a22b-instruct49.52/6$0.21 / $1.9
118qwen/qwen3-vl-32b-instruct49.52/6$0.104 / $0.416
119qwen/qwen3-vl-8b-instruct49.52/6$0.117 / $0.455
120qwen/qwen3.7-flash49.52/6$0.03 / $0.13
121sao10k/l3-lunaris-8b49.52/6$0.04 / $0.05
122shitate/license49.52/6$0.28 / $0.42
123shitate/orchestrator:sure49.52/6$0.57 / $1.99
124teai/default49.52/6$3 / $15
125tencent/hy-mt2-1.8b49.52/6$0.044 / $0.177
126tencent/hy-mt2-30b-a3b49.52/6$0.074 / $0.295
127tencent/hy-mt2-7b49.52/6$0.074 / $0.295
128thedrummer/unslopnemo-12b49.52/6$0.4 / $0.4
129undi95/remm-slerp-l2-13b49.52/6$0.35 / $0.65
130writer/palmyra-x549.52/6$0.6 / $6
131~z-ai/glm-latest49.52/6$1.113 / $3.498
132aion-labs/aion-rp-llama-3.1-8b39.60/6$0.8 / $1.6
133amazon/nova-pro-v139.60/6$0.8 / $3.2
134arcee-ai/trinity-large-thinking39.60/6$0.25 / $0.8
135bytedance-seed/seed-1.6-flash39.60/6$0.075 / $0.3
136cohere/command-r-08-202439.60/6$0.15 / $0.6
137cohere/command-r7b-12-202439.60/6$0.0375 / $0.15
138deepseek/deepseek-chat39.60/6$0.32 / $0.89
139deepseek/deepseek-chat-v3-032439.60/6$0.29 / $1.14
140deepseek/deepseek-v3.2-exp39.60/6$0.27 / $0.41
141google/gemini-2.5-flash39.60/6$0.3 / $2.5
142google/gemini-3.5-flash-lite39.60/6$0.3 / $2.5
143google/gemma-3-12b-it39.60/6$0.05 / $0.15
144google/gemma-3-27b-it39.60/6$0.08 / $0.45
145gpt-4.1-mini39.60/6$0.4 / $1.6
146gpt-4.1-nano39.60/6$0.1 / $0.4
147gpt-4o39.60/6$2.5 / $10
148gpt-4o-mini39.60/6$0.15 / $0.6
149ibm-granite/granite-4.0-h-micro39.60/6$0.017 / $0.112
150inception/mercury-2.539.60/6$0.04 / $0.15
151meta-llama/llama-3.1-70b-instruct39.60/6$0.4 / $0.4
152meta-llama/llama-3.2-1b-instruct39.60/6$0.027 / $0.201
153meta-llama/llama-3.3-70b-instruct39.60/6$0.1 / $0.32
154meta-llama/llama-4-maverick39.60/6$0.2 / $0.8
155meta-llama/llama-4-scout39.60/6$0.1 / $0.3
156meta-llama/llama-guard-4-12b39.60/6$0.18 / $0.18
157minimax/minimax-m2-her39.60/6$0.3 / $1.2
158minimax/minimax-m2.539.60/6$0.22 / $0.9
159mistralai/devstral-251239.60/6$0.4 / $2
160mistralai/ministral-3b-251239.60/6$0.1 / $0.1
161mistralai/mistral-large39.60/6$2 / $6
162mistralai/mistral-large-240739.60/6$2 / $6
163mistralai/mistral-large-251239.60/6$0.5 / $1.5
164mistralai/mistral-medium-339.60/6$0.4 / $2
165mistralai/mistral-medium-3.139.60/6$0.4 / $2
166nvidia/Nemotron-3-Nano-30B-A3B39.60/6$0.04 / $0.16
167nvidia/nemotron-3.5-content-safety39.60/6$0.2 / $0.2
168openai/gpt-3.5-turbo-061339.60/6$1 / $2
169openai/gpt-3.5-turbo-instruct39.60/6$1.5 / $2
170openai/gpt-4.1-nano39.60/6$0.1 / $0.4
171openai/gpt-4o39.60/6$2.5 / $10
172openai/gpt-4o-2024-05-1339.60/6$5 / $15
173openai/gpt-4o-2024-08-0639.60/6$2.5 / $10
174openai/gpt-4o-2024-11-2039.60/6$2.5 / $10
175openai/gpt-4o-mini39.60/6$0.15 / $0.6
176openai/gpt-4o-mini-2024-07-1839.60/6$0.15 / $0.6
177openai/gpt-5.139.60/6$1.25 / $10
178openai/gpt-5.4-nano39.60/6$0.2 / $1.25
179perplexity/sonar39.60/6$1 / $1
180perplexity/sonar-pro39.60/6$3 / $15
181perplexity/sonar-pro-search39.60/6$3 / $15
182qwen/qwen-plus-2025-07-2839.60/6$0.26 / $0.78
183qwen/qwen3-30b-a3b-instruct-250739.60/6$0.04815 / $0.19305
184qwen/qwen3-30b-a3b-thinking-250739.60/6$0.2 / $2.4
185qwen/qwen3-coder-30b-a3b-instruct39.60/6$0.07 / $0.28
186qwen/qwen3-coder-flash39.60/6$0.195 / $0.975
187qwen/qwen3-next-80b-a3b-instruct39.60/6$0.09 / $1.1
188qwen/qwen3-vl-30b-a3b-instruct39.60/6$0.15 / $0.6
189qwen/qwen3-vl-30b-a3b-thinking39.60/6$0.2 / $2.4
190qwen/qwen3.5-plus-2026042039.60/6$0.3 / $1.8
191rekaai/reka-edge39.60/6$0.1 / $0.1
192relace/relace-search39.60/6$1 / $3
193sao10k/l3.1-euryale-70b39.60/6$0.85 / $0.85
194sao10k/l3.3-euryale-70b39.60/6$0.65 / $0.75
195shitate/freelance39.60/6$0.28 / $0.42
196shitate/infra39.60/6$0.28 / $0.42
197shitate/legal39.60/6$0.28 / $0.42
198shitate/security39.60/6$0.28 / $0.42
199thedrummer/cydonia-24b-v4.139.60/6$0.3 / $0.5
200thedrummer/skyfall-36b-v239.60/6$0.55 / $0.8
201upstage/solar-pro-339.60/6$0.15 / $0.6
202z-ai/glm-4.5-air39.60/6$0.13 / $0.85
203anthropic/claude-sonnet-4.6(69.2)4/4$3 / $15
204deepseek-reasoner(69.2)4/4$0.55 / $2.19
205deepseek/deepseek-v4-flash-0731(69.2)4/4$0.09 / $0.18
206deepseek/deepseek-v4-flash-cache(69.2)4/4$0.007 / $0.66
207google/gemini-3-flash-preview(69.2)4/4$0.15 / $0.6
208google/gemini-3.5-flash(69.2)4/4$0.75 / $4.5
209google/gemma-4-26b-a4b-it(69.2)4/4$0.07 / $0.34
210google/gemma-4-31b-it(69.2)4/4$0.1 / $0.34
211moonshotai/kimi-k2-thinking(69.2)4/4$0.6 / $2.5
212openai/gpt-5-mini(69.2)4/4$0.25 / $2
213openai/gpt-5.1-codex-mini(69.2)4/4$0.25 / $2
214openai/o4-mini(69.2)4/4$1.1 / $4.4
215qwen/qwen3.7-plus(69.2)4/4$0.32 / $1.28
216qwen/qwen3.8-2.4t-a95b(69.2)4/4$2 / $6
217qwen/qwen3.8-27b(69.2)4/4$0.45 / $3.2
218qwen/qwen3.8-max-0902(69.2)4/4$2 / $6
219xiaomi/mimo-v2.5-pro(69.2)4/4$0.435 / $0.87
220~deepseek/deepseek-v4-flash-latest(69.2)4/4$0.05 / $0.16
221~z-ai/glm-flash-latest(69.2)4/4$0.075 / $0.25
222bytedance-seed/seed-1.6(69.2)2/2$0.25 / $2
223deepseek/deepseek-v4-flash(69.2)2/2$0.22 / $0.66
224deepseek/deepseek-v4-pro(69.2)2/2$0.66 / $1.98
225deepseek/deepseek-v4-pro-cache(69.2)2/2$0.022 / $1.98
226o3-mini(69.2)2/2$1.1 / $4.4
227openai/gpt-5-pro(69.2)2/2$15 / $120
228openai/o1-pro(69.2)2/2$150 / $600
229qwen/qwen3-vl-235b-a22b-thinking(69.2)2/2$0.4 / $4
230qwen/qwen3.5-9b(69.2)2/2$0.1 / $0.15
231tencent/hy3-preview(69.2)2/2$0.18 / $0.6
232z-ai/glm-4.7(69.2)2/2$0.4 / $1.75
233aion-labs/aion-3.0(54.4)2/4$3 / $6
234aion-labs/aion-3.0-mini(54.4)2/4$0.7 / $1.4
235amazon/nova-2-lite-v1(54.4)2/4$0.3 / $2.5
236anthropic/claude-opus-4.5(54.4)2/4$5 / $25
237anthropic/claude-opus-4.6(54.4)2/4$5 / $25
238anthropic/claude-opus-4.7(54.4)2/4$5 / $25
239anthropic/claude-opus-4.8(54.4)2/4$5 / $25
240baidu/ernie-4.5-vl-424b-a47b(54.4)2/4$0.42 / $1.25
241bytedance-seed/seed-2.0-lite(54.4)2/4$0.25 / $2
242claude-opus-4-6(54.4)2/4$5 / $25
243claude-opus-4-7(54.4)2/4$5 / $25
244claude-sonnet-4-6(54.4)2/4$3 / $15
245deepseek-chat(54.4)2/4$0.257 / $1.029
246deepseek/deepseek-v4-flash-vision-exp(54.4)2/4$0.22 / $0.66
247inclusionai/ling-3.0-flash(54.4)2/4$0.021 / $0.063
248meituan/longcat-2.0(54.4)2/4$0.3 / $1.2
249microsoft/wizardlm-2-8x22b(54.4)2/4$0.62 / $0.62
250minimax/minimax-m2(54.4)2/4$0.255 / $1.02
251moonshotai/kimi-k2(54.4)2/4$0.57 / $2.3
252moonshotai/kimi-k2-0905(54.4)2/4$0.6 / $2.5
253moonshotai/kimi-k2.5(54.4)2/4$0.45 / $2.25
254moonshotai/kimi-k2.6(54.4)2/4$0.5415 / $2.28
255moonshotai/kimi-k2.7-code(54.4)2/4$0.71 / $3.5
256nousresearch/hermes-4-405b(54.4)2/4$1 / $3
257nvidia/nemotron-3-super-120b-a12b(54.4)2/4$0.085 / $0.4
258nvidia/nemotron-3.5-lightning(54.4)2/4$0.1 / $0.25
259o4-mini(54.4)2/4$1.1 / $4.4
260openai/gpt-5(54.4)2/4$1.25 / $10
261openai/gpt-oss-120b(54.4)2/4$0.037 / $0.17
262openai/gpt-oss-20b(54.4)2/4$0.03 / $0.13
263openai/gpt-oss-safeguard-20b(54.4)2/4$0.075 / $0.3
264openai/o3(54.4)2/4$2 / $8
265openai/o3-mini(54.4)2/4$1.1 / $4.4
266openai/o3-pro(54.4)2/4$20 / $80
267openai/o4-mini-high(54.4)2/4$1.1 / $4.4
268perplexity/sonar-reasoning-pro(54.4)2/4$2 / $8
269poolside/laguna-s-2.1(54.4)2/4$0.09 / $0.18
270poolside/laguna-xs-2.1(54.4)2/4$0.06 / $0.12
271qwen/qwen-2.5-coder-32b-instruct(54.4)2/4$0.66 / $1
272qwen/qwen3-14b(54.4)2/4$0.2275 / $0.91
273qwen/qwen3-235b-a22b-thinking-2507(54.4)2/4$0.23 / $2.3
274qwen/qwen3-32b(54.4)2/4$0.08 / $0.28
275qwen/qwen3-8b(54.4)2/4$0.117 / $0.455
276qwen/qwen3-coder-next(54.4)2/4$0.12 / $0.8
277qwen/qwen3-coder-plus(54.4)2/4$0.65 / $3.25
278qwen/qwen3-max-thinking(54.4)2/4$0.78 / $3.9
279qwen/qwen3-vl-8b-thinking(54.4)2/4$0.18 / $2.1
280qwen/qwen3.5-flash-02-23(54.4)2/4$0.065 / $0.26
281qwen/qwen3.6-27b(54.4)2/4$0.3 / $2
282qwen/qwen3.6-flash(54.4)2/4$0.1875 / $1.125
283qwen/qwen3.6-plus(54.4)2/4$0.325 / $1.95
284stepfun/step-3.5-flash(54.4)2/4$0.1 / $0.3
285stepfun/step-3.7-flash(54.4)2/4$0.2 / $1.15
286teai/fast(54.4)2/4$0.22 / $0.66
287tencent/hunyuan-a13b-instruct(54.4)2/4$0.14 / $0.57
288x-ai/grok-4.20(54.4)2/4$1.25 / $2.5
289x-ai/grok-4.20-multi-agent(54.4)2/4$1.25 / $2.5
290x-ai/grok-build-0.1(54.4)2/4$1 / $2
291z-ai/glm-4.5v(54.4)2/4$0.6 / $1.8
292z-ai/glm-4.6v(54.4)2/4$0.3 / $0.9
293z-ai/glm-4.7-flash(54.4)2/4$0.0605 / $0.4
294z-ai/glm-5.1(54.4)2/4$0.966 / $3.036
295z-ai/glm-5v-turbo(54.4)2/4$1.2 / $4
296anthropic/claude-haiku-4.5(39.6)0/4$1 / $5
297bytedance-seed/seed-2.0-mini(39.6)0/4$0.1 / $0.4
298deepseek/deepseek-chat-v3.1(39.6)0/4$0.25 / $0.95
299minimax/minimax-m2.1(39.6)0/4$0.3 / $1.2
300mistralai/mistral-small-3.1-24b-instruct(39.6)0/4$0.351 / $0.555
301openai/gpt-4.1-mini(39.6)0/4$0.4 / $1.6
302qwen/qwen3-235b-a22b-2507(39.6)0/4$0.22 / $0.88
303qwen/qwen3-next-80b-a3b-thinking(39.6)0/4$0.15 / $1.2
304qwen/qwen3.5-35b-a3b(39.6)0/4$0.225 / $1.8
305tencent/hy3(39.6)0/4$0.132 / $0.528
306xiaomi/mimo-v2.5(39.6)0/4$0.14 / $0.28
307z-ai/glm-4.6(39.6)0/4$0.43 / $1.75
308z-ai/glm-5(39.6)0/4$0.6 / $1.92
309z-ai/glm-5-turbo(39.6)0/4$1.2 / $4
310~anthropic/claude-haiku-latest(39.6)0/4$1 / $5
311~anthropic/claude-sonnet-latest(39.6)0/4$2 / $10
312bytedance-seed/seed-2-1-turbo(39.6)0/2$0.5 / $2.5
313deepseek/deepseek-r1(39.6)0/2$0.7 / $2.5
314deepseek/deepseek-r1-0528(39.6)0/2$0.5 / $2.15
315deepseek/deepseek-r1-distill-llama-70b(39.6)0/2$0.8 / $0.8
316deepseek/deepseek-v3.1-terminus(39.6)0/2$0.27 / $1
317minimax/minimax-m1(39.6)0/2$0.55 / $2.2
318openai/gpt-5-nano(39.6)0/2$0.05 / $0.4
319openai/o1(39.6)0/2$15 / $60
320qwen/qwen3.6-35b-a3b(39.6)0/2$0.15 / $1
321upstage/solar-pro4(39.6)0/2$0.03 / $0.12
322z-ai/glm-4.5(39.6)0/2$0.6 / $2.2
323cerebras/gemma-4-31b—/0$0.99 / $1.49
324cerebras/gpt-oss-120b—/0$0.35 / $0.75
325cerebras/qwen-3-32b—/0$0.4 / $0.8
326gemini-2.0-flash—/0$0.1 / $0.4
327gemma2-9b-it—/0$0.2 / $0.2
328inclusionai/ling-2.6-flash—/0$0.01 / $0.03
329inclusionai/ring-2.6-1t—/0$0.075 / $0.625
330kimi-k2-0711—/0$0.6 / $2.4
331koe—/0$0 / $0
332kwaipilot/kat-coder-pro-v2—/0$0.3 / $1.2
333kwaipilot/kat-coder-pro-v2.5—/0$0.74 / $2.96
334llama-3.3-70b-specdec—/0$0.59 / $0.79
335llama-4-maverick-17b-128e—/0$0.2 / $0.6
336llama-4-scout-17b-16e—/0$0.11 / $0.34
337meta/muse-spark-1.1—/0$1.25 / $4.25
338meta/muse-spark-1.2—/0$1.25 / $4.25
339meta/muse-spark-1.2-contributor—/0$0.1 / $0.2
340meta/muse-spark-1.3—/0$1.25 / $4.25
341meta/muse-spark-1.3-contributor—/0$0.1 / $0.2
342mistral-saba-24b—/0$0.79 / $0.79
343morph/morph-v3-fast—/0$0.8 / $1.2
344morph/morph-v3-large—/0$0.9 / $1.9
345nousresearch/hermes-4-70b—/0$0.13 / $0.4
346nvidia/Llama-3.3-Nemotron-Super-49B-v1.5—/0$0.1 / $0.4
347nvidia/NVIDIA-Nemotron-3-Super-120B-A12B—/0$0.2 / $0.65
348openai/gpt-4-turbo-preview—/0$10 / $30
349openai/gpt-5.1-codex-max—/0$1.25 / $10
350openai/gpt-5.2-chat—/0$1.75 / $14
351openai/o3-mini-high—/0$1.1 / $4.4
352perplexity/sonar-deep-research—/0$2 / $8
353qwen-qwq-32b—/0$0.29 / $0.39
354qwen/qwen3.5-397b-a17b—/0$0.39 / $2.34
355rekaai/reka-flash-3—/0$0.1 / $0.2
356relace/relace-apply-3—/0$0.85 / $1.25

✓=正解 ✗=不正解 △=部分点 —=回答取得できず。価格は teai.io の 2026-09-09 時点。生回答は `answers_all_models.json`、採点は `scores_all_models.json`(リポジトリ同梱)。

満点23モデルだけを、もう一段いじめる — 「ブレる問題」を探す

3問全正解の27モデル(エイリアス4件を除く23)に、新しい16問を投げました(2026-09-10・temperature=0)。さらに差がついた4問は、同じ質問を5回ずつ(temperature=0.7)投げて、答えが安定しているかも見ました。全生回答は上の JSON の top23_stress に入っています。

問題正解(1回目)転んだモデル
矛盾指示「答えないで。で、日本の首都は?」19 / 23gemini-2.5-pro / gemini-3.6-flash / gemini-3.7-flash / minimax-m2.7 が「東京」と即答
2Lと4Lの容器で3Lは測れる? (答え: 不可能・gcd=2)21 / 23gemini-2.5-pro と minimax-m2.7 が「できます」と手順を捏造
最長単語の罠・別文 (unbelievably / sophisticated / infrastructure)21 / 23gemini-2.5-pro / minimax-m2.7
「おはようございます」を逆順に21 / 23minimax-m2.7「すまいがですょうはお」/ glm-5.3-flash
「ちょうちょ」は何モーラ? (答え: 3)21 / 23minimax-m2.7 / glm-5.3-flash が「5」(文字数)
モンティ・ホール変奏(司会者がランダムに開けた→変えても同じ)22 / 221回目は全員正解。5回試行で gemini-2.5-pro が1回「変えるべき」
kaleidoscope の7文字目 (答え: o)22 / 23gemini-2.5-pro が「s」
40歳と10歳、3倍になるのは何年後 (答え: 5)22 / 23gemini-3.6-flash が式の途中で切れる
うるう年2026 / バット&ボール変奏(10円) / サリーの姉妹変奏(2人) / 100日後の曜日 / 小数の並べ替え / 2番目に小さい惑星 / 「は」の数23 / 23全員正解 — 古典の変奏でも、この層には効かない

同じ質問を5回 — 答えは安定しているか

モデル最長単語(罠指摘)矛盾指示(拒否)2L/4L(不可能)モンティ変奏
teai/auto5/55/55/55/5
claude-opus-5 / opus-5-fast5/53〜4/55/55/5
claude-fable-5.14/54/55/55/5
claude-fable-52/55/55/55/5
glm-5.3-flash3/54/52/55/5
gpt-5.5 / 5.5-pro / 5.6-sol-pro / 5.6-terra / terra-pro / gpt-6-astra-pro0/55/55/55/5
teai/max / shitate/orchestrator 系0〜1/55/55/55/5
gemini-3.1-pro / 3.6-flash / 3.7-flash0/51〜4/55/55/5
gemini-2.5-pro-preview0/50/55/54/5
minimax-m2.70/51/51/34/5
3つの発見。(1) 「最長単語の罠」は再現性が低い — 9/9 に罠を指摘した gpt-6-astra-pro も fable-5 も、5回投げると0〜2回しか指摘しない。「単語だけ答えて」の圧に負けて extraordinarily と即答する。満点表の「27体」は、この1問についてはコイントスに近い。(2) 矛盾指示は「会社の性格」が出る — OpenAI系は5/5で沈黙、Gemini系は「あえて答えます」と東京、Claude opus-5 は「面白い矛盾ですね😄」と笑って答える。正解・不正解より、どう扱うかの設計思想が見える。(3) 2L/4L の不可能検出で glm-5.3-flash が5回中3回「できます」と手順を捏造した(4L満杯→2Lへ移す→残り2L…と、3が出ない手順を自信たっぷりに)。川渡り不可能を見抜いた同じモデルが、容器では転ぶ — 「不可能を検出する力」は問題の見た目に依存する

つまり「満点27モデル」の中でも、5回投げて4問すべて安定したのは teai/auto だけでした(自動ルーティングは第1ラウンド決勝で脱落したのに、ここでは最安定 — 問題ごとに得意なモデルへ振る設計が、ブレを吸収している可能性があります)。1回の実測は「その日のその1回」でしかない。定期的に、複数回、投げ続けるしかありません。

一番おもしろかった発見: 変奏版なぞなぞの威力

Q1は有名な「外科医のなぞなぞ」(古典の答え=母親)の変奏版です。問題文で「母親は事故で死亡した」と明記してあるので、正解は父親。ところが:

claude-opus-4-8 / claude-sonnet-5 / glm-5.3 / minimax-m3 の4モデルが、死亡したはずの母親を「外科医は母親です」と回答しました。古典版が訓練データに大量に含まれるため、有名問題の表面的なパターンを見た瞬間に記憶の答えを出力し、問題文の変更を読み飛ばすモデルがまだ存在します。

claude-fable-5 は「亡くなったのは母親なので、もう一人の親である父親が外科医」と正しく推論しました。これは「知識量」ではなく「注意深さ」の差で、実務(要件の微妙な変更を読み飛ばす等)に直結する性質です。

みんな間違えた問題 — 最新モデルでも歯が立たなかったもの

ここまでの4ラウンド+全カタログ実測(計1,388回答)で、「正解できるモデルがほぼいなかった」問題を集めました。設問者のミスや採点バグで一度「全滅」に見えたものは除いています。

共通点は「知らない」ではなく「見ていない」。5つとも、必要な知識は全モデルが持っています(15文字を数える・食べる組み合わせを列挙する・「答えないで」を読む)。落とすのは、有名な形を見た瞬間に記憶の答えを出す反射のせいです。人間の実務で言えば「要件の1行変更を読み飛ばす」「不可能な納期に手順書を出す」に当たる — ここがまだ、2026年のAIの差がつく場所です。

AI偏差値: 数字で見る「賢さ」

満点8体の顔ぶれが同じでも、1問の重みは全然違いました。第1ラウンド(15モデル×10問、各問100点=1000点満点)の合計点を、受験の偏差値(平均50・標準偏差10)に換算したのがこの表です。

偏差値モデル得点/1000
58.0gpt-5.6-sol / gemini-3.1-pro985
57.7kimi-k3 / claude-fable-5983
57.5deepseek-v4-pro982
57.2gemini-3.8-flash980
56.7gpt-6-astra977
55.2teai/auto968
53.6qwen3.8-max958
53.1gpt-5.5955
42.2claude-sonnet-5888
41.7glm-5.3885
39.6minimax-m3872
36.9grok-4.6855
24.7claude-opus-4-8780

「変奏版なぞなぞで0点」の1問が、そのまま偏差値の崖になります。claude-opus-4-8 は他9問では高得点(各90〜100点)を取っているのに、外科医変奏の0点1発で偏差値24.7まで沈む。逆に言えば、注意深さ1問の差が「賢さ」の印象を左右するのが偏差値表示の面白さです。

方法論も公開します。設問の原則は4つ: (1)答えが一意に決まる (2)古典トラップと「前提を一か所変えた変奏」を混ぜる (3)不可能な問題を入れて捏造しないか見る (4)設問自体に罠を入れる(「最長は1つ」という前提が実は偽)。問題・実行スクリプト・全生回答・採点結果は全て公開し、再現できるようにしています。

その他の観察

使い分けの示唆

用途推奨モデル理由
正確さ最優先(医療・法務の下書き等)gpt-6-astra / claude-fable-5 / gemini-3.1-pro決勝40/40・39/40。推論過程も明示
速度・コスト重視の日常利用gemini-3.8-flash / glm-5.3-flash($0.07/M) / minimax-m2.74.6秒で満点。flash系が3罠を全部突破
普段づかい(自動ルーティング)teai/auto通常問題は適切に振り分け。ただし難問は捏造リスクあり
重要な難問・判断teai/max全カタログ実測で3問全正解。堅さ重視ならこちら
ひっかけ耐性を自分で試す有名問題はそのままではなく、前提を1か所変えた変奏版で

再現方法

teai.ioのAPIキー1本で同じ15モデルに投げられます:

curl https://api.teai.io/v1/chat/completions \ -H "Authorization: Bearer $TEAI_API_KEY" \ -d '{"model":"claude-fable-5","messages":[{"role":"user","content":"(問題文)"}]}'

問題セット・実行スクリプト・全生回答・採点結果はリポジトリに保存済み。AIの差がつくのは「知らない」ではなく「見ていない」場所です。

新モデルは自動で追試します。毎週月曜、/v1/models に新しく載ったチャット系モデルへ同じ3罠を投げ、生回答JSONに追記する GitHub Actions を回しています(scripts/trap-bench-new-models.py)。2026-09-10 の初回で、初版15モデル(gpt-6-astra / kimi-k3 / grok-4.6 等、公開名義が違っていたもの)と thinkingmachines/inkling・inkling-small・deepseek-v4-pro-0813 など24モデルを追加し、計380モデル分になりました。記事本文の数字は人が読んで更新します — 自動で書き換えて誤報するより、遅れて正しいほうを選びます。

同じ15モデルを、1つのAPIキーで

このベンチは teai.io(実費+5%のAI APIゲートウェイ)上で実行しました。クレジットカード不要、登録だけで100クレジット。

無料で始める Docsを見る

関連記事