MEASURED · 2026-10-04 JST · 12 TASKS / 26 RESPONSES

正解でも、そのまま使えるとは限らない。

GPT-6.1 SolとGemini 3.8 Flashに、同じ小さな12課題を渡しました。Solは返答そのままで12件合格。Flashは11件合格で、応答時間の中央値は短め。残るSQLも、Markdownのコード囲みだけを除くと同じ検査に合格しました。

各課題1回、teai.ioの開発者が自社API経由で測った小規模な合成課題の記録です。独立第三者評価でも、モデル全般の順位でもありません。

今回の実測結果

モデル厳密合格囲み除去後*応答中央値13リクエスト費用推計
GPT-6.1 Sol12/1212/124.275 s¥1.4883
Gemini 3.8 Flash11/1212/122.699 s¥1.3161

*事後の原因確認です。Flashで不合格だった1応答の外側のSQLコード囲みだけを除き、変更していないSQLテストデータで再検査しました。厳密合格数は変えていません。他の応答も囲み除去で直ると保証するものではありません。

26リクエストすべてHTTP 200でした。返答のモデル名とゲートウェイのserved情報は指定モデルと一致し、全件fallback_depth=0。実際の経路は両モデルともOpenRouterと記録されています。これはゲートウェイの申告情報の照合であり、上流モデルの実体を独立に証明したものではありません。

時間は送信からHTTP応答全体の受信・JSON読込までで、通信とゲートウェイの時間を含みます。最初のトークンまでの時間ではありません。中央値は各13リクエストで、ツールの2往復を別々に含みます。Solの最大観測値は32.867秒で、中央値だけでは待ち時間の体験を表せません。

SQLの不合格は、形式の違いでした

修正課題では「SQLite SQLだけ」と指定しました。Flashは答えをMarkdownのコード囲みで包み、その全文をSQLiteへ渡すと実行に失敗しました。冒頭と末尾の囲みだけを除くと、同額の別請求、複数支払い、請求のない顧客を含め、期待した行と列名が得られました。

```sql
SELECT
  c.id AS customer_id,
  COALESCE(inv.billed, 0) AS billed,
  COALESCE(pmt.paid, 0) AS paid
FROM customers c
LEFT JOIN (
  SELECT customer_id, SUM(amount) AS billed
  FROM invoices
  GROUP BY customer_id
) inv ON c.id = inv.customer_id
LEFT JOIN (
  SELECT i.customer_id, SUM(p.amount) AS paid
  FROM payments p
  JOIN invoices i ON p.invoice_id = i.id
  GROUP BY i.customer_id
) pmt ON c.id = pmt.customer_id
ORDER BY c.id ASC;
```

答えをそのまま実行するソフトウェアでは、形式も仕様の一部です。人が確認する作業なら、この返答は小さな整形で使える可能性があります。「SQLを考え間違えた」とまとめず、両方の見方を残します。

12課題で確かめたこと

課題SolFlash
請求・入金集計と未定の期日PASSPASS
予算提案と承認済みの区別PASSPASS
記録内の不正な指示の扱いPASSPASS
値引き・送料・税・クーポン計算PASSPASS
固定UTC+09:00への時刻変換PASSPASS
矛盾する論理条件PASSPASS
並び順の制約PASSPASS
返品規則の境界条件PASSPASS
アクセス規則と拒否優先PASSPASS
SQLの顧客別集計PASSPASS
SQLのJOIN重複修正PASSFAIL · コード囲み
指定ツール呼出と最終JSONPASSPASS

ツールはlookup_orderを強制指定し、引数を検査した後に固定の架空結果を渡して最終JSONを検査しました。自律的なツール選択や実注文サービスの検証ではありません。SQLの2課題は小さな同一のメモリ内テストデータを共有し、SQL全般を独立に網羅しているわけではありません。

条件と費用の数え方

既存の合成課題を再利用したもので、新しい非公開テストではありません。1回の測定から再現率や統計的優位は推定できません。長文コンテキスト・画像・自由作文・コード開発・自律エージェントは対象外です。経路や混雑で応答時間も変わります。

記録を確かめる

全26応答・課題文・料金スナップショット・集計(JSON)

JSONのsourcesに、ベンチ実行コード(task_benchmark_20261004.py)、課題文と採点(pareto_benchmark.py)、SQLiteテストデータと架空ツール(evaluate_selected_models.py)を収録しています。後ろ2つは再利用した依存コードで、各ファイルの単独実験用設定は今回の実行条件ではありません。今回の固定条件はmanifest.configにあります。

今回の学びは、内容と形式を分けて確かめることです。Solは12件とも直接使える返答。Flashは中央値の待ち時間が短く、1件だけ囲み除去が必要でした。モデルを選ぶ前に、実際のソフトウェアが求める仕様に合った検査を用意することが大切です。