IFEVAL30 · 2026-09-24

訂正:IFEval30の欠測と測定手順の不備。

訂正と撤回(2026-09-24)

訂正:当初の欠測ゼロ補完による主表を撤回します。欠測をモデル誤答として扱うのは不適切でした。Xの「1/10」という費用倍率の誤記も撤回します。予約30件で割った1件価格を削除し、保存usage件数を示します。

現行の主表は全3モデル共通で応答が保存された27問だけの参考比較です。2471/2386/3326を全モデルから事後除外しました。計画どおりの成功試験ではなく、順位は断定できません。共通27問にも停止後の続行分が含まれ、条件違反は解消されません。

費用不明はunbiased/paretoの2471/2386/3326の3件です。当初summaryは2471のusage未保存を見落とし、2件と誤記しました。2133円は予算予約であり、実費上限の保証ではありません。保存usageの推計と、欠測・上流失敗を含む実費未確定を分離します。

共通27問の参考比較(事後除外)

全モデルで同じ問題IDを使用。順位表ではありません。
指標anthropic/claude-opus-5.5openai/gpt-6-astraunbiased/pareto
Strict・問題単位23/27 (85.19%)22/27 (81.48%)22/27 (81.48%)
Loose・問題単位26/27 (96.30%)23/27 (85.19%)24/27 (88.89%)
Strict・指示単位46/50 (92.00%)44/50 (88.00%)44/50 (88.00%)
Loose・指示単位49/50 (98.00%)45/50 (90.00%)46/50 (92.00%)

問題単位は全指示の遵守、指示単位は個々の制約の遵守です。Strictは原応答、Looseは公式採点器の緩和処理後の判定です。

全30問:正・誤・不明を分ける

ここでの正・誤はStrict問題単位の指示遵守で、内容の事実性ではありません。欠測は不明であり誤答ではありません。

anthropic/claude-opus-5.5

正 26 / 誤 4 / 不明 0

openai/gpt-6-astra

正 25 / 誤 5 / 不明 0

unbiased/pareto

正 22 / 誤 5 / 不明 3

unbiased/paretoの2471はidentityルール停止で本文・usage未保存。2386は予約後にプロセス停止で結果喪失。3326はusage超過停止で本文・usage未保存です。

予約90件、結果89件、abandoned 1件、記録上のHTTP errors 0件。上流内部の失敗数ではありません。

保存usageの費用推計(円)

モデル保存usage件数推計(円)
anthropic/claude-opus-5.530108.956988
openai/gpt-6-astra3092.385090
unbiased/pareto2716.035495

保存usage合計87件、推計217.377573円。費用不明3件。予算予約2133円、実費は未確定です。

方法と測定側の不備

IFEval公開問題からseed=20260924で事前抽出した独立30問です。temperature=0を指定(anthropic/claude-opus-5.5はgatewayが省略)、max_tokens=4096。これらは要求設定であって遵守保証ではありません。追加system指示・履歴・ツール・問題翻訳なし。公式採点器を使用し、LLM採点・合成smoke結果の混入はありません。

測定側不備:usage>4096で停止した後、原因解消の確認・明示的な再開承認なしに4件を続行しました。03:33:54 UTCのconfig revision後、anthropic/claude-opus-5.5/3326 → unbiased/pareto/3376 → anthropic/claude-opus-5.5/3376 → openai/gpt-6-astra/3376です。runnerに恒久haltがなく、実行ごとにhalt状態をクリアしていました。上限を保証できたとは言えません。

「再試行なし」を訂正:クライアント再試行は0回ですが、gatewayは同一モデルを最大2回試行し得ます。上流失敗のusageは不明で、fallback_depth=0も内部再試行なしの証明ではありません。

gatewayは非streamのfinish_reasonをstopへ書き換えます。出力打切りは未検証です。servedはgatewayが示した指定model情報であり、上流モデル実体を証明しません。identity判定も途中でserved-model一致のみへ変更されました。

限界

IFEval公開問題から独立に抽出した30問のサブセットです。公式フルIFEvalでも、総合ランキングでもありません。コード能力は未測定です。

IFEvalは2023年公開のデータです。評価モデルの学習への混入・汚染は未知であり、汚染なしとは主張しません。seed固定は学習汚染を防ぎません。

生応答は短い2問×3モデルだけを内容確認・完全一致ハッシュ固定して収録します。個人情報・秘密情報の疑い、未レビュー、ハッシュ不一致は原文を除外し、判定要約のみ残します。非公開の原文があるため、公開JSONだけで全問を再採点することはできません。

共通27問の事後比較です。信頼区間は選択偏りや測定手順違反を補正せず、統計的優位や順位は主張しません。

TTFTは未測定です。旧版の応答時間はHTTP完了までの通常応答集計で、同じ共通27問の再集計ではないため現行の主表から外しました。隠れた推論量も統一していません。

費用は保存された返却usageと当時の単価からの推計で、確定請求・残高差分ではありません。未保存分や上流失敗をゼロ円とは扱いません。

現行集計は元scoresの問題別判定とledgerから独立再計算しました。生ledger・元scoresは不変です。旧summaryは撤回履歴だけに残し、現行数値の正本にはしません。

旧版の訂正履歴:撤回済み

以下は501d255公開時の旧表です。欠測のゼロ補完・不明費用の漏れ・異なる母数の平均価格を含むため撤回しました。現行の主張ではありません。旧値は監査用に残し、変更しません。

撤回済み旧表を表示
同じ30問・各1回。比率は0〜1。
指標anthropic/claude-opus-5.5openai/gpt-6-astraunbiased/pareto
Strict・問題単位0.8670.8330.733
Wilson 95%信頼区間0.7032–0.94690.6644–0.92660.5555–0.8582
Strict・指示単位0.9290.8930.786
Loose・問題単位0.9670.8670.800
Loose・指示単位0.9820.9110.821
保存された通常応答 / 30303027
Strict・通常応答のみ(参考)0.8670.8330.815
完了時間の中央値(秒)11.212.818.4
完了時間のp90(秒)21.521.940.9
usage推計合計(円)108.9692.3916.04
usage推計 / 30件(円)3.633.080.53
usage取得件数303027

証拠と帰属

訂正集計・source rows・適用ルール・旧表問題・原資料ハッシュ(JSON)

Google Research IFEvalデータはCC-BY-4.0、採点コードはApache-2.0です。変更は独立抽出・事後共通集合の選択・公開原文の限定。問題原文は再配布しません。収録6応答は確認済みのモデル生応答そのものであり、記事の事実主張ではありません。

Google Research IFEval · CC-BY-4.0