訂正・使い方の更新

訂正:ローカルLLM比較の採点ミスと、いま勧める使い方

以前のローカルLLM比較には、正解条件・得点の尺度・最終回答の判定に誤りがありました。旧ランキングと、それに基づくローカル/クラウドの優劣の断定を撤回します。いま勧めるのは、モデルへの前置きに頼るより、計算とデータ保持を外部で確かめる使い方です。

公開 2026-09-12
訂正・更新 2026-09-13
対象 旧ローカル比較・プロンプト比較

いまは、電卓とJSONの保持チェックから

計算は電卓・決定的コードで確かめる。JSONは構文・スキーマだけでなく、入力の値が保持されたかを照合する。導入はこの2つから始めることを勧めます。具体的な手順と実測の範囲は、「いま勧めるAIの検証:電卓とJSONの保持チェックから」にまとめています。

JSONを整形・修復するときも、ID・数値・文字列などが勝手に変わっていないかを確認します。検証に失敗した出力をそのまま採用せず、入力と照合して直します。クラウドモデルで同じ検証方式がどれだけ改善するかは未検証で、あらゆる用途での正答を保証するものではありません。

訂正1:「最長を1つ選べ」は、同率の片方でよい

旧記事は、次の英文から「最も長い単語を1つだけ選べ」という指示を、最長が一意であるという前提だと誤解していました。

The extraordinarily complicated synchronization failed.

extraordinarily と synchronization はどちらも15文字です。同率でも、どちらか1つを選べば選択として正解です。「同率だから選べない」と指摘することを必須にした採点が誤りでした。文字数を16文字と説明した場合の誤りは、単語の選択とは分けて評価する必要があります。

訂正2:得点の尺度と、最終回答の有無を混同した

3問中2問正解なら、1問1点では2/3、1問2点の尺度にそろえるなら4/6です。旧記事の「2/6」は分子と分母の尺度が混ざった誤表記でした。これは尺度の説明であり、個々のモデルの訂正後得点を示すものではありません。

また、思考がループして最終回答が出なかった出力は無効(最終回答なし)です。思考中に正解らしい語があっても、完成した正答として数えられません。正解条件と最終回答をそろえた再評価が必要なため、ここでモデル別の得点を付け直すことはしません。

以上から、旧得点表・ランキング・偏差値による位置づけを撤回します。この比較からローカルとクラウドの優劣は判断できません。

訂正3:プロンプトと量子化の効果は、この数字では言えない

旧追記の「前提を疑え」で15/21→18/21という集計にも、誤った正解条件が含まれます。この差を改善効果の証拠にはできません。「両方で効いた」「短くすると考える時間が削られて正答率が落ちる」といった効果・原因の断定も撤回します。

「量子化してローカルに載せた瞬間に注意深さが落ちる」という説明も撤回します。量子化以外の条件をそろえた対照比較をしておらず、量子化による性能低下は未測定です。

記録の扱いと、使い分けの考え方

今回の訂正では、過去の生回答・実行ログ・旧集計は書き換えていません。旧集計は当時の記録であり、有効な比較結果として引用しないでください。旧記事にあった生回答JSONの公開リンクは、閲覧できることを保証できないため外しました。

ローカルかクラウドかは、データの扱い・実行環境・費用と、実際の用途での検証結果から選びます。「ローカルは下書き、クラウドなら正しい仕上げ」という旧推奨は撤回します。どちらを使う場合も、まずは計算結果とJSONの値を確かめるところから始めてください。

いま勧める検証の使い方を読む

電卓とJSONの保持チェックから。実測で分かった範囲と、まだ分からない範囲を確認できます。

現在の推奨と検証結果 →