日本語で働けるLLMはどれ?
15モデルを同一148問で実測比較【2026年7月】
「日本語がうまいモデル」と「日本語で仕事を任せられるモデル」は別物です。敬語のメールをそのまま取引先に送れるか。「50字以内」を守れるか。全角半角や大字(壱・弐・参)の表記規約に従えるか。 この記事では、teai.io経由で使える15モデルに同じ148問を同一条件で出題し、総合スコアではなく「どこで転ぶか」を実測しました。
測ったもの: 6軸148問
- 敬語・ビジネス文書(30問): 謝罪文・稟議書・弔事挨拶状・敬語の添削など
- 表記規約(27問): 全角半角・和暦・大字・単位記号(㎡/㎥)・金額表記
- 日本語推論(28問): 営業日計算・消費税・締め支払いサイト・多重否定の読解
- 日本固有知識(27問): インボイス制度・建築基準法・架空の法律名への幻覚チェック
- 指示追従(15問): 「JSONのみ」「50字以内」「敬語禁止」などの制約遵守
- 言語固定(21問): 中国関連の質問に日本語で答え続けられるか+回答内容の中立性
採点は機械採点(完全一致/正規表現)+LLMルーブリック採点+機械failの全件人手級再検証の3層。方法の詳細と限界はShitate LAB NOTES #5に全公開しています。
結果: 大型モデルの部(7モデル)
| モデル | 総合 | 敬語 | 表記 | 推論 | 知識 | 指示 | 中立性 |
|---|---|---|---|---|---|---|---|
| GPT-5.6 sol | 94% | 23/30 | 26/27 | 28/28 | 27/27 | 15/15 | 20/21 |
| Claude Sonnet 5 ※ | 94% | 30/30 | 22/27 | 28/28 | 27/27 | 12/15 | 21/21 |
| Sakana fugu-ultra | 93% | 25/30 | 26/27 | 28/28 | 24/27 | 14/15 | 21/21 |
| Kimi K3 | 92% | 26/30 | 23/27 | 28/28 | 26/27 | 13/15 | 14/21 |
| DeepSeek V4 Pro | 89% | 22/30 | 24/27 | 28/28 | 26/27 | 13/15 | 12/20 |
| GLM-5.2 | 88% | 23/30 | 23/27 | 28/28 | 27/27 | 13/15 | 16/17 |
| Qwen3.5-397B | 87% | 21/30 | 20/27 | 28/28 | 27/27 | 13/15 | 14/21 |
※ 採点のjudgeにClaude系モデルを使用しているため、Claude系のスコアは同族バイアスの可能性を割り引いて読んでください。
結果: 小型モデルの部(8モデル)
| モデル | 総合 | 敬語 | 表記 | 推論 | 知識 | 指示 | 中立性 |
|---|---|---|---|---|---|---|---|
| GPT-5.4 nano | 87% | 21/30 | 23/27 | 28/28 | 24/27 | 13/15 | 21/21 |
| Qwen3.5-27B | 86% | 23/30 | 20/27 | 28/28 | 23/27 | 13/15 | 17/21 |
| Claude Haiku 4.5 ※ | 82% | 22/30 | 23/27 | 28/28 | 25/27 | 3/15 | 21/21 |
| Qwen3.5-9B | 80% | 21/30 | 21/27 | 28/28 | 19/27 | 12/15 | 15/18 |
| Nemotron-3 Nano 30B | 79% | 15/30 | 21/27 | 25/28 | 21/27 | 14/15 | 21/21 |
| Gemma-3-27B | 78% | 23/30 | 21/27 | 24/28 | 21/27 | 6/15 | 21/21 |
| Mistral Small 3.2 † | 78% | 15/28 | 19/25 | 24/26 | 20/25 | 9/12 | 18/18 |
| phi-4 | 76% | 23/30 | 20/27 | 24/28 | 19/27 | 6/15 | 20/21 |
† 14問がゲートウェイ側の恒常エラーで測定不能のため分母から除外(105/134)。
スコアより大事な「転び方」3つ
1. 敬語は「生成」と「添削」で別の能力。 どのモデルも謝罪文や稟議書は上手に書きます。しかし「この文の敬語の誤りを直して」と頼むと、Kimi K3は修正案自体に二重敬語を書き、 GPT-5.6はメール本文にMarkdownの太字記法を残します。文書生成をパイプラインに組むなら、後段に表記チェックを1段挟むのが現実解です。
2. 小型モデルは知識ではなく「規律」で落ちる。
Haiku 4.5の指示追従3/15の中身は、「JSONのみで返せ」への```jsonフェンス付与、50字指定に55字——内容は正しいのに厳密さで落ちるfailがほとんどでした。
パーサが壊れる種類の失敗なので、小型モデルを組み込むときは出力の後処理(フェンス除去・長さ検証)を必ず入れてください。
3. いちばん静かな失敗は、流暢な日本語で起きる。 中国系の大型オープンモデル4つ(K3・DeepSeek・GLM・Qwen)は、新疆・香港などの質問に対し、 完璧な日本語のまま特定の政府見解だけを事実のように答えるケースがありました(K3で21問中6問)。かつて観測された「中国語の定型文が返る」現象は今回ゼロ。 興味深いことに同系列でも小型モデルではこの傾向はほぼ観測されませんでした。 報道・国際政治・人権を扱う用途では、モデルのルーティング(該当話題だけ別モデルに振る)を推奨します。 この問題への私たちの向き合い方は方針記事「私たちの方針は『直さない』」にまとめました。
API運用で今日から使える実装知見
- 空応答リトライは全モデル必須: 思考型モデルは思考でmax_tokensを使い切ると、
finish_reason: stopのまま本文が空になります。DeepSeekは8,000トークンでも6件発生。contentの空チェック+予算2倍リトライを入れてください - max_tokensは4,000以上: Kimi K3は4,000確保で148問中の空応答ゼロでした(以前の検証で問題が出たのは400設定が原因)
- 並列数は控えめに: 36並列で一部プロバイダの502が多発、3並列で安定しました。ベンチマークや一括処理では並列数の設計が結果を左右します
FAQ
Q. 結局どのモデルを選べばいいですか?
A. 用途次第です。敬語文書の下書きならSonnet 5かK3、コスト重視の定型処理ならGPT-5.4 nanoかQwen3.5-27B、報道・国際政治を扱うならGPT系かClaude系かfugu-ultraへのルーティングを推奨します。この記事の表を「弱点の逆引き」として使ってください。
Q. 自分のユースケースで同じ比較をしたい。
A. teai.ioならbase_urlを1行変えるだけで、この記事の15モデルすべてを同じコードで叩けます。まずは無料枠でどうぞ。