CはLLMが最も苦手とする言語の一つ。実測データで成功率の差を可視化し、Claude Sonnet 5 + AddressSanitizer検証ループやKimi K2.6/K3の使い分けなど、CをLLMに書かせる際のベストプラクティスを解説。
結論から: CはLLMが最も苦手とする言語の一つ。Python/TypeScript比で成功率が20-30pt低い実測データがある。Cを書かせるなら Claude Sonnet 5 + AddressSanitizer/valgrind検証ループが定石。コスト重視なら Kimi K2.6($0.60/M in)、最高精度なら Kimi K3(93.4% SWE-bench Verified)、GLM-5.2は実測未確認。teai.ioで base_url 1行差し替えで全モデル横断検証可能。
ben.terhech.de(2025年1月、17モデル×4言語)で同一LLMでも言語ごとに大きな開き:
| 言語 | o3-mini成功率 | Claude 3.5 Sonnet成功率 |
|---|---|---|
| Python | 89% | 81% |
| TypeScript | 73% | 81% |
| Swift | 69% | 71% |
| Rust | 65% | 62% |
Cはこのベンチマーク対象外だが、Rustと同等以上にポインタ・手動メモリ管理・未定義動作(UB)の罠が多く、LLMがミスを静かに埋め込みやすい言語。arXiv 2406.12655でも「コード生成ベンチマークはほぼPython中心で他言語は精度が低い」と明記。
同一ベンチマーク(ben.terhech.de)で Python/TypeScriptが突出して高い。
| 言語 | 学習データ量 | 文法単純さ | 型チェック即効性 | 生成速度 | 実用推奨度 |
|---|---|---|---|---|---|
| Python | ◎ | ◎ | △(動的) | ◎ | ★★★★★ |
| TypeScript | ◎ | ○ | ◎(静的) | ○ | ★★★★★ |
| Go | ○ | ◎ | ◎ | ◎ | ★★★★☆ |
| Rust | △ | △ | ◎ | △ | ★★★☆☆ |
| C | △ | △ | △ | △ | ★★☆☆☆ |
実用の結論: 「AIに書かせるなら」TypeScriptかGoがバランス最良。Cは性能が必要な部分だけに限定し、残りをPython/TSで書くのが正解。
CはLLMのミスが「静かに腐る」(UB・メモリリーク・バッファオーバーフロー)。生成→即検証ループを回すのが定石。
| フェーズ | すること | しないこと |
|---|---|---|
| Plan | 仕様を先に明文化(曖昧な要件ほどLLMは勝手に補完して間違える) | 一括で巨大な生成を依頼 |
| Implement | 関数単位の小さなdiffで重ねる | 生成結果をそのまま信用 |
| Verify | コンパイル・ASan実行・テスト実行の全パス必須 | 「動いたように見える」で完了 |
| 順位 | モデル | Weighted Coding | SWE-bench Verified | 価格(in/out per 1M) | 特徴 |
|---|---|---|---|---|---|
| 1 | Claude Mythos 5 | 81.4% | 95.5% | $10/$50 | 最高精度・高コスト |
| 2 | Claude Fable 5 | 81.2% | 95% | $10/$50 | 推論特化 |
| 3 | GPT-5.6 Sol | 78.8% | — | $5/$30 | OpenAI最強 |
| 4 | Kimi K3 | 78.4% | 93.4% | $3/$15 | コスパ最良・オープンウェイト |
| 5 | Claude Opus 5 | 78.3% | 96% | $5/$25 | バランス |
| 17 | GLM-5.2 | 64.6% | — | $1.40/$4.40 | 安価・実測少なめ |
※ Weighted Coding = SWE-bench Pro 50% + LiveCodeBench 50% の加重スコア
| モデル | C向け評価 | 推奨用途 | 注意点 |
|---|---|---|---|
| Claude Sonnet 5 / Opus 5 | 実績・精度ともに最上位 | 本番の難所・設計レビュー | 高コスト($2-5/$10-25) |
| Kimi K3 | 93.4% SWE-bench Verified(第三者検証済) | 品質勝負・大規模リファクタ | APIは$3/$15、自ホストなら重量級(1.5TB/4-bit) |
| Kimi K2.6 | 80.2% SWE-bench Verified | 日常の大量生成+検証ループ | $0.60/$2.50でコスパ圧倒的 |
| GLM-5.2 | 64.6%(総合)・C特化データ未確認 | 低コスト実験 | 独立したCベンチマーク未確認 |
前回のベイクオフ記事(「このクオリティで、この値段」を実測した)から、同一タスク(営業日計算Python関数・7ケース機械採点)での実測:
| モデル | 判定 | レイテンシ | コスト(USD) | 円換算($1=150) |
|---|---|---|---|---|
| deepseek/deepseek-v4-pro | ✅ PASS | 23.0s | $0.00023 | 0.03円 |
| z-ai/glm-5.2 | ✅ PASS | 15.3s | $0.00225 | 0.34円 |
| moonshotai/kimi-k3 | ✅ PASS | 5.4s | $0.00319 | 0.48円 |
| claude-sonnet-5 | ✅ PASS | 5.8s | $0.00721 | 1.08円 |
読み解き:
teai.io は 95+ モデルを1つのAPIキーで、Anthropic互換(/v1/messages)とOpenAI互換(/v1/chat/completions)の両方を提供。価格は上流原価+5%の自動導出。
メリット:
te-bakeoff/bake.py等)を流用して自動評価| 判断軸 | 推奨 |
|---|---|
| Cを書かせる言語としての適性 | 低い(Python/TS比で成功率-20-30pt)。性能必須箇所のみに限定 |
| 最高精度モデル | Claude Opus 5 / Sonnet 5 (実績最厚) |
| コスパ最良(クラウドAPI) | Kimi K3 — 93.4% SWE-bench Verifiedで$3/$15 |
| 日常運用の実用最適解 | Kimi K2.6 — 80.2%で$0.60/$2.50、検証ループ込みで破綻しない |
| GLM-5.2 | 安いがC特化の第三者検証未確認。実験用途に留める |
| 必須プラクティス | 生成→ASan/valgrind→テスト実行の全自動ループ。これがないとCは危険 |
ANTHROPIC_BASE_URL 差し替えで即試せる