# コスト・追加モデル比較(2026-09-14) 同じタスク管理Webアプリの指示・共通ブラウザ検証20項目。GLM-5.3 Flash / HY4 PreviewはSenteで新規に同時実行。 ## 実測比較 **今回の追加試行ではHY4が正常終了し、20/20項目に合格。GLM FlashはAPIエラーでJavaScript生成前に停止し、3/20です。** GLMの安い金額を完成品単価として評価しません。3件の合格には未完成UIで通る静的な項目が含まれます。 | 製品・モデル | 実行時間 | 終了状態 | 機能検証 | 今回の成果物1件あたり推定費用 | API回数 | 入力 / 出力tokens | |---|---:|---|---:|---:|---:|---:| | Claude Code + Sonnet 4.6 | 254.4秒 | 費用予約枠で停止 | 20/20 | 約92.05円 | 16 | 119,936 / 17,761 | | Sente + Sonnet 4.6 | 236.0秒 | API生成エラー | 20/20 | 約72.12円 | 24 | 89,418 / 14,826 | | OpenCode + Sonnet 4.6 | 295.3秒 | 費用予約枠で停止 | 20/20 | 約89.67円 | 22 | 105,757 / 19,513 | | Sente + GLM-5.3 Flash | 196.1秒 | API生成エラー | 3/20 | 約0.15円+未確定分 | 2 | 5,934 / 3,010 | | Sente + HY4 Preview | 279.6秒 | 正常終了 | 20/20 | 約16.27円 | 23 | 83,601 / 16,381 | **時間は終了状態とセットで読む必要があります。** Sonnetの3製品は正常完了していないため、停止時間を完了速度の順位にしてはいけません。20項目の点数は全要件の品質保証ではありません。 推定費用 = API返却の入力/出力usage × 実行時点のteai公開単価。6 credits ≒ 1円。キャッシュ割引は適用していません。GLMには未確定リクエストが1件あり、表示費用は判明分のみです(予約額込み保守的計上は約2.34円)。最終請求額・提供元の内部ルーティングは未確認。APIの応答model名は `evidence/models/ledger.json` に記録。 ## 費用の見方 - **Claude Code + Sonnet 4.6**: 成果物試行 約92.05円、予備確認/前の失敗試行も含む通算 約126.39円。合格チェック1項目あたり約4.603円。費用未確定リクエスト 0件。 - **Sente + Sonnet 4.6**: 成果物試行 約72.12円、予備確認/前の失敗試行も含む通算 約122.70円。合格チェック1項目あたり約3.606円。費用未確定リクエスト 0件。 - **OpenCode + Sonnet 4.6**: 成果物試行 約89.67円、予備確認/前の失敗試行も含む通算 約139.92円。合格チェック1項目あたり約4.483円。費用未確定リクエスト 0件。 - **Sente + GLM-5.3 Flash**: 成果物試行 約0.15円、予備確認/前の失敗試行も含む通算 約0.15円。合格チェック1項目あたり約0.050円。費用未確定リクエスト 1件。 - **Sente + HY4 Preview**: 成果物試行 約16.27円、予備確認/前の失敗試行も含む通算 約16.27円。合格チェック1項目あたり約0.814円。費用未確定リクエスト 0件。 「合格チェックあたり」はこの固定20項目に対する参考値です。機能の難易度を重み付けしておらず、一般的なコスト性能の指標ではありません。成果物費用は修正や追加作業を含まない1試行の値です。 - 前回全試行/予備確認: 推定 約389.00円 - 今回GLM/HY4追加: 推定 約16.42円 - **合計推定(判明分): 約405.43円+未確定分** - 不確かな応答の予約額と安全係数込み保守的計上: 約610.31円(承認上限1,000円以内) ## モデル単価(実行前取得) | モデル | 入力1,000tokens | 出力1,000tokens | |---|---:|---:| | Sonnet 4.6(前回) | 2.646 credits ≈0.441円 | 13.23 credits ≈2.205円 | | z-ai/glm-5.3-flash | 0.066087 credits ≈0.01101円 | 0.236025 credits ≈0.03934円 | | tencent/hy4-preview | 0.735588 credits ≈0.12260円 | 2.205882 credits ≈0.36765円 | ## 比較条件の差と制約 - GLMは `z-ai/glm-5.3-flash`、HY4は `tencent/hy4-preview`。通常版GLM-5.3は今回実行していません。 - Sente本体と隔離設定、ツール、プロンプトは前回Sente試行に合わせた。GLM/HY4は同時スタート、Sonnetとは実行時間帯が異なる。 - GLM/HY4の最大出力枠は32,000tokens(前回Sonnetは16,000)。途中切断を避けるための変更で、完全同条件ではありません。 - temperature=0 / thinking=disabledを指定したが、非Claudeモデルへの変換・推論設定の適用はサーバ依存で未確認。 - 生成物をこちらで修正せず採点。画面はブラウザで記録し、主観的な美しさの順位は未採点。 - 前回同様、正常終了後または停止後に成果物を検証。初回合格時刻は未計測。1回ずつなので再現性や平均速度は未評価。 ## 保存物 HY4はインライン編集方式で、メモ・優先度・日付の変更保存も追加検証に合格(`evidence/models/supplement.json`)。保存データを読み込み時に正規化する (`hy4/project/app.js:46-57`) 一方、localStorage保存失敗を通知せず無視する (`:60-64`) 弱点があります。これは通常の保存テストとは別の未対応ケースです。 - `models-live.mp4`: SenteのGLM/HY4実行画面を2列同時録画(実CLIログ表示)。 - `glm/project`, `hy4/project`: 生成物原本。各 `verification.json` が共通20項目の結果。 - `cost-comparison.json`: 5条件の費用/速度/採点集計。 - `evidence/models/`: 使用単価、モデルID、各API usageと時刻、実行設定、検証スクリプト。 - `REPORT.md`: 前回3製品比較の詳細。今回の結論は本ファイルを参照。