TEAI DECIDE · GROQ × GPT-OSS 120B

文章を、次のアクションへ。

どの担当へ? どのくらい急ぐ? 返金の相談?
文章から、選択・段階評価・Yes/Noを一括判定。型の決まったJSONで、アプリの処理につなげます。

1回 2cr ≈ ¥0.33最大20問を一括判定Strict JSON Schema

teai Inbox — Support triage · Build notes / 実測・実演動画

人が確認する下処理にはEconomy(20B low・1cr)も選べます。追加の確認用8例では23/24正解、Standardは24/24。Inboxで用途と結果を確認できます。

文章を入れて、試す

判定する質問を編集(JSON)

入力したキーは保存しません。 ログイン · APIキーを取得

入力と質問をGroqに送信します。上流エラー時は返金。自動再試行・別モデルへの代替はしません。

判断の結果

判定すると、ここに結果が表示されます。

Yes/Noは二値の判定です。確率・信頼度は返しません。判定には誤りがあり得るため、重要な処理は人が確認してください。

使い方

  1. teaiにログインするか、個人APIキーを入力します。
  2. サンプルを選ぶか文章を入力。必要なら質問と選択肢を編集します。
  3. 判定ボタンで実行。担当・緊急度・Yes/Noと、実際の応答時間を確認できます。

問い合わせの振り分け、優先順位付け、処理先の選択に。判定API自体は、返金やメール送信などのアクションを実行しません。

APIから、同じ判断を。

POST /v1/decisions · model: teai/decision-120b · 1リクエスト最大12KB / 20問 · 成功時2cr

curl https://teai.io/v1/decisions \
  -H "Authorization: Bearer $TEAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"teai/decision-120b","state":"Please refund me.","questions":{"refund":{"type":"noul","instructions":"Is a refund requested now?"}}}'
{
  "model": "openai/gpt-oss-120b",
  "requested_model": "teai/decision-120b",
  "provider": "groq",
  "output_semantics": "categorical",
  "confidence_available": false,
  "answers": {"refund": {"type": "noul", "yes": true}},
  "billing": {"credits": 2}
}

応答例は抜粋です。実際にはidとusageも返します。

Choice: criteriaのキーから選択。Score: criteria配列の0始まりの整数とlegend。Noul: yesをtrue/falseで返します。Jevの確率出力とは異なるため、モデル切り替え時は返答形式を確認してください。

401: 認証が必要 · 402: 残高/キー上限 · 400/413: 入力不正 · 502: 上流失敗・返金済み · 503: サービス/課金処理を確認できない状態。応答不明時は利用履歴を確認してから再実行してください。

比較して、選びました。

GPT-OSS・Qwenなど5モデルの推論設定を比較。採用版はGPT-OSS 120B・medium+汎用判定プロンプトです。選定用48例で144/144、新規24例で72/72。上流応答の中央値はそれぞれ1.09秒・1.30秒でした。

Qwen 3.8・highも同じ72例で全問正解、中央値0.82秒・0.89秒。今回は厳密なJSON出力、本番向けモデル、約1/6の推定原価を重視して120Bを採用しました。速さだけならQwenが上回りました。

2026年9月21日の自作・小規模評価。72例には類似した条件違いの問題を含みます。一般精度や「世界最高」を示すものではなく、Web/API全体の応答時間でもありません。初期設定では誤判定があり、指示と推論量を改善しました。

Groq Structured Outputs · プライバシー

追試・訂正:Qwen 3.8もStrict JSONに対応し、新規12回で正常出力を確認しました。前回はJSON-objectモードで測っていたため、Strict対応を120B固有の優位とは扱いません。追加比較はInboxの開発記録で公開しています。