← Blog
2026-08-15 · 6 min read

Koe本人声TTSでボイスボットを作る — LLMと音声が1つのAPIで

海外のAPIゲートウェイには無い、teai.io だけの機能が本人声の音声合成「Koe」です。 POST /v1/audio/speechmodel:"koe" を渡すだけで、機械的な読み上げではなく 本人クローン声で日本語を自然に話す音声(MP3)が返ります。 これをLLMと組み合わせれば、コールセンターの自動応答・ナレーション生成・音声エージェントが「1つのAPI」で作れます。

必要なもの

ステップ1:LLMで返答を生成

まずはいつもの /v1/chat/completions で返答テキストを作ります。モデルは用途で選べます (kimi-k3 / gpt-4o / claude-sonnet-4-6 / deepseek-v3 など95+モデルが同じAPIで)。

from openai import OpenAI

client = OpenAI(
    base_url="https://api.teai.io/v1",
    api_key="teai_...",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "今日の東京の天気を教えて"}],
)
answer = resp.choices[0].message.content  # → "今日の東京は晴れ、最高気温は…"

ステップ2:Koe本人声で読み上げ

返答テキストを /v1/audio/speech に渡し、model:"koe" を指定するだけ。 voice は省略でき、その場合はデフォルトの本人声で合成されます。

with client.audio.speech.with_streaming_response.create(
    model="koe",
    input=answer,
    response_format="mp3",
) as r:
    r.stream_to_file("reply.mp3")

curl の場合

curl -X POST https://api.teai.io/v1/audio/speech \
  -H "Authorization: Bearer teai_..." \
  -H "Content-Type: application/json" \
  -d '{"model":"koe","input":"こんにちは、teai.ioです","response_format":"mp3"}' \
  --output reply.mp3

ステップ3:返答 → 読み上げをループにする

あとは入力(ユーザーの発話テキスト)を受け取るたびに、この2つを回すだけです。 最小のボイスボットは下記の形で完成します。

def reply_voice(user_text: str) -> str:
    resp = client.chat.completions.create(
        model="kimi-k3",
        messages=[
            {"role": "system", "content": "あなたは店舗の電話応対係です。丁寧な日本語で簡潔に答えてください。"},
            {"role": "user", "content": user_text},
        ],
    )
    answer = resp.choices[0].message.content
    with client.audio.speech.with_streaming_response.create(
        model="koe", input=answer, response_format="mp3",
    ) as r:
        r.stream_to_file("reply.mp3")
    return answer

どんな用途に向いているか

用途組み合わせ
コールセンター自動応答LLM(応対文生成)→ Koe(本人声で読み上げ)
ナレーション生成原稿を Koe で一括読み上げ(ブログ・動画・紙芝居の音声)
音声エージェントLLM + Koe を Sente(CLIエージェント)や自社アプリに配線
社内アナウンス定型文を Koe で合成して通知・放送に

料金

Koe TTS(model:"koe")は約1クレジット/100文字(1文字あたり約0.01クレジット)と安価です。 LLM側の利用もプロバイダー価格そのまま+マージン5%。最新の料金は料金ページを参照してください。

注意点(正直に)

音声入力(STT)はまだ未提供です。現在 teai.io は音声→テキストの /api/v1/media/stt を準備中で、公開されていません。ボイスボットの「聞き取り」部分は お手持ちの Whisper / Google STT / ブラウザの Web Speech API などと組み合わせてください。 話す側(LLM応答+Koe読み上げ)はこの記事の通りすぐ使えます。

関連記事