Koe本人声TTSでボイスボットを作る — LLMと音声が1つのAPIで
海外のAPIゲートウェイには無い、teai.io だけの機能が本人声の音声合成「Koe」です。
POST /v1/audio/speech に model:"koe" を渡すだけで、機械的な読み上げではなく
本人クローン声で日本語を自然に話す音声(MP3)が返ります。
これをLLMと組み合わせれば、コールセンターの自動応答・ナレーション生成・音声エージェントが「1つのAPI」で作れます。
必要なもの
- teai.io の API キー(登録後、クーポン「WELCOME」で100クレジット。Koe TTS は約1クレジット/100文字)
- OpenAI SDK(Python / Node.js / Go など。既存のコードがそのまま動きます)
ステップ1:LLMで返答を生成
まずはいつもの /v1/chat/completions で返答テキストを作ります。モデルは用途で選べます
(kimi-k3 / gpt-4o / claude-sonnet-4-6 / deepseek-v3 など95+モデルが同じAPIで)。
from openai import OpenAI
client = OpenAI(
base_url="https://api.teai.io/v1",
api_key="teai_...",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "今日の東京の天気を教えて"}],
)
answer = resp.choices[0].message.content # → "今日の東京は晴れ、最高気温は…"ステップ2:Koe本人声で読み上げ
返答テキストを /v1/audio/speech に渡し、model:"koe" を指定するだけ。
voice は省略でき、その場合はデフォルトの本人声で合成されます。
with client.audio.speech.with_streaming_response.create(
model="koe",
input=answer,
response_format="mp3",
) as r:
r.stream_to_file("reply.mp3")curl の場合
curl -X POST https://api.teai.io/v1/audio/speech \
-H "Authorization: Bearer teai_..." \
-H "Content-Type: application/json" \
-d '{"model":"koe","input":"こんにちは、teai.ioです","response_format":"mp3"}' \
--output reply.mp3ステップ3:返答 → 読み上げをループにする
あとは入力(ユーザーの発話テキスト)を受け取るたびに、この2つを回すだけです。 最小のボイスボットは下記の形で完成します。
def reply_voice(user_text: str) -> str:
resp = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "system", "content": "あなたは店舗の電話応対係です。丁寧な日本語で簡潔に答えてください。"},
{"role": "user", "content": user_text},
],
)
answer = resp.choices[0].message.content
with client.audio.speech.with_streaming_response.create(
model="koe", input=answer, response_format="mp3",
) as r:
r.stream_to_file("reply.mp3")
return answerどんな用途に向いているか
| 用途 | 組み合わせ |
|---|---|
| コールセンター自動応答 | LLM(応対文生成)→ Koe(本人声で読み上げ) |
| ナレーション生成 | 原稿を Koe で一括読み上げ(ブログ・動画・紙芝居の音声) |
| 音声エージェント | LLM + Koe を Sente(CLIエージェント)や自社アプリに配線 |
| 社内アナウンス | 定型文を Koe で合成して通知・放送に |
料金
Koe TTS(model:"koe")は約1クレジット/100文字(1文字あたり約0.01クレジット)と安価です。
LLM側の利用もプロバイダー価格そのまま+マージン5%。最新の料金は料金ページを参照してください。
注意点(正直に)
音声入力(STT)はまだ未提供です。現在 teai.io は音声→テキストの
/api/v1/media/stt を準備中で、公開されていません。ボイスボットの「聞き取り」部分は
お手持ちの Whisper / Google STT / ブラウザの Web Speech API などと組み合わせてください。
話す側(LLM応答+Koe読み上げ)はこの記事の通りすぐ使えます。