音声
音声入力(STT)と読み上げ(TTS)を設定する。利用できるプロバイダーはこのビルドの画面定義に限定して記載する。

| 画面表示(主) | 内部キー(サブ) | 製品既定値 | 推奨 |
|---|---|---|---|
| 音声合成プロバイダー | tts.provider | edge | 無料利用は edge |
| 音声認識 | stt.enabled | オン | 音声入力を使う場合オン |
| Echo Transcripts(英語表示) | stt.echo_transcripts | オン | トランスクリプトの投稿が不要ならオフ |
| 音声認識プロバイダー | stt.provider | local | プライバシー重視は local |
| 応答を読み上げる | voice.auto_tts | オフ | 通常オフ |
| 音声ショートカット | voice.record_key | ctrl+b | 他機能と競合しないキー |
| 最大録音時間 | voice.max_recording_seconds | 120 秒 | 60~120秒 |
音声合成プロバイダー
Section titled “音声合成プロバイダー”| 画面表示(主) | 保存値(内部) | 既定 | 実行場所・特徴 | 必要なもの |
|---|---|---|---|---|
| Edge | edge | はい | Microsoft Edge TTS を使う。多数の言語・音声 ID がある | API キー不要。ネットワーク接続 |
| Elevenlabs | elevenlabs | いいえ | ElevenLabs の音声と多言語モデルを使う | ELEVENLABS_API_KEY |
| Openai | openai | いいえ | OpenAI の TTS API、または互換エンドポイントを使う | VOICE_TOOLS_OPENAI_KEY |
| Xai | xai | いいえ | xAI (Grok) の音声合成。再生速度など詳細 5 欄がある | xAI の API 認証(要実機確認) |
| Minimax | minimax | いいえ | MiniMax の音声合成。モデル・音声の専用欄がある | MiniMax の API 認証(要実機確認) |
| Mistral | mistral | いいえ | Mistral の音声合成 | Mistral の API 認証(要実機確認) |
| Gemini | gemini | いいえ | Google Gemini の音声合成 | Gemini の API 認証(要実機確認) |
| Neutts | neutts | いいえ | NeuTTS をローカル実行する。初回はモデル取得が発生し得る | neutts[all] の別途導入、ローカル計算資源 |
| Kittentts | kittentts | いいえ | KittenTTS による音声合成(軽量ローカル TTS)。モデル・音声の専用欄がある | ローカル実行 |
| Piper | piper | いいえ | Piper による音声合成。音声モデルを tts.piper.voice で指定 | ローカル実行(音声モデル、例 en_US-lessac-medium) |
音声認識プロバイダー
Section titled “音声認識プロバイダー”| 画面表示(主) | 保存値(内部) | 既定 | 実行場所・特徴 | 必要なもの |
|---|---|---|---|---|
| Local | local | はい | faster-whisper をローカル実行。音声を外部 STT API へ送らない | 初回モデル取得、ローカル CPU / GPU |
| Groq | groq | いいえ | Groq の Whisper 互換 API。低遅延を重視 | GROQ_API_KEY。このキーは本画面ではなく環境設定側で管理される場合がある |
| Openai | openai | いいえ | OpenAI の Whisper / Transcribe API | VOICE_TOOLS_OPENAI_KEY |
| Mistral | mistral | いいえ | Mistral の音声文字起こし API | Mistral の API 認証(MISTRAL_API_KEY) |
| Xai | xai | いいえ | xAI の音声文字起こし。整形、対応言語、話者処理はサービス仕様に依存 | xAI API キーまたは利用可能な xAI 認証 |
| Elevenlabs | elevenlabs | いいえ | ElevenLabs Scribe を使い、言語指定、音声イベント、話者分離を設定可能 | ELEVENLABS_API_KEY |
TTS 詳細
Section titled “TTS 詳細”以下のサブ設定欄は、tts.provider で選択中のプロバイダーの分だけが表示される。
| 画面表示(主) | 内部キー(サブ) | 製品既定値 | 入力・動作 |
|---|---|---|---|
| Edge 音声 | tts.edge.voice | en-US-AriaNeural | 自由入力。候補 6 種(en-US-Aria/Jenny/Andrew/Brian/GuyNeural、en-GB-SoniaNeural)をサジェスト。フルカタログは 400 種超で、日本語は ja-JP-...Neural 形式の対応 ID を直接入力 |
| OpenAI TTS モデル | tts.openai.model | gpt-4o-mini-tts | 自由入力。候補 gpt-4o-mini-tts / tts-1 / tts-1-hd をサジェスト |
| OpenAI 音声 | tts.openai.voice | alloy | 自由入力。既定候補 13 種(下記) |
| ElevenLabs 音声 | tts.elevenlabs.voice_id | pNInz6obpgDQGcFmaJgB | 自由入力。API 接続に成功するとアカウントの音声一覧(クローン音声含む)が候補に表示される。候補にない音声 ID も直接入力できる |
| ElevenLabs モデル | tts.elevenlabs.model_id | eleven_multilingual_v2 | 閉じた選択リスト。候補 eleven_multilingual_v2 / eleven_turbo_v2_5 / eleven_flash_v2_5 |
OpenAI 音声の既定候補
Section titled “OpenAI 音声の既定候補”既定候補は 13 種(gpt-4o-mini-tts 世代)。
alloy(既定)、ash、ballad、cedar、coral、echo、fable、marin、nova、onyx、sage、shimmer、verse
tts-1 / tts-1-hd 世代が対応するのは alloy / echo / fable / onyx / nova / shimmer の 6 種まで。音色の印象はモデルや API 側の更新で変わり得るため、名前から固定的な性別・声質を断定せず、実際に短文を読み上げて選ぶ。
プロバイダー別サブキーの全一覧
Section titled “プロバイダー別サブキーの全一覧”表示されるのは選択中プロバイダーの欄のみ。
| 画面表示(主) | 内部キー(サブ) | 製品既定値 | 入力・動作 |
|---|---|---|---|
| xAI (Grok) 音声 | tts.xai.voice_id | eve | 自由入力。xAI の音声 ID またはカスタム音声 ID |
| xAI 言語 | tts.xai.language | en | BCP-47 の言語コード(例 en、pt-BR)または auto |
| 再生速度 | tts.xai.speed | 1.0 | 0.7~1.5。0.7 で遅く、1.5 で速く |
| 自動音声タグ | tts.xai.auto_speech_tags | オフ | LLM による書き換えで [laughing] 等の表現タグを合成前のスクリプトへ挿入 |
| ストリーミング遅延最適化 | tts.xai.optimize_streaming_latency | 0 | 0~2。0 は品質優先、2 は低遅延優先 |
| サンプルレート | tts.xai.sample_rate | 24000 | Hz 単位(22050 / 24000 / 44100 / 48000) |
| ビットレート | tts.xai.bit_rate | 128000 | MP3 のビットレート(bps)。コーデックが mp3 のときのみ適用 |
| MiniMax TTS モデル | tts.minimax.model | speech-02-hd | 自由入力。候補 speech-02-hd / speech-02-turbo |
| MiniMax 音声 | tts.minimax.voice_id | English_expressive_narrator | 自由入力(候補サジェストなし) |
| Mistral TTS モデル | tts.mistral.model | voxtral-mini-tts-2603 | 自由入力 |
| Mistral 音声 | tts.mistral.voice_id | c69964a6-ab8b-…(音声 UUID、Paul - Neutral) | 自由入力(候補サジェストなし) |
| Gemini TTS モデル | tts.gemini.model | gemini-2.5-flash-preview-tts | 自由入力。候補 gemini-2.5-flash-preview-tts / gemini-2.5-pro-preview-tts |
| Gemini 音声 | tts.gemini.voice | Kore | 自由入力。既定候補 30 種(下記) |
| NeuTTS モデル | tts.neutts.model | neuphonic/neutts-air-q4-gguf | 自由入力。候補は q4-gguf / q8-gguf / 無印の 3 種 |
| NeuTTS デバイス | tts.neutts.device | cpu | 閉じた選択リスト。cpu / cuda / mps |
| KittenTTS モデル | tts.kittentts.model | KittenML/kitten-tts-nano-0.8-int8 | 自由入力。候補は nano(25MB)/ micro(41MB)/ mini(80MB)の 3 種 |
| KittenTTS 音声 | tts.kittentts.voice | Jasper | 自由入力。候補 Jasper |
| Piper 音声 | tts.piper.voice | en_US-lessac-medium | 自由入力。候補 en_US-lessac-medium / en_US-amy-medium / en_US-ryan-high / en_GB-alan-medium |
| DeepInfra TTS Model(英語表示) | tts.deepinfra.model | 空欄 | 自由入力。空欄では DeepInfra のライブカタログで最初に見つかる TTS タグ付きモデルを使う |
| DeepInfra Voice(英語表示) | tts.deepinfra.voice | default | 自由入力 |
Gemini 音声の既定候補(30種)
Section titled “Gemini 音声の既定候補(30種)”Zephyr、Puck、Charon、Kore(既定)、Fenrir、Leda、Orus、Aoede、Callirrhoe、Autonoe、Enceladus、Iapetus、Umbriel、Algieba、Despina、Erinome、Algenib、Rasalgethi、Laomedeia、Achernar、Alnilam、Schedar、Gacrux、Pulcherrima、Achird、Zubenelgenubi、Vindemiatrix、Sadachbia、Sadaltager、Sulafat
STT 詳細
Section titled “STT 詳細”以下のサブ設定欄は、stt.provider で選択中のプロバイダーの分だけが表示される。音声認識をオフにすると全サブ欄が非表示になる。
| 画面表示(主) | 内部キー(サブ) | 製品既定値 | 推奨 |
|---|---|---|---|
| ローカル文字起こしモデル | stt.local.model | base | 速度重視 base、精度重視 small 以上 |
| 文字起こし言語 | stt.local.language | 空欄(自動) | 日本語固定が必要なら言語コード |
| OpenAI STT モデル | stt.openai.model | whisper-1 | 候補 whisper-1 / gpt-4o-mini-transcribe / gpt-4o-transcribe から選択 |
| Mistral STT モデル | stt.mistral.model | voxtral-mini-latest | 候補 voxtral-mini-latest / voxtral-mini-2602 から選択 |
| ElevenLabs STT モデル | stt.elevenlabs.model_id | scribe_v2 | scribe_v2 |
| ElevenLabs 言語 | stt.elevenlabs.language_code | 空欄(自動) | 必要時に ISO-639-3 |
| 音声イベントをタグ付け | stt.elevenlabs.tag_audio_events | オフ | 会話分析時のみオン |
| 話者分離 | stt.elevenlabs.diarize | オフ | 複数話者の録音時のみオン |
ローカル文字起こしモデルの全候補
Section titled “ローカル文字起こしモデルの全候補”| 画面表示(主) | 保存値(内部) | 既定 | 相対的な速度・精度 | 用途 |
|---|---|---|---|---|
| Tiny | tiny | いいえ | 最速・最小、精度は低め | 動作確認、低性能端末 |
| Base | base | はい | 高速で標準的 | 短い日常音声 |
| Small | small | いいえ | 中程度 | 日本語精度を少し上げたい場合 |
| Medium | medium | いいえ | 低速・高精度 | 精度優先、十分なメモリがある端末 |
| Large-v3 | large-v3 | いいえ | 最も重い・高精度 | 品質最優先、強い CPU / GPU |
ElevenLabs STT モデルの全候補
Section titled “ElevenLabs STT モデルの全候補”| 画面表示(主) | 保存値(内部) | 既定 | 動作 |
|---|---|---|---|
| Scribe V2 | scribe_v2 | はい | 新しい Scribe 系モデル |
| Scribe V1 | scribe_v1 | いいえ | 旧 Scribe モデル。互換性や比較が必要な場合 |
言語と追加解析
Section titled “言語と追加解析”- 文字起こし言語: 空欄では
faster-whisperが自動検出する。固定する場合はja,enなどの対応言語コードを入力する。 - ElevenLabs 言語: 空欄では自動検出。固定時は ElevenLabs が受け付ける ISO-639-3 コードを使う。
- 音声イベントをタグ付け オン: 笑い声、拍手など、音声中の非発話イベントを文字起こしへ含める。
- 音声イベントをタグ付け オフ: 発話本文を中心に返す。
- 話者分離 オン: 複数話者を識別した結果を要求する。処理量や出力複雑度が増える。
- 話者分離 オフ: 話者を分けず単一の文字起こしとして扱う。
- 音声認識 オン: 受信・録音した音声を選択プロバイダーで自動文字起こしする。
- 音声認識 オフ: 自動文字起こしを行わない。ゲートウェイでは音声ファイル自体が保持・参照される場合がある。
- Echo Transcripts オン: ゲートウェイ経由の音声メッセージを文字起こしした際、生のトランスクリプトを 🎙️ 付きメッセージとしてチャットへ投稿し返す。
- Echo Transcripts オフ: エージェントへの文字起こしは維持したまま、チャットへのエコー投稿だけを止める。
- 応答を読み上げる オン: アシスタントの応答を選択した TTS で自動再生する。
- 応答を読み上げる オフ: 必要なときだけ手動の音声機能を使う。
- 音声ショートカット:
ctrl+bのようなキー表記。OS や他アプリのショートカットと競合しない値を使う。 - 最大録音時間: 1回の録音を停止するまでの上限秒数。長くするとファイルサイズと文字起こし時間が増える。
- ローカル・無料重視: STT
local+base、TTSedge、自動読み上げオフ。 - 日本語精度重視: STT の言語を固定し、必要に応じて
small以上。 - 会議録: ElevenLabs の話者分離を有効化し、送信先のデータ方針を確認。
© 2026 Hermes Desktop ガイド(非公式)。引用・部分転載は、出典として本ページへのリンクを添えていただければ歓迎します。記事全文の無断複製・転載はご遠慮ください。