コンテンツにスキップ

音声

音声入力(STT)と読み上げ(TTS)を設定する。利用できるプロバイダーはこのビルドの画面定義に限定して記載する。

画面表示(主)内部キー(サブ)製品既定値推奨
音声合成プロバイダーtts.provideredge無料利用は edge
音声認識stt.enabledオン音声入力を使う場合オン
Echo Transcripts(英語表示)stt.echo_transcriptsオントランスクリプトの投稿が不要ならオフ
音声認識プロバイダーstt.providerlocalプライバシー重視は local
応答を読み上げるvoice.auto_ttsオフ通常オフ
音声ショートカットvoice.record_keyctrl+b他機能と競合しないキー
最大録音時間voice.max_recording_seconds12060~120秒
画面表示(主)保存値(内部)既定実行場所・特徴必要なもの
EdgeedgeはいMicrosoft Edge TTS を使う。多数の言語・音声 ID があるAPI キー不要。ネットワーク接続
ElevenlabselevenlabsいいえElevenLabs の音声と多言語モデルを使うELEVENLABS_API_KEY
OpenaiopenaiいいえOpenAI の TTS API、または互換エンドポイントを使うVOICE_TOOLS_OPENAI_KEY
XaixaiいいえxAI (Grok) の音声合成。再生速度など詳細 5 欄があるxAI の API 認証(要実機確認)
MinimaxminimaxいいえMiniMax の音声合成。モデル・音声の専用欄があるMiniMax の API 認証(要実機確認)
MistralmistralいいえMistral の音声合成Mistral の API 認証(要実機確認)
GeminigeminiいいえGoogle Gemini の音声合成Gemini の API 認証(要実機確認)
NeuttsneuttsいいえNeuTTS をローカル実行する。初回はモデル取得が発生し得るneutts[all] の別途導入、ローカル計算資源
KittenttskittenttsいいえKittenTTS による音声合成(軽量ローカル TTS)。モデル・音声の専用欄があるローカル実行
PiperpiperいいえPiper による音声合成。音声モデルを tts.piper.voice で指定ローカル実行(音声モデル、例 en_US-lessac-medium
画面表示(主)保存値(内部)既定実行場所・特徴必要なもの
Locallocalはいfaster-whisper をローカル実行。音声を外部 STT API へ送らない初回モデル取得、ローカル CPU / GPU
GroqgroqいいえGroq の Whisper 互換 API。低遅延を重視GROQ_API_KEY。このキーは本画面ではなく環境設定側で管理される場合がある
OpenaiopenaiいいえOpenAI の Whisper / Transcribe APIVOICE_TOOLS_OPENAI_KEY
MistralmistralいいえMistral の音声文字起こし APIMistral の API 認証(MISTRAL_API_KEY
XaixaiいいえxAI の音声文字起こし。整形、対応言語、話者処理はサービス仕様に依存xAI API キーまたは利用可能な xAI 認証
ElevenlabselevenlabsいいえElevenLabs Scribe を使い、言語指定、音声イベント、話者分離を設定可能ELEVENLABS_API_KEY

以下のサブ設定欄は、tts.provider で選択中のプロバイダーの分だけが表示される。

画面表示(主)内部キー(サブ)製品既定値入力・動作
Edge 音声tts.edge.voiceen-US-AriaNeural自由入力。候補 6 種(en-US-Aria/Jenny/Andrew/Brian/GuyNeuralen-GB-SoniaNeural)をサジェスト。フルカタログは 400 種超で、日本語は ja-JP-...Neural 形式の対応 ID を直接入力
OpenAI TTS モデルtts.openai.modelgpt-4o-mini-tts自由入力。候補 gpt-4o-mini-tts / tts-1 / tts-1-hd をサジェスト
OpenAI 音声tts.openai.voicealloy自由入力。既定候補 13 種(下記)
ElevenLabs 音声tts.elevenlabs.voice_idpNInz6obpgDQGcFmaJgB自由入力。API 接続に成功するとアカウントの音声一覧(クローン音声含む)が候補に表示される。候補にない音声 ID も直接入力できる
ElevenLabs モデルtts.elevenlabs.model_ideleven_multilingual_v2閉じた選択リスト。候補 eleven_multilingual_v2 / eleven_turbo_v2_5 / eleven_flash_v2_5

既定候補は 13 種(gpt-4o-mini-tts 世代)。

alloy(既定)、ashballadcedarcoralechofablemarinnovaonyxsageshimmerverse

tts-1 / tts-1-hd 世代が対応するのは alloy / echo / fable / onyx / nova / shimmer の 6 種まで。音色の印象はモデルや API 側の更新で変わり得るため、名前から固定的な性別・声質を断定せず、実際に短文を読み上げて選ぶ。

プロバイダー別サブキーの全一覧

Section titled “プロバイダー別サブキーの全一覧”

表示されるのは選択中プロバイダーの欄のみ。

画面表示(主)内部キー(サブ)製品既定値入力・動作
xAI (Grok) 音声tts.xai.voice_ideve自由入力。xAI の音声 ID またはカスタム音声 ID
xAI 言語tts.xai.languageenBCP-47 の言語コード(例 enpt-BR)または auto
再生速度tts.xai.speed1.00.7~1.5。0.7 で遅く、1.5 で速く
自動音声タグtts.xai.auto_speech_tagsオフLLM による書き換えで [laughing] 等の表現タグを合成前のスクリプトへ挿入
ストリーミング遅延最適化tts.xai.optimize_streaming_latency00~2。0 は品質優先、2 は低遅延優先
サンプルレートtts.xai.sample_rate24000Hz 単位(22050 / 24000 / 44100 / 48000)
ビットレートtts.xai.bit_rate128000MP3 のビットレート(bps)。コーデックが mp3 のときのみ適用
MiniMax TTS モデルtts.minimax.modelspeech-02-hd自由入力。候補 speech-02-hd / speech-02-turbo
MiniMax 音声tts.minimax.voice_idEnglish_expressive_narrator自由入力(候補サジェストなし)
Mistral TTS モデルtts.mistral.modelvoxtral-mini-tts-2603自由入力
Mistral 音声tts.mistral.voice_idc69964a6-ab8b-…(音声 UUID、Paul - Neutral)自由入力(候補サジェストなし)
Gemini TTS モデルtts.gemini.modelgemini-2.5-flash-preview-tts自由入力。候補 gemini-2.5-flash-preview-tts / gemini-2.5-pro-preview-tts
Gemini 音声tts.gemini.voiceKore自由入力。既定候補 30 種(下記)
NeuTTS モデルtts.neutts.modelneuphonic/neutts-air-q4-gguf自由入力。候補は q4-gguf / q8-gguf / 無印の 3 種
NeuTTS デバイスtts.neutts.devicecpu閉じた選択リスト。cpu / cuda / mps
KittenTTS モデルtts.kittentts.modelKittenML/kitten-tts-nano-0.8-int8自由入力。候補は nano(25MB)/ micro(41MB)/ mini(80MB)の 3 種
KittenTTS 音声tts.kittentts.voiceJasper自由入力。候補 Jasper
Piper 音声tts.piper.voiceen_US-lessac-medium自由入力。候補 en_US-lessac-medium / en_US-amy-medium / en_US-ryan-high / en_GB-alan-medium
DeepInfra TTS Model(英語表示)tts.deepinfra.model空欄自由入力。空欄では DeepInfra のライブカタログで最初に見つかる TTS タグ付きモデルを使う
DeepInfra Voice(英語表示)tts.deepinfra.voicedefault自由入力

ZephyrPuckCharonKore(既定)、FenrirLedaOrusAoedeCallirrhoeAutonoeEnceladusIapetusUmbrielAlgiebaDespinaErinomeAlgenibRasalgethiLaomedeiaAchernarAlnilamSchedarGacruxPulcherrimaAchirdZubenelgenubiVindemiatrixSadachbiaSadaltagerSulafat

以下のサブ設定欄は、stt.provider で選択中のプロバイダーの分だけが表示される。音声認識をオフにすると全サブ欄が非表示になる。

画面表示(主)内部キー(サブ)製品既定値推奨
ローカル文字起こしモデルstt.local.modelbase速度重視 base、精度重視 small 以上
文字起こし言語stt.local.language空欄(自動)日本語固定が必要なら言語コード
OpenAI STT モデルstt.openai.modelwhisper-1候補 whisper-1 / gpt-4o-mini-transcribe / gpt-4o-transcribe から選択
Mistral STT モデルstt.mistral.modelvoxtral-mini-latest候補 voxtral-mini-latest / voxtral-mini-2602 から選択
ElevenLabs STT モデルstt.elevenlabs.model_idscribe_v2scribe_v2
ElevenLabs 言語stt.elevenlabs.language_code空欄(自動)必要時に ISO-639-3
音声イベントをタグ付けstt.elevenlabs.tag_audio_eventsオフ会話分析時のみオン
話者分離stt.elevenlabs.diarizeオフ複数話者の録音時のみオン

ローカル文字起こしモデルの全候補

Section titled “ローカル文字起こしモデルの全候補”
画面表示(主)保存値(内部)既定相対的な速度・精度用途
Tinytinyいいえ最速・最小、精度は低め動作確認、低性能端末
Basebaseはい高速で標準的短い日常音声
Smallsmallいいえ中程度日本語精度を少し上げたい場合
Mediummediumいいえ低速・高精度精度優先、十分なメモリがある端末
Large-v3large-v3いいえ最も重い・高精度品質最優先、強い CPU / GPU
画面表示(主)保存値(内部)既定動作
Scribe V2scribe_v2はい新しい Scribe 系モデル
Scribe V1scribe_v1いいえ旧 Scribe モデル。互換性や比較が必要な場合
  • 文字起こし言語: 空欄では faster-whisper が自動検出する。固定する場合は ja, en などの対応言語コードを入力する。
  • ElevenLabs 言語: 空欄では自動検出。固定時は ElevenLabs が受け付ける ISO-639-3 コードを使う。
  • 音声イベントをタグ付け オン: 笑い声、拍手など、音声中の非発話イベントを文字起こしへ含める。
  • 音声イベントをタグ付け オフ: 発話本文を中心に返す。
  • 話者分離 オン: 複数話者を識別した結果を要求する。処理量や出力複雑度が増える。
  • 話者分離 オフ: 話者を分けず単一の文字起こしとして扱う。
  • 音声認識 オン: 受信・録音した音声を選択プロバイダーで自動文字起こしする。
  • 音声認識 オフ: 自動文字起こしを行わない。ゲートウェイでは音声ファイル自体が保持・参照される場合がある。
  • Echo Transcripts オン: ゲートウェイ経由の音声メッセージを文字起こしした際、生のトランスクリプトを 🎙️ 付きメッセージとしてチャットへ投稿し返す。
  • Echo Transcripts オフ: エージェントへの文字起こしは維持したまま、チャットへのエコー投稿だけを止める。
  • 応答を読み上げる オン: アシスタントの応答を選択した TTS で自動再生する。
  • 応答を読み上げる オフ: 必要なときだけ手動の音声機能を使う。
  • 音声ショートカット: ctrl+b のようなキー表記。OS や他アプリのショートカットと競合しない値を使う。
  • 最大録音時間: 1回の録音を停止するまでの上限秒数。長くするとファイルサイズと文字起こし時間が増える。
  • ローカル・無料重視: STT local + base、TTS edge、自動読み上げオフ。
  • 日本語精度重視: STT の言語を固定し、必要に応じて small 以上。
  • 会議録: ElevenLabs の話者分離を有効化し、送信先のデータ方針を確認。

© 2026 Hermes Desktop ガイド(非公式)。引用・部分転載は、出典として本ページへのリンクを添えていただければ歓迎します。記事全文の無断複製・転載はご遠慮ください。