Skip to main content
Azure Speech 是內建的 Azure AI Speech 文字轉語音供應商。OpenClaw 會使用 SSML 直接呼叫 Azure Speech REST API,為標準回覆合成 MP3、 為語音訊息合成原生 Ogg/Opus,並為 Voice Call 等電話語音通道合成 8 kHz mulaw。要求會透過 X-Microsoft-OutputFormat 標頭傳送供應商所擁有的 輸出格式。

開始使用

1

建立 Azure Speech 資源

在 Azure 入口網站中建立 Speech 資源。從 Resource Management > Keys and Endpoint 複製 KEY 1,並複製資源位置, 例如 eastus
2

在 tts 中選取 Azure Speech

3

傳送訊息

透過任何已連線的通道傳送回覆。OpenClaw 會使用 Azure Speech 合成音訊, 並為標準音訊傳送 MP3;當通道要求語音訊息時,則傳送 Ogg/Opus。

設定選項

所有選項都位於 tts.providers["azure-speech"] 之下。 設定 apiKey,再加上 regionendpointbaseUrl 其中之一後,即視為已完成供應商設定。 環境變數只會作為尚未設定之設定鍵的備援值進行檢查。工作區 .env 檔案無法設定 AZURE_SPEECH_ENDPOINT;端點路由請使用程序環境、 全域執行階段 dotenv,或明確設定。

注意事項

Azure Speech 使用 Speech 資源金鑰,而非 Azure OpenAI 金鑰。金鑰會以 Ocp-Apim-Subscription-Key 傳送;除非你提供 endpointbaseUrl,否則 OpenClaw 會從 region 衍生 https://<region>.tts.speech.microsoft.com
請使用 Azure Speech 語音的 ShortName 值,例如 en-US-JennyNeural。內建供應商可透過相同的 Speech 資源列出語音, 並篩除標示為已棄用、已停用或已除役的語音。
Azure 接受 audio-24khz-48kbitrate-mono-mp3ogg-24khz-16bit-mono-opusriff-24khz-16bit-mono-pcm 等輸出格式。OpenClaw 會為 voice-note 目標要求 Ogg/Opus,讓通道無須額外轉換 MP3 即可傳送原生語音訊息泡泡;對於電話語音目標,則強制使用 raw-8khz-8bit-mono-mulaw
為相容既有設定,可接受 azure 作為供應商別名,但新設定應使用 azure-speech,以免與 Azure OpenAI 模型供應商混淆。

相關內容

文字轉語音

TTS 概觀、供應商及 tts 設定。

設定

完整設定參考,包括 tts 設定。

供應商

所有內建的 OpenClaw 供應商。

疑難排解

常見問題與偵錯步驟。