Skip to main content
Deepgram 是語音轉文字 API。OpenClaw 透過 tools.media.audio 使用它轉錄傳入的音訊/語音留言,並透過 plugins.entries.voice-call.config.streaming 將它用於語音通話串流 STT。 批次轉錄會將完整音訊檔案上傳至 Deepgram,並把逐字稿注入回覆流水線({{Transcript}} + [Audio] 區塊)。 語音通話串流會透過 Deepgram 的 WebSocket listen 端點轉送即時 G.711 u-law 音訊框架,並在 Deepgram 傳回部分/最終逐字稿時將其發出。

開始使用

1

設定 API 金鑰

2

啟用音訊供應商

3

傳送語音留言

透過任何已連線的頻道傳送音訊訊息。OpenClaw 會透過 Deepgram 將其轉錄,並把逐字稿注入回覆流水線。

設定選項

providerOptions.deepgram 會將額外的查詢參數直接合併至 Deepgram /listen 要求,因此可使用任何 Deepgram 支援的參數名稱(例如 detect_languagepunctuatesmart_format):

語音通話串流 STT

隨附的 deepgram 外掛也會為語音通話外掛註冊即時轉錄供應商。
若要使用 Deepgram 自訂端點,請將 baseUrl 設為端點根目錄,包含任何基礎路徑,但不要包含 /listen。 即時端點接受 http://https://ws://wss://。HTTP 會對應至 WS,HTTPS 會對應至 WSS,而明確指定的 WebSocket 配置則維持不變。 格式錯誤的 URL 和其他配置會在工作階段設定期間失敗。
語音通話會以 8 kHz G.711 u-law 接收電話音訊。Deepgram 串流供應商預設使用 encoding: "mulaw"sampleRate: 8000,因此可直接轉送 Twilio 媒體框架。

注意事項

驗證遵循標準的供應商驗證順序。DEEPGRAM_API_KEY 是最簡單的方式。
使用 Proxy 時,請在 Deepgram tools.media.models[] 項目上覆寫端點或標頭。
輸出遵循與其他供應商相同的音訊規則(大小上限、逾時、逐字稿注入)。

相關內容

媒體工具

音訊、影像與影片處理流水線概覽。

設定

完整的設定參考,包含媒體工具設定。

疑難排解

常見問題與偵錯步驟。

常見問答

關於 OpenClaw 設定的常見問題。