tools.media.audio 使用它轉錄傳入的音訊/語音留言,並透過 plugins.entries.voice-call.config.streaming 將它用於語音通話串流 STT。
批次轉錄會將完整音訊檔案上傳至 Deepgram,並把逐字稿注入回覆流水線({{Transcript}} + [Audio] 區塊)。
語音通話串流會透過 Deepgram 的 WebSocket listen 端點轉送即時 G.711 u-law 音訊框架,並在 Deepgram 傳回部分/最終逐字稿時將其發出。
開始使用
1
設定 API 金鑰
2
啟用音訊供應商
3
傳送語音留言
透過任何已連線的頻道傳送音訊訊息。OpenClaw 會透過 Deepgram 將其轉錄,並把逐字稿注入回覆流水線。
設定選項
providerOptions.deepgram 會將額外的查詢參數直接合併至 Deepgram /listen 要求,因此可使用任何 Deepgram 支援的參數名稱(例如 detect_language、punctuate、smart_format):
- 使用語言提示
- 使用 Deepgram 選項
語音通話串流 STT
隨附的deepgram 外掛也會為語音通話外掛註冊即時轉錄供應商。
baseUrl 設為端點根目錄,包含任何基礎路徑,但不要包含 /listen。
即時端點接受 http://、https://、ws:// 和 wss://。HTTP 會對應至 WS,HTTPS 會對應至 WSS,而明確指定的 WebSocket 配置則維持不變。
格式錯誤的 URL 和其他配置會在工作階段設定期間失敗。
語音通話會以 8 kHz G.711 u-law 接收電話音訊。Deepgram 串流供應商預設使用
encoding: "mulaw" 和 sampleRate: 8000,因此可直接轉送 Twilio 媒體框架。注意事項
驗證
驗證
驗證遵循標準的供應商驗證順序。
DEEPGRAM_API_KEY 是最簡單的方式。Proxy 與自訂端點
Proxy 與自訂端點
使用 Proxy 時,請在 Deepgram
tools.media.models[] 項目上覆寫端點或標頭。輸出行為
輸出行為
輸出遵循與其他供應商相同的音訊規則(大小上限、逾時、逐字稿注入)。
相關內容
媒體工具
音訊、影像與影片處理流水線概覽。
設定
完整的設定參考,包含媒體工具設定。
疑難排解
常見問題與偵錯步驟。
常見問答
關於 OpenClaw 設定的常見問題。