- 提供者:
google - 驗證:
GEMINI_API_KEY或GOOGLE_API_KEY - API:Google Gemini API
- 執行階段選項:
agentRuntime.id: "google-gemini-cli"會重複使用 Gemini 命令列介面的 OAuth,同時將模型參照維持為標準的google/*。
開始使用
選擇偏好的驗證方式,並依照設定步驟操作。- API 金鑰
- Gemini 命令列介面 (OAuth)
**最適合:**透過 Google AI Studio 使用標準 Gemini API。設定 API 金鑰後,OpenClaw 會從 Gemini
models.list API
重新整理 Google AI Studio 的文字模型目錄。因此,新發布的 Gemini 3 Pro、Flash
與 Flash-Lite 變體不必等待 OpenClaw 發布新版本,即會顯示於
openclaw models list --provider google。若無法進行探索,OpenClaw 會保留內建的備援
目錄。google/gemini-3-pro-preview 已於 2026-03-09 停用;請改用 google/gemini-3.1-pro-preview。重新執行 Gemini API 金鑰設定(openclaw onboard --auth-choice gemini-api-key 或 openclaw models auth login --provider google)會將過時的已設定預設值改寫為目前的模型。功能
網路搜尋
內建的gemini 網路搜尋提供者使用 Gemini Google Search Grounding。
請在 plugins.entries.google.config.webSearch 下設定專用搜尋金鑰,
或讓它在 GEMINI_API_KEY 之後重複使用 models.providers.google.apiKey:
webSearch.apiKey,接著是 GEMINI_API_KEY,
最後是 models.providers.google.apiKey。webSearch.baseUrl 為選用,
用於操作人員的 Proxy 或相容的 Gemini API 端點;若省略,
Gemini 網路搜尋會重複使用 models.providers.google.baseUrl。關於提供者專屬的工具行為,請參閱
Gemini 搜尋。
影像生成
內建的google 影像生成提供者預設使用
google/gemini-3.1-flash-image。
- 也支援
google/gemini-3-pro-image - 生成:每次要求最多 4 張影像
- 編輯模式:已啟用,最多 5 張輸入影像
- 幾何控制:
size、aspectRatio和resolution
關於共用工具參數、提供者選擇與容錯移轉行為,請參閱影像生成。
影片生成
內建的google 外掛也會透過共用的
video_generate 工具註冊影片生成功能。
- 預設影片模型:
google/veo-3.1-fast-generate-preview - 模式:文字轉影片、影像轉影片,以及單一影片參照流程
- 支援
aspectRatio(16:9、9:16)和resolution(720P、1080P);Veo 目前不支援音訊輸出 - 支援的持續時間:4、6 或 8 秒(其他值會調整為最接近的允許值)
關於共用工具參數、提供者選擇與容錯移轉行為,請參閱影片生成。
音樂生成
內建的google 外掛也會透過共用的
music_generate 工具註冊音樂生成功能。
- 預設音樂模型:
google/lyria-3-clip-preview - 也支援
google/lyria-3-pro-preview - 提示詞控制:
lyrics和instrumental - 輸出格式:預設為
mp3,在google/lyria-3-pro-preview上另支援wav - 參照輸入:最多 10 張影像
- 由工作階段支援的執行會透過共用的工作/狀態流程分離,包括
action: "status"
關於共用工具參數、提供者選擇與容錯移轉行為,請參閱音樂生成。
文字轉語音
內建的google 語音提供者使用 Gemini API TTS 路徑與
gemini-3.1-flash-tts-preview。
- 預設語音:
Kore - 驗證:
tts.providers.google.apiKey、models.providers.google.apiKey、GEMINI_API_KEY或GOOGLE_API_KEY - 輸出:一般 TTS 附件使用 WAV、語音訊息目標使用 Opus、Talk/電話語音使用 PCM
- 語音訊息輸出:Google PCM 會封裝為 WAV,並使用
ffmpeg轉碼為 48 kHz Opus
generateContent 回應中傳回生成的音訊。若要獲得最低延遲的語音對話,請使用
由 Gemini Live API 支援的 Google 即時語音提供者,而非批次
TTS。
若要將 Google 設為預設 TTS 提供者:
audioProfile,即可在語音文字前加上可重複使用的風格提示詞。當你的提示詞文字提到具名說話者時,請設定
speakerName。
Gemini API TTS 也接受文字中的表現力方括號音訊標籤,
例如 [whispers] 或 [laughs]。若要讓標籤不出現在可見的聊天回覆中,
但仍將其傳送至 TTS,請將它們放在 [[tts:text]]...[[/tts:text]]
區塊內:
限制為 Gemini API 的 Google Cloud Console API 金鑰適用於此
提供者。這不是個別的 Cloud Text-to-Speech API 路徑。
即時語音
內建的google 外掛會註冊由
Gemini Live API 支援的即時語音提供者,用於 Voice Call 和 Google Meet 等後端音訊橋接器。
語音通話即時設定範例:
Google Live API 透過 WebSocket 使用雙向音訊與函式呼叫。
OpenClaw 會調整電話/Meet 橋接音訊以配合 Gemini 的 PCM Live API 串流,並
讓工具呼叫沿用共用的即時語音合約。除非需要變更取樣設定,否則請勿設定
temperature;
OpenClaw 會省略非正值,因為 Google Live 在 temperature: 0 的情況下可能只傳回逐字稿而沒有音訊。
Gemini API 轉錄不需要 languageCodes 即會啟用;目前的 Google
SDK 會拒絕此 API 路徑上的語言代碼提示。Gemini 3.1 Live 透過即時輸入接受對話文字,並使用
循序函式呼叫。OpenClaw 會針對此模型省略較舊的
NON_BLOCKING、函式
回應排程與情感對話欄位。建議使用
thinkingLevel;已設定的正 thinkingBudget 值會對應至
最接近的支援層級,而 -1 則會保留 Google 的預設值。請參閱
Gemini Live 功能比較。控制介面的「Talk」支援使用受限單次
權杖的 Google Live 瀏覽器工作階段。在「Video Talk」中,瀏覽器會以
供應商每秒最多一個影格的限制,將有界限的 JPEG 影格直接傳送至
Google Live。
describe_view 函式會回報該攝影機串流是否啟用。
攝影機影格不會通過閘道。僅後端的即時語音
供應商也可透過通用閘道轉送傳輸執行,
並將供應商認證資訊保留在閘道上。OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts。
此冒煙測試也涵蓋 OpenAI 後端/WebRTC 路徑;Google 部分會鑄造與控制介面「Talk」所用相同形式的
受限 Live API 權杖、開啟瀏覽器
WebSocket 端點、傳送初始設定承載資料及一個 JPEG 影格,並
驗證文字回應與 describe_view 函式往返。
進階設定
直接重複使用 Gemini 快取
直接重複使用 Gemini 快取
對於直接執行 Gemini API(
api: "google-generative-ai"),OpenClaw
會將已設定的 cachedContent 控制代碼傳遞至 Gemini 請求。- 使用
cachedContent或舊版cached_content設定各模型或全域參數 - 範圍越明確的參數(模型層級優先於全域)一律優先。
在相同範圍內,若同時設定兩個鍵,則以
cached_content為準。 每個範圍只使用一個鍵,以免出現非預期結果。 - 值範例:
cachedContents/prebuilt-context - Gemini 快取命中用量會從上游
cachedContentTokenCount正規化至 OpenClawcacheRead
Gemini 命令列介面用量注意事項
Gemini 命令列介面用量注意事項
使用
google-gemini-cli OAuth 供應商時,OpenClaw 預設使用 Gemini
命令列介面的 stream-json 輸出,並從最終
stats 承載資料正規化用量。舊版 --output-format json 覆寫仍使用
JSON 剖析器。- 串流回覆文字來自助理
message事件。 - 對於舊版 JSON 輸出,回覆文字來自命令列介面 JSON 的
response欄位。 - 當命令列介面將
usage留空時,用量會回退至stats。 stats.cached會正規化至 OpenClawcacheRead。- 若缺少
stats.input,OpenClaw 會從stats.input_tokens - stats.cached推導輸入權杖數。
環境與常駐程式設定
環境與常駐程式設定
若閘道以常駐程式(launchd/systemd)執行,請確保該程序可使用
GEMINI_API_KEY
(例如放在 ~/.openclaw/.env 中,或透過
env.shellEnv 提供)。相關內容
模型選擇
選擇供應商、模型參照與容錯移轉行為。
圖片生成
共用圖片工具參數與供應商選擇。
影片生成
共用影片工具參數與供應商選擇。
音樂生成
共用音樂工具參數與供應商選擇。