Skip to main content
Google 外掛透過 Google AI Studio 提供 Gemini 模型的存取能力,並支援影像生成、媒體理解(影像/音訊/影片)、文字轉語音,以及透過 Gemini Grounding 進行網路搜尋。
  • 提供者:google
  • 驗證:GEMINI_API_KEYGOOGLE_API_KEY
  • API:Google Gemini API
  • 執行階段選項:agentRuntime.id: "google-gemini-cli" 會重複使用 Gemini 命令列介面的 OAuth,同時將模型參照維持為標準的 google/*

開始使用

選擇偏好的驗證方式,並依照設定步驟操作。
**最適合:**透過 Google AI Studio 使用標準 Gemini API。
1

取得 API 金鑰

Google AI Studio 建立免費金鑰。
2

執行初始設定

或直接傳入金鑰:
3

設定預設模型

4

確認模型可用

GEMINI_API_KEYGOOGLE_API_KEY 均可使用。請使用你已設定的項目。
設定 API 金鑰後,OpenClaw 會從 Gemini models.list API 重新整理 Google AI Studio 的文字模型目錄。因此,新發布的 Gemini 3 Pro、Flash 與 Flash-Lite 變體不必等待 OpenClaw 發布新版本,即會顯示於 openclaw models list --provider google。若無法進行探索,OpenClaw 會保留內建的備援 目錄。
google/gemini-3-pro-preview 已於 2026-03-09 停用;請改用 google/gemini-3.1-pro-preview。重新執行 Gemini API 金鑰設定(openclaw onboard --auth-choice gemini-api-keyopenclaw models auth login --provider google)會將過時的已設定預設值改寫為目前的模型。

功能

網路搜尋

內建的 gemini 網路搜尋提供者使用 Gemini Google Search Grounding。 請在 plugins.entries.google.config.webSearch 下設定專用搜尋金鑰, 或讓它在 GEMINI_API_KEY 之後重複使用 models.providers.google.apiKey
認證資訊的優先順序為專用的 webSearch.apiKey,接著是 GEMINI_API_KEY, 最後是 models.providers.google.apiKeywebSearch.baseUrl 為選用, 用於操作人員的 Proxy 或相容的 Gemini API 端點;若省略, Gemini 網路搜尋會重複使用 models.providers.google.baseUrl。關於提供者專屬的工具行為,請參閱 Gemini 搜尋
Gemini 3 模型使用 thinkingLevel,而非 thinkingBudget。OpenClaw 會將 Gemini 3、Gemini 3.1 與 gemini-*-latest 別名的推理控制項對應至 thinkingLevel,使預設/低延遲執行不會傳送停用的 thinkingBudget 值。/think adaptive 會保留 Google 的動態思考語意,而不是選擇 固定的 OpenClaw 層級。Gemini 3 與 Gemini 3.1 會省略固定的 thinkingLevel,以便 Google 選擇層級;Gemini 2.5 則會傳送 Google 的動態哨兵值 thinkingBudget: -1Gemma 4 模型(例如 gemma-4-26b-a4b-it)支援思考模式。OpenClaw 會將 thinkingBudget 改寫為 Gemma 4 支援的 Google thinkingLevel。 將思考設為 off 時,會維持停用思考,而不會對應至 MINIMALGemini 2.5 Pro 僅能在思考模式下運作,且會拒絕明確的 thinkingBudget: 0;OpenClaw 會從 Gemini 2.5 Pro 要求中移除該值, 而不會將其傳送。

影像生成

內建的 google 影像生成提供者預設使用 google/gemini-3.1-flash-image
  • 也支援 google/gemini-3-pro-image
  • 生成:每次要求最多 4 張影像
  • 編輯模式:已啟用,最多 5 張輸入影像
  • 幾何控制:sizeaspectRatioresolution
若要將 Google 設為預設影像提供者:
關於共用工具參數、提供者選擇與容錯移轉行為,請參閱影像生成

影片生成

內建的 google 外掛也會透過共用的 video_generate 工具註冊影片生成功能。
  • 預設影片模型:google/veo-3.1-fast-generate-preview
  • 模式:文字轉影片、影像轉影片,以及單一影片參照流程
  • 支援 aspectRatio16:99:16)和 resolution720P1080P);Veo 目前不支援音訊輸出
  • 支援的持續時間:4、6 或 8 秒(其他值會調整為最接近的允許值)
若要將 Google 設為預設影片提供者:
關於共用工具參數、提供者選擇與容錯移轉行為,請參閱影片生成

音樂生成

內建的 google 外掛也會透過共用的 music_generate 工具註冊音樂生成功能。
  • 預設音樂模型:google/lyria-3-clip-preview
  • 也支援 google/lyria-3-pro-preview
  • 提示詞控制:lyricsinstrumental
  • 輸出格式:預設為 mp3,在 google/lyria-3-pro-preview 上另支援 wav
  • 參照輸入:最多 10 張影像
  • 由工作階段支援的執行會透過共用的工作/狀態流程分離,包括 action: "status"
若要將 Google 設為預設音樂提供者:
關於共用工具參數、提供者選擇與容錯移轉行為,請參閱音樂生成

文字轉語音

內建的 google 語音提供者使用 Gemini API TTS 路徑與 gemini-3.1-flash-tts-preview
  • 預設語音:Kore
  • 驗證:tts.providers.google.apiKeymodels.providers.google.apiKeyGEMINI_API_KEYGOOGLE_API_KEY
  • 輸出:一般 TTS 附件使用 WAV、語音訊息目標使用 Opus、Talk/電話語音使用 PCM
  • 語音訊息輸出:Google PCM 會封裝為 WAV,並使用 ffmpeg 轉碼為 48 kHz Opus
Google 的批次 Gemini TTS 路徑會在已完成的 generateContent 回應中傳回生成的音訊。若要獲得最低延遲的語音對話,請使用 由 Gemini Live API 支援的 Google 即時語音提供者,而非批次 TTS。 若要將 Google 設為預設 TTS 提供者:
Gemini API TTS 使用自然語言提示詞控制風格。設定 audioProfile,即可在語音文字前加上可重複使用的風格提示詞。當你的提示詞文字提到具名說話者時,請設定 speakerName Gemini API TTS 也接受文字中的表現力方括號音訊標籤, 例如 [whispers][laughs]。若要讓標籤不出現在可見的聊天回覆中, 但仍將其傳送至 TTS,請將它們放在 [[tts:text]]...[[/tts:text]] 區塊內:
限制為 Gemini API 的 Google Cloud Console API 金鑰適用於此 提供者。這不是個別的 Cloud Text-to-Speech API 路徑。

即時語音

內建的 google 外掛會註冊由 Gemini Live API 支援的即時語音提供者,用於 Voice Call 和 Google Meet 等後端音訊橋接器。 語音通話即時設定範例:
Google Live API 透過 WebSocket 使用雙向音訊與函式呼叫。 OpenClaw 會調整電話/Meet 橋接音訊以配合 Gemini 的 PCM Live API 串流,並 讓工具呼叫沿用共用的即時語音合約。除非需要變更取樣設定,否則請勿設定 temperature; OpenClaw 會省略非正值,因為 Google Live 在 temperature: 0 的情況下可能只傳回逐字稿而沒有音訊。 Gemini API 轉錄不需要 languageCodes 即會啟用;目前的 Google SDK 會拒絕此 API 路徑上的語言代碼提示。
Gemini 3.1 Live 透過即時輸入接受對話文字,並使用 循序函式呼叫。OpenClaw 會針對此模型省略較舊的 NON_BLOCKING、函式 回應排程與情感對話欄位。建議使用 thinkingLevel;已設定的正 thinkingBudget 值會對應至 最接近的支援層級,而 -1 則會保留 Google 的預設值。請參閱 Gemini Live 功能比較
控制介面的「Talk」支援使用受限單次 權杖的 Google Live 瀏覽器工作階段。在「Video Talk」中,瀏覽器會以 供應商每秒最多一個影格的限制,將有界限的 JPEG 影格直接傳送至 Google Live。describe_view 函式會回報該攝影機串流是否啟用。 攝影機影格不會通過閘道。僅後端的即時語音 供應商也可透過通用閘道轉送傳輸執行, 並將供應商認證資訊保留在閘道上。
若要由維護者進行即時驗證,請執行 OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts。 此冒煙測試也涵蓋 OpenAI 後端/WebRTC 路徑;Google 部分會鑄造與控制介面「Talk」所用相同形式的 受限 Live API 權杖、開啟瀏覽器 WebSocket 端點、傳送初始設定承載資料及一個 JPEG 影格,並 驗證文字回應與 describe_view 函式往返。

進階設定

對於直接執行 Gemini API(api: "google-generative-ai"),OpenClaw 會將已設定的 cachedContent 控制代碼傳遞至 Gemini 請求。
  • 使用 cachedContent 或舊版 cached_content 設定各模型或全域參數
  • 範圍越明確的參數(模型層級優先於全域)一律優先。 在相同範圍內,若同時設定兩個鍵,則以 cached_content 為準。 每個範圍只使用一個鍵,以免出現非預期結果。
  • 值範例:cachedContents/prebuilt-context
  • Gemini 快取命中用量會從上游 cachedContentTokenCount 正規化至 OpenClaw cacheRead
使用 google-gemini-cli OAuth 供應商時,OpenClaw 預設使用 Gemini 命令列介面的 stream-json 輸出,並從最終 stats 承載資料正規化用量。舊版 --output-format json 覆寫仍使用 JSON 剖析器。
  • 串流回覆文字來自助理 message 事件。
  • 對於舊版 JSON 輸出,回覆文字來自命令列介面 JSON 的 response 欄位。
  • 當命令列介面將 usage 留空時,用量會回退至 stats
  • stats.cached 會正規化至 OpenClaw cacheRead
  • 若缺少 stats.input,OpenClaw 會從 stats.input_tokens - stats.cached 推導輸入權杖數。
若閘道以常駐程式(launchd/systemd)執行,請確保該程序可使用 GEMINI_API_KEY (例如放在 ~/.openclaw/.env 中,或透過 env.shellEnv 提供)。

相關內容

模型選擇

選擇供應商、模型參照與容錯移轉行為。

圖片生成

共用圖片工具參數與供應商選擇。

影片生成

共用影片工具參數與供應商選擇。

音樂生成

共用音樂工具參數與供應商選擇。