- Nhà cung cấp:
google - Xác thực:
GEMINI_API_KEYhoặcGOOGLE_API_KEY - API: Google Gemini API
- Tùy chọn runtime:
agentRuntime.id: "google-gemini-cli"tái sử dụng OAuth của Gemini CLI trong khi vẫn giữ các tham chiếu mô hình ở dạng chuẩn làgoogle/*.
Bắt đầu
Chọn phương thức xác thực bạn muốn và làm theo các bước thiết lập.- Khóa API
- Gemini CLI (OAuth)
Phù hợp nhất cho: quyền truy cập Gemini API tiêu chuẩn thông qua Google AI Studio.Hoặc truyền khóa trực tiếp:
1
Lấy khóa API
Tạo khóa miễn phí trong Google AI Studio.
2
Chạy quy trình thiết lập ban đầu
3
Đặt mô hình mặc định
4
Xác minh mô hình khả dụng
google/gemini-3-pro-preview đã ngừng hoạt động vào 2026-03-09; hãy sử dụng google/gemini-3.1-pro-preview thay thế. Chạy lại quy trình thiết lập khóa Gemini API (openclaw onboard --auth-choice gemini-api-key hoặc openclaw models auth login --provider google) sẽ ghi đè một giá trị mặc định đã cấu hình nhưng lỗi thời bằng mô hình hiện tại.Khả năng
Tìm kiếm web
Nhà cung cấp tìm kiếm webgemini đi kèm sử dụng khả năng grounding của Google Search trong Gemini.
Cấu hình khóa tìm kiếm chuyên dụng trong plugins.entries.google.config.webSearch,
hoặc cho phép tái sử dụng models.providers.google.apiKey sau GEMINI_API_KEY:
webSearch.apiKey chuyên dụng, sau đó là GEMINI_API_KEY,
rồi models.providers.google.apiKey. webSearch.baseUrl là tùy chọn và
dành cho proxy của đơn vị vận hành hoặc các điểm cuối tương thích với Gemini API; khi bị bỏ qua,
tìm kiếm web Gemini sẽ tái sử dụng models.providers.google.baseUrl. Xem
Tìm kiếm Gemini để biết hành vi công cụ dành riêng cho nhà cung cấp.
Tạo hình ảnh
Nhà cung cấp tạo hình ảnhgoogle đi kèm mặc định sử dụng
google/gemini-3.1-flash-image.
- Cũng hỗ trợ
google/gemini-3-pro-image - Tạo: tối đa 4 hình ảnh cho mỗi yêu cầu
- Chế độ chỉnh sửa: đã bật, tối đa 5 hình ảnh đầu vào
- Điều khiển hình học:
size,aspectRatiovàresolution
Xem Tạo hình ảnh để biết các tham số công cụ dùng chung, cách chọn nhà cung cấp và hành vi chuyển đổi dự phòng.
Tạo video
Plugingoogle đi kèm cũng đăng ký khả năng tạo video thông qua
công cụ video_generate dùng chung.
- Mô hình video mặc định:
google/veo-3.1-fast-generate-preview - Chế độ: văn bản thành video, hình ảnh thành video và các luồng tham chiếu một video
- Hỗ trợ
aspectRatio(16:9,9:16) vàresolution(720P,1080P); hiện nay Veo không hỗ trợ đầu ra âm thanh - Thời lượng được hỗ trợ: 4, 6 hoặc 8 giây (các giá trị khác được điều chỉnh về giá trị được phép gần nhất)
Xem Tạo video để biết các tham số công cụ dùng chung, cách chọn nhà cung cấp và hành vi chuyển đổi dự phòng.
Tạo nhạc
Plugingoogle đi kèm cũng đăng ký khả năng tạo nhạc thông qua
công cụ music_generate dùng chung.
- Mô hình nhạc mặc định:
google/lyria-3-clip-preview - Cũng hỗ trợ
google/lyria-3-pro-preview - Điều khiển lời nhắc:
lyricsvàinstrumental - Định dạng đầu ra: mặc định là
mp3, cùng vớiwavtrêngoogle/lyria-3-pro-preview - Đầu vào tham chiếu: tối đa 10 hình ảnh
- Các lượt chạy dựa trên phiên được tách qua luồng tác vụ/trạng thái dùng chung, bao gồm
action: "status"
Xem Tạo nhạc để biết các tham số công cụ dùng chung, cách chọn nhà cung cấp và hành vi chuyển đổi dự phòng.
Chuyển văn bản thành giọng nói
Nhà cung cấp giọng nóigoogle đi kèm sử dụng đường dẫn TTS của Gemini API với
gemini-3.1-flash-tts-preview.
- Giọng nói mặc định:
Kore - Xác thực:
messages.tts.providers.google.apiKey,models.providers.google.apiKey,GEMINI_API_KEYhoặcGOOGLE_API_KEY - Đầu ra: WAV cho tệp đính kèm TTS thông thường, Opus cho đích ghi chú thoại, PCM cho Talk/điện thoại
- Đầu ra ghi chú thoại: PCM của Google được đóng gói dưới dạng WAV và chuyển mã thành Opus 48 kHz bằng
ffmpeg
generateContent đã hoàn tất. Đối với các cuộc hội thoại bằng giọng nói có độ trễ thấp nhất, hãy sử dụng
nhà cung cấp giọng nói thời gian thực của Google dựa trên Gemini Live API thay vì TTS
theo lô.
Để sử dụng Google làm nhà cung cấp TTS mặc định:
audioProfile để thêm một lời nhắc phong cách có thể tái sử dụng trước văn bản được đọc. Đặt
speakerName khi văn bản lời nhắc đề cập đến một người nói có tên.
TTS của Gemini API cũng chấp nhận các thẻ âm thanh biểu cảm trong dấu ngoặc vuông trong văn bản,
chẳng hạn như [whispers] hoặc [laughs]. Để các thẻ không xuất hiện trong phản hồi trò chuyện
nhưng vẫn gửi chúng đến TTS, hãy đặt chúng bên trong một khối [[tts:text]]...[[/tts:text]]:
Khóa API của Google Cloud Console bị giới hạn cho Gemini API hợp lệ với
nhà cung cấp này. Đây không phải là đường dẫn Cloud Text-to-Speech API riêng biệt.
Giọng nói thời gian thực
Plugingoogle đi kèm đăng ký một nhà cung cấp giọng nói thời gian thực dựa trên
Gemini Live API cho các cầu nối âm thanh phía backend như Voice Call và Google Meet.
Ví dụ về cấu hình thời gian thực cho Cuộc gọi thoại:
Google Live API sử dụng âm thanh hai chiều và gọi hàm qua WebSocket.
OpenClaw điều chỉnh âm thanh cầu nối điện thoại/Meet cho luồng PCM Live API của Gemini và
duy trì các lệnh gọi công cụ trên hợp đồng giọng nói thời gian thực dùng chung. Để trống
temperature
trừ khi cần thay đổi việc lấy mẫu; OpenClaw bỏ qua các giá trị không dương
vì Google Live có thể trả về bản chép lời không có âm thanh đối với temperature: 0.
Tính năng chép lời của Gemini API được bật mà không cần languageCodes; SDK Google
hiện tại từ chối các gợi ý mã ngôn ngữ trên đường dẫn API này.Gemini 3.1 Live tiếp nhận văn bản hội thoại qua đầu vào thời gian thực và sử dụng
cách gọi hàm tuần tự. OpenClaw bỏ qua
NON_BLOCKING cũ, việc lập lịch
phản hồi hàm và các trường hội thoại cảm xúc cho mô hình này. Nên dùng
thinkingLevel; các giá trị dương đã cấu hình cho thinkingBudget được ánh xạ tới
mức được hỗ trợ gần nhất, còn -1 giữ nguyên giá trị mặc định của Google. Xem
so sánh khả năng của Gemini Live.Talk trong Control UI hỗ trợ các phiên Google Live trên trình duyệt bằng token dùng một lần
có giới hạn. Trong Video Talk, trình duyệt gửi trực tiếp các khung hình JPEG có giới hạn tới
Google Live với mức tối đa của nhà cung cấp là một khung hình mỗi giây. Hàm
describe_view báo cáo luồng camera đó có đang hoạt động hay không.
Các khung hình camera không đi qua Gateway. Những nhà cung cấp giọng nói thời gian thực
chỉ dành cho backend cũng có thể chạy qua cơ chế truyền tiếp Gateway chung, qua đó
giữ thông tin xác thực của nhà cung cấp trên Gateway.OPENAI_API_KEY=... GEMINI_API_KEY=... node --import tsx scripts/dev/realtime-talk-live-smoke.ts.
Bài kiểm tra nhanh cũng bao quát các đường dẫn backend/WebRTC của OpenAI; nhánh Google tạo
cùng dạng token Live API có giới hạn mà Talk trong Control UI sử dụng, mở điểm cuối
WebSocket của trình duyệt, gửi tải trọng thiết lập ban đầu cùng một khung hình JPEG, rồi
xác minh phản hồi văn bản và vòng khứ hồi của hàm describe_view.
Cấu hình nâng cao
Tái sử dụng trực tiếp bộ nhớ đệm Gemini
Tái sử dụng trực tiếp bộ nhớ đệm Gemini
Đối với các lượt chạy trực tiếp bằng Gemini API (
api: "google-generative-ai"), OpenClaw
chuyển tiếp mã định danh cachedContent đã cấu hình tới các yêu cầu Gemini.- Cấu hình tham số theo từng mô hình hoặc trên toàn cục bằng
cachedContenthoặccached_contentcũ - Tham số từ phạm vi cụ thể hơn (cấp mô hình thay vì toàn cục) luôn được ưu tiên.
Trong cùng một phạm vi, nếu cả hai khóa đều được đặt,
cached_contentđược ưu tiên. Chỉ sử dụng một khóa cho mỗi phạm vi để tránh kết quả ngoài dự kiến. - Giá trị ví dụ:
cachedContents/prebuilt-context - Mức sử dụng khi khớp bộ nhớ đệm Gemini được chuẩn hóa thành
cacheReadcủa OpenClaw từcachedContentTokenCountở thượng nguồn
Lưu ý sử dụng Gemini CLI
Lưu ý sử dụng Gemini CLI
Khi sử dụng nhà cung cấp OAuth
google-gemini-cli, OpenClaw mặc định sử dụng đầu ra
stream-json của Gemini CLI và chuẩn hóa mức sử dụng từ tải trọng
stats cuối cùng. Các giá trị ghi đè --output-format json cũ vẫn sử dụng
trình phân tích cú pháp JSON.- Văn bản phản hồi được truyền trực tuyến đến từ các sự kiện
messagecủa trợ lý. - Đối với đầu ra JSON cũ, văn bản phản hồi đến từ trường
responsetrong JSON của CLI. - Mức sử dụng dự phòng sang
statskhi CLI để trốngusage. stats.cachedđược chuẩn hóa thànhcacheReadcủa OpenClaw.- Nếu thiếu
stats.input, OpenClaw suy ra token đầu vào từstats.input_tokens - stats.cached.
Thiết lập môi trường và daemon
Thiết lập môi trường và daemon
Nếu Gateway chạy dưới dạng daemon (launchd/systemd), hãy bảo đảm
GEMINI_API_KEY
khả dụng cho tiến trình đó (ví dụ: trong ~/.openclaw/.env hoặc qua
env.shellEnv).Liên quan
Lựa chọn mô hình
Chọn nhà cung cấp, tham chiếu mô hình và hành vi chuyển đổi dự phòng.
Tạo hình ảnh
Các tham số công cụ hình ảnh dùng chung và lựa chọn nhà cung cấp.
Tạo video
Các tham số công cụ video dùng chung và lựa chọn nhà cung cấp.
Tạo nhạc
Các tham số công cụ âm nhạc dùng chung và lựa chọn nhà cung cấp.