image_generate tạo và chỉnh sửa hình ảnh thông qua các nhà cung cấp đã cấu hình.
Trong các phiên trò chuyện, công cụ này chạy bất đồng bộ: OpenClaw ghi lại một
tác vụ nền, trả về mã tác vụ ngay lập tức và đánh thức tác tử khi
nhà cung cấp hoàn tất. Tác tử hoàn tất tuân theo chế độ
phản hồi hiển thị thông thường của phiên: tự động gửi phản hồi cuối cùng khi được cấu hình, hoặc
message(action="send") khi phiên yêu cầu công cụ tin nhắn. Nếu
phiên của bên yêu cầu không hoạt động hoặc lần đánh thức đang hoạt động thất bại, OpenClaw sẽ gửi một
phương án dự phòng trực tiếp có tính lũy đẳng kèm theo các hình ảnh đã tạo để kết quả không bị
mất.
Công cụ chỉ xuất hiện khi có ít nhất một nhà cung cấp tạo hình ảnh
khả dụng. Nếu bạn không thấy
image_generate trong các công cụ của tác tử,
hãy cấu hình agents.defaults.imageGenerationModel, thiết lập khóa API của nhà cung cấp
hoặc đăng nhập bằng OpenAI ChatGPT/Codex OAuth.Bắt đầu nhanh
1
Cấu hình xác thực
Đặt khóa API cho ít nhất một nhà cung cấp (ví dụ:
OPENAI_API_KEY,
GEMINI_API_KEY, OPENROUTER_API_KEY) hoặc đăng nhập bằng OpenAI Codex OAuth.2
Chọn mô hình mặc định (không bắt buộc)
openai/gpt-image-2. Khi một
hồ sơ OAuth openai được cấu hình, OpenClaw định tuyến các yêu cầu hình ảnh
qua hồ sơ OAuth đó thay vì thử OPENAI_API_KEY trước.
Cấu hình models.providers.openai tường minh (khóa API, URL cơ sở tùy chỉnh/Azure)
sẽ chọn lại tuyến OpenAI Images API trực tiếp.3
Yêu cầu tác tử
“Tạo hình ảnh một linh vật rô-bốt thân thiện.”Tác tử tự động gọi
image_generate. Không cần đưa công cụ vào danh sách cho phép
— công cụ được bật theo mặc định khi có nhà cung cấp khả dụng. Công cụ
trả về mã tác vụ nền, sau đó tác tử hoàn tất gửi
tệp đính kèm đã tạo thông qua công cụ message khi tệp sẵn sàng.Các tuyến phổ biến
Cùng một công cụ xử lý cả chuyển văn bản thành hình ảnh và chỉnh sửa bằng hình ảnh tham chiếu. Sử dụng
image
cho một hình ảnh tham chiếu hoặc images cho nhiều hình ảnh. Đối với các mô hình Krea 2 trên fal, những
hình ảnh tham chiếu này được gửi dưới dạng tham chiếu phong cách thay vì đầu vào chỉnh sửa.
Các gợi ý đầu ra được nhà cung cấp hỗ trợ như quality, outputFormat và
background sẽ được chuyển tiếp khi khả dụng và được báo cáo là bị bỏ qua khi
nhà cung cấp không khai báo hỗ trợ. Khả năng hỗ trợ nền trong suốt đi kèm
chỉ dành riêng cho OpenAI; các nhà cung cấp khác vẫn có thể giữ lại kênh alpha của PNG nếu
hệ thống phụ trợ của họ xuất kênh này.
Nhà cung cấp được hỗ trợ
Sử dụng
action: "list" để kiểm tra các nhà cung cấp và mô hình khả dụng trong thời gian chạy:
action: "status" để kiểm tra tác vụ tạo hình ảnh đang hoạt động cho
phiên hiện tại:
Khả năng của nhà cung cấp
Tham số công cụ
Lời nhắc tạo hình ảnh. Bắt buộc đối với
action: "generate".Sử dụng
"status" để kiểm tra tác vụ phiên đang hoạt động hoặc "list" để kiểm tra
các nhà cung cấp và mô hình khả dụng trong thời gian chạy.Ghi đè nhà cung cấp/mô hình (ví dụ:
openai/gpt-image-2). Sử dụng
openai/gpt-image-1.5 cho nền OpenAI trong suốt.Đường dẫn hoặc URL của một hình ảnh tham chiếu cho chế độ chỉnh sửa.
Nhiều hình ảnh tham chiếu cho chế độ chỉnh sửa hoặc các mô hình tham chiếu phong cách (tối đa 14
thông qua công cụ dùng chung; các giới hạn riêng của nhà cung cấp vẫn được áp dụng).
Gợi ý kích thước:
1024x1024, 1536x1024, 1024x1536, 2048x2048, 3840x2160.Tỷ lệ khung hình:
1:1, 2:1, 20:9, 19.5:9, 2:3, 3:2, 2.35:1, 3:4,
4:3, 4:5, 5:4, 9:16, 9:19.5, 9:20, 16:9, 21:9, 1:2, 4:1,
1:4, 8:1, 1:8. Các nhà cung cấp xác thực tập con riêng của mô hình.Gợi ý độ phân giải.
Gợi ý chất lượng khi nhà cung cấp hỗ trợ.
Gợi ý định dạng đầu ra khi nhà cung cấp hỗ trợ.
Gợi ý nền khi nhà cung cấp hỗ trợ. Sử dụng
transparent với
outputFormat: "png" hoặc "webp" cho các nhà cung cấp hỗ trợ nền trong suốt.Số lượng hình ảnh cần tạo (1-4).
Thời gian chờ yêu cầu nhà cung cấp không bắt buộc, tính bằng mili giây. Khi Codex gọi
image_generate thông qua các công cụ động, giá trị cho mỗi lần gọi này vẫn ghi đè
giá trị mặc định đã cấu hình và bị giới hạn ở mức 600000 ms.Gợi ý tên tệp đầu ra.
Các gợi ý chỉ dành cho OpenAI:
background, moderation, outputCompression và user.Điều khiển độ sáng tạo của fal Krea 2. Mặc định là
medium.Không phải tất cả nhà cung cấp đều hỗ trợ mọi tham số. Khi một nhà cung cấp dự phòng hỗ trợ một
tùy chọn hình học gần tương đương thay vì tùy chọn được yêu cầu chính xác, OpenClaw sẽ ánh xạ lại sang
kích thước, tỷ lệ khung hình hoặc độ phân giải được hỗ trợ gần nhất trước khi gửi.
Các gợi ý đầu ra không được hỗ trợ sẽ bị loại bỏ đối với những nhà cung cấp không khai báo
hỗ trợ và được báo cáo trong kết quả công cụ. Kết quả công cụ báo cáo các
thiết lập đã áp dụng;
details.normalization ghi lại mọi phép chuyển đổi
từ giá trị được yêu cầu sang giá trị được áp dụng.Cấu hình
Lựa chọn mô hình
Thứ tự chọn nhà cung cấp
OpenClaw thử các nhà cung cấp theo thứ tự sau:- Tham số
modeltừ lệnh gọi công cụ (nếu agent chỉ định). imageGenerationModel.primarytừ cấu hình.imageGenerationModel.fallbackstheo thứ tự.- Tự động phát hiện - chỉ các giá trị mặc định của nhà cung cấp có thông tin xác thực:
- nhà cung cấp mặc định hiện tại trước;
- các nhà cung cấp tạo ảnh đã đăng ký còn lại theo thứ tự mã định danh nhà cung cấp.
Giá trị ghi đè mô hình cho từng lệnh gọi là chính xác
Giá trị ghi đè mô hình cho từng lệnh gọi là chính xác
Giá trị ghi đè
model cho từng lệnh gọi chỉ thử nhà cung cấp/mô hình đó và
không tiếp tục tới nhà cung cấp chính/dự phòng đã cấu hình hoặc các nhà cung cấp được tự động phát hiện.Tự động phát hiện có nhận biết xác thực
Tự động phát hiện có nhận biết xác thực
Giá trị mặc định của một nhà cung cấp chỉ được đưa vào danh sách ứng viên khi OpenClaw thực sự có thể
xác thực với nhà cung cấp đó. Đặt
agents.defaults.mediaGenerationAutoProviderFallback: false để chỉ sử dụng
các mục model, primary và fallbacks được chỉ định rõ ràng.Thời gian chờ
Thời gian chờ
Đặt
agents.defaults.imageGenerationModel.timeoutMs cho các phần phụ trợ tạo ảnh
chậm. Tham số công cụ timeoutMs cho từng lệnh gọi sẽ ghi đè giá trị mặc định đã cấu hình,
và các giá trị mặc định đã cấu hình sẽ ghi đè giá trị mặc định của nhà cung cấp
do plugin tạo. Các nhà cung cấp ảnh được lưu trữ trên Google và OpenRouter sử dụng giá trị mặc định
180 giây; tính năng tạo ảnh của Microsoft Foundry MAI, xAI và Azure OpenAI sử dụng
600 giây. Các lệnh gọi công cụ động của Codex sử dụng giá trị mặc định cầu nối image_generate
là 120 giây và tuân theo cùng ngân sách thời gian chờ khi được cấu hình, với giới hạn
tối đa 600000 ms của cầu nối công cụ động OpenClaw.Kiểm tra khi chạy
Kiểm tra khi chạy
Sử dụng
action: "list" để kiểm tra các nhà cung cấp hiện đã đăng ký,
mô hình mặc định của chúng và gợi ý về biến môi trường xác thực.Chỉnh sửa ảnh
OpenAI, OpenRouter, Google, DeepInfra, fal, Microsoft Foundry, MiniMax, ComfyUI và xAI hỗ trợ chỉnh sửa ảnh tham chiếu. Các mô hình Krea 2 trên fal sử dụng cùng các trườngimage / images làm tham chiếu phong cách thay vì đầu vào
chỉnh sửa. Truyền đường dẫn hoặc URL của ảnh tham chiếu:
images; xAI hỗ trợ tối đa 3. fal hỗ trợ 1 ảnh tham chiếu cho
Flux chuyển ảnh thành ảnh, tối đa 10 ảnh cho chỉnh sửa GPT Image 2, tối đa 10 tham chiếu phong cách
cho Krea 2 và tối đa 14 ảnh cho chỉnh sửa Nano Banana 2. Microsoft Foundry, MiniMax
và ComfyUI hỗ trợ 1 ảnh.
Tìm hiểu chuyên sâu về nhà cung cấp
OpenAI gpt-image-2 (và gpt-image-1.5)
OpenAI gpt-image-2 (và gpt-image-1.5)
Tính năng tạo ảnh của OpenAI mặc định sử dụng
openai/gpt-image-2. Nếu hồ sơ OAuth
openai được cấu hình, OpenClaw sẽ tái sử dụng cùng hồ sơ
OAuth mà các mô hình trò chuyện theo gói đăng ký Codex sử dụng và gửi
yêu cầu ảnh qua phần phụ trợ Codex Responses. Các URL cơ sở Codex cũ
như https://chatgpt.com/backend-api được chuẩn hóa thành
https://chatgpt.com/backend-api/codex cho các yêu cầu ảnh. OpenClaw
không âm thầm chuyển dự phòng sang OPENAI_API_KEY cho yêu cầu đó -
để buộc định tuyến trực tiếp qua OpenAI Images API, hãy cấu hình
models.providers.openai một cách rõ ràng bằng khóa API, URL cơ sở tùy chỉnh
hoặc điểm cuối Azure.Các mô hình openai/gpt-image-1.5, openai/gpt-image-1 và
openai/gpt-image-1-mini vẫn có thể được chọn rõ ràng. Sử dụng
gpt-image-1.5 để xuất PNG/WebP với nền trong suốt; API
gpt-image-2 hiện tại từ chối background: "transparent".gpt-image-2 hỗ trợ cả tạo ảnh từ văn bản và
chỉnh sửa ảnh tham chiếu thông qua cùng công cụ image_generate.
OpenClaw chuyển tiếp prompt, count, size, quality, outputFormat
và các ảnh tham chiếu tới OpenAI. OpenAI không trực tiếp nhận
aspectRatio hoặc resolution; khi có thể, OpenClaw ánh xạ
chúng sang một size được hỗ trợ, nếu không công cụ sẽ báo cáo chúng là
các giá trị ghi đè bị bỏ qua.Các tùy chọn dành riêng cho OpenAI nằm trong đối tượng openai:openai.background chấp nhận transparent, opaque hoặc auto;
đầu ra trong suốt yêu cầu outputFormat png hoặc webp và một
mô hình ảnh OpenAI có khả năng hỗ trợ độ trong suốt. OpenClaw định tuyến các yêu cầu
nền trong suốt gpt-image-2 mặc định tới gpt-image-1.5.
openai.outputCompression áp dụng cho đầu ra JPEG/WebP và bị bỏ qua
đối với đầu ra PNG.Gợi ý background cấp cao nhất không phụ thuộc nhà cung cấp và hiện được ánh xạ
tới cùng trường yêu cầu background của OpenAI khi nhà cung cấp OpenAI
được chọn. Các nhà cung cấp không khai báo hỗ trợ nền sẽ trả về
giá trị này trong ignoredOverrides thay vì nhận tham số không được hỗ trợ.Để định tuyến tính năng tạo ảnh OpenAI qua một bản triển khai Azure OpenAI
thay vì api.openai.com, hãy xem
Các điểm cuối Azure OpenAI.Các mô hình ảnh Microsoft Foundry MAI
Các mô hình ảnh Microsoft Foundry MAI
Tính năng tạo ảnh Microsoft Foundry sử dụng tên bản triển khai ảnh MAI đã triển khai
dưới tiền tố nhà cung cấp Nhà cung cấp sử dụng API MAI của Microsoft Foundry, không phải OpenAI Images API:
microsoft-foundry/. Không có mô hình mặc định
ở cấp nhà cung cấp vì API MAI yêu cầu tên bản triển khai của bạn trong
trường model:- Điểm cuối tạo ảnh:
/mai/v1/images/generations - Điểm cuối chỉnh sửa:
/mai/v1/images/edits - Xác thực:
AZURE_OPENAI_API_KEY/ khóa API của nhà cung cấp, hoặc Entra ID thông quaaz login - Đầu ra: một ảnh PNG
- Kích thước: mặc định
1024x1024; chiều rộng và chiều cao đều phải ít nhất là 768 px, và tổng số pixel không được vượt quá 1,048,576 - Chỉnh sửa: một ảnh tham chiếu PNG hoặc JPEG, chỉ được hỗ trợ bởi
các bản triển khai
MAI-Image-2.5-FlashvàMAI-Image-2.5
MAI-Image-2.5-Flash hoặc MAI-Image-2.5.Các mô hình ảnh MAI hiện tại là MAI-Image-2.5-Flash, MAI-Image-2.5,
MAI-Image-2e và MAI-Image-2. Xem
Plugin Microsoft Foundry để biết cách thiết lập
và hành vi của mô hình trò chuyện.Các mô hình ảnh OpenRouter
Các mô hình ảnh OpenRouter
Tính năng tạo ảnh OpenRouter sử dụng cùng OpenClaw chuyển tiếp
OPENROUTER_API_KEY và
định tuyến qua API ảnh hoàn thành trò chuyện của OpenRouter. Chọn
các mô hình ảnh OpenRouter bằng tiền tố openrouter/:prompt, count, các ảnh tham chiếu và
gợi ý aspectRatio / resolution tương thích với Gemini tới OpenRouter.
Các lối tắt tích hợp sẵn hiện tại cho mô hình ảnh OpenRouter bao gồm
google/gemini-3.1-flash-image,
google/gemini-3-pro-image và openai/gpt-5.4-image-2. Sử dụng
action: "list" để xem plugin đã cấu hình của bạn cung cấp những gì.fal Krea 2
fal Krea 2
Các mô hình Krea 2 trên fal sử dụng lược đồ Krea gốc của fal thay vì lược đồ
Krea 2 hiện trả về một ảnh cho mỗi yêu cầu. Ưu tiên
image_size chung mà Flux sử dụng. OpenClaw gửi:aspect_ratiocho các gợi ý về tỷ lệ khung hìnhcreativity, mặc định làmediumimage_style_referenceskhiimagehoặcimagesđược cung cấp
aspectRatio cho
Krea; OpenClaw ánh xạ size tới tỷ lệ khung hình Krea được hỗ trợ gần nhất và
từ chối resolution đối với Krea thay vì bỏ qua nó. Sử dụng fal.creativity
khi bạn muốn mức độ sáng tạo gốc của Krea:Xác thực kép MiniMax
Xác thực kép MiniMax
Tính năng tạo ảnh MiniMax khả dụng qua cả hai
phương thức xác thực MiniMax đi kèm:
minimax/image-01cho thiết lập bằng khóa APIminimax-portal/image-01cho thiết lập bằng OAuth
xAI grok-imagine-image
xAI grok-imagine-image
Nhà cung cấp xAI đi kèm sử dụng
/v1/images/generations cho các yêu cầu
chỉ có câu lệnh và /v1/images/edits khi có image hoặc images.- Mô hình:
xai/grok-imagine-image,xai/grok-imagine-image-quality - Số lượng: tối đa 4
- Tham chiếu: một
imagehoặc tối đa baimages - Tỷ lệ khung hình:
1:1,16:9,9:16,4:3,3:4,3:2,2:3,2:1,1:2,19.5:9,9:19.5,20:9,9:20 - Độ phân giải:
1K,2K - Đầu ra: được trả về dưới dạng tệp đính kèm ảnh do OpenClaw quản lý
quality, mask,
user gốc của xAI hoặc tỷ lệ khung hình auto cho đến khi các điều khiển đó tồn tại trong
hợp đồng image_generate dùng chung giữa các nhà cung cấp.Ví dụ
- Tạo (phong cảnh 4K)
- Tạo (PNG trong suốt)
- Tạo (OpenAI chất lượng thấp)
- Tạo (hai ảnh vuông)
- Chỉnh sửa (một ảnh tham chiếu)
- Chỉnh sửa (nhiều ảnh tham chiếu)
- Tham chiếu phong cách Krea
--output-format, --background, --quality và
--openai-moderation tương tự cũng có trên openclaw infer image edit;
--openai-background vẫn là bí danh dành riêng cho OpenAI. Hiện tại, các nhà cung cấp
đi kèm ngoài OpenAI không khai báo rõ khả năng kiểm soát nền, vì vậy
background: "transparent" được báo cáo là bị bỏ qua đối với chúng.
Liên quan
- Tổng quan về công cụ - tất cả công cụ tác tử hiện có
- ComfyUI - thiết lập quy trình làm việc cho ComfyUI cục bộ và Comfy Cloud
- fal - thiết lập nhà cung cấp hình ảnh và video fal
- Google (Gemini) - thiết lập nhà cung cấp hình ảnh Gemini
- Plugin Microsoft Foundry - thiết lập trò chuyện Microsoft Foundry và hình ảnh MAI
- MiniMax - thiết lập nhà cung cấp hình ảnh MiniMax
- OpenAI - thiết lập nhà cung cấp OpenAI Images
- Vydra - thiết lập hình ảnh, video và giọng nói Vydra
- xAI - thiết lập hình ảnh, video, tìm kiếm, thực thi mã và TTS Grok
- Tham chiếu cấu hình - cấu hình
imageGenerationModel - Mô hình - cấu hình mô hình và chuyển đổi dự phòng