openclaw infer là bề mặt headless chuẩn cho suy luận dựa trên nhà cung cấp. Nó cung cấp các nhóm khả năng (model, image, audio, tts, video, web, embedding), thay vì tên RPC thô của Gateway hoặc mã định danh công cụ của tác tử. openclaw capability ... là bí danh cho cùng một cây lệnh.
Lý do nên ưu tiên nó thay vì một trình bao bọc dùng một lần cho nhà cung cấp:
- Tái sử dụng các nhà cung cấp và mô hình đã được cấu hình trong OpenClaw.
- Cấu trúc bao
--jsonổn định dành cho tập lệnh và tự động hóa do tác tử điều khiển (xem Đầu ra JSON). - Chạy theo đường dẫn cục bộ thông thường mà không cần Gateway đối với hầu hết các lệnh con.
- Đối với các bước kiểm tra nhà cung cấp đầu cuối, nó thực thi CLI đã phát hành, quá trình tải cấu hình, phân giải tác tử mặc định, kích hoạt Plugin đi kèm và môi trường thực thi khả năng dùng chung trước khi yêu cầu được gửi đến nhà cung cấp.
Biến infer thành một skill
Sao chép và dán nội dung này cho một tác tử:openclaw infer ... hơn các phương án cấp thấp hơn và không trình bày lại toàn bộ bề mặt infer trong nội dung skill.
Cây lệnh
infer list / infer inspect --name <capability> hiển thị cây này dưới dạng dữ liệu (mã định danh khả năng, phương thức truyền tải, mô tả).
Tác vụ phổ biến
Hành vi
- Dùng
--jsonkhi đầu ra được chuyển cho một lệnh hoặc tập lệnh khác; nếu không, dùng đầu ra văn bản. - Dùng
--providerhoặc--model provider/modelđể cố định một backend cụ thể. - Dùng
model run --thinking <level>để ghi đè chế độ suy nghĩ/lập luận cho một lần chạy:off,minimal,low,medium,high,adaptive,xhighhoặcmax. - Đối với
image describe,audio transcribevàvideo describe,--modelphải có dạng<provider/model>. - Đối với
image describe,--filechấp nhận đường dẫn cục bộ và URL HTTP(S); URL từ xa tuân theo chính sách SSRF tìm nạp phương tiện thông thường. - Các lệnh thực thi không trạng thái (
model run,image *,audio *,video *,web *,embedding *) mặc định chạy cục bộ. Các lệnh trạng thái do Gateway quản lý (tts status) mặc định chạy qua Gateway. - Đường dẫn cục bộ không bao giờ yêu cầu Gateway phải đang chạy.
model runcục bộ là một lần hoàn tất gọn nhẹ trực tiếp với nhà cung cấp: nó phân giải mô hình và thông tin xác thực đã cấu hình của tác tử nhưng không bắt đầu một lượt tác tử trò chuyện, tải công cụ hoặc mở các máy chủ MCP đi kèm.model run --fileđính kèm tệp hình ảnh (tự động phát hiện loại MIME) vào lời nhắc; lặp lại--filecho nhiều hình ảnh. Các tệp không phải hình ảnh sẽ bị từ chối — thay vào đó, hãy dùnginfer audio transcribehoặcinfer video describe.model run --gatewaythực thi định tuyến Gateway, thông tin xác thực đã lưu, lựa chọn nhà cung cấp và môi trường thực thi nhúng, nhưng vẫn là phép thăm dò mô hình thô: không có bản chép lời phiên trước đó, ngữ cảnh bootstrap/AGENTS, công cụ hoặc máy chủ MCP đi kèm.model run --gateway --model <provider/model>yêu cầu thông tin xác thực Gateway của người vận hành đáng tin cậy vì nó yêu cầu Gateway chạy một lần ghi đè nhà cung cấp/mô hình.
Mô hình
Suy luận văn bản và kiểm tra mô hình/nhà cung cấp.<provider/model> đầy đủ với --local để kiểm tra nhanh một nhà cung cấp mà không khởi động Gateway hoặc tải bề mặt công cụ của tác tử:
model runcục bộ là phép kiểm tra nhanh CLI có phạm vi hẹp nhất về tình trạng nhà cung cấp/mô hình/xác thực: đối với các nhà cung cấp không phải ChatGPT-Codex, nó chỉ gửi lời nhắc được cung cấp.model run --model <provider/model>cục bộ có thể phân giải chính xác các hàng trong danh mục tĩnh đi kèm (cùng các hàng màopenclaw models list --allhiển thị) trước khi nhà cung cấp đó được ghi vào cấu hình. Vẫn cần xác thực nhà cung cấp; nếu thiếu thông tin xác thực, lệnh sẽ thất bại với lỗi xác thực, không phảiUnknown model.- Đối với các phép thăm dò lập luận Mistral Medium 3.5, hãy để nhiệt độ không được đặt/mặc định. Mistral từ chối
reasoning_effort="high"vớitemperature: 0; hãy dùng nhiệt độ mặc định hoặc một giá trị khác 0 như0.7. - Các phép thăm dò cục bộ bằng OAuth OpenAI ChatGPT/Codex (API
openai-chatgpt-responses) thêm một chỉ dẫn hệ thống tối thiểu để phương thức truyền tải có thể điền trườnginstructionsbắt buộc — không có đầy đủ ngữ cảnh tác tử, công cụ, bộ nhớ hoặc bản chép lời phiên. model run --fileđính kèm nội dung hình ảnh trực tiếp vào tin nhắn duy nhất của người dùng. Các định dạng phổ biến (PNG, JPEG, WebP) hoạt động khi loại MIME được phát hiện làimage/*; các tệp không được hỗ trợ hoặc không nhận dạng được sẽ thất bại trước khi gọi nhà cung cấp. Thay vào đó, hãy dùnginfer image describekhi bạn muốn sử dụng cơ chế định tuyến và dự phòng mô hình hình ảnh của OpenClaw thay vì thăm dò trực tiếp mô hình đa phương thức.- Mô hình được chọn phải hỗ trợ đầu vào hình ảnh; các mô hình chỉ hỗ trợ văn bản có thể từ chối yêu cầu ở tầng nhà cung cấp.
model run --promptphải chứa văn bản không chỉ gồm khoảng trắng; lời nhắc trống bị từ chối trước mọi lệnh gọi nhà cung cấp hoặc Gateway.model runcục bộ thoát với mã khác 0 khi nhà cung cấp không trả về đầu ra văn bản, nhờ đó nhà cung cấp không thể truy cập và kết quả hoàn tất trống không bị xem nhầm là phép thăm dò thành công.- Dùng
model run --gatewayđể kiểm tra định tuyến Gateway hoặc thiết lập môi trường thực thi tác tử trong khi vẫn giữ nguyên đầu vào mô hình ở dạng thô. Dùngopenclaw agenthoặc một bề mặt trò chuyện để có đầy đủ ngữ cảnh tác tử, công cụ, bộ nhớ và bản chép lời phiên. --thinking adaptiveánh xạ tớimediumở cấp môi trường thực thi hoàn tất;--thinking maxánh xạ tớimaxđối với các mô hình OpenAI hỗ trợ mức nỗ lực tối đa gốc, nếu không thì ánh xạ tớixhigh.model auth login,model auth logoutvàmodel auth statusquản lý trạng thái xác thực nhà cung cấp đã lưu.
Hình ảnh
Tạo, chỉnh sửa và mô tả.-
Sử dụng
image editkhi bắt đầu từ các tệp đầu vào hiện có;--size,--aspect-ratiohoặc--resolutionthêm gợi ý hình học trên các nhà cung cấp/mô hình hỗ trợ chúng. -
--output-format png --background transparentcùng với--model openai/gpt-image-1.5tạo đầu ra PNG OpenAI có nền trong suốt;--openai-backgroundlà bí danh dành riêng cho OpenAI cho cùng gợi ý đó. Các nhà cung cấp không khai báo hỗ trợ nền sẽ báo cáo gợi ý này là một giá trị ghi đè bị bỏ qua (xemignoredOverridestrong phong bì JSON). -
--quality low|medium|high|autohoạt động với các nhà cung cấp hỗ trợ gợi ý chất lượng hình ảnh, bao gồm OpenAI. OpenAI cũng chấp nhận--openai-moderation low|auto. -
image providers --jsonliệt kê các nhà cung cấp hình ảnh đi kèm nào có thể được phát hiện, đã được cấu hình, được chọn và những khả năng tạo/chỉnh sửa mà mỗi nhà cung cấp cung cấp. -
image generate --model <provider/model> --jsonlà phép kiểm tra nhanh trực tiếp có phạm vi hẹp nhất cho các thay đổi về tạo hình ảnh:Phản hồi báo cáook,provider,model,attemptsvà các đường dẫn đầu ra đã ghi. Khi--outputđược đặt, phần mở rộng cuối cùng có thể tuân theo kiểu MIME do nhà cung cấp trả về. -
Đối với
image describevàimage describe-many, hãy sử dụng--promptcho một chỉ dẫn dành riêng cho tác vụ (OCR, so sánh, kiểm tra giao diện người dùng, tạo chú thích ngắn gọn). -
Sử dụng
--timeout-mscho các mô hình thị giác cục bộ chậm hoặc lần khởi động nguội của Ollama. -
Đối với
image describe, một--modelđược chỉ định rõ ràng (phải là một<provider/model>có khả năng xử lý hình ảnh) sẽ chạy trước, sau đó thửagents.defaults.imageModel.fallbacksđã cấu hình nếu lệnh gọi đó thất bại. Các lỗi chuẩn bị đầu vào (thiếu tệp, URL không được hỗ trợ) sẽ thất bại trước bất kỳ lần thử dự phòng nào, và mô hình phải có khả năng xử lý hình ảnh trong danh mục mô hình hoặc cấu hình nhà cung cấp. -
Đối với các mô hình thị giác Ollama cục bộ, trước tiên hãy kéo mô hình xuống và đặt
OLLAMA_API_KEYthành bất kỳ giá trị giữ chỗ nào, ví dụollama-local. Xem Ollama.
Âm thanh
Chuyển lời tệp thành văn bản (không phải quản lý phiên theo thời gian thực).--model phải là <provider/model>.
TTS
Tổng hợp giọng nói và trạng thái nhà cung cấp/chân dung giọng nói TTS.tts statuschỉ hỗ trợ--gateway(nó phản ánh trạng thái TTS do Gateway quản lý).- Sử dụng
tts providers,tts voices,tts personas,tts set-providervàtts set-personađể kiểm tra và cấu hình hành vi TTS.
Video
Tạo và mô tả.video generatechấp nhận--size,--aspect-ratio,--resolution,--duration,--audio,--watermarkvà--timeout-ms, được chuyển tiếp đến runtime tạo video.--modelphải là<provider/model>đối vớivideo describe.
Web
Tìm kiếm và truy xuất.web providers liệt kê các nhà cung cấp khả dụng, đã cấu hình và được chọn cho việc tìm kiếm và truy xuất.
Nhúng
Tạo vectơ và kiểm tra nhà cung cấp nhúng.Đầu ra JSON
Các lệnh infer chuẩn hóa đầu ra JSON trong một phong bì dùng chung:okcapabilitytransportprovidermodelattemptsinputs(các tệp đính kèm hình ảnh được gửi cùng yêu cầu, khi áp dụng)outputsignoredOverrides(các khóa gợi ý mà nhà cung cấp không hỗ trợ, khi áp dụng)error
outputs chứa các tệp do OpenClaw ghi. Để tự động hóa, hãy sử dụng path, mimeType, size và mọi kích thước dành riêng cho nội dung đa phương tiện trong mảng đó thay vì phân tích stdout dành cho người đọc.