Chuyển đến nội dung chính
OpenClaw giao tiếp với API gốc của Ollama (/api/chat), không phải endpoint tương thích với OpenAI /v1. Ba chế độ được hỗ trợ: Để thiết lập chỉ dùng đám mây với id nhà cung cấp chuyên biệt ollama-cloud, hãy xem Ollama Cloud. Sử dụng các tham chiếu ollama-cloud/<model> khi bạn muốn giữ định tuyến đám mây tách biệt với nhà cung cấp ollama cục bộ.
Không sử dụng URL tương thích với OpenAI /v1 (http://host:11434/v1). URL này làm hỏng việc gọi công cụ và các mô hình có thể xuất JSON gọi công cụ thô dưới dạng văn bản thuần túy. Hãy sử dụng URL gốc: baseUrl: "http://host:11434" (không có /v1).
Khóa cấu hình chuẩn là baseUrl. baseURL cũng được chấp nhận cho các ví dụ theo kiểu OpenAI SDK, nhưng cấu hình mới nên sử dụng baseUrl.

Quy tắc xác thực

Các URL Ollama dạng loopback, mạng riêng, .local và tên máy chủ thuần không cần bearer token thực. OpenClaw sử dụng dấu hiệu ollama-local cho các URL này.
Các máy chủ từ xa công khai và https://ollama.com yêu cầu thông tin xác thực thực: OLLAMA_API_KEY, hồ sơ xác thực hoặc apiKey của nhà cung cấp. Để sử dụng trực tiếp dịch vụ được lưu trữ, nên dùng nhà cung cấp ollama-cloud.
Nhà cung cấp tùy chỉnh có api: "ollama" tuân theo các quy tắc tương tự. Ví dụ, nhà cung cấp ollama-remote trỏ đến máy chủ LAN riêng có thể sử dụng apiKey: "ollama-local"; các tác tử con phân giải dấu hiệu đó thông qua hook của nhà cung cấp Ollama thay vì coi đó là thông tin xác thực bị thiếu. agents.defaults.memorySearch.provider cũng có thể trỏ đến id nhà cung cấp tùy chỉnh để các embedding sử dụng endpoint Ollama đó.
auth-profiles.json lưu thông tin xác thực cho một id nhà cung cấp; đặt các thiết lập endpoint (baseUrl, api, mô hình, header, thời gian chờ) trong models.providers.<id>. Các tệp phẳng cũ như { "ollama-windows": { "apiKey": "ollama-local" } } không phải là định dạng thời gian chạy; openclaw doctor --fix ghi lại chúng thành hồ sơ khóa API ollama-windows:default chuẩn và tạo bản sao lưu. Giá trị baseUrl trong tệp cũ đó là dữ liệu nhiễu và nên được chuyển sang cấu hình nhà cung cấp.
Xác thực bearer cho embedding bộ nhớ Ollama được giới hạn trong máy chủ mà nó được khai báo:
  • Khóa cấp nhà cung cấp chỉ được gửi đến máy chủ của nhà cung cấp đó.
  • agents.*.memorySearch.remote.apiKey chỉ được gửi đến máy chủ embedding từ xa của nó.
  • Giá trị env thuần OLLAMA_API_KEY được coi là quy ước của Ollama Cloud và theo mặc định không được gửi đến các máy chủ cục bộ/tự lưu trữ.

Bắt đầu

1

Chạy thiết lập ban đầu

Chọn Ollama, sau đó chọn một chế độ: Đám mây + Cục bộ, Chỉ đám mây hoặc Chỉ cục bộ.Trong lần thiết lập có hướng dẫn mới, trước tiên OpenClaw kiểm tra máy chủ Ollama mặc định hoặc đã cấu hình. Nếu một mô hình đã cài đặt công bố hỗ trợ công cụ, quy trình thiết lập dùng chung cho CLI/macOS sẽ cung cấp mô hình đó ngay lập tức và xác minh bằng một lượt hoàn thành thực. Kiểm tra tự động này không bao giờ tải mô hình xuống; nếu không có mô hình phù hợp nào đã được cài đặt, quá trình thiết lập ban đầu tiếp tục đến trình chọn Ollama thông thường.
2

Chọn mô hình

Cloud only yêu cầu nhập OLLAMA_API_KEY và đề xuất các giá trị mặc định được lưu trữ trên đám mây. Cloud + LocalLocal only yêu cầu URL cơ sở Ollama, khám phá các mô hình khả dụng và tự động tải mô hình cục bộ đã chọn nếu còn thiếu. Thẻ :latest đã cài đặt như gemma4:latest được hiển thị một lần thay vì lặp lại gemma4. Cloud + Local cũng kiểm tra xem máy chủ đã đăng nhập để truy cập đám mây hay chưa.
3

Xác minh

Không tương tác:
--custom-base-url--custom-model-id là tùy chọn; nếu bỏ qua, hệ thống sử dụng máy chủ cục bộ mặc định và mô hình được đề xuất gemma4.

Mô hình đám mây thông qua máy chủ cục bộ

Cloud + Local định tuyến cả mô hình cục bộ và mô hình :cloud thông qua một máy chủ Ollama có thể truy cập — đây là luồng kết hợp của Ollama và là chế độ cần chọn trong quá trình thiết lập khi bạn muốn sử dụng cả hai. OpenClaw yêu cầu URL cơ sở, khám phá các mô hình cục bộ và kiểm tra trạng thái ollama signin. Khi đã đăng nhập, hệ thống đề xuất các giá trị mặc định được lưu trữ (kimi-k2.5:cloud, minimax-m2.7:cloud, glm-5.1:cloud, glm-5.2:cloud). Nếu chưa đăng nhập, thiết lập chỉ duy trì ở chế độ cục bộ cho đến khi bạn chạy ollama signin. Để chỉ truy cập đám mây mà không cần daemon cục bộ, hãy sử dụng openclaw onboard --auth-choice ollama-cloud và xem Ollama Cloud — đường dẫn đó không cần ollama signin hoặc máy chủ đang chạy:
Danh sách mô hình đám mây hiển thị trong openclaw onboard được lấy trực tiếp từ https://ollama.com/api/tags, giới hạn ở 500 mục, vì vậy trình chọn phản ánh danh mục được lưu trữ hiện tại. Nếu không thể truy cập ollama.com hoặc endpoint này không trả về mô hình nào tại thời điểm thiết lập, OpenClaw dùng danh sách đề xuất được mã hóa cứng làm phương án dự phòng để quá trình thiết lập ban đầu vẫn hoàn tất.

Khám phá mô hình (nhà cung cấp ngầm định)

Khi OLLAMA_API_KEY (hoặc hồ sơ xác thực) được đặt và cả models.providers.ollama lẫn nhà cung cấp tùy chỉnh khác có api: "ollama" đều không được định nghĩa, OpenClaw khám phá các mô hình từ http://127.0.0.1:11434:
Việc đặt models.providers.ollama với mảng models tường minh hoặc một nhà cung cấp tùy chỉnh có api: "ollama"baseUrl không phải loopback sẽ vô hiệu hóa tính năng tự động khám phá; khi đó phải định nghĩa các mô hình theo cách thủ công (xem Cấu hình). Mục models.providers.ollama trỏ đến https://ollama.com được lưu trữ cũng bỏ qua khám phá vì các mô hình Ollama Cloud do nhà cung cấp quản lý. Các nhà cung cấp tùy chỉnh dạng loopback như http://127.0.0.2:11434 vẫn được coi là cục bộ và duy trì tính năng tự động khám phá. Bạn có thể sử dụng tham chiếu đầy đủ như ollama/<pulled-model>:latest mà không cần mục models.json viết thủ công; OpenClaw phân giải trực tiếp tham chiếu đó. Đối với các máy chủ đã đăng nhập, việc chọn tham chiếu ollama/<model>:cloud không có trong danh sách sẽ xác thực chính xác mô hình đó bằng /api/show và chỉ thêm nó vào danh mục thời gian chạy nếu Ollama xác nhận siêu dữ liệu — lỗi chính tả vẫn khiến mô hình bị báo là không xác định.

Kiểm thử nhanh

Để thăm dò văn bản trong phạm vi hẹp mà không sử dụng toàn bộ bề mặt công cụ của tác tử:
Thêm --file cùng một hình ảnh để thăm dò gọn nhẹ mô hình thị giác (chấp nhận PNG/JPEG/WebP; các tệp không phải hình ảnh bị từ chối trước khi gọi Ollama — sử dụng openclaw infer audio transcribe cho âm thanh):
Cả hai đường dẫn đều không tải công cụ trò chuyện, bộ nhớ hoặc ngữ cảnh phiên. Nếu thao tác này thành công trong khi phản hồi thông thường của tác tử thất bại, vấn đề có thể nằm ở khả năng xử lý công cụ/tác tử của mô hình, chứ không phải endpoint. Việc chọn mô hình bằng /model ollama/<model> là lựa chọn chính xác của người dùng: nếu baseUrl đã cấu hình không thể truy cập, phản hồi tiếp theo sẽ thất bại với lỗi từ nhà cung cấp thay vì âm thầm chuyển sang một mô hình đã cấu hình khác. Các tác vụ Cron biệt lập thêm một bước kiểm tra an toàn cục bộ trước khi bắt đầu lượt của agent: nếu mô hình được chọn phân giải thành nhà cung cấp Ollama trên mạng cục bộ/riêng/.local và không thể truy cập /api/tags, OpenClaw ghi nhận lần chạy đó là skipped, kèm mô hình trong nội dung lỗi. Bước kiểm tra điểm cuối này được lưu vào bộ nhớ đệm trong 5 phút cho mỗi máy chủ, vì vậy các tác vụ Cron lặp lại nhắm đến một daemon đã dừng sẽ không đồng loạt khởi chạy các yêu cầu thất bại. Xác minh trực tiếp:
Đối với Ollama Cloud, hãy trỏ cùng bài kiểm thử trực tiếp đó đến điểm cuối được lưu trữ (mặc định bỏ qua embedding; buộc bật bằng OPENCLAW_LIVE_OLLAMA_EMBEDDINGS=1 vì khóa đám mây có thể không cấp quyền cho /api/embed):
Để thêm một mô hình, hãy kéo mô hình đó về và hệ thống sẽ tự động phát hiện:

Suy luận cục bộ trên Node

Các agent có thể ủy quyền một tác vụ ngắn cho mô hình Ollama trên máy tính để bàn hoặc Node máy chủ đã ghép đôi. Lời nhắc và phản hồi đi qua kết nối Gateway/Node đã xác thực hiện có; yêu cầu chạy trên điểm cuối Ollama loopback của chính Node đó (http://127.0.0.1:11434).
1

Khởi động Ollama trên Node

2

Kết nối máy chủ Node

Phê duyệt thiết bị và các lệnh Node của thiết bị đó trên máy chủ Gateway, sau đó xác minh:
Kết nối lần đầu hoặc một bản nâng cấp bổ sung các lệnh Ollama có thể kích hoạt yêu cầu phê duyệt lệnh Node. Nếu Node kết nối mà không quảng bá ollama.modelsollama.chat, hãy kiểm tra lại openclaw nodes pending.
3

Sử dụng từ một agent

Plugin Ollama đi kèm cung cấp công cụ node_inference. Các agent gọi action: "discover" trước, sau đó gọi action: "run" với một Node và mô hình từ kết quả đó (run có thể bỏ qua Node khi chỉ có đúng một Node đủ khả năng đang kết nối). Ví dụ: “Phát hiện các mô hình Ollama trên các Node của tôi, sau đó dùng mô hình đã tải nhanh nhất để tóm tắt văn bản này.”
Quá trình phát hiện đọc /api/tags, kiểm tra các khả năng /api/show và sử dụng /api/ps khi có thể để ưu tiên xếp hạng các mô hình đã tải. Quá trình này chỉ trả về các mô hình cục bộ mà Ollama báo cáo là có khả năng trò chuyện (khả năng completion) — các hàng Ollama Cloud và mô hình chỉ dành cho embedding bị loại trừ. Mỗi lần chạy đều tắt chế độ suy nghĩ của mô hình và mặc định giới hạn đầu ra ở 512 token (giới hạn cứng 8192), trừ khi lệnh gọi công cụ yêu cầu maxTokens khác; một số mô hình (ví dụ GPT-OSS) không hỗ trợ tắt chế độ suy nghĩ và vẫn có thể phát ra token lập luận. Để giữ Ollama chạy trên một Node mà không cung cấp nó cho các agent:
Khởi động lại Node (openclaw node restart, hoặc dừng/chạy lại openclaw node run đối với một phiên chạy ở tiền cảnh). Node ngừng quảng bá ollama.modelsollama.chat; bản thân Ollama và nhà cung cấp Ollama của Gateway không bị ảnh hưởng. Đặt lại giá trị thành true rồi khởi động lại để bật lại; bề mặt lệnh đã thay đổi có thể cần phê duyệt lại openclaw nodes pending sau khi kết nối lại. Xác minh trực tiếp các lệnh Node mà không cần lượt của agent:
--invoke-timeout giới hạn thời gian Node được phép chạy lệnh; --timeout giới hạn toàn bộ lệnh gọi Gateway và phải lớn hơn. Suy luận cục bộ trên Node luôn sử dụng điểm cuối loopback của chính Node đó — nó không tái sử dụng models.providers.ollama.baseUrl từ xa/đám mây đã cấu hình. Các lệnh Node mặc định khả dụng trên các máy chủ Node macOS, Linux và Windows và vẫn chịu sự điều chỉnh của chính sách ghép đôi/lệnh Node thông thường.

Thị giác và mô tả hình ảnh

Plugin Ollama đi kèm đăng ký Ollama làm nhà cung cấp hiểu nội dung đa phương tiện có khả năng xử lý hình ảnh, vì vậy OpenClaw có thể định tuyến các yêu cầu mô tả hình ảnh rõ ràng và giá trị mặc định của mô hình hình ảnh đã cấu hình thông qua các mô hình thị giác Ollama cục bộ hoặc được lưu trữ.
--model phải là một tham chiếu <provider/model> đầy đủ; khi được đặt, infer image describe sẽ thử mô hình đó trước thay vì bỏ qua bước mô tả đối với các mô hình đã hỗ trợ thị giác nguyên bản. Nếu lệnh gọi thất bại, OpenClaw có thể tiếp tục qua agents.defaults.imageModel.fallbacks; lỗi chuẩn bị tệp/URL sẽ khiến quá trình thất bại trước khi thử phương án dự phòng. Dùng infer image describe cho luồng hiểu hình ảnh của OpenClaw và imageModel đã cấu hình; dùng infer model run --file cho phép thăm dò đa phương thức thô với lời nhắc tùy chỉnh. Để đặt Ollama làm nhà cung cấp hiểu hình ảnh mặc định cho nội dung đa phương tiện đến:
Ưu tiên tham chiếu ollama/<model> đầy đủ. Một tham chiếu imageModel trần như qwen2.5vl:7b chỉ được chuẩn hóa thành ollama/qwen2.5vl:7b khi đúng mô hình đó được liệt kê trong models.providers.ollama.models với input: ["text", "image"] và không có nhà cung cấp hình ảnh đã cấu hình nào khác cung cấp cùng một id trần; nếu không, hãy sử dụng rõ ràng tiền tố nhà cung cấp. Các mô hình thị giác cục bộ chậm có thể cần thời gian chờ hiểu hình ảnh dài hơn các mô hình đám mây và có thể gặp sự cố trên phần cứng hạn chế nếu Ollama cố gắng phân bổ toàn bộ ngữ cảnh thị giác được mô hình quảng bá. Hãy đặt thời gian chờ khả năng và giới hạn num_ctx:
Thời gian chờ này áp dụng cho việc hiểu hình ảnh đến và cho công cụ image rõ ràng. models.providers.ollama.timeoutSeconds vẫn kiểm soát cơ chế bảo vệ yêu cầu HTTP Ollama bên dưới cho các lệnh gọi mô hình thông thường. Xác minh trực tiếp:
Nếu bạn tự định nghĩa models.providers.ollama.models, hãy đánh dấu rõ ràng các mô hình thị giác:
OpenClaw từ chối các yêu cầu mô tả hình ảnh đối với những mô hình không được đánh dấu là có khả năng xử lý hình ảnh. Với quá trình phát hiện ngầm định, thông tin này đến từ khả năng thị giác của /api/show.

Cấu hình

Nếu OLLAMA_API_KEY được đặt, bạn có thể bỏ qua apiKey trong mục nhà cung cấp; OpenClaw sẽ điền giá trị đó để kiểm tra tính khả dụng.

Các công thức phổ biến

Thay thế ID mô hình bằng tên chính xác từ ollama list hoặc openclaw models list --provider ollama.
Ollama trên cùng máy với Gateway, được phát hiện tự động:
Không thêm khối models.providers.ollama trừ khi bạn cần các mô hình thủ công.
contextWindow là ngân sách ngữ cảnh của OpenClaw; params.num_ctx được gửi đến Ollama. Hãy giữ chúng đồng bộ khi phần cứng không thể chạy toàn bộ ngữ cảnh được mô hình quảng bá.
Không có daemon cục bộ, dùng trực tiếp các mô hình được lưu trữ:
Đối với id nhà cung cấp chuyên dụng ollama-cloud thay vì cấu trúc này, hãy xem Ollama Cloud.
Sử dụng các ID nhà cung cấp tùy chỉnh khi chạy nhiều máy chủ Ollama; mỗi máy chủ có host, mô hình, thông tin xác thực và thời gian chờ riêng.
OpenClaw loại bỏ tiền tố nhà cung cấp đang hoạt động (dự phòng về tiền tố ollama/ thuần túy) trước khi gọi Ollama, vì vậy ollama-large/qwen3.5:27b đến Ollama dưới dạng qwen3.5:27b.
Một số mô hình cục bộ xử lý được các lời nhắc đơn giản nhưng gặp khó khăn với toàn bộ bề mặt công cụ của tác nhân. Hãy giới hạn công cụ và ngữ cảnh trước khi thay đổi các cài đặt thời gian chạy toàn cục:
Chỉ sử dụng compat.supportsTools: false khi mô hình hoặc máy chủ liên tục gặp lỗi với lược đồ công cụ — tùy chọn này đánh đổi khả năng của tác nhân để lấy tính ổn định. localModelLean loại bỏ các công cụ nặng về trình duyệt, cron, tin nhắn, tạo phương tiện, giọng nói và PDF khỏi bề mặt tác nhân trực tiếp trừ khi được yêu cầu rõ ràng, đồng thời đặt các danh mục lớn hơn phía sau Tìm kiếm công cụ. Tùy chọn này không thay đổi ngữ cảnh thời gian chạy hoặc chế độ suy nghĩ của Ollama. Kết hợp với params.num_ctxparams.thinking: false cho các mô hình suy nghĩ nhỏ kiểu Qwen bị lặp hoặc dành hết ngân sách cho suy luận ẩn.

Lựa chọn mô hình

Các ID nhà cung cấp tùy chỉnh hoạt động theo cách tương tự: đối với một tham chiếu sử dụng tiền tố nhà cung cấp đang hoạt động, chẳng hạn như ollama-spark/qwen3:32b, OpenClaw loại bỏ tiền tố đó trước khi gọi Ollama và gửi qwen3:32b. Đối với các mô hình cục bộ chậm, hãy ưu tiên tinh chỉnh trong phạm vi nhà cung cấp trước khi tăng thời gian chờ của toàn bộ thời gian chạy tác nhân:
timeoutSeconds bao quát yêu cầu HTTP của mô hình: thiết lập kết nối, tiêu đề, truyền phát phần thân và thao tác hủy guarded-fetch tổng thể. params.keep_alive được chuyển tiếp dưới dạng keep_alive cấp cao nhất trong các yêu cầu /api/chat gốc; hãy đặt theo từng mô hình khi thời gian tải ở lượt đầu tiên là nút thắt cổ chai.

Xác minh nhanh

Đối với các host từ xa, hãy thay 127.0.0.1 bằng host baseUrl. Nếu curl hoạt động nhưng OpenClaw không hoạt động, hãy kiểm tra xem Gateway có chạy trên một máy, vùng chứa hoặc tài khoản dịch vụ khác hay không.

Tìm kiếm web Ollama

OpenClaw tích hợp sẵn Tìm kiếm web Ollama dưới dạng nhà cung cấp web_search. Chọn tùy chọn này trong openclaw onboard hoặc openclaw configure --section web, hoặc đặt:
Đối với tìm kiếm được lưu trữ trực tiếp thông qua Ollama Cloud:
Đối với host tự lưu trữ, trước tiên OpenClaw thử proxy /api/experimental/web_search cục bộ, sau đó dự phòng sang đường dẫn /api/web_search được lưu trữ trên cùng host; một daemon cục bộ đã đăng nhập thường phản hồi thông qua proxy cục bộ. Các lệnh gọi trực tiếp https://ollama.com luôn sử dụng điểm cuối /api/web_search được lưu trữ.
Để biết đầy đủ về thiết lập và hành vi, hãy xem Tìm kiếm web Ollama.

Cấu hình nâng cao

Việc gọi công cụ không đáng tin cậy trong chế độ này. Chỉ sử dụng khi proxy cần định dạng OpenAI và bạn không phụ thuộc vào tính năng gọi công cụ gốc.
Đặt api: "openai-completions" rõ ràng cho một proxy phía sau /v1/chat/completions:
Chế độ này có thể không hỗ trợ đồng thời truyền phát và gọi công cụ; bạn có thể cần params: { streaming: false } trên mô hình.OpenClaw chèn options.num_ctx theo mặc định trong chế độ này để Ollama không âm thầm dự phòng về ngữ cảnh 4096 token. Nếu proxy của bạn từ chối các trường options không xác định, hãy tắt tùy chọn này:
Đối với các mô hình được tự động phát hiện, OpenClaw sử dụng cửa sổ ngữ cảnh mà /api/show báo cáo, bao gồm các giá trị PARAMETER num_ctx lớn hơn từ Modelfile tùy chỉnh; nếu không, OpenClaw dự phòng về cửa sổ ngữ cảnh Ollama mặc định của mình.contextWindow, contextTokensmaxTokens ở cấp nhà cung cấp đặt giá trị mặc định cho mọi mô hình thuộc nhà cung cấp đó và có thể được ghi đè theo từng mô hình. contextWindow là ngân sách lời nhắc/Compaction riêng của OpenClaw. Các yêu cầu /api/chat gốc để options.num_ctx ở trạng thái chưa đặt trừ khi bạn đặt params.num_ctx rõ ràng, vì vậy Ollama áp dụng giá trị mặc định dựa trên mô hình, OLLAMA_CONTEXT_LENGTH hoặc VRAM của riêng mình; các giá trị params.num_ctx không hợp lệ, bằng 0, âm hoặc không hữu hạn sẽ bị bỏ qua. Nếu một cấu hình cũ chỉ sử dụng contextWindow/maxTokens để buộc ngữ cảnh yêu cầu gốc, hãy chạy openclaw doctor --fix để sao chép các giá trị đó vào params.num_ctx. Bộ điều hợp tương thích OpenAI vẫn chèn options.num_ctx theo mặc định từ params.num_ctx hoặc contextWindow đã cấu hình; hãy tắt bằng injectNumCtxForOpenAICompat: false nếu hệ thống thượng nguồn từ chối options.Các mục mô hình gốc cũng chấp nhận các tùy chọn thời gian chạy Ollama phổ biến trong params, được chuyển tiếp dưới dạng options /api/chat gốc: num_keep, seed, num_predict, top_k, top_p, min_p, typical_p, repeat_last_n, temperature, repeat_penalty, presence_penalty, frequency_penalty, stop, num_batch, num_gpu, main_gpu, use_mmapnum_thread. Một số khóa (format, keep_alive, truncate, shift) được chuyển tiếp dưới dạng các trường yêu cầu cấp cao nhất thay vì nằm trong options. OpenClaw chỉ chuyển tiếp các khóa yêu cầu Ollama này, vì vậy các tham số chỉ dành cho thời gian chạy như streaming không bao giờ được gửi đến Ollama. Sử dụng params.think (hoặc params.thinking) để đặt think cấp cao nhất; false tắt chế độ suy nghĩ ở cấp API cho các mô hình suy nghĩ kiểu Qwen.
agents.defaults.models["ollama/<model>"].params.num_ctx theo từng mô hình cũng hoạt động; mục mô hình nhà cung cấp rõ ràng sẽ được ưu tiên nếu cả hai đều được đặt.
OpenClaw chuyển tiếp chế độ suy nghĩ theo đúng định dạng Ollama mong đợi: think cấp cao nhất, không phải options.think. Các mô hình được tự động phát hiện mà /api/show báo cáo có khả năng thinking sẽ cung cấp /think low, /think medium, /think high/think max; các mô hình không suy nghĩ chỉ cung cấp /think off.
Hoặc đặt giá trị mặc định cho mô hình:
params.think/params.thinking theo từng mô hình có thể tắt hoặc buộc API suy luận cho một mô hình cụ thể. OpenClaw giữ nguyên cấu hình tường minh đó khi lượt chạy đang hoạt động chỉ có giá trị mặc định off ngầm định; một lệnh thời gian chạy không phải tắt như /think medium vẫn ghi đè lên cấu hình đó. Yêu cầu suy luận có giá trị đúng sẽ không bao giờ được gửi đến mô hình được đánh dấu rõ ràng là reasoning: false; yêu cầu think: false luôn được gửi trong mọi trường hợp.
Các mô hình có tên deepseek-r1, reasoning, reason hoặc think mặc định được xem là có khả năng suy luận — không cần cấu hình bổ sung:
Ollama chạy cục bộ và miễn phí, vì vậy mọi chi phí mô hình đều là 0 đối với cả mô hình được tự động phát hiện lẫn mô hình được định nghĩa thủ công.
Plugin Ollama đi kèm đăng ký một trình cung cấp embedding bộ nhớ cho tìm kiếm bộ nhớ. Plugin sử dụng URL cơ sở và khóa API Ollama đã cấu hình, gọi /api/embed, đồng thời gom nhiều đoạn bộ nhớ vào một yêu cầu input khi có thể.Khi proxy.enabled=true, các yêu cầu embedding đến đúng nguồn gốc loopback cục bộ của máy chủ được suy ra từ baseUrl đã cấu hình sẽ sử dụng đường dẫn trực tiếp có bảo vệ của OpenClaw thay vì proxy chuyển tiếp được quản lý. Tên máy chủ đã cấu hình phải chính là localhost hoặc một địa chỉ IP loopback dạng chữ — các tên DNS chỉ phân giải thành loopback vẫn sử dụng đường dẫn proxy được quản lý. Các máy chủ Ollama trên LAN, tailnet, mạng riêng và mạng công cộng luôn sử dụng đường dẫn proxy được quản lý, đồng thời chuyển hướng sang máy chủ/cổng khác không kế thừa độ tin cậy. proxy.loopbackMode: "proxy" vẫn định tuyến lưu lượng loopback qua proxy; proxy.loopbackMode: "block" từ chối lưu lượng đó trước khi kết nối — xem Proxy được quản lý.Embedding tại thời điểm truy vấn sử dụng tiền tố truy xuất cho các mô hình yêu cầu hoặc khuyến nghị chúng: nomic-embed-text, qwen3-embeddingmxbai-embed-large. Các lô tài liệu vẫn giữ nguyên dữ liệu thô, nên những chỉ mục hiện có không cần di chuyển định dạng.
Đối với máy chủ embedding từ xa, hãy giới hạn phạm vi xác thực ở máy chủ đó:
Ollama mặc định sử dụng API gốc (/api/chat), hỗ trợ đồng thời truyền trực tuyến và gọi công cụ — không cần cấu hình đặc biệt.Đối với yêu cầu gốc, cơ chế điều khiển suy luận được chuyển tiếp trực tiếp: /think offopenclaw agent --thinking off gửi think: false cấp cao nhất trừ khi params.think/params.thinking tường minh được cấu hình; /think low|medium|high gửi chuỗi mức nỗ lực tương ứng; /think max ánh xạ đến mức nỗ lực cao nhất của Ollama, think: "high".
Để dùng điểm cuối tương thích OpenAI, hãy xem phần “Chế độ tương thích OpenAI cũ” ở trên — truyền trực tuyến và gọi công cụ có thể không hoạt động đồng thời trong chế độ đó.

Khắc phục sự cố

Trên WSL2 với NVIDIA/CUDA, trình cài đặt Ollama Linux chính thức tạo một đơn vị systemd ollama.service với Restart=always. Nếu dịch vụ đó tự động khởi động và tải một mô hình dùng GPU trong quá trình khởi động WSL2, Ollama có thể ghim bộ nhớ máy chủ trong khi tải; cơ chế thu hồi bộ nhớ của Hyper-V không phải lúc nào cũng thu hồi được các trang đó, vì vậy Windows có thể chấm dứt máy ảo WSL2, systemd khởi động lại Ollama và vòng lặp tiếp diễn.Dấu hiệu: WSL2 liên tục khởi động lại/chấm dứt, mức sử dụng CPU cao trong app.slice hoặc ollama.service ngay sau khi WSL2 khởi động, và SIGTERM từ systemd thay vì trình diệt OOM của Linux.OpenClaw ghi cảnh báo khởi động khi phát hiện WSL2, ollama.service được bật với Restart=always, và có thể thấy các dấu hiệu CUDA.Biện pháp giảm thiểu:
Ở phía Windows, thêm nội dung này vào %USERPROFILE%\.wslconfig, sau đó chạy wsl --shutdown:
Hoặc rút ngắn thời gian duy trì hoạt động / chỉ khởi động Ollama thủ công khi cần:
Xem ollama/ollama#11317.
Xác nhận Ollama đang chạy, OLLAMA_API_KEY (hoặc một hồ sơ xác thực) đã được đặt, và models.providers.ollama không được định nghĩa tường minh:
Tải mô hình xuống cục bộ hoặc định nghĩa tường minh trong models.providers.ollama:
Xác minh từ cùng máy và môi trường thời gian chạy đang chạy Gateway:
Nguyên nhân thường gặp:
  • baseUrl trỏ đến localhost, nhưng Gateway chạy trong Docker hoặc trên một máy chủ khác.
  • URL sử dụng /v1, chọn hành vi tương thích OpenAI thay vì Ollama gốc.
  • Máy chủ từ xa cần thay đổi tường lửa hoặc liên kết LAN.
  • Mô hình nằm trên daemon của máy tính xách tay nhưng không có trên daemon từ xa.
Thông thường, trình cung cấp đang ở chế độ tương thích OpenAI hoặc mô hình không thể xử lý lược đồ công cụ. Nên ưu tiên chế độ gốc:
Nếu một mô hình cục bộ nhỏ vẫn không xử lý được lược đồ công cụ, hãy đặt compat.supportsTools: false trên mục nhập mô hình đó và kiểm thử lại.
Các phản hồi Kimi/GLM được lưu trữ có chuỗi ký hiệu dài, không mang tính ngôn ngữ được xem là một lệnh gọi trình cung cấp thất bại thay vì phản hồi thành công, để cơ chế thử lại/chuyển đổi dự phòng/xử lý lỗi thông thường tiếp quản thay vì lưu văn bản bị hỏng vào phiên.Nếu sự cố tái diễn, hãy ghi lại tên mô hình, tệp phiên hiện tại và liệu lượt chạy đã sử dụng Cloud + Local hay Cloud only, sau đó thử một phiên mới và một mô hình dự phòng:
Các mô hình cục bộ lớn có thể cần nhiều thời gian cho lần tải đầu tiên. Hãy giới hạn phạm vi thời gian chờ ở trình cung cấp Ollama và tùy chọn giữ mô hình được tải giữa các lượt:
Nếu bản thân máy chủ chậm chấp nhận kết nối, timeoutSeconds cũng kéo dài thời gian chờ kết nối có bảo vệ cho trình cung cấp này.
Nhiều mô hình công bố kích thước ngữ cảnh lớn hơn mức phần cứng có thể chạy thoải mái. Ollama gốc sử dụng giá trị mặc định thời gian chạy riêng trừ khi params.num_ctx được đặt. Hãy giới hạn cả ngân sách của OpenClaw và ngữ cảnh yêu cầu của Ollama để có độ trễ token đầu tiên có thể dự đoán:
Giảm contextWindow nếu OpenClaw gửi quá nhiều nội dung nhắc. Giảm params.num_ctx nếu ngữ cảnh thời gian chạy của Ollama quá lớn đối với máy. Giảm maxTokens nếu quá trình tạo kéo dài quá lâu.

Liên quan

Ollama Cloud

Thiết lập chỉ dành cho đám mây với trình cung cấp ollama-cloud chuyên dụng.

Trình cung cấp mô hình

Tổng quan về tất cả trình cung cấp, tham chiếu mô hình và hành vi chuyển đổi dự phòng.

Lựa chọn mô hình

Cách chọn và cấu hình mô hình.

Tìm kiếm web bằng Ollama

Chi tiết đầy đủ về thiết lập và hành vi của tính năng tìm kiếm web do Ollama hỗ trợ.

Cấu hình

Tài liệu tham chiếu cấu hình đầy đủ.