/api/chat), không phải endpoint tương thích với OpenAI
/v1. Ba chế độ được hỗ trợ:
ollama-cloud, hãy xem
Ollama Cloud. Sử dụng các tham chiếu ollama-cloud/<model> khi
bạn muốn định tuyến đám mây tách biệt với nhà cung cấp ollama cục bộ.
Khóa cấu hình chuẩn là baseUrl. baseURL cũng được chấp nhận cho
các ví dụ theo kiểu OpenAI SDK, nhưng cấu hình mới nên sử dụng baseUrl.
Quy tắc xác thực
Máy chủ cục bộ và LAN
Máy chủ cục bộ và LAN
.local và tên máy chủ trần không cần bearer token thực. OpenClaw sử dụng dấu mốc ollama-local cho các trường hợp này.Máy chủ từ xa và Ollama Cloud
Máy chủ từ xa và Ollama Cloud
https://ollama.com yêu cầu thông tin xác thực thực: OLLAMA_API_KEY, một hồ sơ xác thực hoặc apiKey của nhà cung cấp. Để sử dụng trực tiếp dịch vụ được lưu trữ, nên dùng nhà cung cấp ollama-cloud.Id nhà cung cấp tùy chỉnh
Id nhà cung cấp tùy chỉnh
api: "ollama" tuân theo cùng các quy tắc. Ví dụ: nhà cung cấp ollama-remote trỏ đến máy chủ LAN riêng có thể sử dụng apiKey: "ollama-local"; các tác tử con phân giải dấu mốc đó thông qua hook nhà cung cấp Ollama thay vì coi đó là thông tin xác thực bị thiếu. agents.defaults.memorySearch.provider cũng có thể trỏ đến một id nhà cung cấp tùy chỉnh để các embedding sử dụng endpoint Ollama đó.Hồ sơ xác thực
Hồ sơ xác thực
auth-profiles.json lưu trữ thông tin xác thực cho một id nhà cung cấp; đặt các thiết lập endpoint (baseUrl, api, mô hình, header, thời gian chờ) trong models.providers.<id>. Các tệp phẳng cũ như { "ollama-windows": { "apiKey": "ollama-local" } } không phải là định dạng thời gian chạy; openclaw doctor --fix ghi lại chúng thành một hồ sơ khóa API ollama-windows:default chuẩn kèm bản sao lưu. Giá trị baseUrl trong tệp cũ đó là dữ liệu nhiễu và nên được chuyển sang cấu hình nhà cung cấp.Phạm vi embedding bộ nhớ
Phạm vi embedding bộ nhớ
- Khóa cấp nhà cung cấp chỉ được gửi đến máy chủ của nhà cung cấp đó.
agents.*.memorySearch.remote.apiKeychỉ được gửi đến máy chủ embedding từ xa của nó.- Giá trị env
OLLAMA_API_KEYthuần túy được coi là quy ước Ollama Cloud và theo mặc định không được gửi đến các máy chủ cục bộ/tự lưu trữ.
Bắt đầu
- Hướng dẫn thiết lập ban đầu (khuyến nghị)
- Thiết lập thủ công
Chạy hướng dẫn thiết lập ban đầu
/api/show xác nhận hỗ trợ công cụ và cửa sổ ngữ cảnh ít nhất 16K;
siêu dữ liệu ngữ cảnh bị thiếu hoặc nhỏ hơn sẽ tiếp tục theo quy trình thiết lập thủ công. Quy trình
thiết lập CLI/macOS dùng chung vẫn xác minh tuyến đã chọn bằng một
lượt hoàn thành thực trước khi lưu. Việc kiểm tra tự động này không bao giờ tải về
mô hình; nếu không có mô hình phù hợp đã cài đặt, hướng dẫn thiết lập ban đầu sẽ tiếp tục đến
trình chọn Ollama thông thường.Chọn mô hình
Cloud only nhắc nhập OLLAMA_API_KEY và đề xuất các giá trị mặc định đám mây được lưu trữ. Cloud + Local và Local only nhắc nhập URL cơ sở Ollama, khám phá các mô hình có sẵn và tự động tải về mô hình cục bộ đã chọn nếu còn thiếu. Thẻ :latest đã cài đặt như gemma4:latest được hiển thị một lần thay vì lặp lại gemma4. Cloud + Local cũng kiểm tra xem máy chủ đã đăng nhập để truy cập đám mây hay chưa.Xác minh
--custom-base-url và --custom-model-id là tùy chọn; nếu bỏ qua, hệ thống sử dụng máy chủ cục bộ mặc định và mô hình được đề xuất gemma4.Mô hình đám mây thông qua máy chủ cục bộ
Cloud + Local định tuyến cả mô hình cục bộ và mô hình :cloud thông qua một
máy chủ Ollama có thể truy cập — đây là luồng kết hợp của Ollama và là chế độ cần chọn trong quá trình thiết lập
khi bạn muốn sử dụng cả hai.
OpenClaw nhắc nhập URL cơ sở, khám phá các mô hình cục bộ và kiểm tra
trạng thái ollama signin. Khi đã đăng nhập, hệ thống đề xuất các giá trị mặc định được lưu trữ
(kimi-k2.5:cloud, minimax-m2.7:cloud, glm-5.1:cloud, glm-5.2:cloud). Nếu
chưa đăng nhập, quá trình thiết lập vẫn chỉ dùng cục bộ cho đến khi bạn chạy ollama signin.
Để chỉ truy cập đám mây mà không có daemon cục bộ, hãy sử dụng openclaw onboard --auth-choice ollama-cloud và xem Ollama Cloud — đường dẫn đó không cần ollama signin hoặc máy chủ đang chạy:
openclaw onboard được lấy trực tiếp từ
https://ollama.com/api/tags, giới hạn ở 500 mục, vì vậy trình chọn phản ánh
danh mục được lưu trữ hiện tại. Nếu ollama.com không thể truy cập hoặc không trả về
mô hình nào tại thời điểm thiết lập, OpenClaw quay về danh sách đề xuất được mã hóa cứng để
hướng dẫn thiết lập ban đầu vẫn hoàn tất.
Khám phá mô hình (nhà cung cấp ngầm định)
KhiOLLAMA_API_KEY (hoặc một hồ sơ xác thực) được đặt và cả
models.providers.ollama lẫn một nhà cung cấp tùy chỉnh khác có api: "ollama" đều không được
định nghĩa, OpenClaw khám phá mô hình từ http://127.0.0.1:11434:
models.providers.ollama với một mảng models rõ ràng, hoặc một
nhà cung cấp tùy chỉnh có api: "ollama" và baseUrl không phải loopback, sẽ vô hiệu hóa
tự động khám phá; khi đó các mô hình phải được định nghĩa thủ công (xem
Cấu hình). Mục models.providers.ollama trỏ đến
https://ollama.com được lưu trữ cũng bỏ qua việc khám phá, vì các mô hình Ollama Cloud
do nhà cung cấp quản lý. Các nhà cung cấp tùy chỉnh dạng loopback như
http://127.0.0.2:11434 vẫn được coi là cục bộ và tiếp tục tự động khám phá.
Bạn có thể sử dụng tham chiếu đầy đủ như ollama/<pulled-model>:latest mà không cần
mục models.json viết thủ công; OpenClaw phân giải trực tiếp. Với các máy chủ đã đăng nhập,
việc chọn tham chiếu ollama/<model>:cloud không có trong danh sách sẽ xác thực chính xác
mô hình đó bằng /api/show và chỉ thêm mô hình vào danh mục thời gian chạy nếu Ollama
xác nhận siêu dữ liệu — lỗi chính tả vẫn thất bại vì mô hình không xác định.
Kiểm thử nhanh
Để thực hiện phép thăm dò văn bản hẹp, bỏ qua toàn bộ bề mặt công cụ của tác tử:--file cùng một hình ảnh để thực hiện phép thăm dò gọn nhẹ cho mô hình thị giác (chấp nhận PNG/JPEG/WebP;
các tệp không phải hình ảnh bị từ chối trước khi gọi Ollama — sử dụng
openclaw infer audio transcribe cho âm thanh):
/model ollama/<model> là lựa chọn chính xác của người dùng: nếu
baseUrl đã cấu hình không thể truy cập được, phản hồi tiếp theo sẽ thất bại với lỗi
của nhà cung cấp thay vì âm thầm chuyển sang một mô hình đã cấu hình khác.
Các tác vụ cron cô lập bổ sung một bước kiểm tra an toàn cục bộ trước khi bắt đầu lượt của agent:
nếu mô hình đã chọn được phân giải thành nhà cung cấp Ollama cục bộ/mạng riêng/.local
và /api/tags không thể truy cập được, OpenClaw ghi nhận lần chạy đó là
skipped, với mô hình xuất hiện trong nội dung lỗi. Việc kiểm tra endpoint này được lưu vào bộ nhớ đệm
trong 5 phút cho mỗi máy chủ, nhờ đó các tác vụ cron lặp lại nhắm đến một daemon đã dừng sẽ không
đồng loạt khởi chạy các yêu cầu chắc chắn thất bại.
Xác minh trực tiếp:
OPENCLAW_LIVE_OLLAMA_EMBEDDINGS=1 vì khóa
đám mây có thể không cấp quyền cho /api/embed):
Suy luận cục bộ trên Node
Các agent có thể ủy quyền một tác vụ ngắn cho mô hình Ollama trên máy tính để bàn hoặc Node máy chủ đã ghép nối. Prompt và phản hồi đi qua kết nối Gateway/Node đã xác thực hiện có; yêu cầu chạy trên endpoint Ollama loopback của chính Node đó (http://127.0.0.1:11434).
Khởi động Ollama trên Node
Kết nối máy chủ Node
ollama.models và ollama.chat, hãy kiểm tra lại openclaw nodes pending.Sử dụng từ một agent
node_inference. Các agent gọi
action: "discover" trước, sau đó gọi action: "run" với một Node và mô hình từ
kết quả đó (run có thể bỏ qua Node khi chỉ có đúng một Node có khả năng
được kết nối). Ví dụ: “Khám phá các mô hình Ollama trên các Node của tôi, sau đó sử dụng
mô hình đã tải nhanh nhất để tóm tắt văn bản này.”/api/tags, kiểm tra các khả năng của /api/show và sử dụng
/api/ps khi có thể để ưu tiên xếp hạng các mô hình đã tải. Quá trình này chỉ trả về
các mô hình cục bộ mà Ollama báo cáo là có khả năng trò chuyện (khả năng completion) —
các hàng Ollama Cloud và mô hình chỉ dành cho embedding bị loại trừ. Mỗi lần chạy đều tắt
chế độ suy nghĩ của mô hình và mặc định giới hạn đầu ra ở 512 token (giới hạn cứng 8192), trừ khi
lệnh gọi công cụ yêu cầu một maxTokens khác; một số mô hình (ví dụ GPT-OSS)
không hỗ trợ tắt chế độ suy nghĩ và vẫn có thể tạo ra token suy luận.
Để Ollama tiếp tục chạy trên một Node mà không cung cấp cho các agent:
openclaw node restart, hoặc dừng/chạy lại openclaw node run
đối với phiên chạy ở foreground). Node ngừng quảng bá ollama.models và
ollama.chat; bản thân Ollama và nhà cung cấp Ollama của Gateway không bị ảnh hưởng.
Đặt lại giá trị thành true và khởi động lại để bật lại; bề mặt lệnh đã thay đổi
có thể cần phê duyệt lại openclaw nodes pending sau khi kết nối lại.
Xác minh trực tiếp các lệnh Node mà không cần lượt của agent:
--invoke-timeout giới hạn thời gian Node được phép chạy lệnh;
--timeout giới hạn toàn bộ lệnh gọi Gateway và phải lớn hơn.
Suy luận cục bộ trên Node luôn sử dụng endpoint loopback của chính Node đó — không
tái sử dụng models.providers.ollama.baseUrl từ xa/đám mây đã cấu hình. Các
lệnh Node mặc định khả dụng trên máy chủ Node macOS, Linux và Windows,
đồng thời vẫn tuân theo chính sách ghép nối/lệnh Node thông thường.
Thị giác và mô tả hình ảnh
Plugin Ollama đi kèm đăng ký Ollama làm nhà cung cấp hiểu nội dung đa phương tiện có khả năng xử lý hình ảnh, nhờ đó OpenClaw có thể định tuyến các yêu cầu mô tả hình ảnh tường minh và các giá trị mặc định của mô hình hình ảnh đã cấu hình qua các mô hình thị giác Ollama cục bộ hoặc được lưu trữ.--model phải là tham chiếu <provider/model> đầy đủ; khi được đặt, infer image describe sẽ thử mô hình đó trước thay vì bỏ qua bước mô tả đối với các mô hình
đã hỗ trợ thị giác gốc. Nếu lệnh gọi thất bại, OpenClaw có thể tiếp tục
qua agents.defaults.imageModel.fallbacks; lỗi chuẩn bị tệp/URL
sẽ khiến quy trình thất bại trước khi thử phương án dự phòng. Sử dụng infer image describe cho luồng
hiểu hình ảnh của OpenClaw và imageModel đã cấu hình; sử dụng infer model run --file cho phép thử đa phương thức thô với prompt tùy chỉnh.
Để đặt Ollama làm nhà cung cấp hiểu hình ảnh mặc định cho nội dung đa phương tiện đến:
ollama/<model> đầy đủ. Một tham chiếu imageModel trần như
qwen2.5vl:7b chỉ được chuẩn hóa thành ollama/qwen2.5vl:7b khi đúng mô hình đó
được liệt kê trong models.providers.ollama.models với
input: ["text", "image"] và không có nhà cung cấp hình ảnh nào khác đã cấu hình cung cấp
cùng ID trần; nếu không, hãy sử dụng tiền tố nhà cung cấp một cách tường minh.
Các mô hình thị giác cục bộ chậm có thể cần thời gian chờ hiểu hình ảnh dài hơn
các mô hình đám mây và có thể gặp sự cố trên phần cứng hạn chế nếu Ollama cố
phân bổ toàn bộ ngữ cảnh thị giác được mô hình quảng bá. Hãy đặt thời gian chờ
khả năng và giới hạn num_ctx:
image tường minh. models.providers.ollama.timeoutSeconds vẫn kiểm soát
cơ chế bảo vệ yêu cầu HTTP Ollama nền tảng cho các lệnh gọi mô hình thông thường.
Xác minh trực tiếp:
models.providers.ollama.models theo cách thủ công, hãy đánh dấu tường minh
các mô hình thị giác:
/api/show.
Cấu hình
- Cơ bản (khám phá ngầm định)
- Tường minh (mô hình thủ công)
- URL cơ sở tùy chỉnh
Công thức thường dùng
Thay thế ID mô hình bằng tên chính xác từollama list hoặc
openclaw models list --provider ollama.
Mô hình cục bộ với khám phá tự động
Mô hình cục bộ với khám phá tự động
models.providers.ollama trừ khi bạn cần các mô hình thủ công.Máy chủ Ollama trong LAN với các mô hình thủ công
Máy chủ Ollama trong LAN với các mô hình thủ công
contextWindow là ngân sách ngữ cảnh của OpenClaw; params.num_ctx được gửi đến
Ollama. Hãy giữ chúng đồng bộ khi phần cứng không thể chạy toàn bộ ngữ cảnh
được mô hình quảng bá.Chỉ Ollama Cloud
Chỉ Ollama Cloud
ollama-cloud thay cho cấu trúc này, hãy xem
Ollama Cloud.Đám mây kết hợp cục bộ thông qua daemon đã đăng nhập
Đám mây kết hợp cục bộ thông qua daemon đã đăng nhập
Nhiều máy chủ Ollama
Nhiều máy chủ Ollama
ollama/) trước khi gọi Ollama, vì vậy ollama-large/qwen3.5:27b
đến Ollama dưới dạng qwen3.5:27b.Hồ sơ mô hình cục bộ tinh gọn
Hồ sơ mô hình cục bộ tinh gọn
compat.supportsTools: false khi mô hình hoặc máy chủ thường xuyên
gặp lỗi với schema công cụ — tùy chọn này đánh đổi khả năng của agent để lấy sự ổn định.
localModelLean loại bỏ các công cụ nặng về trình duyệt, cron, tin nhắn, tạo nội dung đa phương tiện,
giọng nói và PDF khỏi bề mặt trực tiếp của agent trừ khi được yêu cầu rõ ràng,
đồng thời đặt các danh mục lớn hơn phía sau Tìm kiếm công cụ. Tùy chọn này không thay đổi
ngữ cảnh runtime hoặc chế độ suy nghĩ của Ollama. Hãy kết hợp với params.num_ctx và
params.thinking: false cho các mô hình suy nghĩ nhỏ kiểu Qwen thường lặp vô hạn hoặc
tiêu tốn ngân sách vào quá trình suy luận ẩn.Chọn mô hình
ollama-spark/qwen3:32b, OpenClaw loại bỏ tiền tố đó trước khi
gọi Ollama và gửi qwen3:32b.
Đối với các mô hình cục bộ chậm, nên ưu tiên tinh chỉnh theo phạm vi nhà cung cấp trước khi tăng thời gian chờ
của toàn bộ runtime agent:
timeoutSeconds bao quát yêu cầu HTTP của mô hình: thiết lập kết nối, header,
truyền luồng nội dung và thao tác hủy guarded-fetch tổng thể. params.keep_alive được
chuyển tiếp dưới dạng keep_alive cấp cao nhất trên các yêu cầu /api/chat gốc; hãy đặt theo từng
mô hình khi thời gian tải ở lượt đầu tiên là điểm nghẽn.
Xác minh nhanh
127.0.0.1 bằng host baseUrl. Nếu curl
hoạt động nhưng OpenClaw thì không, hãy kiểm tra xem Gateway có chạy trên một
máy, container hoặc tài khoản dịch vụ khác hay không.
Tìm kiếm web Ollama
OpenClaw tích hợp sẵn Tìm kiếm web Ollama dưới dạng nhà cung cấpweb_search.
openclaw onboard hoặc openclaw configure --section web, hoặc đặt:
/api/experimental/web_search
cục bộ, sau đó chuyển sang đường dẫn /api/web_search được lưu trữ trên cùng host; một
daemon cục bộ đã đăng nhập thường phản hồi thông qua proxy cục bộ. Các lệnh gọi trực tiếp
https://ollama.com luôn sử dụng endpoint /api/web_search được lưu trữ.
Cấu hình nâng cao
Chế độ tương thích OpenAI cũ
Chế độ tương thích OpenAI cũ
api: "openai-completions" một cách rõ ràng cho proxy phía sau
/v1/chat/completions:params: { streaming: false } trên mô hình.OpenClaw mặc định chèn options.num_ctx trong chế độ này để Ollama
không âm thầm quay về ngữ cảnh 4096 token. Nếu proxy từ chối
các trường options không xác định, hãy tắt tùy chọn này:Cửa sổ ngữ cảnh
Cửa sổ ngữ cảnh
/api/show
báo cáo, bao gồm các giá trị PARAMETER num_ctx lớn hơn từ
Modelfile tùy chỉnh; nếu không, OpenClaw sẽ dùng cửa sổ ngữ cảnh Ollama mặc định
của mình.contextWindow, contextTokens và maxTokens ở cấp nhà cung cấp đặt
giá trị mặc định cho mọi mô hình thuộc nhà cung cấp đó và có thể được ghi đè theo từng
mô hình. contextWindow là ngân sách prompt/Compaction riêng của OpenClaw. Các yêu cầu
/api/chat gốc để options.num_ctx ở trạng thái chưa đặt trừ khi bạn đặt
params.num_ctx một cách rõ ràng, vì vậy Ollama áp dụng giá trị mặc định dựa trên mô hình,
OLLAMA_CONTEXT_LENGTH hoặc VRAM của chính nó; các giá trị params.num_ctx không hợp lệ, bằng không, âm
hoặc không hữu hạn sẽ bị bỏ qua. Nếu một cấu hình cũ chỉ sử dụng
contextWindow/maxTokens để buộc ngữ cảnh yêu cầu gốc, hãy chạy
openclaw doctor --fix để sao chép các giá trị đó vào params.num_ctx. Bộ chuyển đổi
tương thích OpenAI vẫn mặc định chèn options.num_ctx từ
params.num_ctx hoặc contextWindow đã cấu hình; hãy tắt bằng
injectNumCtxForOpenAICompat: false nếu upstream từ chối options.Các mục mô hình gốc cũng chấp nhận các tùy chọn runtime Ollama phổ biến trong
params, được chuyển tiếp dưới dạng /api/chat options gốc: num_keep, seed,
num_predict, top_k, top_p, min_p, typical_p, repeat_last_n,
temperature, repeat_penalty, presence_penalty, frequency_penalty,
stop, num_batch, num_gpu, main_gpu, use_mmap và num_thread.
Một số khóa (format, keep_alive, truncate, shift) được chuyển tiếp dưới dạng
các trường yêu cầu cấp cao nhất thay vì nằm trong options. OpenClaw chỉ
chuyển tiếp các khóa yêu cầu Ollama này, vì vậy các tham số chỉ dành cho runtime như
streaming không bao giờ được gửi đến Ollama. Sử dụng params.think (hoặc
params.thinking) để đặt think cấp cao nhất; false tắt chế độ
suy nghĩ ở cấp API cho các mô hình suy nghĩ kiểu Qwen.agents.defaults.models["ollama/<model>"].params.num_ctx theo từng mô hình cũng
hoạt động; mục mô hình nhà cung cấp được chỉ định rõ sẽ được ưu tiên nếu cả hai đều được thiết lập.Kiểm soát suy luận
Kiểm soát suy luận
think ở cấp cao nhất, không phải
options.think. Các mô hình được tự động phát hiện mà /api/show báo cáo khả năng
thinking sẽ cung cấp /think low, /think medium, /think high
và /think max; các mô hình không suy luận chỉ cung cấp /think off.params.think/params.thinking theo từng mô hình có thể tắt hoặc buộc
suy luận qua API cho một mô hình cụ thể. OpenClaw giữ nguyên cấu hình tường minh đó
khi lượt chạy đang hoạt động chỉ có giá trị mặc định ngầm định off; một lệnh
thời gian chạy không phải off như /think medium vẫn ghi đè lên cấu hình này. Yêu cầu
suy luận có giá trị đúng sẽ không bao giờ được gửi đến mô hình được đánh dấu rõ ràng là
reasoning: false; yêu cầu think: false luôn được gửi bất kể cấu hình.Mô hình suy luận
Mô hình suy luận
deepseek-r1, reasoning, reason hoặc think được mặc định
xem là có khả năng suy luận — không cần cấu hình thêm:Chi phí mô hình
Chi phí mô hình
0 đối với cả
mô hình được tự động phát hiện và mô hình được định nghĩa thủ công.Embedding bộ nhớ
Embedding bộ nhớ
/api/embed và gộp nhiều đoạn bộ nhớ vào
một yêu cầu input khi có thể.Khi proxy.enabled=true, các yêu cầu embedding đến chính xác
nguồn loopback cục bộ trên máy được suy ra từ baseUrl đã cấu hình sẽ sử dụng
đường dẫn trực tiếp được bảo vệ của OpenClaw thay vì proxy chuyển tiếp được quản lý. Tên máy
đã cấu hình phải là localhost hoặc một địa chỉ IP loopback dạng chữ — các tên DNS
chỉ phân giải thành loopback vẫn sử dụng đường dẫn proxy được quản lý. Các máy chủ Ollama
trên LAN, tailnet, mạng riêng và mạng công cộng luôn đi qua
đường dẫn proxy được quản lý, đồng thời chuyển hướng đến máy chủ/cổng khác không kế thừa
độ tin cậy. proxy.loopbackMode: "proxy" vẫn định tuyến lưu lượng loopback qua
proxy; proxy.loopbackMode: "block" từ chối lưu lượng đó trước khi kết nối —
xem Proxy được quản lý.nomic-embed-text, qwen3-embedding và
mxbai-embed-large. Các lô tài liệu vẫn giữ nguyên dữ liệu thô, vì vậy các chỉ mục hiện có
không cần di chuyển định dạng.Cấu hình phát trực tuyến
Cấu hình phát trực tuyến
/api/chat), hỗ trợ đồng thời
phát trực tuyến và gọi công cụ — không cần cấu hình đặc biệt.Đối với các yêu cầu gốc, chế độ kiểm soát suy luận được chuyển tiếp trực tiếp: /think off
và openclaw agent --thinking off gửi think: false ở cấp cao nhất trừ khi
params.think/params.thinking được cấu hình tường minh; /think low|medium|high gửi chuỗi mức độ tương ứng; /think max ánh xạ tới
mức độ cao nhất của Ollama là think: "high".Khắc phục sự cố
Vòng lặp sự cố WSL2 (khởi động lại liên tục)
Vòng lặp sự cố WSL2 (khởi động lại liên tục)
ollama.service với Restart=always. Nếu dịch vụ đó
tự động khởi động và tải một mô hình sử dụng GPU trong lúc WSL2 khởi động, Ollama có thể giữ chặt
bộ nhớ máy chủ khi tải; cơ chế thu hồi bộ nhớ của Hyper-V không phải lúc nào cũng có thể thu hồi
các trang đó, vì vậy Windows có thể chấm dứt máy ảo WSL2, systemd khởi động lại
Ollama và vòng lặp tiếp diễn.Dấu hiệu: WSL2 liên tục khởi động lại/chấm dứt, mức sử dụng CPU cao trong app.slice hoặc
ollama.service ngay sau khi WSL2 khởi động và SIGTERM từ systemd thay vì
trình xử lý OOM của Linux.OpenClaw ghi cảnh báo khởi động khi phát hiện WSL2, ollama.service
được bật với Restart=always và có thể thấy các dấu hiệu CUDA.Biện pháp giảm thiểu:%USERPROFILE%\.wslconfig, sau đó chạy
wsl --shutdown:Không phát hiện Ollama
Không phát hiện Ollama
OLLAMA_API_KEY (hoặc một hồ sơ xác thực) đã được thiết lập,
và models.providers.ollama không được định nghĩa rõ ràng:Không có mô hình khả dụng
Không có mô hình khả dụng
models.providers.ollama:Kết nối bị từ chối
Kết nối bị từ chối
Máy chủ từ xa hoạt động với curl nhưng không hoạt động với OpenClaw
Máy chủ từ xa hoạt động với curl nhưng không hoạt động với OpenClaw
baseUrltrỏ đếnlocalhost, nhưng Gateway chạy trong Docker hoặc trên một máy chủ khác.- URL sử dụng
/v1, chọn hành vi tương thích với OpenAI thay vì Ollama gốc. - Máy chủ từ xa cần thay đổi cấu hình tường lửa hoặc liên kết LAN.
- Mô hình nằm trên daemon của máy tính xách tay nhưng không có trên daemon từ xa.
Mô hình xuất JSON của công cụ dưới dạng văn bản
Mô hình xuất JSON của công cụ dưới dạng văn bản
compat.supportsTools: false trong mục nhập của mô hình đó rồi kiểm thử lại.Kimi hoặc GLM trả về các ký hiệu bị lỗi
Kimi hoặc GLM trả về các ký hiệu bị lỗi
Cloud + Local hay Cloud only hay không, sau đó thử một
phiên mới và một mô hình dự phòng:Mô hình cục bộ chưa được tải bị hết thời gian chờ
Mô hình cục bộ chưa được tải bị hết thời gian chờ
timeoutSeconds cũng
kéo dài thời gian chờ kết nối được bảo vệ cho nhà cung cấp này.Mô hình có ngữ cảnh lớn quá chậm hoặc hết bộ nhớ
Mô hình có ngữ cảnh lớn quá chậm hoặc hết bộ nhớ
params.num_ctx được thiết lập. Giới hạn cả ngân sách của OpenClaw và ngữ cảnh yêu cầu
của Ollama để có độ trễ token đầu tiên ổn định:contextWindow nếu OpenClaw gửi quá nhiều nội dung nhắc. Giảm
params.num_ctx nếu ngữ cảnh môi trường chạy của Ollama quá lớn đối với máy.
Giảm maxTokens nếu quá trình tạo nội dung kéo dài quá lâu.Liên quan
Ollama Cloud
ollama-cloud chuyên dụng.