Skip to main content
個人代理基準測試套件是一個由小型儲存庫支援的 QA 情境套件,適用於 本機個人助理工作流程。它不是通用模型基準測試,也 不需要新的執行器:它會重複使用私有 QA 堆疊(QA 概覽)、 合成的 QA 頻道,以及現有的 qa/scenarios YAML 目錄。

情境

共十個情境,定義於 qa/scenarios/personal/*.yaml 機器可讀取的套件中繼資料(ID 清單、標題、說明)位於 extensions/qa-lab/src/scenario-packs.ts,其名稱為 QA_PERSONAL_AGENT_SCENARIO_IDS。 使用 --pack personal-agent 執行套件:
--pack 可透過重複使用 --scenario 旗標累加。明確指定的情境會 先執行,接著套件情境會依 QA_PERSONAL_AGENT_SCENARIO_IDS 順序執行, 並移除重複項目。 此套件以搭配 mock-openai 或其他本機 QA 提供者 執行路徑的 qa-channel 為目標。請勿將它指向即時聊天服務或真實個人帳號。

隱私權模型

情境只會使用虛假使用者、虛假偏好設定、虛假機密,以及 套件建立的暫時 QA 閘道工作區。它們不得讀取或 寫入真實 OpenClaw 使用者的記憶、工作階段、認證資訊、啟動代理程式、全域 設定或即時閘道狀態。 成品會保留在現有的 QA 套件成品目錄下,並視為 測試輸出。遮蔽檢查會使用虛假標記,因此可安全地 檢查失敗並將其提交至議題。

擴充套件

qa/scenarios/personal/ 下新增 .yaml 案例,然後將情境 ID 新增至 QA_PERSONAL_AGENT_SCENARIO_IDS。每個案例應保持小型、僅限本機,並在 mock-openai 中具有確定性,且聚焦於一項個人助理行為。 良好的後續候選項目:已遮蔽的軌跡匯出檢查、僅限本機的 外掛工作流程檢查。 在情境目錄擁有足夠穩定的案例,足以證明新增介面的合理性之前, 請避免新增執行器、外掛、相依套件、即時傳輸或模型評審器。