用过一段时间通用 Agent 的人都遇到过三件糟心事:记忆是黑盒(它记住了什么你根本不知道)、项目串味(做 A 项目时冒出 B 项目的上下文)、账单失控(不管任务多简单都调最贵的模型)。2026 年 8 月,清华大学 THUNLP 实验室、面壁智能、OpenBMB 与 AI9Stars 联合开源的 PilotDeck 就是冲着这三点来的——它不是又一个 Agent 框架,而是一套以「WorkSpace 工作舱」为基本单位的智能体操作系统。
先搞懂:黑盒 Agent 与白盒 Agent 的差别
PilotDeck 最核心的设计哲学,是把 Agent 内部原本看不见的东西全部摊开给你看、让你能改:
| 维度 | 传统黑盒 Agent | PilotDeck(白盒) |
|---|---|---|
| 可见性 | 只看得到最终输出,不知道记了什么 | 随时查看记忆内容、写入时间与归属 |
| 可控性 | 写入后不可改,只能指望 AI 自我纠正 | 手动增删改标记,关键决策不丢失 |
| 可追溯 | 出错难定位,上下文压缩后不可逆 | 全链路可查可改,支持一键回滚 |
| 隔离性 | 全局共享记忆,容易跨项目污染 | WorkSpace 严格隔离,互不干扰 |
| 经济性 | 无论难易都用大模型,成本高 | 智能路由,简单任务走便宜模型 |
一句话理解 WorkSpace:它相当于 Agent 世界里的「独立虚拟机」——每个工作舱有自己的文件系统、记忆库和技能集,默认互不访问。你可以同时开三个舱做三件完全不相干的事,上下文不会串。
Step 1:安装 PilotDeck
官方一键脚本会自动配好 Node.js 22 环境、拉代码、装依赖并编译前端:
# 方式一:一键安装(macOS / Linux,推荐)
curl -fsSL https://raw.githubusercontent.com/OpenBMB/PilotDeck/main/install.sh | bash
pilotdeck # 启动服务,浏览器访问 http://localhost:3001
pilotdeck status # 查看运行状态
# 方式二:源码启动(想改代码 / 开发插件时用)
# 注意仓库用 Git LFS 管理演示视频,不需要可跳过下载
GIT_LFS_SKIP_SMUDGE=1 git clone https://github.com/OpenBMB/PilotDeck.git
cd PilotDeck
npm install # 根目录依赖(Gateway 运行时)
cd ui && npm install # UI 依赖
npm run start # 生产模式,访问 http://localhost:3001
# 方式三:Docker(Windows 用户首选)
docker compose up -d
Step 2:配置模型 Provider
PilotDeck 读取 ~/.pilotdeck/pilotdeck.yaml,支持 OpenAI、Anthropic、DeepSeek、Qwen、Kimi、MiniMax 等协议。你也可以启动 Web UI 后在设置界面里可视化填:
schemaVersion: 1
agent:
model: deepseek/deepseek-v4-pro # 默认主模型
model:
providers:
deepseek:
protocol: openai # 兼容 OpenAI 协议
url: https://api.deepseek.com/v1
apiKey: sk-your-api-key
anthropic:
protocol: anthropic
apiKey: sk-ant-your-key
建议至少配两家:后面 Step 4 的「主强子弱」路由需要一强一弱两个模型才能发挥省钱效果。只配一家的话,路由等于没开。
Step 3:创建第一个工作舱(WorkSpace)
在 Web 界面点「新建 WorkSpace」,设定任务目标与技能集。也可以用模板批量初始化:
# template.yaml —— 带预置技能包的工作舱模板
name: research_paper
skills:
- markdown-formatter
- academic-style-checker
memory_policy:
auto_cleanup: false # 学术项目建议关掉自动清理,记忆自己管
max_items: 500
跨舱协作时,用 @ 引用另一个舱的特定记忆,而不是把两个项目混在一起:
@marketing_plan:Q2预算 请参考这个数据框架,写研究经费部分
Step 4:智能路由,把账单砍到 1/6
这是 PilotDeck 最实用的省钱设计。官方在 7 个复杂任务(播客多语言推送、多源数据报告、论文综述、代码库架构文档等)上的对比数据:
| 配置 | 得分 | 成本 |
|---|---|---|
| 弱模型单 Agent | 37.1 | 约 1.9 美元 |
| 顶级模型单 Agent | 69.1 | 约 18.4 美元 |
| 主强 + 子弱路由编排 | 70.6 | 约 3.2 美元 |
也就是说,用 1/6 的钱拿到了比单用顶级模型还高的分。路由策略可以直接用自然语言写:
# 自定义路由规则示例
代码相关任务 -> 走强模型(Claude / DeepSeek Pro)
文本整理、摘要 -> 走便宜模型
网页抓取、格式化 -> 走最便宜档
为什么能既省又强?因为复杂任务里 80% 的步骤是机械劳动(抓取、格式化、汇总),只有 20% 需要真正的推理判断。一刀切用顶配,等于请院士去贴发票。
Step 5:白盒记忆的日常管理
这是 PilotDeck 和黑盒 Agent 拉开差距的地方。当 Agent 开始「胡说」,你不用猜,直接去翻它的记忆:
# 定期整理记忆库(Dream 模式:自动去重、归并、提炼)
pilotdeck memory-dream --workspace=research_paper
# 常见排障动作
1. Web UI 打开对应 WorkSpace 的「记忆」面板
2. 按时间/来源筛选,找到那条错误记忆
3. 直接编辑或删除,或对关键条目打「锁定」标记防止被覆盖
4. 出现连锁错误时,一键回滚到某个时间点的记忆快照
Step 6:Always-on 常驻 + MCP 插件扩展
开启 Always-on 模式后,Agent 在后台持续监控、主动发现任务并执行,把长周期工作的成果落成本地文件与摘要汇报:
# 典型常驻场景
· 每天扫一遍订阅源,发现领域新论文自动读并追加到综述
· 监控竞品官网/定价页变化,有变动就生成对比说明
· 跨境团队:夜里把中文文案翻译并适配成多语种草稿
能力不够就装插件。PilotDeck 采用微内核架构,插件代码与开源核心严格隔离,通过 plugin.json 注册:
· MCP Servers:原生支持 Model Context Protocol,直接挂现成工具链
· Tools & Skills:注册自定义工具,或从社区 Skill 包引入现成能力
· Lifecycle Hooks:拦截 PreToolUse、UserPromptSubmit 等关键生命周期
· Custom Memory:接入自定义记忆存储 Provider
常见问题速查
| 问题 | 解答 |
|---|---|
| 支持 Windows 吗 | 官方脚本主要面向 macOS / Linux,Windows 走 WSL2 或 Docker Compose |
| WorkSpace 之间数据互通吗 | 默认严格隔离,需要引用时用 @工作舱:记忆条目 显式跨舱 |
| 路由怎么判断任务难度 | 内置复杂度评估模块(语义分析 + 历史执行数据 + 预设规则),也可自然语言自定义 |
| Dream 模式会额外烧 Token 吗 | 会,但用便宜模型跑,且能减少后续每轮的上下文体积,长期是净省 |
| 和 OpenClaw 什么关系 | 都是通用 Agent,但 PilotDeck 定位「生产力底座」,强调记忆白盒、多任务隔离与成本工程 |