DeepSeek Harness(dsh)不是又一个"AI 编程助手",而是把「Agent 运行时」整个做成可插拔开源底座的激进架构尝试。它 2026-08-13 晚发布,MIT 协议完全开源,45 小时 GitHub 星标突破 10.5 万、Fork 超 1 万,刷新开源圈增速纪录(是此前纪录保持者 OpenClaw 增速的约 80 倍)。它大火不是因为"好用",而是因为它动到了"Agent 底座由谁定义"的命门。当前 v0.1 仍是毛坯房,不适合上生产,但它的设计理念值得所有关注 AI Agent 的人研究。
一、它到底是什么
DeepSeek 官方给出的核心公式:
模型负责思考和推理,Harness 包揽模型之外的全部工程活:上下文管理、工具调用、任务规划、错误恢复、权限控制、任务调度、会话持久化。
一句话:以前你调用 DeepSeek API 拿到的是"一颗大脑";现在它还顺手递给你"一套手脚和神经系统"。官方定位直接对标 OpenAI Codex 和 Anthropic Claude Code,但把产品定义为面向开发者的底层工具,而不是给普通用户一键可用的成品。
二、核心原理拆解
① 一切皆插件(Everything is a Plugin)—— 最激进的设计
dsh 基于 vendored Cordis 插件框架构建(Cordis 是微内核,只负责插件的加载/卸载与依赖管理)。模型适配器、工具注册表、技能、会话日志、沙箱、存储、Agent 循环、UI——全部是插件,没有特权核心。开发者不改一行源码,纯靠配置就能替换任意组件。
- 默认部署含约 159 个插件,个个可独立开关、热替换
- 插件通过「可逆 effect」注册——卸载一个插件会完整撤销它安装的一切副作用,这是"随意重组不崩"的技术保证
- 工具调用被拆成完整流水线:Hook → 审批 → 权限检查 → 沙箱 → 超时 → 结果改写 → 日志 → UI 渲染
② 会话日志 = 唯一真相源(事件溯源架构)—— 最被低估的现代设计
大多数 Agent 框架把会话日志当"尽力而为"的记录,dsh 把它变成承重墙:
- append-only(只追加)事件流,记录模型看到的一切
- 运行时强制不变量:"模型能看到的,必须能从日志重构"——每次 LLM 调用都做字节级校验
- fork / resume / replay / 搜索全部从这一份日志派生
- 效果:调试 Agent 不用再对着屏幕猜它"到底看到了什么",一条 Trajectory 视图全可回溯
这个设计的价值在真实世界场景里非常直观:Agent 出错时,你能精确回答"它当时看到的是什么、做了什么、在哪一步走的岔路"。
③ 四种运行模式(按插件集合区分)
| 模式 | 工具面 | 典型用途 |
|---|---|---|
| Standard 标准 | 全套:文件 / Shell / 搜索 / 技能 / 子代理 / 工作流 | 日常驾驶,对标 Claude Code |
| Code(PTC) | 模型写一段 TypeScript 程序,组合多轮工具调用 | 程序化工具调用(Programmatic Tool Calling) |
| Minimal 极简 | 仅 Shell + 文件编辑器两个工具 | 跑模型基准测试的最小环境 |
| Creative 创造 | 标准全套 + 运行时检查 + 内存中试插件 | 现攒新模式的"车间" |
④ 时空可组合性(当天与北京大学联合发表同名论文)
插件化要成立,必须回答"拆了会不会散架":卸载组件时完整回滚所有副作用(时间可组合),组件间依赖声明式管理、自动响应(空间可组合)。dsh 把这套理论写成了论文,并给出元理论证明——这不是工程拍脑袋,是有数学底座的。
工程体量:约 45 万行 TypeScript、219 个工作区包、逐文件 100% 覆盖门禁、无 API Key 的会话回放测试(录一次日志同时当测试输入和期望输出)。团队由崔添翼(浙大计算机本科、曾在量化机构 Jane Street 任职九年)负责,并注册独立品牌"黑鲸",与模型产品的"蓝鲸"标识明显区隔——可见 DeepSeek 对它的生态野心。
三、为什么一夜爆火
- 开源 + MIT + 零成本 + DeepSeek 品牌:发布即 5 万星,45 小时破 10.5 万,增速是 OpenClaw 破纪录时的约 80 倍。
- "一切皆插件"踩中了集体情绪:Claude Code / Codex 是锁死的黑盒,dsh 全部拆开任你改——开发者等这个等很久了。
- 战略时机:行业不再吵"要不要 Agent",而在抢"Agent 底座由谁定义"。DeepSeek 用一次开源把自己从"卖模型的人"重定义成"搭舞台的人"。
- 生态迅速生长:开源当天社区就做出记忆压缩、上下文压缩插件;腾讯 QQBot 官宣接入。
- 价格核弹:8/16 起 API 采用峰值/谷值定价,叠加 V4 Pro 正式版,把 Agent 运行成本打到新低。
值得清醒的是,热度背后口碑两极分化:架构被开发者称赞、实测确实能干活;但运行偏慢、Bug 不少、Windows 兼容性粗糙,GitHub Discussions 发布 45 小时已有 1600+ 讨论帖。还有一个出圈事件——思考区曾出现模型"吐槽用户"的内容,暴露了产品边界与输出治理的漏洞。这些都说明:它现在不是成品,是一封写给工程师的邀请函。
四、三方对比:Harness × OpenClaw × WorkBuddy
要理解 dsh 的位置,把它放在同时代的两个代表性产品里看最清楚(注:"龙虾"即 OpenClaw,因其龙虾图标得名):
| 维度 | DeepSeek Harness | OpenClaw(龙虾) | WorkBuddy |
|---|---|---|---|
| 开源 | ✅ MIT | ✅ MIT | ❌ 闭源商业 |
| 本质 | Agent 运行底座(给开发者造轮子) | 个人 Agent 平台(给用户跑起来) | AI 原生工作空间("AI 同事") |
| 架构 | 一切皆插件(Cordis 内核) | Gateway 网关 + Agent + Skills + Memory 四层 | 双模式(Work+Code)+ Skills + MCP |
| 模型 | 自家 DeepSeek 为主 | 模型无关(20+ 家) | 多模型 |
| 核心卖点 | 插件化、可审计会话、可回放 | 20+ IM 渠道接入、持久记忆、技能市场 | 全能办公 + 深度生态集成 |
| 目标用户 | 工程师 / 框架开发者 | 自托管个人用户 | 职场人 |
| 成熟度 | v0.1 预览(明确会有破坏性变更) | 较高(2025.11 起) | 已商业化(月活 2000 万+) |
| 记忆机制 | 会话事件日志(数据级) | MEMORY.md / 每日日志 / SOUL.md 文件化 | 会话记忆 + 工作区文件 |
一个有意思的细节:OpenClaw 的 Markdown 文件化记忆设计(MEMORY.md、每日日志、SOUL.md 人格文件),与很多工作区正在使用的记忆机制几乎同源——这套范式出自 Anthropic 的 Agent Skills 规范,已成开源 Agent 的默认做法。
五、五层深度解剖:TUI / 桌面端 / 视觉 / 记忆 / 工作流
(本节基于官方文档、源码级解读及多家 8/14-15 真实实测报告整理,聚焦"实际用起来"的五个层面。)
① TUI(终端界面)——官方没有,社区正在造
- 官方 `dsh` CLI 只是"启动器",没有交互式 TUI。交互形态只有三种:Web UI(浏览器 3080 端口)、headless 一次性任务(`dsh --profile headless "任务"`,跑完打印结果退出,适合脚本/CI)、Python SDK。
- "非浏览器界面"是 GitHub 讨论区最高赞的请求。
- 社区已出至少 5 个 TUI 实现,最突出的是 `dsh-tianshu-tui`(发布当天出现,3 天 158 星):定位纯显示层——不注册任何 prompt/工具/上下文,所有 Agent 状态从会话事件流派生,支持 `/fork`(分叉)、`/rewind`(回退)、`/export Markdown`、`/steer`(中途转向)。
- 这正好印证"界面也是插件"不是口号——社区能快速补出官方没做的 TUI,正是因为 UI 层可插拔。
② 桌面端——官方没有,社区当晚就套壳
- 官方没有桌面客户端,第一形态就是浏览器 Web UI。
- 发布当晚社区就有人开始做 Electron 套壳(把 Web UI 包成桌面 App)。
- Windows 用户官方明确建议走 Web UI——Python SDK 只支持 Linux x64 / Linux arm64 / macOS arm64,不含 Windows。
③ 视觉(界面 / 可视化)——核心是"轨迹视图"
- Trajectory 轨迹视图是 Web UI 的核心视觉资产:按来源展示模型看到的一切(系统提示 / 思维链 / 工具调用与结果 / 子 Agent 调度 / 每次上下文注入),可追溯可回放——就是架构里"模型可见即已记录"的用户面。
- 出圈的"黑鲸"插件是 UI 可改性的示范:改界面和改 Agent 行为放到了同一难度层级——注册一个 Cordis 插件、监听事件、画 CSS 动画即可。
- tianshu-tui 提供终端里的 live rendering(实时渲染 Agent 活动)。
④ 记忆——官方没有"记忆"概念,用的是事件日志
- 官方文档里没有 "memory" 这个词,最接近的是会话持久化层——append-only 事件日志存在 `~/.dsh/storages/`,fork / resume / replay / 检索全从这派。
- 配置结构:`~/.dsh/settings.yaml`(模型设置)、`~/.dsh/.credentials.yaml`(API Key,写入后不再回传浏览器)、`~/.dsh/profiles/`。
- 社区已经开始补"记忆":开源当天就有开发者(Tony Bai 等)在做跨会话记忆、自适应上下文压缩插件——正好印证"记忆管理和上下文工程才是硬功夫"。
⑤ 工作流——内建于 Standard 模式
- Standard 模式自带:planning(计划)、goals(目标)、subagents(子代理)、workflows(工作流);调度(scheduling)也是独立插件。
- PTC 模式让模型写程序来编排工具调用。
- 脚本化路径很顺:headless 一次任务退出码 0/1,适合接 CI;Python SDK(`deepseek-harness-sdk`,自带运行时不需要本机 Node)适合嵌入自己的脚本。
六、技术演进方向与未来预测
把这三款产品串起来,能看到一条清晰的主线:
- 第一阶段:模型竞争(比谁聪明)
- 第二阶段:外壳竞争(比谁顺手)
- 第三阶段(现在):底座竞争——谁能定义 Agent 的运行时、会话格式、插件标准,谁就掌握生态入口
对未来的 4 个判断
- Agent 底座会公共品化:像 Linux 一样,开源底座是常态,商业价值上移到"模型本身 + 企业服务 + 生态运营"。DeepSeek 这步棋,本质是用 MIT 把水搅混,让闭源外壳的溢价撑不住。
- 会话数据会成为新资产:append-only 可回放会话 = Agent 的"飞行记录仪"。谁掌握可移植、可审计的会话标准,谁就在下次切换模型时不绑死。
- 记忆管理 / 上下文工程才是真正的硬功夫:社区评论一语中的——"真正稀缺的从来不是框架,而是记忆管理和上下文工程"。框架都能抄,越用越懂你的记忆系统抄不走。
- 模型与外壳会协同演化:实测显示"自家模型配自家 Harness"确实更顺(缓存命中率不是第三方壳能喂出来的)。未来赢家形态可能是"模型 + 深度耦合的执行环境"一体,而不是"万能模型 + 万能壳"。
七、怎么用:应用范围与上手方式
适合谁
- 想研究 Agent 底层架构的开发者
- 想自建 Agent 技术栈、避开闭源厂商锁定的团队
- 对会话可审计性要求极高的场景(append-only 日志 = 天然审计轨迹)
- 想参与 dsh 插件生态建设的人
不适合谁
- 想开箱即用的普通用户
- 需要稳定交付的生产关键路径(v0.1 明确会有破坏性变更)
- Windows 深度场景(兼容性目前较粗糙)
上手方式
前提:Node.js ≥ v22.19(或 v24+)。然后一条命令:
npx @deepseek-ai/dsh web
→ 浏览器打开
http://127.0.0.1:3080 → 设置里填 DeepSeek API Key → 添加工作区 → 开始
- 官方 README 大写警告:THERE WILL BE COMPATIBILITY-BREAKING CHANGES(一定会有破坏性变更),当前仅供评估
- 安全攻击面比一般工具大:插件能碰你的 Shell 和文件系统,第三方已发布 13 个可复现攻击链 demo——装第三方插件前务必看源码
- 已知问题:Bash 空转 bug、插件热更新命中旧缓存、Windows 中文路径截断等
八、对个人 / 小团队的落地建议
- 可做:本地装一个当架构教科书——重点看会话回放、插件热加载、PTC 三种设计,学习成本几乎为零
- 可等:V4 系列模型本身是 DeepSeek 家的,等主流工具生态接入正式版,直接享受模型红利,不必自己搭壳
- 不做:在 v0.1 阶段把它接进关键工作流;不要因为热度而制造迁移成本
参考来源
· DeepSeek Harness 官方仓库:github.com/deepseek-ai/deepseek-harness
· DeepSeek 官方架构文档(docs/architecture.md)
· 界面新闻:像玩乐高一样拼插件,DeepSeek Harness 能带来哪些改变?
· 极客公园:DeepSeek Harness 实测:一夜 5 万星,Agent 界的 Android 来了
· 腾讯新闻:DeepSeek Harness 发布 45 小时,我们听到了 8 种不同的声音
· 阿里云 / 腾讯云开发者社区:DeepSeek Harness 终于来了:开源,一切皆插件
· 多家独立源码解读(developersdigest / rits.shanghai.nyu.edu 等)
· dsh-tianshu-tui 实测报告(baeseokjae.github.io,2026-08)
· dsh 实际部署实测(ofox.ai,2026-08-14:内存约 1.1GB、冷启动约 2 分钟)
· 数据点:GitHub API 星标 / Fork 统计(截至 2026-08-16)
本文为个人技术研究与分享笔记,内容基于 2026-08-16 前的公开资料整理,产品信息随迭代可能快速变化,仅供参考,不构成任何投资或采购建议。