跳到主要内容
归档
作者 Harness the Agents

DeepSeek Harness 不是 Claude Code 杀手,它是更有趣的东西

DeepSeek 的开源智能体 harness 上线第一周 GitHub 星数就突破了 168,000。我装了它,读了仓库,还亲手跑了一遍。以下是我验证下来站得住的东西。

The DeepSeek Harness wordmark beside the DeepSeek whale logo, in blue on a white background with faint circuit-board traces.

DeepSeek Harness 不是 Claude Code 杀手,它是更有趣的东西

README 承诺一行安装。输入 npx @deepseek-ai/dsh web,你就进去了。在我的机器上,这一行跑了十六分钟,往 npx 缓存里拉了几百个包,下一次运行时又花了十分钟重新解析依赖。我不怪 DeepSeek。我提这件事,是因为"一行命令的承诺"和"十六分钟的现实"之间的落差,就是 DeepSeek Harness 整个故事的缩影。8 月 13 日发布的这个东西,确实有意思,确实粗糙,而且被普遍误读了。

误读是这样的:DeepSeek 造了一个 Claude Code 的竞争对手。这是大多数发布报道套用的框架,我理解为什么。它看起来像,用起来像,而且其中一部分还真就是出自 Claude Code 之手。但这个框架是错的。在花了整整一周读仓库、跑这个东西、核查别人对它的各种说法之后,我认为真正的故事在更上面一层。

核心要点

DeepSeek Harness(dsh)是一个 MIT 许可的智能体编程 harness(编排运行层),于 2026 年 8 月 13 日以开发者预览形式发布。上线第一周,GitHub 星数突破 168,000,npm 下载量达 552,000 次。它"一切皆插件"的说法是字面意义上的真。模型适配器、工具、乃至智能体循环本身都是可替换的,构建在一个在 AI 之外已有四年生产历史的框架之上。Token 消耗确实很大,且有多方佐证,但接近 99% 的缓存命中率摊薄了账单。把它当作折腾者的预览版,而不是日常主力工具。战略动作比工具本身更重要:一家模型实验室把 harness 层免费送了出来,这一枪打的是"harness 订阅制"这种商业模式,而不是 Claude Code 的功能清单。

开始之前,先交代一下方法。下文关于仓库、安装和运行的所有内容,都是我这周的第一手经历。凡是借助他人测试的地方,我都会说明并点名。

DeepSeek 到底发布了什么?

截至 2026 年 8 月 20 日,这个仓库刚满一周,星数停在 168,325,npm 包在 8 月 12 至 18 日那一周被下载了 552,210 次。对于一个自家文档都警告会毫无预兆地破坏兼容性的开发者预览版来说,这些数字大得惊人。这些星数买来的是一个本地智能体 harness:你运行 dsh web,一个浏览器界面会在 3080 端口打开,你把它指向一个工作区,选一个模型和一种模式,然后让它干活。

我觉得最能说明问题的细节在内部。这不是一个包着 API 的薄壳。我从源码构建的那份检出里有 226 个工作区包,一个带沙箱模式的权限系统(从 read-onlydanger-full-access),以及四个智能体预设。Standard 是完整的编程智能体,PTC 让模型写一个程序然后执行它,Minimal 只带两个工具,而可自我扩展的 Creator 模式的头部注释直接告诉你要把它当作 shell 访问来对待。

最引人注目的是:官方插件包能让这个 harness 把 Claude Code 和 Codex 当作子智能体来调用。DeepSeek 的 harness 会高高兴兴地把子任务委托给它所谓的对手。而且每个会话都会写入一个只追加的日志,记录完整的系统提示词、每一次工具调用和每一项 token 计数。我自己的测试运行为一个十步任务产生了 250 个事件,事后全部可以检视。

一个实用提醒。还有一个不相干的第三方项目也叫 deepseek-harness,是五月发布的一个协议适配器。如果你去找,认准 deepseek-ai 这个组织。另一个不是恶意的,只是名字起得容易混淆。

DeepSeek Harness 是一个 MIT 许可的智能体编程 harness,于 2026 年 8 月 13 日以开发者预览形式发布。GitHub 仓库一周内星数突破 168,000,而且它能将 Claude Code 和 Codex 编排为子智能体,而不只是与它们竞争。

这套框架来自一个聊天机器人生态

这是几乎所有英文报道都没抓住的部分。DeepSeek 并没有从零构建这个 harness 的插件架构。它构建在 Cordis 之上,那是一个 MIT 许可的 TypeScript 插件框架,自 2022 年起就在 Koishi 底下承担生产负载。Koishi 是一个拥有数千个社区插件的聊天机器人框架。Cordis 的作者 Yifan Shi,正是 DeepSeek 随这次发布一同发表的论文的第一作者,署名单位是北京大学。这篇论文是自托管的预印本,88 页,老实地标注为草稿。Cordis 仓库本身在我 8 月 20 日查看时是 6,465 颗星。

这篇论文所形式化的想法,有一个吓人的名字,时空可组合性(spatiotemporal composability),和一个朴素的意思。时间维度:系统的任何部分都可以在运行时卸载,它做过的一切都会被干净地撤销。空间维度:各部分声明自己依赖什么,随着依赖的来去而唤醒或关闭。论文证明了加载和卸载的顺序无关紧要,无论如何系统都会收敛到同一个状态。如果这听起来像一个已解决的问题,那并不是。论文的动机数据是:最流行的 100 个 VSCode 扩展里,有 87 个不重启编辑器就无法卸载。

我想知道"一切皆插件"是营销话术还是真实机制,于是把解析后的配置导了出来。是机制。默认的 web 配置由 135 行插件组成,横跨 24 个 YAML 补丁层,每一行都标注了它由哪个包贡献。模型适配器、工具注册表、会话日志、智能体循环:全是插件,全部可逆。仓库还在 CI 里给每个源文件卡了 100% 测试覆盖率,对一个刚满一周的预览版来说,这道门槛严得近乎滑稽。

DeepSeek Harness 运行在 Cordis 之上,这个插件框架自 2022 年起就在 Koishi 聊天机器人生态中承担生产负载,并由北京大学与 DeepSeek 的 一篇 88 页预印本加以形式化。它的核心保证是:任何组件都可以在运行时加载或卸载,无论顺序如何,系统都会收敛到同一状态。

它是用对手的工具造出来的

现在说说那个尴尬又好玩的部分。一篇代码取证分析(来自 winzheng.com,单一来源,不过它声称其脚本可复现)梳理了提交历史,发现前 12,293 个提交中有 1,760 个带 codex/ 分支前缀,第十一提交的标题是 "fix issues found in the second round of Codex review"(修复第二轮 Codex 审查发现的问题),而且一个指向 AGENTS.mdCLAUDE.md 符号链接从第一个提交起就存在。说白了:DeepSeek 的团队在构建这个 harness 时,深度地把 OpenAI 的 Codex 和 Anthropic 的 Claude Code 放在了回路里。

我会把这件事归为有趣,而不是丑闻。我认识的每一个认真的工程团队现在都在用这些工具做开发,DeepSeek 显然也一样。同一份报告还核查了那个更劲爆的传言,说这个 harness 是从泄露的 Claude Code 源码里搬出来的,结果是字符串重叠为零。这一点值得说,因为那个传言确实流传过一阵。取证真正揭示的东西比传言有意思得多:这家实验室深信模型是大宗商品、围绕着它的循环才是产品,这种信念一直延伸到了它自己构建软件的方式里。

再说一句实话。这个 harness 在一些英文报道没提的地方是以中文为先的。预设的元数据文件是先以中文写成的,一些随产品发布的界面字符串只有中文。如果你想要一个小而具体的信号,看看 DeepSeek 预期的早期采用者是谁,这就是了。

我自己跑了一遍

光读关于一个 harness 的文章只能走这么远,所以我跑了一个真实任务。我没有用 DeepSeek 的 API 密钥,而是用了一个 OpenCode Go 订阅密钥,它路由到一个收录七家或更多实验室、共十六个模型的目录。这个选择纯属偶然,却成了整个测试中最有教益的部分:我跑的是 DeepSeek 的 harness,用的是 DeepSeek 的 V4 Flash 模型,却全程没有碰 DeepSeek 自家的 API。架构所承诺的供应商可替换性不是理论,它就是一个 YAML 文件加一个环境变量。

任务:构建一个单页网站,显示杭州、伦敦和纽约的实时时钟,然后验证它。这次运行耗时 2 分 8 秒,10 个步骤,9 次工具调用,烧掉约 108,000 个 token,其中 91% 的输入由缓存提供。智能体探测了环境,写出页面,提取出自己的 JavaScript 并用 node 做了语法检查,在自己的验证脚本里抓到一个舍入 bug,修掉它,然后重跑了检查。我随后独立验证了输出:时区运算是正确的,包括伦敦目前在英国夏令时、纽约在 EDT 这个事实。小任务,结果正确,日志完整。

粗糙的边角也是真的。从源码检出启动对你的工作目录很挑剔,而文档对此只字未提。无头模式不打印 token 汇总,上面那些数字是我从会话日志里手工算出来的。还有,系统提示词告诉模型它是 deepseek-v4-flash,因为我配置的路由就叫这个名字,这在有人代理了另一个模型、智能体对自我身份产生错觉之前都没什么问题。全都是预览版成色的问题。

在 2026 年 8 月 20 日的一次第一手测试中,DeepSeek Harness 用 2 分 8 秒、10 个步骤完成了一个经过验证的单页构建,消耗约 108,000 个 token,缓存读取率 91%,走的是第三方 OpenCode Go 模型密钥,而非 DeepSeek 自家 API。

诚实的账单

对这个 harness 最猛烈的批评是它烧 token,而这个批评站得住。Julian Goldie 的 AI Success Lab 在发布周用同一个单页网站任务给它和 Claude Code 计了时:DeepSeek 这套组合用了约 483,000 个 token,Claude Code 用了 48,000 个,不过前者 11 分钟就跑完了,后者要 30 多分钟,前者的成本约为五美分。一位 Reddit 用户的并排对比在代码审查任务上发现了同样的形态,而他的后续补充承认他完全没有调过 dsh 的配置。

测试

Token 数

时间

备注

单页网站,dsh + V4 Pro(AI Success Lab)

~483,000

11 分钟

约 $0.05,重度依赖缓存

单页网站,Claude Code(同一任务)

~48,000

30+ 分钟

质量得分更高,9/10 对 7/10

代码审查,dsh 未调优(Reddit)

500,000

不适用

缓存命中率 70%

代码审查,OpenCode(同一批任务)

~70,000

不适用

缓存命中率 95%

时钟页面构建,我的实测(8 月 20 日)

~108,000

2 分 8 秒

缓存读取率 91%,输出已验证

拯救这笔账的是缓存。QbitAI 的测试者(这家中国媒体有两周的封闭测试权限)测得的缓存命中率在 99% 左右,而我自己的运行是 91%。缓存输入几乎免费,所以吓人的 token 计数最后换算成的是小账单。

可靠性是更软的下腹部。AtlasCloud 把发布报道里的 ISS 追踪器构建重跑了三遍(披露一下:这是一家厂商的博客,跑的是它自家托管的端点),其中两遍 harness 打印了 "Done",而浏览器里的页面实际上是坏的。我的时钟任务验证得很干净,但我的时钟任务也确实是微不足道的。把演示当演示看。

DeepSeek Harness 吃 token 但重缓存:2026 年 8 月的独立测试显示,在相同任务上它的 token 消耗约为 Claude Code 的十倍,但被接近 99% 的缓存命中率和 DeepSeek 官方定价(每百万缓存输入 token $0.007 至 $0.014)所抵消。

DeepSeek 要花多少钱?

定价需要打上日期戳,因为发布周的不少报道现在已经过时了。8 月 16 日,DeepSeek 把它的 API 改成了高峰与低谷定价。截至 8 月 20 日,官方定价页列出的 V4 Flash 是每百万输入 token $0.22 至 $0.44(视时段而定),每百万输出 $0.66 至 $1.32,缓存命中为 $0.007 至 $0.014。Pro 是它的三倍。如果一篇评测给你报的是一口价 $0.14,那它引用的是六月。这些数字为什么能一直这么低,长版本在 中国 AI 为什么便宜 里。

在这两个模型之间,早期共识和我的直觉一致:日常干活用 Flash,问题真的硬了再上 Pro。如果你正在把它们和场上其他选手放在一起权衡,我在 Qwen、DeepSeek 与 Llama 对比 里维护着一份持续更新的比较。

DeepSeek Harness 跑起来安全吗?

老规矩,先声明部署假设。harness 在本地运行,模型路由由你选择,所以数据驻留问题取决于你把它指向哪个供应商,而不是 harness 本身;我的测试把提示词发给了 OpenCode Go 的服务器,而不是 DeepSeek 的。还剩两个真实的注意事项。仓库自己的说明里描述了默认关闭的遥测,但一旦启用,它在发送时不带任何脱敏规则。而且插件是以你的权限在进程内执行的,所以插件生态是一个供应链问题,和当初 DeepSeek 用于企业是否安全 是同一个形状的问题。目前还没有人做过独立的安全审计。

这一步棋意味着什么

DeepSeek 为这次发布准备的 产品页 用四个词点明了主旨:Agent = Model + Harness(智能体等于模型加 harness)。模型负责预测 token;harness 决定它拿到什么工具、何时停下、记住什么。VentureBeat 的发布报道有一个锋利的框架:一旦前沿模型在能力上收敛,控制着智能体如何推理、如何跨工作流持久化的那一层,就会变得比模型本身难替换得多。这就引出了一个问题:为什么一家实验室会把那一层以 MIT 许可送出去?

因为把贵的东西送出去,正是 DeepSeek 的拿手好戏。它对模型层这么干过,用的是开源权重,中国开源权重生态实地指南就是那个故事的长版本。harness 是同一根楔子,只是往上打了一层。一位源码评审者引用的 36Kr 评论把没说破的那半句说破了:这一枪不是打 Claude Code 的功能清单,是打"harness 作为付费产品"这件事本身。这个赌注能否兑现,取决于一件 DeepSeek 控制不了的事,那就是陌生人到底会不会真的来写插件。那才是我会盯着的数字,而不是星数。

所以,你该试试吗?如果你爱折腾,该。安装是重,但源码构建很干净,而且读一份这么自律的代码库有一种真实的乐趣。如果你自托管模型,或者关心规模化成本,该,供应商配置本身就是这次练习的要点。如果你需要一个稳定的日常主力工具,别。仓库白纸黑字地承诺了破坏性变更,而且它是认真的。

DeepSeek Harness 是一次战略发布,而不只是一个工具:通过以 MIT 许可放出 harness 层并宣称 "Agent = Model + Harness",DeepSeek 是在主张 harness 应该成为大宗商品,这与它此前用开源权重打穿模型层的是同一根楔子。

常见问题

带着 shell 访问权限运行 DeepSeek Harness 安全吗?

harness 在本地运行,所以这个问题要拆成两半。你的提示词会去往你配置的任何一家模型供应商,而内置沙箱从只读起步,往上是工作区可写和完全访问模式。更尖锐的风险在插件:它们以你的权限在进程内运行,而这个刚满一周的插件生态还没有任何独立审计。

DeepSeek Harness 真的能调用 Claude Code 和 Codex 吗?

能,而且这一点是在仓库里得到确认的,不只是报道里的说法。名为 subagent-claude-codesubagent-codex 的可选插件包,分别驱动官方的 Claude Agent SDK 和 Codex 的 app-server。你仍然需要自己安装并登录那些工具;harness 提供的是编排,不是订阅。

用 DeepSeek Harness 该选 Flash 还是 Pro?

大多数工作用 Flash。早期的独立测试显示,无论选哪个,在相同任务上的 token 消耗都大约是 Claude Code 的十倍,所以经济账是在更便宜的那个模型上算得过来的。截至 2026 年 8 月 20 日,DeepSeek 官方定价里 Flash 的输出价格是 Pro 的三分之一。把 Pro 留给那些真的需要额外推理能力的问题。

结语

DeepSeek Harness 是一件粗糙、自律、真正新颖的工程作品,而大多数发布报道把它描述成了错误的东西。它没有想在 Claude Code 的游戏里胜过 Claude Code。它是一家模型实验室在宣告:模型之上那一层应该是免费的,而这份宣告是用四年历史的聊天机器人框架零件和对手自己的编程工具搭出来的。这份宣告能不能立住,取决于插件作者们,而他们需要几个月才能给出判决。在此期间,这是我今年装过的最有教益的一次十六分钟安装。

如果你正在为某个真实项目权衡中国模型或智能体工具,欢迎联系我

资料来源(均检索于 2026-08-20):