DeepSeek 把 Claude Code 的缰绳偷了
副标题:5 个月写百万行的护城河,被国产三剑客 72 小时摊到 MIT 协议下。
钩子
8 月 13 日 UTC 11 点 56 分,DeepSeek 在 GitHub 上git push了一个叫deepseek-ai/deepseek-harness的仓库。MIT 协议。一行代码都没写错。
两天后——8 月 15 日——这个仓库已经有了 95,386 个 star,8,826 个 fork。两天,从零到九万五。
同一周,阿里通义把「Claude Code 体验」打成 npm 包@qwen-code/qwen-code推到 Apache 2.0;字节 DeerFlow 2.0 在 70K+ stars 的位置上继续收 LangGraph 重写后的子代理编排。三件事,三种姿势,三套 license——MIT、Apache 2.0、MIT,全是开放的。
讲道理,OpenAI 在 2 月份写《Harness engineering: leveraging Codex in an agent-first world》的时候,那可是 3 个工程师、5 个月、100 万行代码、1500 个 PR 才攒出来的护城河。不到半年,国产三剑客把同一层缰绳摊开给所有人看了。说白了,这次是真的白给。
§1 三剑客 72 小时,把 Harness 摊到 MIT 下
先把三件事按时间线摆出来,别急着下结论。
三剑客的姿势不一样,这是关键。DeepSeek 走「元框架 + 一切皆插件」,Qwen Code 走「终端向 IDE 插件全套体验」,DeerFlow 2.0 走「LangGraph 编排 + 子代理 + 沙箱」。你如果只用一句话区分:DeepSeek 把 Harness 拆成可换零件,Qwen 把 Harness 塞进终端,DeerFlow 把 Harness 当交响乐团排。
再放一张横向对比表,把护城河的关键差异列清楚——这是 8-13 那篇没来得及列完的:
| 维度 | DeepSeek Harness (dsh) | Claude Code (Anthropic) | Qwen Code | DeerFlow 2.0 |
|---|---|---|---|---|
| License | MIT | 闭源 + 商业订阅 | Apache 2.0 | MIT |
| 设计哲学 | 一切皆插件(meta-framework) | 成熟商业产品 | Claude Code 体验平替 | LangGraph 编排 |
| 主接口 | Web UI + headless + Python SDK | Terminal + VS Code + JetBrains + Slack | Terminal + IDE + CI/CD + IM Bot | Python SDK + 多种 IM 渠道 |
| 模型选择 | DeepSeek / Anthropic / OpenAI / 本地 | 主要 Claude | OpenAI / Anthropic / Gemini / Qwen / 本地 | 主要 Qwen / 自配 |
| Extensibility | 极强:每个组件都能换 | 强:Skills / Hooks / MCP / Plugins | 强:MCP / SubAgents / Auto-Skills | 强:Skill / SubAgent |
| 成熟度 | Developer preview(README 警告:会有破坏性变更) | 已商业化 | 已商业化 | 已商业化 |
老实说,DeepSeek Harness 这一栏的 Extensibility 是真正的护城河。它不是和 Claude Code 比「谁更好用」,它是和 Claude Code 比「谁更不容易被锁」。Cordis 插件框架把模型、工具、技能、会话、沙箱、存储、循环、调度、UI 全部做成可热插拔的部件——Claude Code 想换底层模型?对不起,得等 Anthropic 自己发版;DeepSeek Harness 想换底层模型?一行配置。
§2 arXiv 2605.18747:Harness 的三大形式化性质
但 Harness 这个词被用烂了。从 2026 年初到现在,LangChain / OpenAI / Anthropic / Martin Fowler / Birgitta Böckeler 五家给的定义都不一样(dev.to 上 kenimo49 那篇综述列得很清楚)。老实说,谁对?
arXiv 2605.18747「Code as Agent Harness」做了一件没人做过的事——把 Harness 形式化成三个可验证的性质,从此别再争定义。我读完第一反应是:早该这么干了。
这张图的重点在右下角那个判定框——首次执行真实业务任务,成功率 ≥ 90%。这是德勤 2026 年企业落地调研给的硬标准,腾讯云开发者那篇文章直接借用了。
讲到这里如果你前两天读过 8-13「Harness 第一线」和 8-14「Harness 在偷笑」应该会有点感觉——OpenAI 那套 AGENTS.md + linter 的硬规则,本质就是给 Harness 灌 Executability;Anthropic 的 progress.txt + Context Reset,本质就是给 Harness 灌 Statefulness。三剑客抄走的不是「Harness」这个名词,是这三个性质。
§3 通信协议:为什么 dsh 的权限模型敢开源
Claude Code 的权限系统是黑盒:哪些命令能跑、哪些目录能写、哪些 API 能调,全在 Anthropic 内部策略里。开源的 Harness 不敢这样。
看下三剑客怎么处理「Agent 向系统请求一次 shell 执行」这条链路:
注意Policy/Approval 是插件,不是写死在二进制里。这就是 DeepSeek Harness 敢开源的核心——整套权限模型是声明式的,任何公司都可以 fork 出来换成自己的合规策略。
对比一下:Claude Code 的 Approval Mode 是 YOLO / Plan / Default 三档,藏在 Anthropic 的商业产品里;Qwen Code 同样内置 Approval Mode,但底层规则锁在@qwen-code/qwen-code包里;DeerFlow 2.0 把沙箱做成可替换的 Skill,通过容器 / microVM / WebAssembly 任选。
这意味着什么?意味着国产企业买 DeepSeek Harness,可以直接把 Policy 插件换成自己的「不允许写 /etc、不允许访问海外 API」规则集,不用等开源社区改 issue 也不用等厂商发版。这才是 Harness 进企业的真门槛,也是腾讯云开发者那篇文章说的「Harness 趋同」之外的真正差异化战场。
§4 Harness 不是银弹:腾讯云这盆冷水该不该接
8 月初腾讯云开发者社区那篇「Harness 热退潮后」泼了一盆冷水。我把它核心论点拎出来,再加一层反驳:
腾讯云说:Harness 不是终局,所有工具终将走向趋同。理由是德勤 2026 标准——首次执行真实任务成功率 < 90% 就是失败。Skill 是封装好的 Prompt + 工具调用,靠 Prompt 堆不出企业级可靠性。
我同意一半。Skill 确实只是 Prompt + 工具调用,没错。但腾讯云把「Harness 趋同」和「Skill 是天花板」两个论点绑在一起卖,逻辑上不严:
- Harness 趋同≠Skill 是天花板。前者是基础设施层的合并,后者是应用层的限制。Anthropic 在 Opus 新版里拆掉自己当年费尽心力搭的控制组件,正是因为模型变强后很多 Skill 成了冗余——但 Executability / Inspectability / Statefulness 三大性质没拆。
- 首次执行成功率 90%这个标准反过来打 Harness 自己的脸。如果你的 Harness 让 Agent 首次成功率只有 60%,那你需要的不是更多 Skill,是更深的状态外化(Statefulness)和更强的执行验证(Executability)。
怎么说呢,腾讯云的冷水对了一半——Harness 会趋同没错,但趋同的方向不是「都变成一个东西」,是「三大性质全部内置」。三剑客里 DeepSeek Harness 离这个目标最近,因为它的插件机制允许企业直接 fork 一份私有 Policy 写进 CI。
我的判断
赌注 72 小时:DeepSeek Harness v0.1 现在还在 0.1.0-rc.5,README 自己写「会有破坏性变更」。我赌到 2026 年 12 月底之前,要么 DeepSeek Harness 至少稳定到 1.0,要么 Qwen Code 把「插件化」做到和 DeepSeek Harness 同级。DeerFlow 2.0 我反而最不看好——LangGraph + LangChain 重写意味着字节把命运交给 LangChain,而 LangChain 自己都在做 DeepAgents,DeerFlow 2.0 的差异化会被慢慢吃掉。说真的,这事让我有点担心。
时窗 90 天:观察三个信号——DeepSeek Harness 的 npm 下载量能不能破月活 10 万、Qwen Code 的 Skills marketplace 能不能上 GitHub Trending、DeerFlow 2.0 的子代理编排能不能被 LangChain DeepAgents 替代。
反方对冲:如果三个月内 DeepSeek 因为 V4-Pro 涨价把开发者全推到 Anthropic / Claude Code,dsh 可能停在 1.0 之前就没人维护。这是开源最大的风险——模型厂不赚钱就没动力维护框架。Qwen Code 反而更稳,因为阿里靠云卖 Token,Apache 2.0 框架是引流入口不是产品本身。
小结(3 条 Actionable Insight)
- 今晚就能做的:打开
npx @deepseek-ai/dsh web,跑个 5 分钟的小任务,感受「插件化 Harness」和 Claude Code 的差异;或者npm install -g @qwen-code/qwen-code,在自己项目目录跑qwen。 - 这周能做的:挑一个企业内部脚本,把 Approval Mode 改成自己的白名单策略(DeepSeek Harness 的 Policy 插件 / Qwen Code 的 Approval 模式),跑通后这就是你公司的私有 Harness。
- 看趋势必看的:盯 arXiv 2603.01209「Agents Learn Their Runtime」——这篇论文证明了 Harness 的状态持久化语义必须和模型训练时的语义匹配,80% 缺失变量错误 / 3.5× token 开销就是错配的代价。三大性质不是装饰,是底线。
互动段
下一篇我想拆给你看的点是:DeepSeek Harness 的profile + bundle + patch layer这套机制。它就是把 LangChain 的 LangGraph 配置 + Anthropic 的 Skills marketplace + Vercel 的 bundle 思想三合一。讲真的,看到这块的时候我觉得有点佩服 DeepSeek 团队的抽象能力——把三家的设计哲学缝一块还不漏痕迹。下周给你拆开。
你最近在用哪个 Harness?被坑过哪个 Skill?评论区喊一声,下一篇写它。有想看的具体代码片段也行,留言我接着写。
来源区(≥3 权威 + ≥1 中文一手源)
- VentureBeat — DeepSeek Harness launches as open source rival to Claude Code — Carl Franzen 当天深度报道,确认 MIT 协议 + Cordis 元框架 + 95K stars 数据
- Qwen Code — Announcing Qwen Code: An AI Coding Agent That Thinks Like a Programmer — 阿里通义实验室官方,Skills / SubAgents / Approval Mode 完整定义
- GitHub — bytedance/deer-flow — 字节跳动官方仓库,DeerFlow 2.0 LangGraph 重写版本
- 腾讯云开发者 — Harness 热退潮后,Agent 的下一个主战场,不在论文里 — 关键中文一手源,反方对冲素材
- cc.bruniaux.com — Code as Agent Harness (arXiv 2605.18747) — arXiv 论文深度解读,三大形式化性质出处
- 腾讯新闻 — 2026 年中国 TOP10 AI 代码智能体排行榜 — 新华社瞭望财经 + 快思慢想研究院联合发布,国产地位定论