返回博客

两天 95k Star:DeepSeek Harness 凭什么引爆开发者社区?

两天 95k Star:DeepSeek Harness 凭什么引爆开发者社区?

2026 年 8 月 13 日,DeepSeek 做了两件事:发布 V4 Pro 正式版,开源 Harness。

一天之内,Harness 的 GitHub 仓库冲到 8 万 Star。两天后,这个数字逼近 95k。1.5 小时破 2.4 万 Star 的瞬间,直接刷新了 GitHub 史上最快涨星纪录。

不是营销砸出来的,不是 KOL 刷出来的。开发者用脚投了票。

先搞清楚:Harness 是什么

DeepSeek 官网放了一条公式:

Agent = Model + Harness

模型是灵魂,Harness 是骨架。模型负责推理,Harness 让 Agent 能看懂环境、用工具、在真实场景里持续工作。

你用过的 Claude Code、Cursor、Codex,背后都有一个 Harness——只不过它们的 Harness 是锁死的,和自家模型深度绑定。DeepSeek 把这层骨架拆出来开源了,而且每一块都能换。

核心:一切皆插件

这是 Harness 最狠的设计。

模型、工具、技能、会话、沙箱、存储、循环、调度、UI——所有 Agent 能力,全是插件。基于 Cordis 插件系统构建,没有特权核心,不需要改源码,配置文件里选、换、扩展都行。

想用 DeepSeek V4?插件。想换 Claude?插件。GPT?Gemini?AWS Bedrock?Azure?全是插件。Harness 甚至能读 Claude Code 的 CLAUDE.md 和 Codex 的 hooks.json,把它们当子 Agent 调度。

这意味着什么? 模型和基础设施彻底解耦。一个团队用 Claude 做复杂任务,用便宜模型跑日常活,不用换工具链。想横向对比几个模型?同一个 Harness 跑不同 Provider,直接比。

四种运行模式

Harness 不是只能跑一种 Agent。它有四个预设:

Standard:全功能编码 Agent。文件编辑、Shell、网页搜索、技能、规划、子 Agent、工作流,全开。

Code:在 Standard 基础上,把工具暴露成 TypeScript SDK。模型可以写一段程序,把多步工具调用编排成一次往返——降延迟,省 Token。

Minimal:只留 bash 和文件编辑器两个工具。给模型跑 Benchmark 用的,最干净的环境。

Creator:检查当前运行时,内存里测插件,组合出新模式。给想造自己 Agent 预设的人用的。

每一步都可追溯

这是 Harness 和大多数竞品拉开差距的地方。

模型看到的一切——系统提示词、思维链、工具调用和结果、子 Agent 调度、每次上下文注入——全部写进只追加的会话日志。上下文压缩不删原始历史,只是用替换事件改变模型后续看到的表象。

Trajectory 视图里按来源逐条追。恢复、分叉、搜索、回放,全操作在同一条事件流上。

Agent 做了件 unexpected 的事?不用猜,拉日志看它当时看到了什么、为什么做了那个选择。Debug 和 Guess 之间的区别,就在这里。

沙箱:用操作系统级别的隔离

Agent 跑模型生成的任意命令,沙箱不是可选项。

Harness 在 Linux 上用 Landlock,macOS 上用 Seatbelt,Windows 上用 ACL 受限令牌。这些都是操作系统级的容器机制,和浏览器隔离不可信代码是同一类技术。

不是 Docker 套一层,不是进程级限制凑数。很多 Agent 工具在这块是偷懒的,Harness 没有。

为什么两天 95k Star

不是单一原因。是几个因素叠在一起:

模型无关。开源 Agent 框架最大的吸引力就是不被锁死在某家模型上。Harness 把模型也做成了插件,这在当前 Agent 工具里几乎没有第二家做到这个程度。

Cordis 架构。和北大 researchers 合作的"时空可组合性元框架"。学术 + 工业的合作,在基础设施层做了真正的创新,不是拿个开源框架套壳。

DeepSeek 品牌势能。V4 Pro 同日发布,DeepSeek 在开发者社区已经积累了大量信任。性价比屠榜之后,开发者愿意试它的基础设施产品。

一行命令启动npx @deepseek-ai/dsh web,装好 Node.js 就能跑。没有环境配置地狱。

社区插件生态自发生长。开源几小时,dsh-plugin 话题下已经有 307+ 个公开仓库。这速度说明开发者不是来看热闹的,是真的在动手造。

12,000+ commits。这不是一个 PPT 项目。仓库带着超过 1.2 万次提交、230 多个 workspace 成员,说明内部已经迭代了很久,拿出来的是成熟度相当高的东西。

和其他工具对比

维度

DeepSeek Harness

Claude Code

OpenAI Codex

LangChain

LangGraph

定位

Agent Harness

集成产品

集成产品

Agent 框架

Agent 运行时

模型锁定

无(全插件)

Claude

GPT

开源

MIT

MIT

MIT

插件系统

一切皆插件

组件级

节点/边

可追溯性

完整(append-only)

有限

有限

手动

手动

沙箱

OS 级

不公开

不公开

控制粒度

中(配置组合)

低(开箱即用)

低(开箱即用)

高(最细粒度)

适合场景

基础设施

即用编码

即用编码

快速原型

生产级工作流

关键区别:Claude Code 和 Codex 是成品,开箱即用但什么都锁死。LangChain 和 LangGraph 给你积木,但 Harness 的活要自己搭。DeepSeek Harness 在中间——给你一个能跑的 Agent,但每个零件都能换

LangChain 官方自己把这三个层次叫做:Runtime(LangGraph,最控制最少抽象)→ Framework(LangChain)→ Harness(Deep Agents,最少控制最开箱即用)。DeepSeek Harness 做的是同样的 Harness 层,但比 LangChain 自家的 Deep Agents 走得更极端——连模型和 Agent 主循环都是插件。

还不能忽视的问题

不接受外部 PR。README 明确写了:"We are sorry that we cannot accept external pull requests at the moment." 开源了代码,但治理还没开放。贡献者只能去 GitHub Discussions 发插件。

MIT 协议但治理不开放,这是个张力。对于一个主打"模块化、反锁定"的项目来说,尤其值得观察。

Developer Preview。核心插件和 API 还会变。现在上生产环境需要做好跟着 breaking change 走的准备。

这意味着什么

DeepSeek 在赌一件事:基础设施层的价值会超过模型层

模型越来越便宜,差距在缩小。今天 V4 Pro 和 Claude 4.5 各有胜负,明天可能更多模型追上来。如果模型变成大宗商品,那让 Agent 跑起来的基础设施就是价值锚点。

Harness 能用竞争对手的模型,甚至能把 Claude Code 和 Codex 当子 Agent 调度。这不是做慈善——这是在说:不管你用谁的模型,你的 Agent 基础设施都可以跑在我上面。

这个赌注能不能赢,还太早说。但两天 95k Star 说明一件事:开发者受够了被锁定。


DeepSeek Harness 官网:deepseek.com/harness GitHub 仓库:github.com/deepseek-ai/deepseek-harness