Skip to content
Zegging's Tech Blog
Go back

特修斯之船:DeepSeek Harness 与模型的协同进化

特修斯之船是一个被讨论过无数次的哲学问题:一艘船在航行过程中,船板、桅杆、船帆被逐块替换,直到最初的部件一个也没有留下,它还是原来的那艘船吗?

我并不想继续讨论它的哲学答案,这个故事中吸引我的是自身不断变化但是仍然抵达终点的这艘船:如果船可以在航行中更换自己的每一个部件,它是不是能比一艘结构固定的船更快地适应风浪,抵达原本无法抵达的地方?

这个 blog 是我对 DeepSeek Harness 的一个猜想,这个猜想未必正确,DeepSeek 也从未明确宣布过这样一份 AGI 路线图。但在一切尚未收敛的时候,我想先把判断写下来。未来回头看,至少可以知道自己在这个时间点究竟看到了什么,又看错了什么。

模型已经足够聪明,为什么 Agent 仍然显得笨拙?

在此前流出的投资者交流会转写稿中,梁文锋把智能的发展描述为一条阶梯:语言模型、思维链、Agent、持续学习、自我迭代,最终才是具身智能。他把语言模型视为智能的主线,而搜索、多模态等更多是主线之外的组件。在会议上梁文峰多次强调 DeepSeek 在路线上是非常克制的,他们没有因为某个方向热闹就把所有事情都做一遍。也正因为如此,DeepSeek 官方开源 DeepSeek Harness,并把它建立在“一切都是插件”的架构上,是一个强烈的信号。

今天很多 Agent 完不成任务,未必是因为模型缺乏理解和推理能力。模型可能已经知道应该做什么,却没有合适的手脚:

  • 没有能访问目标系统的工具;
  • 没有适合当前任务的 memory;
  • 工具返回的信息太多、太少,或者格式根本不适合模型理解;
  • 固定的 agent loop 不适合这个任务;
  • 上下文管理、权限和运行环境阻止了它采用更直接的做法。

一个固定身体里的模型只能反复调整自己的表达。它写更长的计划,进行更多轮对话,绕过工具限制,用十几次调用补偿一次本可直接完成的操作。这些现象在很多情况下被错误归因于模型不够聪明。但这里可能同时存在两个不同的问题:模型不知道怎么做;模型知道怎么做、却没有合适的身体去做。 人类不会飞,也不能在水下长时间呼吸,但人类制造了飞机和潜水艇。我们没有通过进化出翅膀来解决飞行问题,而是用智力改变外部结构,扩展自己的能力。对模型来说,这个边界更加模糊。模型的工具、memory、system prompt、agent loop 和运行时环境本来就是软件。它制造出来的“飞机”不必永远作为外部工具存在,而可以直接加载进自己的运行时,成为新的感官、手脚乃至行为方式。

传统 Agent 的更新是一种逻辑上的停机更新

今天要为一个 Coding Agent 增加 memory,我们通常需要先由人类完成设计和开发,再按照既有框架提供的扩展方式写一个 plugin 或 extension,配置、部署,然后让 Agent 在新的结构中重新运行。

进程不一定真的停止,但 Agent 的自我适应在逻辑上中断了。模型发现缺少能力,人类离开任务现场去修改承载模型的软件,再把一个更新后的系统交还给模型。模型的智力和它对自身结构的改造之间,始终隔着一个人类开发者。Pi 这些架构的热加载更趋向于一种自进化的方向,但第一等级的用户还是人类开发者(不然的话 /reload 就会当作一个 Tool 暴露给 LLM 了)。DeepSeek Harness 的思路是更加激进的——如果把 framework 做的更好扩展,做 Agent 的 Emacs 和 VSCode——如果是服务于 DeepSeek 本身的 AGI 路线的话就不能按照一个人类完成任务使用的工具来看待了。插件很多、扩展点很多,并不是最重要的事情。关键在于 DeepSeek Harness 试图消除不可替换的特权核心:模型适配器、工具注册表、会话日志,甚至 agent loop 本身都是插件,都可以替换。

它底层的 Cordis 进一步处理了两类问题:

  • 空间可组合性:组件能够声明依赖,并在其它组件变化时重新完成组合;
  • 时间可组合性:组件卸载时,它产生的 effect 能够被完整撤销。

一个组件不是简单地被塞进系统。它可以在运行时挂载,在不合适时卸载,并尽量把系统恢复到安装之前的状态。配置协调、热模块替换、可逆 effect 和追加式会话日志组合在一起,构成了一艘可以在航行中更换船板,同时尽可能保持航程连续的船。

DeepSeek Harness 的本质并不只是“一个灵活、易扩展的 Agent 框架”。更重要的是,它为 Agent 提供了一种运行时自我改造的可能。

当模型发现自己的工具不适合环境时,未来它不必继续扭曲自己的行为去迁就工具。它可以诊断缺少的能力,编写一个新组件,在隔离环境中测试,动态加载并继续任务;如果修改产生了回归,再卸载、回滚,换一种方案。

在这个比喻里,模型是船长,Harness 是船体。会话日志保存已经发生的航程,Cordis 让甲板、船帆、桅杆乃至舵本身可以被替换。模型不再只是驾驶一艘别人造好的船,而开始参与建造自己的下一副身体。

当然,DeepSeek Harness 目前证明的是“船板可以换”,并不等于它已经把锤子交给了船长。完整的自我改造仍然需要自我诊断、组件生成、沙箱验证、权限控制、回归测试和失败回滚。但如果未来的目标是让 Agent 在运行中进化,那么先让每一块都能够安全地替换,是一个非常自然的起点。

从特修斯之船到模型与 Harness 的协同进化

只讨论运行时自我改造,可能仍然低估了这条路线。梁文锋在交流会中把 Agent 之后的关键阶段指向持续学习和自我迭代。如果把这件事与可自我改造的 Harness 放在一起,一个更完整的闭环会出现:

模型执行真实任务

任务暴露工具、记忆、控制循环或环境接口的缺陷

模型诊断失败,提出并验证 Harness 修改

新的 Harness 让模型进入过去无法进入的环境,完成更长、更复杂的任务

真实运行轨迹成为新的经验与训练信号

模型更新,并获得设计下一代 Harness 的能力

这不是模型进化和 Harness 进化两条平行的线,而是协同进化

Harness 是更快的适应层。模型权重不变时,系统仍然可以通过更换工具、提示结构、memory 和控制流快速适应一个陌生环境。最近的 Self-Harness 已经展示了这种可能:冻结模型,让 Agent 从失败轨迹中发现自身弱点、提出 Harness 修改并用回归测试筛选,依然可以提高未见任务上的表现。

模型训练则是更慢的内化层。运行时发现的有效结构、失败模式和成功轨迹,可以进一步变成训练数据或强化学习信号。原本需要复杂外部脚手架才能完成的能力,有机会被下一代模型吸收。更新后的模型又能识别更深的问题,制造更好的工具和 Harness。HarnessX 已经把两者放进同一条路径:执行轨迹既用于演化运行时接口,也用于形成模型训练信号。这并不能证明 DeepSeek 内部采用了相同方案,但至少说明“模型—Harness 协同进化”不是只有隐喻,它已经开始成为可以实现和验证的工程方向。

从这个视角来看 AGI 也许不是某个训练完成、等待发布的最终模型。它更可能是一个持续运行的系统:模型、Harness、环境和经验彼此反馈,不断改变自己。智能不只存在于参数里,也存在于系统改变自身结构的能力里。新的问题是:

如果一艘船能够根据风浪自己设计木板、试装、回滚,并把造船经验交给下一代船长,它最终能够驶向哪里?

如何抽自己大耳刮子?

判断,就应该留下能够证实或证伪它的信号,而不是等未来发生以后自圆其说。

1. 控制权是否真正交给模型

最重要的信号不是插件数量,而是模型能否自主安装、卸载和替换插件,甚至替换 agent loop。只要所有结构变化仍然由人类配置,“一切都是插件”就仍然主要是一种开发者架构。

2. 是否出现完整的自我改造闭环

不只是“模型会写插件”,而是执行失败、自动诊断、生成修改、沙箱测试、回归验证、热加载和失败回滚组成的完整链路。生成代码很容易,可靠地判断一次自我修改是否真的更好,才是这个协同演化的核心难题。

3. 结构变更是否保持任务稳定

支持热更新,只说明组件可以被卸载和重新挂载,并不等于同一个 Agent 在变更前后仍然保持连续。正在执行的任务能否在安全边界停止,并由新的结构继续完成,可能是工程上需要做出的约束。

4. Harness 演化是否与模型训练耦合

同一批真实任务轨迹,是否一边用于筛选 Harness 修改,一边进入模型的持续训练?DeepSeek 未来的论文、代码、数据管线和招聘信息中,如果开始出现这种连接,将会是“协同进化”最强的证据之一。

5. 评价标准是否从模型分数转向适应能力

如果目标改变,度量也会改变。除了单次 benchmark 分数,我会关注它们是否开始衡量长期任务完成率、进入陌生环境后的适应速度、自主恢复能力、跨环境迁移,以及完成一次可靠自我改造的成本。

6. 组织边界是否开始合流

Harness、后训练、强化学习和持续学习如果始终是互不相干的团队,这条闭环就很难成为真实路线。反过来,论文作者、代码仓库和招聘岗位开始交叉,会比宣传稿更能说明内部正在做什么。

最强的验证事件会是:一个权重冻结的模型进入陌生环境,自己发现能力缺口,编写并热加载新组件,完成原本无法完成的任务,再把这段经历用于下一轮模型更新,过程中几乎不需要人类传接力棒。 相反,如果 DeepSeek Harness 长期只是由开发者手工配置插件,主要服务于一个 Coding Agent 产品,并且始终没有与持续训练系统连接,那么我今天这个猜想的强版本就是错的。它仍然可能是一个优秀的框架,但不是我所想象的 DeepSeek AGI 进化底座。简而言之就是:他妈的想多了!

写在最后

DeepSeek 是否真的这样思考,我不知道。我按照最近看到的信息,直觉上的判断是:下一阶段的 Agent 进步,不会只来自更大的模型,也不会只来自人类为模型编写更精巧的 Harness,而会来自模型与 Harness 的协同进化。 如果这个判断成立,那么 DeepSeek Harness 最重要的地方,不是它今天提供了多少工具、支持多少模型,也不是“一切都是插件”这句口号本身。真正重要的是:可以在航行中安全地更换每一块木板的船先得造出来。

至于是不是一定要写一篇论文开源一个新的框架才能达成目的,那就是 DeepSeek 自己内部的判断了……我哪里看得明白。

参考


Share this post on:

Previous Post
Agent Memory 到底在解决什么问题?
Next Post
阅读 DeepSeek Harness(一):vendored Cordis 的复杂性从哪里来