DeepSeek Harness 开源:模型之外的战争刚刚开始-龍德明宇

📅 2026/8/15 10:39:22
DeepSeek Harness 开源:模型之外的战争刚刚开始-龍德明宇
DeepSeek Harness 开源模型之外的战争刚刚开始作者龍德明宇8月13日这一天DeepSeek 放出了两个动作。凌晨V4 Pro 正式版上线架构和预览版完全一致Agent 能力却暴涨晚上DeepSeek HarnessDSH开发者预览版开源MIT 协议GitHub 同步开放。后者是更值得注意的信号。这不是新模型也不是 API 客户端而是一整套把模型接进文件系统、终端、网页和工具并组织上下文、工具调用与任务执行的 Agent 运行框架。DeepSeek 第一次把手伸到了模型输出之后的执行层。一切皆插件它不是又一个 Claude CodeDSH 最核心的设计是「一切皆插件」。模型、工具、会话、沙箱、存储、循环、调度、UI所有能力都由插件组合而成可自由替换、灵活重组底层基于 Cordis 这套可组合框架设计思想源自一篇关于时空可组合性的编程范式论文。它提供标准、PTC、极简、创造等多种 Agent 预设。同一个进程里可以同时运行写作 Agent、编码 Agent、研究 Agent各自看到不同的工具和指令不必启动多套服务。所以它不像 Codex 那样交付一个「拿来即用的 Agent」更像一套「组装 Agent 的运行时」。据参与内测的媒体介绍内测用户短短几天就自发开发了约三百个插件连跨会话长期记忆、界面改版都是纯插件实现。最值得注意的线索官方跑分用的是它自己V4 Flash 正式版的更新日志里藏着一行容易被忽略的字公开基准测试中的 Code Agent 任务使用「DeepSeek Harness 极简模式即将发布」作为框架进行测试。换句话说DeepSeek 对自家模型 Agent 能力的评测本身就带着自己的 Harness。官方公式「Model Harness Agent」在这里是字面意义的模型之外的所有工程化工作都属于 Harness 的范畴。这解释了一个反常识的现象同一个模型放进不同 Harness效果可以差出数倍。第三方测试中同一个 V4 Flash 接入八种 Harness 完成三十项任务最多完成二十项、最少十四项单任务成本差最高达七倍。模型划定能力上限harness 决定这份能力最终兑现多少。模型是空无Harness 提供结构这恰好印证了我一直写的一个判断模型本身是「空无」它只提供统计预测的潜能是 harness 这种外在结构把潜能组织成真实的执行能力。V4 Pro 正式版与预览版架构完全一致能力却大幅跃升靠的正是后训练与这套「脚手架」。DeepSeek 从产业层面验证了这个理论。当多个 Agent 被放进同一个系统单个 Agent 的能力边界由「Model Harness」定义下一个问题自然浮现当多个 Agent 被放进同一个系统它们之间的「关系」该如何设计我在此前的文章中论证过多 LLM 之间的交互不构成真正意义上的「关系」而是以 Harness 为中介的「结构性耦合」关系不是「涌现」的而是「被设计」的。这指向一个工程方向关系工程。DeepSeek 开源 Harness等于把「如何定义单个 Agent」的主动权交还给开发者。而当越来越多的 Agent 被组装进同一个系统「如何定义 Agent 之间的关系」就会成为下一个战场。这个问题的答案可能比谁的开源协议更宽松更重要。延伸阅读多LLM交互与关系性消解