DeepSeek的Harness,为何是一头黑色鲸鱼?

2026-08-14 02:26:40 · chineseheadlinenews.com · 来源: 腾讯科技



DeepSeek的Harness,为何是一头黑色鲸鱼?

图片由AI生成



北京时间8月13日晚,DeepSeek面向全球开发者开放DeepSeekHarness开发者预览版,并以MIT协议开放源代码。

与外界更熟悉的模型权重发布不同,这次DeepSeek开源的是模型外部的一整套Agent运行基础设施。模型、工具、技能、会话、沙箱、存储、Agent循环、任务调度和用户界面,都可以作为插件加载、卸载和替换。

DeepSeek为这套架构概括出一句很容易传播的话:一切皆插件。

值得注意的是,DeepSeek还为Harness单独开设了微信公众号“DeepSeek Harness团队”。这个账号使用黑色鲸鱼作为标识,与DeepSeek模型产品沿用的蓝色鲸鱼形成明显区隔。

独立品牌区隔的背后,DeepSeek也许希望为Harness建立独立的开发者沟通渠道,并围绕它持续经营生态。一个模型能否在真实环境中连续完成任务,越来越取决于模型之外的系统:它看到了哪些上下文,能调用什么工具,如何处理失败,是否可以恢复任务,谁来批准高风险操作,以及长时间运行后如何避免偏离目标。Harness正是负责连接模型与这些能力的运行层。

DeepSeek Harness让开发者可以像搭积木一样重新组合Agent,它也把DeepSeek的开源边界从模型延伸到了Agent工程体系。



01

模型能力之外,为什么还需要Harness

大模型本身只负责生成下一步内容。一个能读写文件、运行命令、调用外部服务、派出子Agent并根据执行结果继续工作的Agent,还需要一套持续运转的控制系统。

Anthropic曾把Agent的基础单元概括为经过检索、工具和记忆增强的大模型。进入长程任务之后,Harness还要负责上下文管理、权限控制、状态保存、错误恢复和循环停止条件。Anthropic在2026年4月讨论托管Agent时进一步指出,Harness包含了开发者对“模型自身做不到什么”的判断,而这些判断会随着模型能力提升而过时。

由此点出了Harness设计的一个长期矛盾:框架需要提供足够多的控制,同时不能用过度固定的流程限制模型。

这也解释了DeepSeek为何强调可替换性。同一个模型放进不同Harness,最终表现可能出现明显差异。系统提示词如何组织,工具定义是否清晰,上下文何时压缩,失败后能否重试,都会影响任务成功率、Token消耗和运行时间。

模型评测逐渐从单次问答转向真实工程任务之后,Harness本身已经成为评测变量。

目前,这一层已经聚集了多条技术路线。OpenAI Agents SDK提供工具、Agent交接、护栏、会话和追踪;Claude Agent SDK开放了Claude Code使用的工具、Agent循环和上下文管理;LangGraph则侧重持久化执行、人类介入和状态恢复。DeepSeek Harness进入的是一个已有成熟参与者的市场,差异化方向是把这些能力进一步拆成可由配置组合的插件。

02

“一切皆插件”?

DeepSeek Harness建立在Cordis插件系统之上。根据官方文档,模型适配器、工具注册表、会话日志乃至Agent循环本身都属于插件,开发者无需修改Harness主体代码,就能通过插件替换或扩展具体能力。

Cordis将这种能力称为“时空可组合性”。这里的“时间”指插件卸载后,其注册过的服务、事件和副作用能够随之撤销;“空间”指插件可以声明依赖,并在其他组件发生变化时重新建立协作关系。

8月13日公开的Cordis论文仍被标注为持续修订中的预印本,其实现包括副作用追踪、依赖解析、配置协调和热更新。显然,这套设计瞄准的场景已经从传统插件系统延伸到“自我演进的Agent Harness”。



对于开发者,这种拆分带来三类直接价值。

第一,模型与运行环境可以分离。开发者可以保留同一套会话、工具和权限体系,只替换模型适配器;也可以固定模型,比较不同上下文管理或Agent循环的效果。对于模型评测,这有助于分辨能力提升究竟来自模型,还是来自外部工程优化。

第二,企业可以保留自己的基础设施。沙箱、存储、审批、凭证和遥测都能作为插件存在,理论上可以接入内部权限系统与审计要求,减少被单一Agent产品绑定的程度。

第三,Agent能力可以形成独立生态。开发者无需维护DeepSeek Harness的分叉版本,只需发布插件。官方已经建议插件仓库添加dsh-plugin标签,这一安排有助于逐步形成可检索、可复用的插件生态。

这套设计也把风险同步交给了插件系统。一个工具插件可以接触文件和外部服务,一个存储插件掌握完整会话,一个循环插件则可能改变Agent的决策路径。插件来源验证、权限边界、依赖冲突、版本兼容和供应链安全,都会成为生态能否进入生产环境的前提。开放程度越高,治理成本也越高。

03

四种模式,实际上是四种Agent实验方法

官方资料将DeepSeek Harness的预设运行方式分为标准、PTC、极简和创造四种模式。它们加载不同的插件组合,也对应不同的开发目的。



标准模式提供相对完整的工具集合,面向日常Agent任务。极简模式只保留Shell和文件编辑工具,主要用于基准测试。它尽量减少外围工具差异,使评测更接近对模型自主规划、代码修改和终端操作能力的直接观察。官方仓库的基准说明目前只给出了如何运行jsonrpc-agent极简变体,尚未公布DeepSeek Harness与其他Harness的对比成绩。

PTC模式采用程序化工具调用(Programmatic Tool Calling)。模型先生成一段代码,再由代码组织多轮工具调用。对于需要连续查询、批量处理或根据中间结果分支的任务,这种方式可以减少模型与工具之间反复往返,也可能降低上下文中堆积的中间信息。不过,模型生成的代码获得了更强的调度能力,对沙箱隔离、超时、资源配额和权限控制也提出了更高要求。PTC的价值最终需要用任务成功率、成本和安全事件来检验。

创造模式最有实验性。Agent可以检查当前运行时,在内存中试验Cordis插件,再组合出新的运行模式。

官方开发文档已经提供一个“自指式”Cordis演示,允许Agent检查和修改正在运行的插件环境。这为Harness自我调整留下了接口,但它距离稳定的“自我进化”仍有很长的工程路径。

04

把每一次运行变成可回放的事件流

DeepSeek Harness另一项重要设计,是仅追加的会话日志。

一个Session由按顺序追加的事件构成,是Agent全部交互历史的唯一事实来源。模型消息历史由这份日志推导生成,不再单独保存;恢复和回放也从同一组事件重新构建。

官方文档称,系统提示词、思维链、工具调用及其结果、子Agent调度和上下文注入都会被记录,并可以在Trajectory视图中按来源查看;其中能够显示多完整的推理内容,仍取决于具体模型接口实际返回的数据。这样做的价值很直接:当Agent在第几十步做错决定,开发者可以回到当时模型真正看到的上下文,确认问题来自模型判断、工具返回、提示词变化还是错误的上下文注入。OpenAI Agents SDK和LangGraph同样把追踪、持久化与恢复视为Agent运行时的重要能力,说明可观测性已经从调试工具变成Agent基础设施的标准组成。

仅追加日志也会带来新的数据治理问题。完整事件流可能包含代码、凭证线索、内部文件内容和工具返回结果。可回放提高了可审计性,也扩大了需要保护的数据面。

05

它与MCP处在不同层级

“一切皆插件”很容易让人联想到MCP。两者解决的问题并不相同。

MCP是连接AI应用与外部数据、工具和工作流的开放标准,重点是统一连接方式。Harness负责更上层的运行逻辑:什么时候把工具交给模型,调用前是否需要审批,结果如何写入会话,失败后是否重试,Agent何时派出子任务,又在什么条件下停止。

因此,MCP服务器可以成为DeepSeek Harness中的工具来源,Skills可以成为能力包,Cordis插件负责把模型、工具、状态、循环、界面和政策组合成一个可运行的Agent。也就是Agent“如何运行”的控制层。

这个位置具有潜在生态价值。谁掌握Harness,谁就更接近真实任务入口,也更容易影响模型选择、工具分发、运行成本和开发者工作流。不过,MIT许可证只能降低采用门槛,无法自动形成生态。开发者是否愿意持续维护插件,企业是否敢把生产权限交给第三方组件,以及插件能否跨版本稳定运行,才会决定这套架构能走多远。

06 v0.1仍是一张设计蓝图

DeepSeek对版本状态给出了相当明确的提示:当前处于开发者预览阶段,后续将出现破坏兼容性的变更。截至发稿,仓库根目录package.json标注的版本为0.1.0-rc.5,GitHub Releases页面仍为空。更准确地说,它目前处在v0.1系列的候选和快速迭代阶段。

开发者安装Node.js后,可以通过npx @deepseek-ai/dsh web启动Web界面,默认地址为http://127.0.0.1:3080;也可以从Deepseek官方仓库克隆源码安装。官方开发文档目前要求Node.js 22.19及以上的22.x版本,或24及以上版本。

从安装流程看,DeepSeek Harness的部署门槛并不高,也可以借助WorkBuddy这类能够操作终端和文件的Agent,辅助完成Node.js环境检查、安装与启动。

需要注意的是,Harness本身按MIT协议免费开源,但官方默认使用方式仍需配置DeepSeek API Key;用户可以免费打开Web UI,真正运行Agent还是会产生模型调用成本。

DeepSeek Harness将开源竞争推进到了模型之外。开放权重解决了“谁能运行模型”的问题,开放Harness进一步触及“谁能决定模型如何工作”。

当Agent开始执行持续数小时甚至数天的任务,模型只是系统中的一个组件,运行层会越来越多地决定能力上限和使用边界。

“一切皆插件”给了开发者更大的改造空间,也让DeepSeek承担了更难的生态任务。


    24小时新闻排行榜更多>>
  1. 朱镕基离世 许多谜底有了答案
  2. 纽约布碌崙华人社区6203号地下室突遭搜查
  3. 困扰数学圈22年的难题,被协和实习医生解决了?
  4. 被制裁几十年,伊朗咋还越来越强硬?
  5. 郭德纲暴雷仅1天,陈年旧事被扒干净
  6. 川习会成果卡关 美中投资委员会5月成立后未曾磋商
  7. 习近平做一事惹怒41国 现代8国联军要中方给交代
  8. 朱镕基去世时间有疑?五前常委去世 今年十将领身亡
  9. 《十万个为什么》为何被打成大毒草?
  10. 知情人爆朱镕基被蔡奇人马贴身监视 旧部落马、病亡
  11. 薄毕瓜发文悼念朱镕基 引发海外华人热议
  12. 三星堆最诡异的谜团是什么?
  13. 男子将收款码贴功德箱上,3天收款900多元
  14. 闪迪豪言:2028-30营收中高双位数增长
  15. 美国7月PPI同比涨幅收窄至4.7%
  16. 川普政府开发AI工具 打击“协助中国”的贸易伙伴
  17. 纽约要开“供销社”?美式“社会主义”能玩多久?
  18. 市场不再完全押注美联储年内加息
  19. 升糖最快的主食被揪出,是米饭的4倍
  20. 中国多行业限制出境延至体制外 海关严查很多人被劝返
  21. 39岁的他猝死公司马桶上 官方:没在座位不算工伤
  22. WSJ:人去了哪里?三星堆最诡异的谜团是什么?
  23. 朱同志如何面对人生低谷?那20年他很少对外讲起…
  24. 2028年民主党总统候选人仍不明确
  25. 大众电影百花奖投票结果公布,王宝强获得0票
  26. 马斯克打开了魔盒?美国CEO开始纷纷拿天价薪酬
  27. 白宫新报告《大转运骗局》 控40多国帮中国逃关税
  28. 扎克伯格:与中国相比,美国有个明显劣势
  29. WorkBuddy上线远程控制
  30. 《我的前半生》“诈尸”翻红了
  31. 巴拿马运河大堵船 平均等10天 有货轮花400万“插队”
  32. 中国年轻人海外求学为何降温?
  33. “最会拍姐弟恋”的传奇导演,突然去世
  34. 这次百花奖,扯下内娱遮羞布
  35. 30年期美债标售得标利率创新高
  36. 7年亏掉2亿,邹市明45岁“听老婆的话”重返拳击场
  37. 以国防部长誓言:继续驻留黎巴嫩
  38. 福建一船厂起火救援时发生爆炸 致12伤含10名消防员
  39. 谷歌推出Gemini 3.7 Flash模型
  40. 太子集团又一“幕后大佬”找到了?美检方披露身份
  41. 卢比奥上节目 爆战争部长家的猫和肯尼迪“酸菜”趣事
  42. 董卿被造黄谣,评论区不堪入目
  43. 中国靠40国“洗产地”躲关税!白宫公布名单
  44. 暑假去了一趟天安门广场 游客:到最后快崩溃了
  45. DeepSeek Harness开发者预览版:一切皆插件
  46. 朱镕基国企改革 工人失业血泪 东北、南方老哥争不休?
  47. 中国催婚新招:银行也能办结婚证
  48. 500美元起家致富!币圈大亨坠楼前诡异 爆粗对话曝
  49. 一只“白海豚”,凭什么浇透小半个中国?
  50. 郭德纲被立案后,我有一个问题不敢大声问…
  51. 战争进入第7个月 伊朗究竟还能撑多久?
  52. 75岁郭台铭被爆出轨,妻子发文
  53. 阎王爷喂饭:4月4日生,高考444分,考进殡葬系
  54. 川普关税战重大胜利 取消小额包裹免税裁定合法
  55. 王思聪5年前组装"神级电脑" 竟成理财产品?打破贬值定律
  56. 智谱发布GLM-5.3模型,性能比肩Fable 5
  57. 郭麒麟登顶热搜第一,瘦到认不出
  58. 江泽民官方纪录片触及六四 形容1989年“临危受命”
  59. 英伟达正在效仿AIG?
  60. 人生九件大事 你完成了几件?