DeepSeek Harness 开源:告别大模型跑分内卷,AI Agent 正式进入组装时代
本帖最后由 沐光而行 于 2026-8-17 17:08 编辑发布背景:2026 年 8 月 13 日,DeepSeek 同步上线 V4 Pro 正式版,并且开源智能体运行框架 DeepSeek Harness,AI 行业正在迎来一次关键转向:从比拼模型参数,转向比拼真实落地执行能力DeepS...。
很长一段时间,我们评判一款 AI 能力强弱,习惯盯着参数量、评测跑分、上下文窗口、推理分数、API 价格。行业默认逻辑:只要拥有足够聪明的模型大脑,现实业务问题就会迎刃而解。
但当 AI 走出聊天对话框,真正进入代码仓库、终端环境、浏览器与企业工作流之后,行业慢慢意识到一个残酷现实:光有强大的模型大脑,不等于 AI 可以完成复杂现实任务博客园。
举一个软件开发场景的例子:让 AI 修复大型项目中的 Bug。完整链路需要理解需求、检索关联源码、理清依赖关系、修改代码、调用终端执行测试;测试报错之后,读取报错日志、重新定位问题、迭代修改代码,循环往复。
这类长周期任务,会持续几十分钟甚至数小时。过程中 AI 需要自主判断哪些历史信息保留、哪些信息压缩;什么时候调用搜索工具、什么时候申请操作权限;是否拆分子任务交给子 Agent;任务失败之后,是重新规划整体方案,还是在现有路径上继续修正。
决定最终结果的,早已不只是大模型本身的推理能力。模型之外那一套管理工具调用、维护会话状态、管控执行权限、构建反馈循环的系统,才是关键。这套系统,就是 Harness(智能体运行框架)。
OpenAI 在拆解 Codex 架构时,同样将 Harness 作为独立核心层:模型负责生成工具调用指令,Harness 负责执行指令,把执行结果回传给模型,循环往复直至任务完成。当任务链条变长,上下文管理、状态维护本身就成为 Agent 最大的难题之一。
同一个大模型底座,套入两套不同的 Harness 执行框架,最终表现出来的效果,可能像两个完全不一样的 AI。这也是 DeepSeek 此次发布最核心的启示:Agent = 模型(Model)+ Harness,模型决定智能的上限,Harness 决定这份智能到底能兑现多少价值。
DeepSeek Harness:“一切皆插件”,Agent 进入组装时代
很多人会把 DeepSeek Harness 理解成 DeepSeek 版 Codex,但这大大低估了这次开源的价值。它不是全新大模型,也不是简单的 API 客户端,而是一套完整开源的 Coding Agent 运行基础设施,当前处于开发者预览版本,一条命令即可本地部署 WebUI 界面,采用 MIT 开源协议,可供开发者自由二次开发。
它最激进的设计理念就是 Everything is a plugin(一切皆插件),这不是营销口号,是底层架构事实DeepSeek。
传统软件框架,会有一个固定不可修改的核心内核,插件仅用于扩展外围功能。而 DeepSeek Harness 基于 Cordis 微内核,把 Agent 几乎所有模块全部拆解为平等插件:模型适配器、工具注册系统、会话日志 SessionLog、存储模块、子 Agent、上下文压缩策略,就连 Agent 主运行循环本身,也只是一个普通插件,可以被替换重写。
开发者无需修改框架底层源码,就可以自由插拔替换任意组件:可以更换底层大模型、自定义工具集、修改权限策略、改写任务调度逻辑。
就像组装一台设备,你可以在同一套框架内,搭建多个完全不同定位的 Agent:一个专门负责代码开发,一个做调研检索,一个专注内容创作。不需要改动模型,仅仅更换提示词、工具集、权限配置、工作流程,就塑造出完全不同能力的智能体。
同时 Harness 实现完整可追溯的运行链路:所有用户消息、模型推理、工具调用、工具返回结果全部写入追加式事件流日志。完整保存 Agent 全部工作轨迹,支持任务恢复、任务分叉、回放调试。
这点对于代码场景意义重大。写文章的好坏偏向主观,但是代码任务拥有客观反馈:代码能否编译、单元测试是否通过、程序能否正常运行、终端报错信息,都会直接反馈给 Agent,形成「行动‑反馈‑修正‑再行动」的闭环。
Harness 管控这套闭环,训练 Agent 长链路规划、工具调用、失败重试、长上下文管理的综合能力,而不只是训练写代码的能力。
值得一提的是,早在正式开源之前,DeepSeek 内部评测 Code Agent 能力,就已经在使用 Harness 极简模式。这说明 DeepSeek 内部已经把模型能力和 Harness 执行系统,视作共同决定 Agent 表现的整体,而非割裂看待博客园。
不能忽视:预览版下的风险与现实挑战
强大的灵活性背后,也伴随着不可回避的风险。现阶段 DeepSeek Harness 还处在开发者预览阶段,“一切皆插件” 的开放架构,也把安全与长任务稳定性两大难题摆到开发者面前。
[*]安全风险是第一底线Agent 具备调用 Shell 命令、读写本地文件、发起网络请求、调度子 Agent 的能力。一旦出现模型幻觉,就可能出现误删除目录、覆盖配置文件、向生产环境发送请求等不可逆事故。
虽然 SessionLog 日志可以完成事后审计,但预览版本尚未提供开箱即用的细粒度沙箱、运行时阻断、人工审批干预机制。如果投入真实项目使用,开发者必须自行搭建安全防护层,权限隔离是绕不开的硬工作,这也是开源社区很容易忽略的部分。
[*]长任务场景充满暗礁当 Agent 持续运行一小时,循环上百次,会不断遭遇模型幻觉、工具超时、状态漂移、API 限流等各类异常。虽然框架支持任务事件流恢复,但失败之后是整体回滚、还是局部重试;当模型产生矛盾的任务计划,框架能否自动识别触发重规划;几十万 token 堆叠之后,上下文压缩策略是否会丢失关键信息,这些问题在预览版文档中还没有完备的生产级解决方案。框架提供了可替换上下文插件,但默认策略还需要大量真实业务场景检验。
所以,我们不能因为插件生态的亮眼设计盲目乐观,也不能因为现存缺陷否定它的方向。单次演示可以证明执行框架会显著改变 Agent 效果,但还不能证明这套框架可以适配全部业务场景。它的未来,取决于稳定性、安全边界、插件生态、长任务可靠性,需要开源社区和官方持续迭代完善。
AI 行业的转向:从比拼跑分,到争夺真实世界执行权
过去 AI 行业竞赛,比拼的是谁训练出更强的模型大脑。而从这次 DeepSeek V4 Pro+Harness 联合发布可以看到行业重大转向:未来竞争的核心,是谁能让大模型可靠地在真实世界持续工作。
让 AI 连续工作数小时,调用几十种工具,遇到错误可以自我修复,最终交付现实结果。基础大模型正在从完整的终端产品,回归为基础零件。不同底座模型,接入不同工具、工作流、执行环境之后,用户最终体验,更多来自整套系统,而不是模型本身的名字。
DeepSeek 开源 Harness,本质上是把 Agent 的组装权交到每一位开发者手上,同时也将安全、稳定的责任交给实践检验。未来或许我们不再会问 “你用的是哪一个大模型?”,而是会问 “你的 Agent 是如何组装搭建的?”。
这场 AI 战争,已经从论文榜单上参数跑分的比拼,切换到真实世界执行能力的较量。聪明只是基础,边界管控、容错能力、持续稳定运行,才是 Harness 接下来要交出答卷的考场。
页:
[1]