人工智能

DeepSeek Harness v0.1.0-rc.8 更新:多模态能力再升级,Claude Code 与 Codex 子代理正式加入

作者: 来源: 文章标签:

上线12小时5万星,DeepSeek Harness实测:能干活,但得盯着

DeepSeek Harness 又迎来一次重要版本更新。

近日,DeepSeek Harness 发布 v0.1.0-rc.8。从此次更新内容来看,新版本并非简单的功能堆叠,而是围绕多模态交互、子代理、Codex 能力、Windows 开发环境以及底层性能进行了较大范围的完善。

尤其值得关注的是,DeepSeek Harness 开始进一步补齐 AI Coding Agent 的核心能力:模型可以直接处理图片,Claude Code 与 Codex 可以作为子代理按需安装,Codex 支持非交互权限模式和多个命名实例,同时 Windows 端的终端体验也得到明显增强。

这意味着 DeepSeek Harness 正在从一个围绕 DeepSeek 模型打造的智能体工具,逐渐向更加完整的 AI Coding Agent 平台演进。

多模态能力进一步增强,图片正式进入 Agent 工作流

此次更新最明显的变化之一,是多模态支持进一步增强。

在 v0.1.0-rc.8 中,DeepSeek 模型适配器新增了原生图片请求配置能力。用户可以根据实际需求启用原生图片请求,让模型直接参与图像理解相关任务。

与此同时,/goal/plan 等命令现在也可以接收图文输入。

这一变化的意义并不只是“可以上传图片”。

对于 Coding Agent 来说,图片实际上是非常重要的输入形式。开发者可能需要让 AI 分析网页截图、UI 设计稿、报错截图、流程图、产品原型,甚至是终端运行结果。如果 Agent 只能理解文本,那么用户往往需要先把图片中的信息转换成文字,再交给模型处理,整个交互过程会被人为割裂。

如今图片可以直接进入 /goal/plan 等工作流,相当于进一步降低了用户与 Agent 之间的信息转换成本。

与此同时,更新还专门修复了图片尺寸过大、历史图片不断累积导致模型请求失败的问题。对于长时间运行的 Agent 会话来说,这一点尤其重要。

因为多模态最大的一个潜在问题就是上下文膨胀。一张图片可能远比一段文本占用更多的上下文空间,如果历史图片不断累积,很容易导致请求体过大甚至超过模型或者网关限制。

此次更新针对这一问题进行修复,也说明 DeepSeek Harness 已经开始考虑多模态 Agent 在长上下文场景中的实际稳定性,而不仅仅是增加一个“上传图片”的入口。

@ 菜单进一步打通文件与会话

在交互体验方面,v0.1.0-rc.8 还增加了通过 @ 菜单引用文件和会话的能力。

这看似是一个比较小的交互调整,实际上对于 AI Coding 工具非常关键。

传统聊天式 AI 更多是“问一个问题,给一段回答”,而 Coding Agent 的工作对象通常是一整个代码仓库。用户需要不断在代码文件、历史会话、任务上下文之间切换。

通过 @ 菜单直接引用文件和会话,可以让上下文组织变得更加自然。

尤其是在复杂项目中,用户可以更明确地告诉 Agent:“参考这个文件”“结合之前那个会话”“围绕这个模块继续处理”,而不需要反复复制内容或者重新描述背景。

这也是 AI Coding 产品从聊天工具向“开发工作台”演进过程中,一个非常典型的变化。

Claude Code、Codex 进入子代理体系

此次更新另一个值得关注的变化,是 Claude Code 与 Codex 子代理均可以作为 Profile Bundle 按需安装

换句话说,DeepSeek Harness 正在进一步开放自己的 Agent 架构。

过去,一个 AI Coding 工具往往绑定某一个模型或者某一套 Agent 能力。用户打开工具之后,背后是什么模型、什么执行框架,基本是固定的。

而 Profile Bundle 的思路更加接近“能力插件”。

用户可以根据自己的需求安装不同的 Agent 配置,让 Claude Code、Codex 等能力以子代理形式参与任务执行。

这种架构对于复杂任务尤其有价值。

例如,一个主 Agent 可以负责理解需求、拆解任务,再把代码编写、测试、代码审查等具体工作交给不同的子代理执行。不同模型和 Agent 可以各自承担擅长的任务,最终由父任务进行整合。

这也是当前 AI Coding 领域越来越明显的发展趋势:未来真正有竞争力的 Coding Agent,不一定是一个模型包打天下,而可能是一个能够调度多个模型、多个 Agent 的工作系统。

Codex 能力继续扩展,多实例与非交互模式加入

此次更新中,Codex 本身也获得了多项增强。

首先,Codex 支持非交互权限模式

对于自动化任务而言,这个功能非常重要。

交互式权限确认适合人工操作,但如果 Agent 被用于自动执行测试、批量修改文件或者工作流自动化,频繁等待用户确认会严重影响执行效率。

非交互权限模式可以让 Codex 更好地参与自动化流程。

与此同时,Codex 还支持多个命名实例

这意味着开发者可以同时运行多个具有不同身份或任务上下文的 Codex 实例,从而进一步适应复杂的并行 Agent 工作流。

如果结合此次新增的子代理体系来看,这几个功能并不是孤立存在的。

DeepSeek Harness 正在逐渐形成一个更完整的执行链路:主任务负责规划,子代理负责执行,不同 Agent 可以按需调用,多个实例则负责并行处理。

这种架构已经明显区别于传统意义上的 AI 聊天客户端。

Windows 终端体验得到针对性强化

Windows 用户此次也迎来了一项比较实用的更新。

v0.1.0-rc.8 增加了 PTY 终端对持久 PowerShell 会话的支持

对于 AI Coding Agent 来说,终端并不是一个简单的命令执行窗口。

一个真实的开发任务往往需要连续执行多条命令,而且命令之间存在状态依赖。例如进入某个虚拟环境、切换目录、设置环境变量、启动开发服务等,都需要保持终端上下文。

持久 PowerShell 会话能够让 Agent 更稳定地维持这种执行状态。

与此同时,极简模式预设也默认支持相关能力。对于希望快速启动一个轻量级 AI Coding 环境的用户来说,上手门槛进一步降低。

一批稳定性问题得到集中修复

除了新功能,此次版本还针对此前使用过程中比较容易遇到的问题进行了修复。

例如,取消流式生成之后,已经展示的回复前缀此前可能无法正确带入后续提问或者分叉会话。新版本修复了这一问题。

对于 AI Agent 来说,这种问题虽然不如“新增一个大功能”显眼,却直接影响实际使用体验。

因为用户在长对话中经常需要中断当前任务,然后基于已经生成的内容继续追问或者创建分支。如果上下文无法正确继承,就会造成任务状态丢失。

此外,新版本还修复了部分自定义 OpenAI 兼容网关因为请求格式差异无法调用的问题,同时解决了部分情况下推理内容回传缺失的问题。

这说明 DeepSeek Harness 正在努力扩大对第三方模型和网关环境的兼容范围。

对于一个 AI Coding Agent 而言,这一点非常重要。

真正的开发者用户往往不会只使用一种模型,也可能通过自建网关、第三方 API 或不同的模型服务商进行组合。如果工具只能适配少数固定接口,其实际使用范围就会受到很大限制。

底层存储重构,SQLite 性能进一步优化

此次更新还涉及比较底层的一项变化:SQLite 后端的读写与分叉性能得到改善,同时降低了存储体积。

对于 AI Coding Agent 来说,会话数据并不是简单的聊天记录。

随着用户不断运行任务、创建分支、保存上下文,大量历史会话会逐渐积累。如果数据库读写效率不足,长时间使用后就可能出现明显的性能下降。

此次优化针对 SQLite 的读写和分叉性能进行改善,同时降低存储体积,有利于长期运行。

需要注意的是,这次 SQLite 数据结构发生了不兼容变化。

也就是说,v0.1.0-rc.8 并不是一个完全意义上的无感升级版本,涉及历史数据时需要关注版本兼容问题。

从“能用”向“好用”补齐细节

除了核心能力,v0.1.0-rc.8 还对大量细节进行了调整。

例如,HOME 目录现在统一使用 ~ 进行缩写,输入框针对窄屏布局进行了优化,反馈界面也进行了调整。

侧栏搜索焦点响应、工作流面板、模型选择器、本地文件打开失败后的重试机制等,也进行了针对性优化。

工具调用方面,web_search 支持并发查询,子代理的 reportDelivery 可以更及时地反馈结果并唤醒父任务。

安装与启动流程也得到改善,包括进一步缩减依赖下载体积,以及本地运行 dsh web 时自动打开浏览器。

这些变化单独看都不算“杀手级功能”,但大量细节叠加之后,会直接影响一个 AI Coding Agent 的完成度。

尤其是对于这类开发者工具而言,真正决定用户是否长期使用的,往往不是发布会上的几个功能,而是启动速度、上下文是否稳定、终端是否可靠、文件操作是否顺手、任务分叉是否流畅,以及长时间运行之后性能是否下降。

此次更新实际上正在集中解决这些问题。

SDK 同步扩展,开发者能力进一步开放

除了客户端本身,DeepSeek Harness 的 Python SDK 也进行了调整。

新版本的 SDK 依赖配置覆盖了 4 个内置 Agent 预设,同时包含 rgglob 搜索以及 MCP stdio 工具所需依赖。

这意味着 DeepSeek Harness 并不只是希望成为一个供用户直接使用的桌面工具,其底层 Agent 能力也在逐步向开发者开放。

如果未来这些能力进一步标准化,开发者可以基于 Harness 的 Agent、工具、模型适配器和工作流机制构建自己的应用,那么它的定位就会从一个具体产品进一步向 Agent 基础设施靠拢。

一次版本更新背后的产品方向

从功能列表来看,v0.1.0-rc.8 的变化很多,真正值得关注的其实是这些变化背后的产品方向。

多模态能力,让 Agent 能够理解更多现实世界的信息;

Profile Bundle 和子代理,让不同 Agent 可以进入同一套任务体系;

Codex 多实例与非交互模式,让自动化能力进一步增强;

持久 PowerShell 和终端优化,则让 Agent 更接近真正的开发环境;

SQLite、历史会话、分叉性能优化,则解决长期使用过程中越来越明显的基础设施问题。

这些变化共同指向一个目标:让 DeepSeek Harness 不再只是“DeepSeek + 一个 Coding 界面”,而是逐渐成为一个可以承载多个模型、多个 Agent 和多种工具的开发工作平台。

当然,v0.1.0-rc.8 仍然只是一个 RC(Release Candidate)版本,距离真正成熟的开发者基础设施还有不少距离。尤其是在多 Agent 协作、复杂任务稳定性、模型兼容性以及生态建设方面,后续版本仍然值得观察。

不过从此次更新的方向来看,DeepSeek Harness 的路线已经越来越清晰。

它正在把竞争从“谁的模型更聪明”,逐步拉到另一个维度——谁能够把模型、Agent、工具、终端和开发工作流真正组织起来。

而这,可能才是 AI Coding 下一阶段真正值得关注的竞争。

收藏文章

评论交流