找工位
空间入驻
小程序

公测不到一周就加多模态!DeepSeek Harness这次更新有点猛

2026-08-21 05:02:53

公测不到一周就加多模态!DeepSeek Harness这次更新有点猛

如果你最近在折腾AI编程工具,或者关注DeepSeek家族的一举一动,那你大概率已经听说了DeepSeek Harness这个名字。8月13日刚开放公测并同步开源的它,仅过去不到一周,就迎来了一次重磅更新——多模态能力,正式补齐!

有国内开发者看到更新后直接感叹:"DSH支持多模态了,奔走相告!"海外网友也评价:这套Agent Harness正变得"越来越有意思"。

这次更新到底带来了什么?纯文本模型又是怎么做到"看图"的?咱们一条一条拆开看。

🔍 01. 多模态正式补齐,直接"看图"

🌟 14项调整,多模态是绝对主角

这次v0.1.0-rc.8版本共带来14项调整,覆盖多模态输入、子代理协作、终端体验、工具调用和开发者支持等多个方向。最吸引眼球的,无疑是多模态能力的正式上线。

DeepSeek模型适配器现在可以通过配置启用原生图片请求。对于具备视觉能力的模型,Harness可以直接把图片送进模型处理。更贴心的是,/goal、/plan等常用指令也已经支持图文混合输入,玩起来更顺滑。

💡 输入框@菜单新增文件和会话引用

以前只能在聊天框里拖文本和代码,现在输入框中的@菜单新增了文件和会话引用功能——你可以直接把本地文件、已有会话等内容一键拉进当前任务。

这意味着什么?过去主要围绕文本、代码和工具调用展开的Agent工作流,现在可以把截图、流程图、界面截图等视觉信息纳入任务上下文了。对日常开发、文档整理、需求分析的效率提升,都是实打实的。

⚠️ 子代理体系继续扩充,Windows用户被点名照顾

新版还支持把Claude CodeCodex作为Profile Bundle按需安装。其中Codex更是支持非交互权限模式以及多个命名实例,方便你在同一个任务里配置不同的Codex子代理。

Windows这次也被重点照顾!PTY终端加入了持久PowerShell会话,并在极简模式预设中默认开启,减少了命令执行过程中频繁重建终端环境的尴尬。

🛠️ 一批公测暴露的问题集中修复

新能力之外,官方也没闲着,集中修掉了一批问题:

  • 单张图片尺寸过大或历史会话累积图片过多,此前可能导致模型请求直接失败,已处理
  • 取消流式生成后,已显示的回复前缀可能不会带入下一轮提问或分叉会话,已修正
  • 自定义OpenAI兼容网关因请求格式差异无法调用,以及推理内容回传缺失的问题,也得到修复

🧠 02. 纯文本模型也能"看图"?OCR和像素分析拼出工具层视觉

🤔 一个被开发者扒出来的细节

如果说原生多模态请求是官方的"明牌",那么接下来这个发现才真的让社区兴奋起来。

网友Yinsen测试DeepSeek Harness处理图片时发现,当所调用的模型本身没有声明图像输入能力时,直接调用read_image会首先失败。但任务并没有就此停下!

🔧 工具链式的"视觉":OCR+颜色统计+像素扫描

从执行轨迹来看,Harness随后会退化到另一套工具链:

  • 先进行OCR文字识别
  • 统计图片中的颜色比例
  • 扫描部分像素行
  • 读取图片尺寸、色彩模式等元信息

例如一张包含文字和简单图形的图片,可以被拆成"文字内容及坐标""背景颜色比例""特定区域像素变化""图片尺寸"等多组信息。

最后,这些结构化结果会被重新交给文本大模型,让模型根据OCR文本、颜色占比、像素位置等证据"脑补"出整张图的大致内容。相当于给纯文本模型,拼出了一套工具层的"视觉"!

⚠️ 局限在哪?实话实说

这种能力和视觉大模型直接理解图片,仍然有明显区别。对于PPT截图、流程图、界面截图等结构相对明确的图片,它可以借助OCR和像素特征拿到不少有效信息;但面对真实照片、复杂空间关系等内容,能恢复的信息就相当有限了。

不过从Agent Harness的角度看,这个设计真的很有意思:视觉能力并不完全绑死在底座模型上,工具也可以承担一部分感知工作。

🔍 社区早有铺垫,并非凭空而来

事实上在官方加强多模态支持之前,社区已经围绕视觉能力出现了一批插件,包括dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision以及通过pi2dsh桥接的pi-vision等。

其中一些方案就是通过OCR、像素分析、结构化证据或者独立视觉子代理,让纯文本模型间接处理图片;也有开发者通过自定义路由,为本身支持视觉的模型配置input: [text, image],直接接收图片。

rc.8上线后,原生多模态模型和这类工具层视觉方案,完全可以进一步配合使用了。

🧩 03. 一切皆插件,"拆开重组"的野心

⚙️ 核心设计思路:一切皆插件

8月13日公测时,DeepSeek Harness团队就强调过其核心设计思路——一切皆插件:模型、工具、技能、会话、沙箱、存储、循环、调度和UI等Agent能力,都可以由不同插件组合和替换。

当Agent Harness拥有越来越丰富的工具和子代理后,一些原本依赖单个模型能力的任务,也可以通过工具编排被重新拆解和实现。

🚀 此次rc.8把这种思路推得更远

  • 视觉模型可以原生接收图片
  • 纯文本模型也能借助视觉工具获得部分图像信息
  • Claude Code和Codex可以作为子代理按需装进同一套Harness

此外,rc.8还加入了web_search并发查询、子代理reportDelivery及时唤醒父任务、本地运行dsh web自动打开浏览器等优化,并提升了大型历史会话分叉以及SQLite后端的读写性能。

💭 结语

从8月13日开放公测,到如今把多模态和更多子代理能力装进来,DeepSeek Harness仍处于快速迭代阶段。它没有选择把一切能力堆在模型身上,而是用"一切皆插件"的思路,把能力拆开、重组、装进同一个体系。

工具也能承担感知工作,模型不一定要样样全能——这套架构思维,也许比多模态本身更值得期待。

你觉得这种"工具层视觉"的思路,能走多远?评论区聊聊你的看法!

如果觉得这篇文章有用,记得点个赞、转给身边也在折腾AI开发的朋友~