

公测不到一周就加多模态!DeepSeek Harness这次更新有点猛
如果你最近在折腾AI编程工具,或者关注DeepSeek家族的一举一动,那你大概率已经听说了DeepSeek Harness这个名字。8月13日刚开放公测并同步开源的它,仅过去不到一周,就迎来了一次重磅更新——多模态能力,正式补齐!
有国内开发者看到更新后直接感叹:"DSH支持多模态了,奔走相告!"海外网友也评价:这套Agent Harness正变得"越来越有意思"。
这次更新到底带来了什么?纯文本模型又是怎么做到"看图"的?咱们一条一条拆开看。
这次v0.1.0-rc.8版本共带来14项调整,覆盖多模态输入、子代理协作、终端体验、工具调用和开发者支持等多个方向。最吸引眼球的,无疑是多模态能力的正式上线。
DeepSeek模型适配器现在可以通过配置启用原生图片请求。对于具备视觉能力的模型,Harness可以直接把图片送进模型处理。更贴心的是,/goal、/plan等常用指令也已经支持图文混合输入,玩起来更顺滑。
以前只能在聊天框里拖文本和代码,现在输入框中的@菜单新增了文件和会话引用功能——你可以直接把本地文件、已有会话等内容一键拉进当前任务。
这意味着什么?过去主要围绕文本、代码和工具调用展开的Agent工作流,现在可以把截图、流程图、界面截图等视觉信息纳入任务上下文了。对日常开发、文档整理、需求分析的效率提升,都是实打实的。
新版还支持把Claude Code和Codex作为Profile Bundle按需安装。其中Codex更是支持非交互权限模式以及多个命名实例,方便你在同一个任务里配置不同的Codex子代理。
Windows这次也被重点照顾!PTY终端加入了持久PowerShell会话,并在极简模式预设中默认开启,减少了命令执行过程中频繁重建终端环境的尴尬。
新能力之外,官方也没闲着,集中修掉了一批问题:
如果说原生多模态请求是官方的"明牌",那么接下来这个发现才真的让社区兴奋起来。
网友Yinsen测试DeepSeek Harness处理图片时发现,当所调用的模型本身没有声明图像输入能力时,直接调用read_image会首先失败。但任务并没有就此停下!
从执行轨迹来看,Harness随后会退化到另一套工具链:
例如一张包含文字和简单图形的图片,可以被拆成"文字内容及坐标""背景颜色比例""特定区域像素变化""图片尺寸"等多组信息。
最后,这些结构化结果会被重新交给文本大模型,让模型根据OCR文本、颜色占比、像素位置等证据"脑补"出整张图的大致内容。相当于给纯文本模型,拼出了一套工具层的"视觉"!
这种能力和视觉大模型直接理解图片,仍然有明显区别。对于PPT截图、流程图、界面截图等结构相对明确的图片,它可以借助OCR和像素特征拿到不少有效信息;但面对真实照片、复杂空间关系等内容,能恢复的信息就相当有限了。
不过从Agent Harness的角度看,这个设计真的很有意思:视觉能力并不完全绑死在底座模型上,工具也可以承担一部分感知工作。
事实上在官方加强多模态支持之前,社区已经围绕视觉能力出现了一批插件,包括dsh-vision、dsh-vision-toolkit、modlens、dsh-auto-vision、dsh-subagent-vision以及通过pi2dsh桥接的pi-vision等。
其中一些方案就是通过OCR、像素分析、结构化证据或者独立视觉子代理,让纯文本模型间接处理图片;也有开发者通过自定义路由,为本身支持视觉的模型配置input: [text, image],直接接收图片。
rc.8上线后,原生多模态模型和这类工具层视觉方案,完全可以进一步配合使用了。
8月13日公测时,DeepSeek Harness团队就强调过其核心设计思路——一切皆插件:模型、工具、技能、会话、沙箱、存储、循环、调度和UI等Agent能力,都可以由不同插件组合和替换。
当Agent Harness拥有越来越丰富的工具和子代理后,一些原本依赖单个模型能力的任务,也可以通过工具编排被重新拆解和实现。
此外,rc.8还加入了web_search并发查询、子代理reportDelivery及时唤醒父任务、本地运行dsh web自动打开浏览器等优化,并提升了大型历史会话分叉以及SQLite后端的读写性能。
从8月13日开放公测,到如今把多模态和更多子代理能力装进来,DeepSeek Harness仍处于快速迭代阶段。它没有选择把一切能力堆在模型身上,而是用"一切皆插件"的思路,把能力拆开、重组、装进同一个体系。
工具也能承担感知工作,模型不一定要样样全能——这套架构思维,也许比多模态本身更值得期待。
你觉得这种"工具层视觉"的思路,能走多远?评论区聊聊你的看法!
如果觉得这篇文章有用,记得点个赞、转给身边也在折腾AI开发的朋友~