智东西
作者 | 江宇
编辑 | 李水青
8月20日,智东西报道,DeepSeek Harness在公测后的首次重要更新悄然而至。v0.1.0-rc.8版本正式问世,多模态能力的加入成为此次更新的亮点。
这次更新一共包含了14项调整,它们被分布在多模态输入、子代理协作、终端体验、工具调用和开发者支持等多个领域。通过这些调整,Agent处理图片等多模态任务的能力得到了补全,子代理协作、终端交互和工具调用的体验也得到了进一步完善。
在功能方面,新版支持了原生图片请求和图文混合输入。/goal、/plan等命令现在也可以直接接收图片。Claude Code和Codex进一步接入其子代理体系。Windows终端体验以及图片请求、流式生成、自定义网关等方面的一批问题也得到了修复。
DeepSeek Harness于8月13日正式开启了v0.1版本的公测,并同步实现了开源。仅一周时间,这套Agent Harness就补齐了多模态功能。这次更新很快在DeepSeek Harness社区引起了热议。
国内开发者看到更新后表示兴奋:“DSH支持多模态了,大家都在传播这个消息!”海外开发者同样关注这两项能力。有网友评价称,DeepSeek Harness正变得越来越有趣,多模态支持和更完善的子代理集成是一次明显的推进。
更值得注意的是,开发者们还发现了DeepSeek Harness的“看图”方式。对于不支持图像输入的模型,它能够调用OCR、颜色统计、像素扫描等工具,将图片拆分成结构化信息,再交给文本模型进行推理,相当于为纯文本模型拼出了一套工具层的“视觉”。
GitHub:https://github.com/deepseek-ai/deepseek-harness/releases/tag/dsh-v0.1.0-rc.8
一、多模态功能正式完善,可以直接“看图”
rc.8版本最显著的变化,是DeepSeek Harness在多模态输入方面实现了进一步补齐。官方更新日志显示,DeepSeek模型适配器现在可以通过配置来启用原生图片请求。对于拥有视觉能力的模型,Harness可以直接将图片送入模型;/goal、/plan等指令也支持图文混合输入。同时,输入框中的@菜单新增了文件和会话引用功能,用户可以直接将本地文件、已有会话等内容拖入当前任务。
这意味着,过去主要围绕文本、代码和工具调用展开的Agent工作流,现在可以进一步将截图、图片等视觉信息纳入任务上下文。子代理体系也继续扩充。新版支持将Claude Code和Codex作为Profile Bundle按需安装。其中,Codex支持非交互权限模式以及多个命名实例,方便在同一个任务中配置不同的Codex子代理。
Windows用户这次也享受到了特别的关注。DeepSeek Harness的PTY终端加入了持久PowerShell会话,并在极简模式预设中默认开启,减少了命令执行过程中频繁重建终端环境的问题。
除了新功能,这次更新还集中修复了一批公测后暴露的问题。比如,当单张图片尺寸过大,或者历史会话中累积图片过多时,此前可能导致模型请求直接失败。新版对此进行了处理。取消一次流式生成后,已经显示出来的回复前缀此前也可能不会被带入下一轮提问或者分叉会话,这一问题现在已经得到了修正。对于使用自定义OpenAI兼容网关的开发者,新版还修复了部分网关因请求格式差异而无法调用,以及推理内容回传缺失的问题。
二、纯文本模型也能“看图”,通过OCR和像素分析拼出工具层视觉
DeepSeek Harness在补上原生图片请求的同时,一个有趣的细节也很快被开发者发现。网友Yinsen在测试DeepSeek Harness时,揭示了其“看图”的机制。










网友评论