DeepSeek Harness rc.8 上手:多模态输入、工具层视觉与子代理

DeepSeek Harness(dsh)8 月 13 日开放公测并开源,核心设计只有一句话:一切皆插件——模型、工具、技能、会话、沙箱、存储、循环、调度、UI 全部可以组合替换。六天后,v0.1.0-rc.8 带来公测后的首次重要更新,共 14 项调整,重头戏是多模态。

带视觉能力的模型现在可以直接收图;纯文本模型则靠一套工具层视觉回退(OCR + 颜色统计 + 像素扫描)「脑补」出图片内容;Claude Code 和 Codex 也能按需装成子代理。下面说清楚怎么用。

rc.8 更新了什么

DeepSeek 模型适配器现在支持配置启用原生图片请求/goal/plan 等命令可以接收图文混合输入,输入框的 @ 菜单新增文件和会话引用,可以把本地文件、历史会话直接拉进当前任务。

  • 多模态输入:视觉模型原生收图;/goal/plan 支持图文混输,@ 菜单可引用文件与会话。
  • 新子代理:Claude Code 与 Codex 可作为 Profile Bundle 按需安装;Codex 支持非交互权限模式和多个命名实例。
  • Windows:PTY 终端加入持久 PowerShell 会话,极简模式预设默认开启。

修复项同样值得关注:单张图片过大或历史会话图片累积过多导致的模型请求失败;取消流式生成后,已显示的回复前缀现在会带入后续提问和分叉会话;部分自定义 OpenAI 兼容网关因请求格式差异无法调用、推理内容回传缺失的问题也已修复。

开启原生图片输入

安装并启动 Web UI:

npx @deepseek-ai/dsh web
# Web UI: http://127.0.0.1:3080

使用带视觉能力的模型时,在适配器配置里显式声明输入类型即可(社区通行做法):

# 适配器/模型配置(预发布阶段 schema 变化快,以文档为准)
model:
  input: [text, image]   # 允许原生图片请求

开启后,把截图直接丢进 /goal/plan,或者用 @ 菜单把本地文件、历史会话附加到当前任务。

纯文本模型也能「看图」:工具层视觉回退

更巧妙的是模型没有视觉能力时发生的事。read_image 调用失败后,Harness 会退到另一套工具链:先用 OCR 识别文字,再统计颜色占比、扫描部分像素行,读取图片尺寸、色彩模式等元信息,最后把这些结构化证据交给文本模型推理。

这套方案对结构清晰的图片很有效:PPT 截图、流程图、界面截图、表格都能还原出不少信息;真实照片和复杂空间关系则明显吃力。设计思路值得玩味:感知能力不一定绑死在底座模型上,工具也可以承担一部分「看」的活。

其实 rc.8 之前社区已经围绕这个思路做了一批插件:dsh-visiondsh-vision-toolkitmodlensdsh-auto-visiondsh-subagent-vision,以及通过 pi2dsh 桥接的 pi-vision。原生多模态与工具层视觉现在可以配合使用。

Claude Code 与 Codex 按需安装为子代理

两者都可以作为 Profile Bundle 按需安装,任务需要时才拉进来。Codex 支持非交互权限模式多个命名实例,一个任务里可以配置多个不同角色的 Codex 子代理;子代理 reportDelivery 现在会及时反馈并唤醒父任务,不用等整轮跑完。

# 示意配置
subagents:
  codex-worker-a:
    provider: codex
    permission: non-interactive
  codex-worker-b:
    provider: codex
    permission: non-interactive

Windows 体验、修复项与实践建议

Windows 的 PTY 终端现在保持持久 PowerShell 会话(极简模式预设默认开启),不再频繁重建终端环境。web_search 支持并发查询;SQLite 后端的读写与分叉性能提升、存储体积更小(数据结构不兼容,升级前先备份);Python SDK 现在覆盖全部 4 个内置 Agent 预设,并包含 rg/glob 搜索和 MCP stdio 工具所需依赖。

这周可以试三件事:

  • 截图生成代码:视觉模型下把 UI 截图丢进 /goal,让它直接搭实现框架。
  • 带证据的 Bug 排查:贴错误截图,用便宜的纯文本模型走 OCR 回退提取报错信息和位置。
  • 子代理分工:同一个任务里 Codex 写代码、Claude Code 做 review。

如果正在挑一个视觉能力强的底座模型配合使用,GPT-5.6 Sol 的视觉提升值得关注;开源 Deep Research 工具实测那篇也整理了类似的 Agent 编排思路。

资源链接

发表评论

滚动至顶部