dsh-tool-describe-image
zhu1090093659
给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。
我们跑过,装得上
hisence999/DSH-vison
DSH-vison 是一个 DeepSeek Harness 插件,为不支持多模态的模型补充图片理解能力。agent 仍可直接接收图片;插件调用 DSH 中已配置的视觉模型生成文字描述,再把描述交给纯文本模型。原始图片会保留在会话历史中,UI 仍可显示图片;模型侧则通过替换后的消息看到描述文字。readimage 工具也会采用同样的处理方式,多模态模型则自动放行,不重复识别。
安装
GitHub 方式 · GitHub 源码
从 GitHub 装会执行项目自己的构建脚本,而 pnpm 默认拦着不让跑——先跑一次这条命令,pnpm 会打印出要加到 ~/.dsh/profiles/web/pnpm-workspace.yaml 里 `allowBuilds` 下面的那个 key。
我们跑过之后
我们跑过,装得上
这里每条命令都在一次性容器里、对着干净 profile 真跑过,结果取自 harness 自己的记录,不是读源码猜的。 最近一次 11 天前.
挂进你的 README
给维护者的:badge 取这条 listing 最近一次 sandbox 实测的结果,重跑之后它自己会变,读者点开就是这页的完整记录。
安装前须知
是什么 — DSH-vison 为纯文本模型提供图片理解,通过配置的视觉模型将图像转为描述文字。
谁该装 — 当你使用纯文本模型处理包含图片的用户消息时,需要图片理解能力。 如果你使用支持图片的模型,可以不安装此插件。
注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。没发现明显的坑。
锐评 — 我会安装它,因为沙箱测试通过且安装后全局生效。
grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。

DSH-vison 是一个 DeepSeek Harness 插件,为不支持多模态的模型补充图片理解能力。agent 仍可直接接收图片;插件调用 DSH 中已配置的视觉模型生成文字描述,再把描述交给纯文本模型。原始图片会保留在会话历史中,UI 仍可显示图片;模型侧则通过替换后的消息看到描述文字。read_image 工具也会采用同样的处理方式,多模态模型则自动放行,不重复识别。
插件通过包装 llm.resolveModelInfo 放宽图片准入和工具门禁,并监听 agent/pre-step、tools/post-execute、system-prompt/assemble。配置保存在 dsh-image-vision,可设置开关、识别模型和提示词;cordis.patch.yml 中的 enabled 与 patchAdmission 可作为兜底配置。
它适合需要让纯文本模型处理用户图片的 DSH 部署,但至少要先配置一个支持图片的模型。描述不会跨轮缓存,后续再次发送图片仍会调用视觉模型。插件还会通过 PowerShell 或 shell 脚本修改 $DSH_HOME 下的 profile 文件和 dsh-host-apiproxy 白名单;不希望插件触及这些终端文件时,不应使用它。
插件使用 dsh-image-vision settings namespace,设置页提供开关、识别模型和提示词。profile 补丁中的兜底配置为:
| Key | Value |
|---|---|
enabled |
true |
patchAdmission |
true |
patchAdmission 是对共享 llm service 的可逆包装。设置页还要求把 dsh-image-vision 加入 dsh-host-apiproxy 的 WEB_SETTINGS_NAMESPACES 白名单,否则页面找不到该 namespace。
插件文件为 index.js、client.js 和 package.json,放在 $DSH_HOME/profiles/<profile>/node_modules/dsh-image-vision/。profile 的 $DSH_HOME/profiles/<profile>/cordis.patch.yml 需要包含名为 image-vision、指向 dsh-image-vision 的条目。脚本会修改 dsh-host-apiproxy 中的白名单;升级 DSH 后该文件可能被覆盖,需要重新处理。
Windows 使用 install.ps1、uninstall.ps1,Linux 和 macOS 使用 install.sh、uninstall.sh。卸载会删除插件、image-vision 条目和白名单修改;配置默认保留。Windows 可用 -PurgeConfig,Unix 可用 --purge-config 一并清理配置。安装或卸载后都要重启 DSH。
必须至少配置一个支持图片的模型。描述不跨轮缓存,同一轮同一图片只识别一次;后续再次发送仍会调用视觉模型。识别失败时会以 0.6s 间隔重试其他可用模型,全部失败则写入占位文字,不把图片直接交给纯文本模型。
根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README
同一分类
zhu1090093659
给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。
我们跑过,装得上
Anionex
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
我们跑过,装得上
ysr666
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
我们跑过,装得上
Anionex
让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。
我们跑过,装得上
omdsh-dev
Chrome sidebar extension that lets DeepSeek Harness operate your browser directly, no vision capabilities required. 一款 Chrome 侧边栏扩展程序,可让 DeepSeek Harness 直接操控您的浏览器,无需视觉能力。
我们跑过,装得上