DSH Marketplace
EN

DSH-vison

hisence999/DSH-vison

DSH-vison 是一个 DeepSeek Harness 插件,为不支持多模态的模型补充图片理解能力。agent 仍可直接接收图片;插件调用 DSH 中已配置的视觉模型生成文字描述,再把描述交给纯文本模型。原始图片会保留在会话历史中,UI 仍可显示图片;模型侧则通过替换后的消息看到描述文字。readimage 工具也会采用同样的处理方式,多模态模型则自动放行,不重复识别。

安装

把 DSH-vison 装进 DeepSeek Harness

GitHub 方式 · GitHub 源码

从 GitHub 装会执行项目自己的构建脚本,而 pnpm 默认拦着不让跑——先跑一次这条命令,pnpm 会打印出要加到 ~/.dsh/profiles/web/pnpm-workspace.yaml 里 `allowBuilds` 下面的那个 key。

安装前须知

装 DSH-vison 之前,先看这几条

  • 源码在这里: hisence999/DSH-vison——从 GitHub 的 dsh-plugin topic 发现,没有进入人工审过的精选库。
  • 开源协议:MIT。
  • 自动识别到:终端执行。授权之前请先读一遍源码。
  • 被收录在这里不代表通过了安全审计。插件是带着你 agent 的权限在跑。

DSH-vison 是做什么的

Image tiles split between preserved records and a description path before converging in a model chamber.

DSH-vison 是一个 DeepSeek Harness 插件,为不支持多模态的模型补充图片理解能力。agent 仍可直接接收图片;插件调用 DSH 中已配置的视觉模型生成文字描述,再把描述交给纯文本模型。原始图片会保留在会话历史中,UI 仍可显示图片;模型侧则通过替换后的消息看到描述文字。read_image 工具也会采用同样的处理方式,多模态模型则自动放行,不重复识别。

插件通过包装 llm.resolveModelInfo 放宽图片准入和工具门禁,并监听 agent/pre-steptools/post-executesystem-prompt/assemble。配置保存在 dsh-image-vision,可设置开关、识别模型和提示词;cordis.patch.yml 中的 enabledpatchAdmission 可作为兜底配置。

它适合需要让纯文本模型处理用户图片的 DSH 部署,但至少要先配置一个支持图片的模型。描述不会跨轮缓存,后续再次发送图片仍会调用视觉模型。插件还会通过 PowerShell 或 shell 脚本修改 $DSH_HOME 下的 profile 文件和 dsh-host-apiproxy 白名单;不希望插件触及这些终端文件时,不应使用它。

DSH-vison 的文档

配置

插件使用 dsh-image-vision settings namespace,设置页提供开关、识别模型和提示词。profile 补丁中的兜底配置为:

Key Value
enabled true
patchAdmission true

patchAdmission 是对共享 llm service 的可逆包装。设置页还要求把 dsh-image-vision 加入 dsh-host-apiproxyWEB_SETTINGS_NAMESPACES 白名单,否则页面找不到该 namespace。

文件与宿主集成

插件文件为 index.jsclient.jspackage.json,放在 $DSH_HOME/profiles/<profile>/node_modules/dsh-image-vision/。profile 的 $DSH_HOME/profiles/<profile>/cordis.patch.yml 需要包含名为 image-vision、指向 dsh-image-vision 的条目。脚本会修改 dsh-host-apiproxy 中的白名单;升级 DSH 后该文件可能被覆盖,需要重新处理。

命令与平台

Windows 使用 install.ps1uninstall.ps1,Linux 和 macOS 使用 install.shuninstall.sh。卸载会删除插件、image-vision 条目和白名单修改;配置默认保留。Windows 可用 -PurgeConfig,Unix 可用 --purge-config 一并清理配置。安装或卸载后都要重启 DSH。

已知限制

必须至少配置一个支持图片的模型。描述不跨轮缓存,同一轮同一图片只识别一次;后续再次发送仍会调用视觉模型。识别失败时会以 0.6s 间隔重试其他可用模型,全部失败则写入占位文字,不把图片直接交给纯文本模型。

根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README

同一分类

DSH-vison 的同类插件

modlens

liustack

2.3k

为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

npm 包TypeScript今天

让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

npm 包TypeScript今天

为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

npm 包JavaScript今天

dsh-vision

linenxi-ctrl

11

外挂识图插件:鲸鱼按钮配置面板、图片识图自动回传、模型自主截图识图工具。

npm 包JavaScript昨天
9

DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经 OpenAI 兼容 VLM 转译成文字,再交给纯文本的 DeepSeek 作答——有 key 自动走快速通道(默认 qwen3.7-flash,支持百炼/智谱/OpenRouter 等任意 OpenAI 兼容端点),无 key 自动探测本地 Ollama(零配置,图片不出本机)。

npm 包JavaScript今天
9

给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。

npm 包TypeScript今天