dsh-tool-describe-image
zhu1090093659
给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。
我们跑过,装得上
ysr666/dsh-vision-router
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
安装
npm 方式
直接拉已发布的 tarball,不用克隆整个仓库,也不需要额外配置。如果你用的是别的 profile,把 `web` 换成对应的名字。
GitHub 方式 · npm 包
从 GitHub 装会执行项目自己的构建脚本,而 pnpm 默认拦着不让跑——先跑一次这条命令,pnpm 会打印出要加到 ~/.dsh/profiles/web/pnpm-workspace.yaml 里 `allowBuilds` 下面的那个 key。
我们跑过之后
我们跑过,装得上
这里每条命令都在一次性容器里、对着干净 profile 真跑过,结果取自 harness 自己的记录,不是读源码猜的。 最近一次 11 天前.
挂进你的 README
给维护者的:badge 取这条 listing 最近一次 sandbox 实测的结果,重跑之后它自己会变,读者点开就是这页的完整记录。
安装前须知
是什么 — dsh-vision-router 为 DeepSeek Harness 文本代理提供免费视觉能力,支持像素工具调用。
谁该装 — 当代理需要 vision grounding 或 vision crop 操作时,此插件适合使用。 如果代理本身支持多模态输入而非仅文本模式,则无需此插件。
注意 — 没发现明显的坑。沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。插件会执行 shell 命令,但未引发任何故障。
锐评 — 我会装它,因为它支持连续多步图像处理直到任务完成。
grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。

dsh-vision-router 是一个为纯文本 agent 增加图像处理能力的 DeepSeek Harness 插件。它不把图片先压缩成一段描述再交给 DeepSeek,而是在图像回合中通过视觉模型读取原始像素,DeepSeek 继续负责推理。插件使用 agent/request waterfall,并随包提供 dsh.bundle.patch;执行安装后会自动接入 composition row、admission wrapper 和附件限制,不需要手动修改文件。接管官方 DeepSeek 路由的 stealth mode 默认关闭。
视觉请求优先使用用户配置的 vision model,之后才进入内置的 OVHcloud 免 Key fallback chain。可用能力包括看图问答、定位、裁剪、像素对比、取色、OCR、SVG trace、抠图和截图,README 明确展示了 vision_ground、vision_crop、vision_describe、vision_pixel_diff。图片答案按图像内容缓存,图片在会话界面中仍以图片显示,内部改写只发生在模型调用中。
它适合需要连续检查图片、但不想切换主模型的文本型 agent。不适合已有足够视觉路由的环境,或不能接受匿名外部 endpoint 的场景;内置 fallback 每个 IP、每个模型为每分钟 2 次。插件还会触及终端表面,因为本地图像处理依赖 sharp、potrace、tesseract 和 system Chrome。
图片回合会作为普通 tool-calling turn 处理。agent 可以先调用 vision_ground 定位,再用 vision_crop 裁剪、vision_describe 描述或 vision_pixel_diff 对比,修改后重新截图检查。上传图片仍保留在会话界面中,内部路由改写不会写入 session log。文本回合继续使用原有模型、成本和上下文路径;答案按图像内容缓存。
README 列出的能力包括问答、grounding、裁剪、pixel diff、取色、OCR、SVG trace、抠图和截图。明确出现的工具如下:
| 工具 | 用途 |
|---|---|
vision_ground |
在图片中定位元素 |
vision_crop |
裁剪图片区域 |
vision_describe |
生成图片描述 |
vision_pixel_diff |
对比图片像素 |
用户提供的 vision model 优先使用;不可用时进入包含五个模型的 OVHcloud anonymous fallback chain,无需账号或 Key。README 标明每个 IP、每个模型限制为 2 requests/minute,独立 bucket 理论上合计约 10 RPM。
运行时要求 Node.js >=22,不需要 Python。本地图像处理使用 sharp、potrace、tesseract 和 system Chrome,其中 system Chrome 用于 HTML screenshot。插件提供 dsh.bundle.patch,并引用 cordis.patch.yml 的 DSH Web profile。
接管官方 DeepSeek route 的 stealth mode 是可选项,默认关闭。README 未给出该选项的具体 config key 或命令行 flag。匿名 fallback 受速率限制;插件的本地处理链会访问终端中的 system Chrome。
根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README
同一分类
zhu1090093659
给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。
我们跑过,装得上
Anionex
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
我们跑过,装得上
Anionex
让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。
我们跑过,装得上
omdsh-dev
Chrome sidebar extension that lets DeepSeek Harness operate your browser directly, no vision capabilities required. 一款 Chrome 侧边栏扩展程序,可让 DeepSeek Harness 直接操控您的浏览器,无需视觉能力。
我们跑过,装得上
oxbshw
DeepWatch, powered by Watch Skill: a local-first perception and verification stack for AI agents. Understand video, audio and screen activity, keep timestamped evidence, and independently verify what a tool or workflow actually did. MCP, CLI, REST, Web and DeepSeek Harness.
我们跑过,装得上