modlens
liustack
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
ysr666/dsh-vision-router
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
安装
npm 方式
直接拉已发布的 tarball,不用克隆整个仓库,也不需要额外配置。如果你用的是别的 profile,把 `web` 换成对应的名字。
GitHub 方式 · npm 包
从 GitHub 装会执行项目自己的构建脚本,而 pnpm 默认拦着不让跑——先跑一次这条命令,pnpm 会打印出要加到 ~/.dsh/profiles/web/pnpm-workspace.yaml 里 `allowBuilds` 下面的那个 key。
安装前须知

dsh-vision-router 是一个为纯文本 agent 增加图像处理能力的 DeepSeek Harness 插件。它不把图片先压缩成一段描述再交给 DeepSeek,而是在图像回合中通过视觉模型读取原始像素,DeepSeek 继续负责推理。插件使用 agent/request waterfall,并随包提供 dsh.bundle.patch;执行安装后会自动接入 composition row、admission wrapper 和附件限制,不需要手动修改文件。接管官方 DeepSeek 路由的 stealth mode 默认关闭。
视觉请求优先使用用户配置的 vision model,之后才进入内置的 OVHcloud 免 Key fallback chain。可用能力包括看图问答、定位、裁剪、像素对比、取色、OCR、SVG trace、抠图和截图,README 明确展示了 vision_ground、vision_crop、vision_describe、vision_pixel_diff。图片答案按图像内容缓存,图片在会话界面中仍以图片显示,内部改写只发生在模型调用中。
它适合需要连续检查图片、但不想切换主模型的文本型 agent。不适合已有足够视觉路由的环境,或不能接受匿名外部 endpoint 的场景;内置 fallback 每个 IP、每个模型为每分钟 2 次。插件还会触及终端表面,因为本地图像处理依赖 sharp、potrace、tesseract 和 system Chrome。
图片回合会作为普通 tool-calling turn 处理。agent 可以先调用 vision_ground 定位,再用 vision_crop 裁剪、vision_describe 描述或 vision_pixel_diff 对比,修改后重新截图检查。上传图片仍保留在会话界面中,内部路由改写不会写入 session log。文本回合继续使用原有模型、成本和上下文路径;答案按图像内容缓存。
README 列出的能力包括问答、grounding、裁剪、pixel diff、取色、OCR、SVG trace、抠图和截图。明确出现的工具如下:
| 工具 | 用途 |
|---|---|
vision_ground |
在图片中定位元素 |
vision_crop |
裁剪图片区域 |
vision_describe |
生成图片描述 |
vision_pixel_diff |
对比图片像素 |
用户提供的 vision model 优先使用;不可用时进入包含五个模型的 OVHcloud anonymous fallback chain,无需账号或 Key。README 标明每个 IP、每个模型限制为 2 requests/minute,独立 bucket 理论上合计约 10 RPM。
运行时要求 Node.js >=22,不需要 Python。本地图像处理使用 sharp、potrace、tesseract 和 system Chrome,其中 system Chrome 用于 HTML screenshot。插件提供 dsh.bundle.patch,并引用 cordis.patch.yml 的 DSH Web profile。
接管官方 DeepSeek route 的 stealth mode 是可选项,默认关闭。README 未给出该选项的具体 config key 或命令行 flag。匿名 fallback 受速率限制;插件的本地处理链会访问终端中的 system Chrome。
根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README
同一分类
liustack
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
Anionex
让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。
linenxi-ctrl
外挂识图插件:鲸鱼按钮配置面板、图片识图自动回传、模型自主截图识图工具。
Flyvhidbwo
DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经 OpenAI 兼容 VLM 转译成文字,再交给纯文本的 DeepSeek 作答——有 key 自动走快速通道(默认 qwen3.7-flash,支持百炼/智谱/OpenRouter 等任意 OpenAI 兼容端点),无 key 自动探测本地 Ollama(零配置,图片不出本机)。
jyh20030112
给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。
ConsoleSun
接入 gemini.google.com 的 MCP 桥:图片/视频视觉识别、Imagen 生图、Veo 生视频与历史对话管理,复用浏览器登录态,无需 API Key。