modlens
liustack
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
Anionex/dsh-vision-toolkit
让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。
安装
npm 方式
直接拉已发布的 tarball,不用克隆整个仓库,也不需要额外配置。如果你用的是别的 profile,把 `web` 换成对应的名字。
GitHub 方式 · npm 包
从 GitHub 装会执行项目自己的构建脚本,而 pnpm 默认拦着不让跑——先跑一次这条命令,pnpm 会打印出要加到 ~/.dsh/profiles/web/pnpm-workspace.yaml 里 `allowBuilds` 下面的那个 key。
安装前须知
dsh-vision-toolkit 是一个 DeepSeek Harness 插件,用于补足纯文本模型处理图像时的能力:它可以围绕当前问题回答图片内容,读取长截图 OCR,定位元素坐标,提取素材,辅助还原 UI,并用像素差异检查结果。它不是只生成一段通用描述,而是把视觉证据整理成 agent 后续可以继续使用的结果。
在 DSH Web 中粘贴图片后,纯文本路由会切换到 Vision Toolkit 变体,并保留 workspace path;图片会连同本次检查的意图发送到视觉服务。默认使用无需 API key 的 Gemma 4 服务。裁剪、像素 diff、颜色分析、前景提取、SVG tracing 和 HTML screenshot 等操作在本地执行,结果可包括坐标、OCR Markdown、crop、透明 PNG、色板、可编辑 SVG、heatmap 与 JSON。
它适合做截图问答、网页或 UI 还原、长图文字提取和视觉回归检查。若现有模型已经原生支持这些视觉流程,安装它可能只是重复能力;若图片不能发送到默认视觉服务,也应先评估使用方式。免费服务有 100/day、400/day 和 20/minute 的限制。该源码仓库没有列出风险标记。
插件将 agent-vision-toolkit 接入 DSH。用户在 DSH Web 粘贴图片后,纯文本路由使用 Vision Toolkit 变体并保存 workspace path,之后可以再次引用图片。请求会带上检查原因,因此回答可聚焦错误位置、按钮颜色等具体问题,而不是只生成概括性描述。
README 记录的流程包括图片问答、元素 grounding、原图像素坐标、长截图 OCR、UI 还原、素材提取和 screenshot 对比。输出可包含 OCR Markdown、chunks、manifests、可恢复运行状态、crop、透明 PNG、color palette、editable SVG、HTML screenshot、差异百分比、排序后的区域、heatmap 和 JSON。
默认视觉服务为 Gemma 4,不需要 API key。crop、pixel diff、color analysis、foreground extraction、SVG tracing 和 HTML screenshot 在本地运行,不消耗 vision API 请求。Settings 提供真实 image-request test;仅请求 /models 不能证明模型支持图片。
Windows 的首次 isolated-runtime setup 支持 Microsoft Store Python。README 片段未给出其他配置键或独立工具命令。
免费服务限制为每客户端 100/day、全局 400/day,以及 20/minute 的突发限制。默认视觉路径依赖该服务;需要完全不发送图片的流程时,应改用本地处理覆盖的功能。
根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README
同一分类
liustack
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
ysr666
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
linenxi-ctrl
外挂识图插件:鲸鱼按钮配置面板、图片识图自动回传、模型自主截图识图工具。
Flyvhidbwo
DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经 OpenAI 兼容 VLM 转译成文字,再交给纯文本的 DeepSeek 作答——有 key 自动走快速通道(默认 qwen3.7-flash,支持百炼/智谱/OpenRouter 等任意 OpenAI 兼容端点),无 key 自动探测本地 Ollama(零配置,图片不出本机)。
jyh20030112
给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。
ConsoleSun
接入 gemini.google.com 的 MCP 桥:图片/视频视觉识别、Imagen 生图、Veo 生视频与历史对话管理,复用浏览器登录态,无需 API Key。