DSH Marketplace
EN

dsh-vision-toolkit

Anionex/dsh-vision-toolkit

让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

50825TypeScriptMIT源码

安装

把 dsh-vision-toolkit 装进 DeepSeek Harness

npm 方式

直接拉已发布的 tarball,不用克隆整个仓库。

GitHub 方式 · npm 包

安装前须知

装 dsh-vision-toolkit 之前,先看这几条

  • 源码在这里: Anionex/dsh-vision-toolkit——已进入社区精选库,DSH 自带的插件市场就是从这儿装的。
  • 开源协议:MIT。
  • 被收录在这里不代表通过了安全审计。插件是带着你 agent 的权限在跑。

dsh-vision-toolkit 是做什么的

dsh-vision-toolkit 是一个 DeepSeek Harness 插件,用于补足纯文本模型处理图像时的能力:它可以围绕当前问题回答图片内容,读取长截图 OCR,定位元素坐标,提取素材,辅助还原 UI,并用像素差异检查结果。它不是只生成一段通用描述,而是把视觉证据整理成 agent 后续可以继续使用的结果。

在 DSH Web 中粘贴图片后,纯文本路由会切换到 Vision Toolkit 变体,并保留 workspace path;图片会连同本次检查的意图发送到视觉服务。默认使用无需 API key 的 Gemma 4 服务。裁剪、像素 diff、颜色分析、前景提取、SVG tracing 和 HTML screenshot 等操作在本地执行,结果可包括坐标、OCR Markdown、crop、透明 PNG、色板、可编辑 SVG、heatmap 与 JSON。

它适合做截图问答、网页或 UI 还原、长图文字提取和视觉回归检查。若现有模型已经原生支持这些视觉流程,安装它可能只是重复能力;若图片不能发送到默认视觉服务,也应先评估使用方式。免费服务有 100/day400/day20/minute 的限制。该源码仓库没有列出风险标记。

dsh-vision-toolkit 的文档

行为说明

插件将 agent-vision-toolkit 接入 DSH。用户在 DSH Web 粘贴图片后,纯文本路由使用 Vision Toolkit 变体并保存 workspace path,之后可以再次引用图片。请求会带上检查原因,因此回答可聚焦错误位置、按钮颜色等具体问题,而不是只生成概括性描述。

能力与输出

README 记录的流程包括图片问答、元素 grounding、原图像素坐标、长截图 OCR、UI 还原、素材提取和 screenshot 对比。输出可包含 OCR Markdown、chunks、manifests、可恢复运行状态、crop、透明 PNG、color palette、editable SVG、HTML screenshot、差异百分比、排序后的区域、heatmap 和 JSON。

服务与本地处理

默认视觉服务为 Gemma 4,不需要 API key。crop、pixel diff、color analysis、foreground extraction、SVG tracing 和 HTML screenshot 在本地运行,不消耗 vision API 请求。Settings 提供真实 image-request test;仅请求 /models 不能证明模型支持图片。

环境要求

Windows 的首次 isolated-runtime setup 支持 Microsoft Store Python。README 片段未给出其他配置键或独立工具命令。

已知限制

免费服务限制为每客户端 100/day、全局 400/day,以及 20/minute 的突发限制。默认视觉路径依赖该服务;需要完全不发送图片的流程时,应改用本地处理覆盖的功能。

根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README

同一分类

dsh-vision-toolkit 的同类插件

modlens

liustack

2.3k

为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

npm 包TypeScript今天

为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

npm 包JavaScript今天

dsh-vision

linenxi-ctrl

11

外挂识图插件:鲸鱼按钮配置面板、图片识图自动回传、模型自主截图识图工具。

npm 包JavaScript昨天
9

DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经 OpenAI 兼容 VLM 转译成文字,再交给纯文本的 DeepSeek 作答——有 key 自动走快速通道(默认 qwen3.7-flash,支持百炼/智谱/OpenRouter 等任意 OpenAI 兼容端点),无 key 自动探测本地 Ollama(零配置,图片不出本机)。

npm 包JavaScript今天
9

给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。

npm 包TypeScript今天

Gemini-Eyes

ConsoleSun

6

接入 gemini.google.com 的 MCP 桥:图片/视频视觉识别、Imagen 生图、Veo 生视频与历史对话管理,复用浏览器登录态,无需 API Key。

GitHub 源码Python2 天前