dsh-tool-describe-image
zhu1090093659
给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。
我们跑过,装得上
Anionex/dsh-vision-toolkit
让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。
安装
npm 方式
直接拉已发布的 tarball,不用克隆整个仓库,也不需要额外配置。如果你用的是别的 profile,把 `web` 换成对应的名字。
GitHub 方式 · npm 包
从 GitHub 装会执行项目自己的构建脚本,而 pnpm 默认拦着不让跑——先跑一次这条命令,pnpm 会打印出要加到 ~/.dsh/profiles/web/pnpm-workspace.yaml 里 `allowBuilds` 下面的那个 key。
我们跑过之后
我们跑过,装得上
这里每条命令都在一次性容器里、对着干净 profile 真跑过,结果取自 harness 自己的记录,不是读源码猜的。 最近一次 11 天前.
挂进你的 README
给维护者的:badge 取这条 listing 最近一次 sandbox 实测的结果,重跑之后它自己会变,读者点开就是这页的完整记录。
安装前须知
是什么 — DSH Vision Toolkit 让文本模型支持图像输入,实现 Q&A、OCR 和 UI 复现等任务。
谁该装 — 在 DeepSeek Harness Web 中使用文本模型处理截图进行元素定位和多图比较的任务适合安装此插件。 对于使用原生视觉功能的模型,此插件无需额外集成。
注意 — 没发现明显的坑。默认采用作者托管免费服务,每台机器每日限额 100 次,超过时可配置为自有提供商。
锐评 — 我会安装它,因为它提供了 DeepSeek Harness 原生集成,让视觉任务在 profile 和 session 中无缝使用。
grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。
dsh-vision-toolkit 是一个 DeepSeek Harness 插件,用于补足纯文本模型处理图像时的能力:它可以围绕当前问题回答图片内容,读取长截图 OCR,定位元素坐标,提取素材,辅助还原 UI,并用像素差异检查结果。它不是只生成一段通用描述,而是把视觉证据整理成 agent 后续可以继续使用的结果。
在 DSH Web 中粘贴图片后,纯文本路由会切换到 Vision Toolkit 变体,并保留 workspace path;图片会连同本次检查的意图发送到视觉服务。默认使用无需 API key 的 Gemma 4 服务。裁剪、像素 diff、颜色分析、前景提取、SVG tracing 和 HTML screenshot 等操作在本地执行,结果可包括坐标、OCR Markdown、crop、透明 PNG、色板、可编辑 SVG、heatmap 与 JSON。
它适合做截图问答、网页或 UI 还原、长图文字提取和视觉回归检查。若现有模型已经原生支持这些视觉流程,安装它可能只是重复能力;若图片不能发送到默认视觉服务,也应先评估使用方式。免费服务有 100/day、400/day 和 20/minute 的限制。该源码仓库没有列出风险标记。
插件将 agent-vision-toolkit 接入 DSH。用户在 DSH Web 粘贴图片后,纯文本路由使用 Vision Toolkit 变体并保存 workspace path,之后可以再次引用图片。请求会带上检查原因,因此回答可聚焦错误位置、按钮颜色等具体问题,而不是只生成概括性描述。
README 记录的流程包括图片问答、元素 grounding、原图像素坐标、长截图 OCR、UI 还原、素材提取和 screenshot 对比。输出可包含 OCR Markdown、chunks、manifests、可恢复运行状态、crop、透明 PNG、color palette、editable SVG、HTML screenshot、差异百分比、排序后的区域、heatmap 和 JSON。
默认视觉服务为 Gemma 4,不需要 API key。crop、pixel diff、color analysis、foreground extraction、SVG tracing 和 HTML screenshot 在本地运行,不消耗 vision API 请求。Settings 提供真实 image-request test;仅请求 /models 不能证明模型支持图片。
Windows 的首次 isolated-runtime setup 支持 Microsoft Store Python。README 片段未给出其他配置键或独立工具命令。
免费服务限制为每客户端 100/day、全局 400/day,以及 20/minute 的突发限制。默认视觉路径依赖该服务;需要完全不发送图片的流程时,应改用本地处理覆盖的功能。
根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README
同一分类
zhu1090093659
给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。
我们跑过,装得上
Anionex
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
我们跑过,装得上
ysr666
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
我们跑过,装得上
omdsh-dev
Chrome sidebar extension that lets DeepSeek Harness operate your browser directly, no vision capabilities required. 一款 Chrome 侧边栏扩展程序,可让 DeepSeek Harness 直接操控您的浏览器,无需视觉能力。
我们跑过,装得上
oxbshw
DeepWatch, powered by Watch Skill: a local-first perception and verification stack for AI agents. Understand video, audio and screen activity, keep timestamped evidence, and independently verify what a tool or workflow actually did. MCP, CLI, REST, Web and DeepSeek Harness.
我们跑过,装得上