DSH Marketplace
EN

ModLens:视觉与 OCR 插件

liustack/modlens

为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

4,051123TypeScriptMIT源码

安装

把 modlens 装进 DeepSeek Harness

npm 方式

直接拉已发布的 tarball,不用克隆整个仓库,也不需要额外配置。如果你用的是别的 profile,把 `web` 换成对应的名字。

GitHub 方式 · npm 包

从 GitHub 装会执行项目自己的构建脚本,而 pnpm 默认拦着不让跑——先跑一次这条命令,pnpm 会打印出要加到 ~/.dsh/profiles/web/pnpm-workspace.yaml 里 `allowBuilds` 下面的那个 key。

我们跑过之后

我们跑过,装得上

这里每条命令都在一次性容器里、对着干净 profile 真跑过,结果取自 harness 自己的记录,不是读源码猜的。 最近一次 11 天前.

挂进你的 README

实测可装 — dshmarketplace

给维护者的:badge 取这条 listing 最近一次 sandbox 实测的结果,重跑之后它自己会变,读者点开就是这页的完整记录。

安装前须知

装 modlens 之前,先看这几条

  • 源码在这里: liustack/modlens——已进入社区精选库,DSH 自带的插件市场就是从这儿装的。
  • 开源协议:MIT。
  • 自动识别到:终端执行。授权之前请先读一遍源码。
  • 被收录在这里不代表通过了安全审计。插件是带着你 agent 的权限在跑。

AI 锐评

是什么 — ModLens 为文本-only 模型提供视觉桥接,让粘贴的图片获得 OCR、布局和语义的结构化 JSON 证据。

谁该装 — 在使用 DeepSeek Harness 文本-only 模型(如 DeepSeek-V4)时需要分析粘贴图片的情况适合。 对于使用原生多模态模型的用户,此插件并非必需,因为原生模型会保持内置粘贴能力。

注意 — 沙箱实测通过,在全新 profile 里装上,并被 harness 注册进 profile。未发现明显的坑。

锐评 — 我会安装它,因为它输出结构化视觉证据且无需保存图片到文件路径。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。

modlens 是做什么的

Image tiles pass through a lens and provider channels, converging into structured data blocks.

modlens 是一个 DeepSeek Harness 插件,为无法直接处理图片的 DeepSeek 和 GLM 纯文本模型提供视觉读取通道。它接收聊天中粘贴的图片或图片路径,通过 modlens_read_image 生成结构化 JSON 证据,包括 OCR、按阅读顺序排列的版面区域、实体和关系。普通粘贴流程中,宿主会把图片放入私有临时文件,并将路径交给 composer;选择 (modlens vision) 模型后,缩略图仍保留在消息里,插件会在请求时把图片转换为证据。它会发现元数据明确标记为纯文本模型的 provider route,并为其创建包装后的 (modlens vision) 条目;原生支持视觉的模型则继续使用自身的粘贴处理。

它适合需要读取截图、文档或其他图片,但当前模型只有文本能力的 agent,前提是至少有一个可用的视觉引擎。README 说明它可以使用 Gemini API、OpenAI-compatible endpoint、Anthropic API,或复用 Claude Code、Codex、OpenCode、Pi 中已有的登录。终端访问需要审查:配置和运行过程中可能检查本地 harness CLI,并调用获准使用的登录路线;粘贴图片也会经过本地临时文件。如果模型本身已经支持视觉、图片不能发送到外部引擎,或没有可用的 API 与本地 CLI,就不应使用它。

modlens 的文档

行为说明

modlens_read_image 是提供给纯文本模型的原生工具。粘贴图片时,宿主可以把私有临时文件路径放入 composer;选择 (modlens vision) 条目时,缩略图会保留在消息中,并在请求时转换为证据。聊天中也可以直接提供图片路径。输出用于让模型依据图片内容回答,并包含 OCR、版面区域、实体和关系等结构化信息。

模型路由

插件只接管元数据明确确认是纯文本 DeepSeek 或 GLM 模型的 provider route,并为每条路线添加包装后的 (modlens vision) 条目。已确认的视觉模型会自动排除,未确认的模型保持不变。README 给出的标准条目包括 DeepSeek-V4-Flash (modlens vision) 和 DeepSeek-V4-Pro (modlens vision);opencode-go、zai 等额外路线也可以获得自己的条目。

视觉引擎

README 记录了六个内置 provider 和四个可复用的本地 agent CLI。已列出的 provider 包括需要 Gemini API key 的 gemini-api,需要 key、baseUrl、model 的 openai,以及需要 Anthropic API key 的 anthropic。antigravity-cli 在登录后可作为无 key 通道。复用 Claude Code、Codex、OpenCode 或 Pi 的登录前会询问许可;读取结果会标明消耗了哪一方的 quota。

终端访问

配置会检查本地可用凭据,并在复用前征求许可。README 给出的登录命令是 agy。因此需要同时审查本地 CLI、凭据和发送给所选 provider 的图片数据。

根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README

同一分类

modlens 的同类插件

7.6k

给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。

我们跑过,装得上

npm 包TypeScript15 天前

AI 锐评

dsh-tool-describe-image

是什么 — dsh-tool-describe-image 是纯文本模型的图像描述工具。支持将本地路径、URL或附件发送至配置的 OpenAI 兼容视觉端点,仅返回文本进入会话。

谁该装 — 在使用 DeepSeek Harness 的纯文本模型处理图像附件时,用户适合安装此插件。 使用支持原生视觉模型的用户可以选择不安装,因为他们的模型有内置图像处理能力。

注意 — 在全新 profile 中安装并注册测试通过,未发现明显的坑。 静态检查未发现任何问题。

锐评 — 我会装,因为它让纯文本模型在会话中处理图像输入。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码

为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

我们跑过,装得上

GitHub 源码Python1 个月前

AI 锐评

agent-vision-toolkit

是什么 — agent-vision-toolkit 为文本模型提供视觉工具箱和技能。

谁该装 — 在 DeepSeek Harness 中使用文本模型进行需要图片理解的编码任务时适合安装此插件。不适合系统已允许原生图像工具的用户。

注意 — 从源码安装时需要先手动放行它的构建脚本。安装会执行 shell 命令。沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。未发现明显的坑。

锐评 — 我装了,因为它已在 DeepSeek 和 Claude Code 会话中验证。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

我们跑过,装得上

npm 包JavaScript昨天

AI 锐评

dsh-vision-router

是什么 — dsh-vision-router 为 DeepSeek Harness 文本代理提供免费视觉能力,支持像素工具调用。

谁该装 — 当代理需要 vision grounding 或 vision crop 操作时,此插件适合使用。 如果代理本身支持多模态输入而非仅文本模式,则无需此插件。

注意 — 没发现明显的坑。沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。插件会执行 shell 命令,但未引发任何故障。

锐评 — 我会装它,因为它支持连续多步图像处理直到任务完成。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1详情

让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。

我们跑过,装得上

npm 包TypeScript4 天前

AI 锐评

dsh-vision-toolkit

是什么 — DSH Vision Toolkit 让文本模型支持图像输入,实现 Q&A、OCR 和 UI 复现等任务。

谁该装 — 在 DeepSeek Harness Web 中使用文本模型处理截图进行元素定位和多图比较的任务适合安装此插件。 对于使用原生视觉功能的模型,此插件无需额外集成。

注意 — 没发现明显的坑。默认采用作者托管免费服务,每台机器每日限额 100 次,超过时可配置为自有提供商。

锐评 — 我会安装它,因为它提供了 DeepSeek Harness 原生集成,让视觉任务在 profile 和 session 中无缝使用。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
详情

dsh-browser

omdsh-dev

705

Chrome sidebar extension that lets DeepSeek Harness operate your browser directly, no vision capabilities required. 一款 Chrome 侧边栏扩展程序,可让 DeepSeek Harness 直接操控您的浏览器,无需视觉能力。

我们跑过,装得上

GitHub 源码TypeScript10 天前

AI 锐评

dsh-browser

是什么 — 这是一个 Chrome 侧边栏扩展,允许 DeepSeek Harness 直接操控浏览器页面,无需视觉能力。

谁该装 — 使用 deepseek-v4-flash 模型执行浏览器导航、表单填充和标签管理任务的用户适合安装它。无需浏览器交互的用户不必装它。

注意 — 安装时需要从源码构建并手动放行构建脚本。沙箱中在全新 profile 注册成功,未发现明显的坑。性能基准显示平均端到端延迟 5.32 秒,少于匹配的 Playwright 基线。

锐评 — 我装它,因为它在真实浏览器会话中操作而非模拟,能保留登录状态和会话。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
2源码
396

DeepWatch, powered by Watch Skill: a local-first perception and verification stack for AI agents. Understand video, audio and screen activity, keep timestamped evidence, and independently verify what a tool or workflow actually did. MCP, CLI, REST, Web and DeepSeek Harness.

我们跑过,装得上

GitHub 源码Python16 天前

AI 锐评

watch-skill

是什么 — watch-skill 插件为 DeepSeek Harness 中的 AI 代理提供视频音频屏幕活动的感知,使用时间戳证据保存,并通过 THE LOOP 独立验证代理所做工作。

谁该装 — 在 DeepSeek Harness 中处理浏览器流或生成的视频时,需要验证代理效果的用户适合安装 watch-skill。 对于不涉及动态屏幕或视频输入的用户,不需要安装 watch-skill。

注意 — 全新 profile 安装并被 DeepSeek Harness 注册,沙箱实测通过。 插件会执行 shell 命令。 未发现明显的坑。

锐评 — 我会装它,因为它能驱动浏览器并证明每个动作的效果,这在代理工作中是必要的。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码