DSH Marketplace
EN

modlens

liustack/modlens

为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

2,32561TypeScriptMIT源码

安装

把 modlens 装进 DeepSeek Harness

npm 方式

直接拉已发布的 tarball,不用克隆整个仓库,也不需要额外配置。如果你用的是别的 profile,把 `web` 换成对应的名字。

GitHub 方式 · npm 包

从 GitHub 装会执行项目自己的构建脚本,而 pnpm 默认拦着不让跑——先跑一次这条命令,pnpm 会打印出要加到 ~/.dsh/profiles/web/pnpm-workspace.yaml 里 `allowBuilds` 下面的那个 key。

安装前须知

装 modlens 之前,先看这几条

  • 源码在这里: liustack/modlens——已进入社区精选库,DSH 自带的插件市场就是从这儿装的。
  • 开源协议:MIT。
  • 自动识别到:终端执行。授权之前请先读一遍源码。
  • 被收录在这里不代表通过了安全审计。插件是带着你 agent 的权限在跑。

modlens 是做什么的

Image tiles pass through a lens and provider channels, converging into structured data blocks.

modlens 是一个 DeepSeek Harness 插件,为无法直接处理图片的 DeepSeek 和 GLM 纯文本模型提供视觉读取通道。它接收聊天中粘贴的图片或图片路径,通过 modlens_read_image 生成结构化 JSON 证据,包括 OCR、按阅读顺序排列的版面区域、实体和关系。普通粘贴流程中,宿主会把图片放入私有临时文件,并将路径交给 composer;选择 (modlens vision) 模型后,缩略图仍保留在消息里,插件会在请求时把图片转换为证据。它会发现元数据明确标记为纯文本模型的 provider route,并为其创建包装后的 (modlens vision) 条目;原生支持视觉的模型则继续使用自身的粘贴处理。

它适合需要读取截图、文档或其他图片,但当前模型只有文本能力的 agent,前提是至少有一个可用的视觉引擎。README 说明它可以使用 Gemini API、OpenAI-compatible endpoint、Anthropic API,或复用 Claude Code、Codex、OpenCode、Pi 中已有的登录。终端访问需要审查:配置和运行过程中可能检查本地 harness CLI,并调用获准使用的登录路线;粘贴图片也会经过本地临时文件。如果模型本身已经支持视觉、图片不能发送到外部引擎,或没有可用的 API 与本地 CLI,就不应使用它。

modlens 的文档

行为说明

modlens_read_image 是提供给纯文本模型的原生工具。粘贴图片时,宿主可以把私有临时文件路径放入 composer;选择 (modlens vision) 条目时,缩略图会保留在消息中,并在请求时转换为证据。聊天中也可以直接提供图片路径。输出用于让模型依据图片内容回答,并包含 OCR、版面区域、实体和关系等结构化信息。

模型路由

插件只接管元数据明确确认是纯文本 DeepSeek 或 GLM 模型的 provider route,并为每条路线添加包装后的 (modlens vision) 条目。已确认的视觉模型会自动排除,未确认的模型保持不变。README 给出的标准条目包括 DeepSeek-V4-Flash (modlens vision)DeepSeek-V4-Pro (modlens vision)opencode-gozai 等额外路线也可以获得自己的条目。

视觉引擎

README 记录了六个内置 provider 和四个可复用的本地 agent CLI。已列出的 provider 包括需要 Gemini API key 的 gemini-api,需要 keybaseUrlmodelopenai,以及需要 Anthropic API key 的 anthropicantigravity-cli 在登录后可作为无 key 通道。复用 Claude Code、Codex、OpenCode 或 Pi 的登录前会询问许可;读取结果会标明消耗了哪一方的 quota。

终端访问

配置会检查本地可用凭据,并在复用前征求许可。README 给出的登录命令是 agy。因此需要同时审查本地 CLI、凭据和发送给所选 provider 的图片数据。

根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README

同一分类

modlens 的同类插件

让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

npm 包TypeScript今天

为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

npm 包JavaScript今天

dsh-vision

linenxi-ctrl

11

外挂识图插件:鲸鱼按钮配置面板、图片识图自动回传、模型自主截图识图工具。

npm 包JavaScript昨天
9

DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经 OpenAI 兼容 VLM 转译成文字,再交给纯文本的 DeepSeek 作答——有 key 自动走快速通道(默认 qwen3.7-flash,支持百炼/智谱/OpenRouter 等任意 OpenAI 兼容端点),无 key 自动探测本地 Ollama(零配置,图片不出本机)。

npm 包JavaScript今天
9

给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。

npm 包TypeScript今天

Gemini-Eyes

ConsoleSun

6

接入 gemini.google.com 的 MCP 桥:图片/视频视觉识别、Imagen 生图、Veo 生视频与历史对话管理,复用浏览器登录态,无需 API Key。

GitHub 源码Python2 天前