DSH Marketplace
EN

插件索引

视觉与多模态

这些 DSH 插件同步自社区精选库和 GitHub 的 dsh-plugin topic。Star 数、最近推送时间直接取自 GitHub。

306 个插件

99% 实测可装

7.6k

给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。

我们跑过,装得上

npm 包TypeScript16 天前

AI 锐评

dsh-tool-describe-image

是什么 — dsh-tool-describe-image 是纯文本模型的图像描述工具。支持将本地路径、URL或附件发送至配置的 OpenAI 兼容视觉端点,仅返回文本进入会话。

谁该装 — 在使用 DeepSeek Harness 的纯文本模型处理图像附件时,用户适合安装此插件。 使用支持原生视觉模型的用户可以选择不安装,因为他们的模型有内置图像处理能力。

注意 — 在全新 profile 中安装并注册测试通过,未发现明显的坑。 静态检查未发现任何问题。

锐评 — 我会装,因为它让纯文本模型在会话中处理图像输入。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码

modlens

liustack

4.1k

为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

我们跑过,装得上

npm 包TypeScript3 天前

AI 锐评

modlens

是什么 — ModLens 为文本-only 模型提供视觉桥接,让粘贴的图片获得 OCR、布局和语义的结构化 JSON 证据。

谁该装 — 在使用 DeepSeek Harness 文本-only 模型(如 DeepSeek-V4)时需要分析粘贴图片的情况适合。 对于使用原生多模态模型的用户,此插件并非必需,因为原生模型会保持内置粘贴能力。

注意 — 沙箱实测通过,在全新 profile 里装上,并被 harness 注册进 profile。未发现明显的坑。

锐评 — 我会安装它,因为它输出结构化视觉证据且无需保存图片到文件路径。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1详情

为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

我们跑过,装得上

GitHub 源码Python1 个月前

AI 锐评

agent-vision-toolkit

是什么 — agent-vision-toolkit 为文本模型提供视觉工具箱和技能。

谁该装 — 在 DeepSeek Harness 中使用文本模型进行需要图片理解的编码任务时适合安装此插件。不适合系统已允许原生图像工具的用户。

注意 — 从源码安装时需要先手动放行它的构建脚本。安装会执行 shell 命令。沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。未发现明显的坑。

锐评 — 我装了,因为它已在 DeepSeek 和 Claude Code 会话中验证。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

我们跑过,装得上

npm 包JavaScript昨天

AI 锐评

dsh-vision-router

是什么 — dsh-vision-router 为 DeepSeek Harness 文本代理提供免费视觉能力,支持像素工具调用。

谁该装 — 当代理需要 vision grounding 或 vision crop 操作时,此插件适合使用。 如果代理本身支持多模态输入而非仅文本模式,则无需此插件。

注意 — 没发现明显的坑。沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。插件会执行 shell 命令,但未引发任何故障。

锐评 — 我会装它,因为它支持连续多步图像处理直到任务完成。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1详情

让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。

我们跑过,装得上

npm 包TypeScript5 天前

AI 锐评

dsh-vision-toolkit

是什么 — DSH Vision Toolkit 让文本模型支持图像输入,实现 Q&A、OCR 和 UI 复现等任务。

谁该装 — 在 DeepSeek Harness Web 中使用文本模型处理截图进行元素定位和多图比较的任务适合安装此插件。 对于使用原生视觉功能的模型,此插件无需额外集成。

注意 — 没发现明显的坑。默认采用作者托管免费服务,每台机器每日限额 100 次,超过时可配置为自有提供商。

锐评 — 我会安装它,因为它提供了 DeepSeek Harness 原生集成,让视觉任务在 profile 和 session 中无缝使用。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
详情

dsh-browser

omdsh-dev

705

Chrome sidebar extension that lets DeepSeek Harness operate your browser directly, no vision capabilities required. 一款 Chrome 侧边栏扩展程序,可让 DeepSeek Harness 直接操控您的浏览器,无需视觉能力。

我们跑过,装得上

GitHub 源码TypeScript11 天前

AI 锐评

dsh-browser

是什么 — 这是一个 Chrome 侧边栏扩展,允许 DeepSeek Harness 直接操控浏览器页面,无需视觉能力。

谁该装 — 使用 deepseek-v4-flash 模型执行浏览器导航、表单填充和标签管理任务的用户适合安装它。无需浏览器交互的用户不必装它。

注意 — 安装时需要从源码构建并手动放行构建脚本。沙箱中在全新 profile 注册成功,未发现明显的坑。性能基准显示平均端到端延迟 5.32 秒,少于匹配的 Playwright 基线。

锐评 — 我装它,因为它在真实浏览器会话中操作而非模拟,能保留登录状态和会话。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
2源码
396

DeepWatch, powered by Watch Skill: a local-first perception and verification stack for AI agents. Understand video, audio and screen activity, keep timestamped evidence, and independently verify what a tool or workflow actually did. MCP, CLI, REST, Web and DeepSeek Harness.

我们跑过,装得上

GitHub 源码Python16 天前

AI 锐评

watch-skill

是什么 — watch-skill 插件为 DeepSeek Harness 中的 AI 代理提供视频音频屏幕活动的感知,使用时间戳证据保存,并通过 THE LOOP 独立验证代理所做工作。

谁该装 — 在 DeepSeek Harness 中处理浏览器流或生成的视频时,需要验证代理效果的用户适合安装 watch-skill。 对于不涉及动态屏幕或视频输入的用户,不需要安装 watch-skill。

注意 — 全新 profile 安装并被 DeepSeek Harness 注册,沙箱实测通过。 插件会执行 shell 命令。 未发现明显的坑。

锐评 — 我会装它,因为它能驱动浏览器并证明每个动作的效果,这在代理工作中是必要的。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

Photo-to-editorial Skill with Original (Codex) and V3 Adaptive editions. Scene-aware layouts, creative controls, Strict Fidelity composition, structured QA, and a validated DeepSeek Harness capability path.

我们跑过,装得上

GitHub 源码Python24 天前

AI 锐评

photo-abstract-editorial

是什么 — 将照片转化为带原图、抽象面板和英文题目的编辑构图。

谁该装 — 使用 DeepSeek Harness 进行照片编辑任务时,若需场景自适应布局和创意控制,此插件适合。 如果追求固定不变的 Codex 工作流,则无需此插件。

注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。未发现明显的坑。

锐评 — 我会装它,因为它提供了 validated DeepSeek Harness capability path。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码
90

面向 DSH Web GUI 的 AI 生图插件:通过可配置的 OpenAI 兼容端点(gpt-image-2 / gpt-image-1 / dall-e-3)实现文生图与图生图,提供 api_url/api_key 设置卡片与侧边栏分栏生图工作台。

我们跑过,装得上

npm 包TypeScript6 天前

AI 锐评

dsh-imagegen

是什么 — 集成 DeepSeek Harness Web GUI 的 AI 图像生成插件,支持文生图和图生图。

谁该装 — 在使用 DeepSeek Harness Web GUI 进行图像生成时,用户适合安装此插件。 不使用 DSH 宿主进程代理 API 的用户不需要此插件。

注意 — 沙箱实测通过,在全新 profile 里装上并被 harness 注册进 profile。需在设置卡片中配置 API 地址和密钥。没发现明显的坑。

锐评 — 我会装它,因为它支持跨设备共享历史记录。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-comfyui

fandc520

80

让 DeepSeek Harness 的 Agent 直接驱动本地或远程 ComfyUI:comfyui_run / comfyui_object_info / comfyui_workflow 工具生成与编辑图像、视频,附带工作流库(图工作流提取:按分量 / 主流程 / 整体)、加载区分辨率自动匹配、实时队列、SDXL 与 Wan 2.1 模板、配套 skill 与同源媒体代理。

我们跑过,装得上

npm 包TypeScript17 天前

AI 锐评

dsh-comfyui

是什么 — dsh-comfyui 插件让 DeepSeek Harness 的 Agent 驱动本地或远程 ComfyUI 服务器生成图像和视频,并提供工作流库和技能包管理。

谁该装 — 如果你使用 DeepSeek Harness 进行图像生成或视频合成任务,需要 Agent 直接执行 ComfyUI 工作流,那么这个插件适合你的场景。 如果你的任务不需要 ComfyUI 后端或其他生成工具,则可以不安装它。

注意 — 安装后无需额外配置,在全新 profile 中成功注册并被 Harness 注册使用。没发现明显的坑。

锐评 — 我会装它,因为它支持 Agent 编写技能包,让经验在不同会话中复用,避免重复配置复杂工作流。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码

Community Docker and Kubernetes packaging for DeepSeek Harness (@deepseek-ai/dsh), with a hardened image, Compose stack, Helm chart, Web UI, and headless CLI.

我们跑过,装得上

GitHub 源码Shell23 天前

AI 锐评

deepseek-harness-docker

是什么 — DeepSeek Harness Docker 提供 hardened image、Compose stack、Helm chart、Web UI 和 headless CLI,在 Node.js 24 运行时使用官方 npm 发行物部署。

谁该装 — 当需要在 Docker 容器中运行 DeepSeek Harness Web UI 并持久化 profile、sessions 和 workspace 时适合安装此方案。那些仅需 headless 模式或无需容器边界处理的用户不适合安装此方案。

注意 — 从源码安装时需要先手动放行构建脚本。会执行 shell 命令。沙箱实测在全新 profile 里通过,并被 harness 注册进 profile。

锐评 — 我会装它,因为它处理了官方发行物在容器中的 PTY 监听地址等边界,而上游暂无容器方案。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-design-qa

sunxin-ai

44

给纯文本模型的设计稿保真判定:`deepseek_vision` 工具从任意 OpenAI 兼容视觉路由借来一只眼,让模型判断实现与设计稿是否一致——并附上支撑该判定的基准(4 组夹具、23 处注入缺陷、逐格原始输出)与其依赖的提问纪律。

我们跑过,装得上

npm 包JavaScript24 天前

AI 锐评

dsh-design-qa

是什么 — dsh-design-qa 插件通过 deepseek_vision 工具让纯文本模型读取图片。

谁该装 — 如果你需要在 DeepSeek Harness 中让模型判断实现是否与 mock 匹配,就适合安装此插件。 如果你没有 OpenAI-compatible vision route,就无法使用此插件。

注意 — 沙箱测试在全新 profile 里装上,并被 harness 注册进 profile。插件会执行 shell 命令。

锐评 — 前提是模型支持 tool calling,我会装它,因为它包含了判断所需的基准和提问规范。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码
36

给纯文本模型的"读图"能力:图片降分辨率+降色深+结构/色彩指纹渲染成文本网格喂回对话,模型像多模态一样自主缩放、取样、OCR 读图;纯本地零外部模型依赖,附读图方法论 skill 与可选 PaddleOCR。

我们跑过,装得上

npm 包JavaScript12 天前

AI 锐评

picturereader

是什么 — picturereader 将图片降分辨率降色深生成文本网格供纯文本模型自主看图。

谁该装 — 使用 DeepSeek 等纯文本模型分析图像时缺读图能力适合安装 picturereader。 对于执行纯文本任务的用户来说无需安装,因为他们不需要视觉信息输入。

注意 — 沙箱测试通过,安装并被 DeepSeek Harness 注册进 profile 成功。 ZCode 版存在 MCP 进程通信额外开销。 没发现其他明显问题。

锐评 — 我会装它,因为它提供了经过大量真实图片迭代验证的图像阅读方法论技能,能让文本模型自主验证图像内容。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

DSH-vison

hisence999

35

DSH-vison 是一个 DeepSeek Harness 插件,为不支持多模态的模型补充图片理解能力。agent 仍可直接接收图片;插件调用 DSH 中已配置的视觉模型生成文字描述,再把描述交给纯文本模型。原始图片会保留在会话历史中,UI 仍可显示图片;模型侧则通过替换后的消息看到描述文字。readimage 工具也会采用同样的处理方式,多模态模型则自动放行,不重复识别。

我们跑过,装得上

GitHub 源码JavaScript1 个月前

AI 锐评

DSH-vison

是什么 — DSH-vison 为纯文本模型提供图片理解,通过配置的视觉模型将图像转为描述文字。

谁该装 — 当你使用纯文本模型处理包含图片的用户消息时,需要图片理解能力。 如果你使用支持图片的模型,可以不安装此插件。

注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。没发现明显的坑。

锐评 — 我会安装它,因为沙箱测试通过且安装后全局生效。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
LINUX DO1详情

dsh-vision

william-jin-cmu

30

dsh 插件:给纯文本 DeepSeek 加视觉——view_image 工具桥接任意 OpenAI 兼容 VLM(默认智谱免费档,实测 4 厂商 10 模型)

我们跑过,装得上

GitHub 源码TypeScript1 个月前

AI 锐评

dsh-vision

是什么 — dsh-vision 插件注册 view_image 工具桥接 OpenAI 兼容 VLM,为纯文本 DeepSeek 提供图片分析。

谁该装 — 使用 DeepSeek-V4-Flash 在 DSH web 上描述桌面图片时需要安装此插件。 不需视觉分析的用户可以不装此插件。

注意 — 沙箱实测通过:在全新 profile 里装上并被 harness 注册进 profile。 从 GitHub 源码安装需要手工链接宿主依赖。 没发现明显的坑。

锐评 — 我会装它,因为它让 DeepSeek-V4-Flash 能看图描述,但前提是手动配置后端 apiKey。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-directorx

LaplaceYoung

28

DirectorX as a DeepSeek Harness plugin: AI video/image/audio skills, knowledge corpus, and configurable vision/image/video/audio model tools.

我们跑过,装得上

GitHub 源码JavaScript28 天前

AI 锐评

dsh-directorx

是什么 — DirectorX 是 DeepSeek Harness 插件,集成 AI 视频图像音频生成编辑和知识库工具。

谁该装 — 在 DeepSeek Harness 中制作多镜头视频时,需要分镜板和角色锚点规划,这个插件提供无限画布和本地剪辑能力。 对于仅单次图像生成且不涉及画布任务的用户,不需要 DirectorX 提供的分镜确认和画布工具。

注意 — 实测通过:在全新 profile 里装上,并被 harness 注册进 profile。 没发现明显的坑。

锐评 — 我会装它,因为它允许本地 ffmpeg 剪辑无限重跑而无需二次生成,但前提是确认后再落到画布。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-clawrouter

BlockRunAI

21

A safety gate for DeepSeek Harness: a stronger model reviews dangerous tool calls before they run. Plus vision and 67 models from one wallet, paid per request over x402.

我们跑过,装得上

npm 包TypeScript26 天前

AI 锐评

dsh-clawrouter

是什么 — DeepSeek Harness 插件,在代理执行危险工具调用前由更强模型审查。

谁该装 — 在使用 DeepSeek Harness 执行 rm -rf ~ 这样的高风险命令时,使用 anthropic/claude-opus-5 模型审查代理的决定。 对于不希望通过 x402 支付模型请求费用的用户,此插件不适用。

注意 — 实测在全新 profile 中安装后,并被 DeepSeek Harness 注册进 profile,通过沙箱测试。没发现明显的坑。

锐评 — 换成我,我不会安装它,因为它仅审查危险命令而不审查普通工作。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

我们跑过,装得上

GitHub 源码Python1 个月前

AI 锐评

dsh-media-skills

是什么 — 为 DeepSeek Harness 提供免费图像读取与生成技能,支持文本会话粘贴图片。

谁该装 — 在文本会话中缺少图像能力时适合安装此插件。 如果只想使用付费模型的用户可以不安装此插件。

注意 — 沙箱实测通过,在全新 profile 里装上,并被 harness 注册进 profile。没发现明显的坑。

锐评 — 我会安装它,因为它提供了免费图像处理且支持结构化证据输出。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码

dsh-media-skills

akqwpeter-prog

18

面向纯文本模型的免费视觉桥与生图:粘贴读图、GLM-4V-Flash 与 Gemini 引擎故障转移、modlens 同款结构化证据输出,并自动播种免费视觉模型路由。

我们跑过,装得上

GitHub 源码Python10 天前

AI 锐评

dsh-media-skills

是什么 — 为 DeepSeek Harness 提供图像粘贴读取和免费图像生成功能。

谁该装 — 使用文本模型进行图像分析或内容创作时,此插件能通过粘贴图像获取描述并支持生成。 如果你的工作仅限于纯文本推理而无图像输入需求,则无需安装。

注意 — 安装从 GitHub 源码进行时需手动允许构建脚本。实测在全新 profile 中成功注册并被 Harness 注册。没发现明显的坑。

锐评 — 我会装它,因为它填补了文本模型的视觉缺口,但前提是用户能获取 Zhipu 和 SiliconFlow 的 API 密钥。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码

describe_image 模型工具:让纯文本模型通过视觉语言模型获得图像理解能力。

没有一行式安装命令——这个插件在一个大仓库的子目录里,也没发 npm 包。

GitHub 源码1 个月前

AI 锐评

dsh-tool-describe-image

是什么 — 为纯文本模型提供图像理解能力,通过 vision-language model 暴露为 describe_image 工具。

谁该装 — 如果你在 DeepSeek Harness 的纯文本模型会话中处理图片描述,需要图像理解支持。 如果你使用 vision-language 模型直接分析图像,则此插件可作为补充。

注意 — 没发现明显的坑。 沙箱实测未完成。

锐评 — 如果需要图像理解,我会安装此插件,因为它是文本模型的视觉扩展。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码
16

给纯文本模型装上眼睛:把用户图片转发给任意 OpenAI 兼容的视觉模型生成描述,并在 Web UI 右侧面板展示结果。

我们跑过,装得上

npm 包TypeScript29 天前

AI 锐评

dsh-visual-plugin

是什么 — 此插件为文本模型提供视觉处理能力,通过转发用户上传的图片至兼容的视觉模型,并在 Web UI 右侧面板显示描述。

谁该装 — 当你使用文本模型执行图像分析或视觉描述相关的聊天任务时,此插件能补充缺失的图像理解功能。纯文本对话或不涉及图像上传的用户无需安装此插件。

注意 — 沙箱测试通过:在全新 profile 中成功安装并注册进 Harness。配置端点、模型和密钥后测试连接,未发现运行中的问题。

锐评 — 我会安装它,因为它桥接了文本模型与视觉模型处理图片,但前提是后端支持 OpenAI 兼容的视觉 API。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码
14

DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经官方 deepseek-v4-flash-vision-exp 原生识图转译,再交给纯文本的 DeepSeek 作答(纯文本 V4-Pro 也能看图);支持任意 OpenAI 兼容 VLM 与本地 Ollama 作为备选。

我们跑过,装得上

npm 包JavaScript1 个月前

AI 锐评

dsh-vision-proxy

是什么 — 此插件注册 deepseek-vision 路由,将 GUI 附加图片转译为文字后再发送给纯文本 DeepSeek 模型。

谁该装 — 在 DeepSeek Harness GUI 中附加图片的用户可以安装此插件实现图像识别。使用官方视觉模型的用户无需安装,因为官方已支持多模态。

注意 — 在全新 profile 中安装并被 harness 注册后能正常运行。安装时会询问是否有 VLM API key,非交互环境自动跳过。没发现明显的坑。

锐评 — 我会装它,因为它桥接了纯文本模型的图像识别能力,但前提是使用非官方视觉模型。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-docs

Sqhao-O

14

Fully local document intelligence for DeepSeek Harness. Parse PDF, Office files, images, and scanned documents with offline OCR. | DeepSeek Harness 全本地文档智能插件,支持 PDF、Office、图片与离线 OCR

我们跑过,装得上

npm 包TypeScript1 个月前

AI 锐评

dsh-docs

是什么 — DeepSeek Harness 插件,提供本地文档智能解析,支持 PDF、Office 文件及图片离线 OCR。

谁该装 — 在处理本地 PDF 或 Office 文件的 DeepSeek Harness 项目中适合安装此插件。 如果你需要远程 HTTP 服务支持时可跳过此插件。

注意 — 安装过程会执行 shell 命令。实测在全新 profile 中通过沙箱测试并成功注册。没发现明显的坑。

锐评 — 前提是使用 Windows x64 时它能提供完整 OCR 支持,我会装它。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

给纯文本主模型加可配置识图模型:vision_read_image 工具、输入框识图模型选择器,以及纯文本路由的图片自动转文字。

我们跑过,装得上

GitHub 源码JavaScript22 天前

AI 锐评

dsh-vision-opencode

是什么 — DSH 插件通过视觉模型将图片自动转换为文本,供纯文本 LLM 使用。

谁该装 — 纯文本模型用户在聊天中处理图片时适合安装此插件。 支持图片输入的多模态模型用户可继续使用原生图片能力,无需此插件。

注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。安装脚本会执行 shell 命令,且卸载前需备份图片会话。没发现明显的坑。

锐评 — 我会装它,因为它不需要切换主模型就能处理图片,且沙箱测试通过。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码