dsh-free-vision
FuzzySoul
免费视觉插件:纯文本模型看图 / OCR / UI / 报错分析,优先免费模型(千问 Qwen3-VL-Flash、豆包、DeepSeek-OCR),设置界面可配置。
插件索引
这些 DSH 插件同步自社区精选库和 GitHub 的 dsh-plugin topic。Star 数、最近推送时间直接取自 GitHub。
41 个插件
FuzzySoul
免费视觉插件:纯文本模型看图 / OCR / UI / 报错分析,优先免费模型(千问 Qwen3-VL-Flash、豆包、DeepSeek-OCR),设置界面可配置。
MicroHEROX
给在线模型装上本地双手:koboldcpp_run 与 koboldcpp_vision 工具把重复的文本与视觉(OCR、图像分析、对比)劳动交给本地 KoboldCpp(llama.cpp)服务器,并按需拉起与管理服务器生命周期。
TZHR-invest
Agent 可调用的视觉工具:通过你配置的任意 OpenAI 兼容视觉端点描述本地图片,支持多模型交叉核对,不内置任何密钥。
没有一行式安装命令——这个插件在一个大仓库的子目录里,也没发 npm 包。
gloryxpnv
本地优先的结构化视觉插件:图片交给本地 OpenAI 兼容 VLM,返回 JSON 证据(摘要、逐字 OCR、版面区域、实体/关系、配色、显式不确定项),带反幻觉回退与可选粘贴/上传桥;零云端成本,图片不出本机。
让 dsh 通过 grok2api 的 API 获得生成图片与视频能力。
siegfly
视觉语言网关:注册支持图片输入的 DeepSeek provider 路由,图片先由可配置 VL 模型(默认 Qwen-VL)描述成文字再发送。
xsoc1
纯文本 DeepSeek 的聊天识图插件:view_image 工具转发任意 OpenAI 兼容 VLM(本地 Ollama 或云端),对话框粘贴/拖拽的图片自动改写为 view_image 路径标记供模型查看。
Elohia
图片转文字输入插件:粘贴/拖拽图片自动转为结构化文字描述发送,给纯文本 LLM 提供图片输入接管(OpenAI 兼容视觉 API)。
Isanti2016
纯文本模型双层识图:优先本地快速 OCR(RapidOCR,离线),不足时回落视觉模型(modlens)。
LeemanCheung
GPT Image 2 `image_gen`:默认复用 Codex 订阅 OAuth,也可显式使用 API Key;显影卡片、最多 3 张 API 实时局部图、持久附件回放/灯箱/下载、纯文本模型输出和受限的凭据安全请求。
MicroHEROX
把重复的文本与视觉(OCR、图像分析、对比)劳动交给本地运行的 Unsloth Desktop(Unsloth Studio)服务器:unsloth_run 与 unsloth_vision 两个工具,纯 HTTP 客户端,不拉起也不持有任何进程。
good-boy4069
纯文本路由的透明图片护栏:贴图不再 400 卡死会话,附带 vision_analyze 工具(OCR/PDF/docx/pptx/视频)。
kaixinbaba
视觉模型路由:把附加图片经可配置模型(15+ OpenAI 兼容与 Anthropic 供应商)转译为文字,对话仍由 DeepSeek 作答。
niuniuaba
让纯文本 DeepSeek 代理在同一会话内读图:委派给视觉子代理,发送时自动把图片转为文件路径。
ruby1304
纯文本模型的视觉补全:vision_agent 工具把读图委托给可配 MiniMax/Kimi 路由的一次性子代理,另有 Codex 式输入框粘贴桥——图片在隔离上下文分析,只有文本进入主会话。
s3yf1337
让纯文本模型拥有视觉:describe_image 工具调用 dsh 模型列表中的视觉模型描述图片,走 harness 自身的 LLM 运行时。
wulusai2333
`describe_image` 视觉桥:经 opencode Zen API(凭据 `OPENCODE_GO_API_KEY`,免费线路优先、付费兜底)把图片发给 mimo-v2.5、返回文字描述给纯文本模型,原生格式直发,SVG/TIFF/HEIC 等格式经 ImageMagick 自动转码。