DSH Marketplace
EN

dsh-ears

WizisCool/dsh-ears

给 DSH 加语音输入:转写可以走浏览器原生 Web Speech、本机 Whisper、Groq、阿里云百炼,或任意 OpenAI 兼容接口;转完能用 dsh 里已经接好的模型润色,提示词自定义。出来的是可编辑草稿,手动发送,不会替你说话。默认快捷键 Ctrl+Shift+Space。

安装

把 dsh-ears 装进 DeepSeek Harness

npm 方式

直接拉已发布的 tarball,不用克隆整个仓库,也不需要额外配置。如果你用的是别的 profile,把 `web` 换成对应的名字。

GitHub 方式 · npm 包

从 GitHub 装会执行项目自己的构建脚本,而 pnpm 默认拦着不让跑——先跑一次这条命令,pnpm 会打印出要加到 ~/.dsh/profiles/web/pnpm-workspace.yaml 里 `allowBuilds` 下面的那个 key。

安装前须知

装 dsh-ears 之前,先看这几条

  • 源码在这里: WizisCool/dsh-ears——从社区帖子人工收录,没有进入 DSH 自带市场的那个精选库。
  • 开源协议:MIT。
  • 被收录在这里不代表通过了安全审计。插件是带着你 agent 的权限在跑。

dsh-ears 是做什么的

Sound waves flow through transcription and polishing channels into an editable draft.

dsh-ears 是一个 DeepSeek Harness 插件,为 Web UI 增加语音输入。按下默认快捷键 Ctrl+Shift+Space 或点击麦克风后,插件把录音交给所选转写后端:浏览器原生 Web Speech、本机 whisper CLI、Groq、阿里云百炼,或指定的 OpenAI 兼容 /audio/transcriptions 接口。转写结果先放进输入框,成为可修改的草稿,必须由人工确认并发送,不会替 agent 自动发言。

它也可以调用 dsh → 设置 → 模型 中已经配置的模型进行润色。插件保存所选提供方、模型名和提示词,并复用 DSH 已有的 LLM key;润色失败或取消时保留原始转写。这个设计适合需要口述输入、但不希望语音直接触发会话发送的场景。

如果音频不能离开本机,远程 Groq、阿里云百炼或自定义接口就不合适;本地方案还要求预装 openai-whisper。Web Speech 依赖 Chromium 内核浏览器,且音频可能由浏览器厂商处理。本机 Whisper 在停止录音后才开始转写,较大的模型纯靠 CPU 也可能很慢。运行插件需要 DeepSeek Harness 0.1.0-rc.6rc.7,以及 Node.js ^22.19.0 || >=24.0.0

dsh-ears 的文档

行为说明

刷新 Web UI 后,输入框右侧会出现麦克风图标。默认使用 Ctrl+Shift+Space 录音,处理流程为“录音→转写→可选润色→可编辑草稿→手动发送”。草稿不会自动发送。润色可去除口头禅、修正 ASR 错字,也能处理自我纠正和口头列举;润色失败或取消时保留原始转写。

转写后端

后端 工作方式 要求
Web Speech 浏览器实时识别 Chromium 内核浏览器;音频可能经浏览器厂商处理
本地 Whisper 停止录音后由 Host 调用本机 whisper CLI 预装 openai-whisper,并在设置页下载模型
Groq Host 调用 Groq Whisper API Groq API key
阿里云百炼 使用 DashScope 同步转写 HTTPS 源站、API key、模型名;单次最多 300 秒
自定义 OpenAI 兼容 向指定端点发送 POST 端点、API key、模型名,并提供 /audio/transcriptions

Whisper 权重不随插件打包。免费额度和限流以提供商最新文档为准。

润色配置

润色模型从 dsh → 设置 → 模型 的已有列表中选择。插件保存提供方、模型名和提示词,LLM key 复用 DSH 配置。提示词留空时使用内置默认值,可在设置页查看。

环境要求与命令

需要 DeepSeek Harness 0.1.0-rc.6rc.7,以及 Node.js ^22.19.0 || >=24.0.0。卸载使用 dsh plugin --profile web remove dsh-ears,完成后刷新 Web UI。源码开发还提供 pnpm installpnpm checkpnpm testpnpm buildpnpm dev:configpnpm dev:webpnpm dev:watch

根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README

同一分类

dsh-ears 的同类插件

modlens

liustack

2.8k

为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。

我们跑过,装得上

npm 包TypeScript昨天

AI 锐评

modlens

是什么 — ModLens 为 DeepSeek Harness 的文本-only 模型添加图片粘贴视觉桥接。粘贴图片后获得 OCR、布局和语义的结构化 JSON 证据。

谁该装 — 当你使用 DeepSeek 文本模型在 Harness 中进行聊天任务并需要分析粘贴图片时,此插件适合使用。 如果你使用的是支持原生图片处理的模型,或者你的工作完全不涉及图片输入,则不必安装它,因为它不会影响纯文本模型的独立运行。

注意 — 实测在全新 profile 中成功安装并被 Harness 注册。静态检查显示插件会执行 shell 命令,这是必要的图片读取桥接。未发现明显的其他问题。

锐评 — 我会安装它,因为它提供了文本模型读取图片并生成结构化证据的扩展;如果不处理视觉输入任务,则不值得安装。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1详情

为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode

我们跑过,装得上

GitHub 源码Python昨天

AI 锐评

agent-vision-toolkit

是什么 — agent-vision-toolkit 提供图像问答、长截图OCR、前端UI还原和GUI自动化的视觉工具箱和技能。

谁该装 — 在使用 DeepSeek Harness 进行软件开发时,如果文本模型缺乏图像理解能力,此 plugin 可用于视觉任务。 如果使用原生多模态模型完成任务,此 plugin 提供可选无缝集成。

注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。代码已在Codex和DeepSeek会话中验证。同一个pipeline在Claude Code、Pi、Oh My Pi和OpenCode中已live验证。

锐评 — 我会安装它,因为它能让文本模型代理的视觉体验无缝等同于多模态模型,并最终让工具化文本代理超越不使用此工具的原生多模态代理。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。

我们跑过,装得上

npm 包JavaScript昨天

AI 锐评

dsh-vision-router

是什么 — dsh-vision-router 让 text-only agents 通过像素工具和视觉链处理图像。

谁该装 — 在使用 text-only 模型的 DeepSeek Harness 图像 grounding 或 OCR 任务中适合安装此插件。 如果代理专注于纯文本推理而不需视觉支持,则无需安装此插件。

注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。 会执行 shell 命令。 没发现明显的坑。

锐评 — 我会装它,因为它支持 Oh-DSH Desktop 并修复了 DSH runtime readiness 问题。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1详情

让纯文本模型更好地做视觉任务:带意图的图片问答、长截图 OCR、UI 还原等。

我们跑过,装得上

npm 包TypeScript昨天

AI 锐评

dsh-vision-toolkit

是什么 — 为 DeepSeek Harness 文本模型添加视觉支持,包括图像问答、长截图 OCR、UI 重现、接地和像素差异。

谁该装 — 在 DeepSeek Harness 中使用文本模型完成任务时,需要处理用户提供的图像截图来完成视觉问答或 UI 操作。 如果使用原生支持视觉的模型,则可以直接调用其视觉能力完成任务。

注意 — 安装后会执行 shell 命令。 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。 未发现其他问题。

锐评 — 我会装它,因为它是 DeepSeek Harness 生态首个综合视觉工具插件,且沙箱实测通过。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1详情

dsh-crew

ZSeven-W

50

DeepSeek Harness (DSH) plugin: dispatch work to DSH agents from Claude Code / Codex — native subagent progress, in-host worker sessions with per-tier presets, and a multimodal bridge that lends the text-only harness vision and image generation.

我们跑过,装得上

npm 包JavaScript昨天

AI 锐评

dsh-crew

是什么 — DSH Crew 插件让 Claude Code / Codex 分派工作到 DSH 代理,并显示原生子代理进度,支持多模态图像生成。

谁该装 — 当使用 Claude Code / Codex 调度 DSH 代理以获得原生进度 UI 时适合安装此插件。 如果您的任务仅限于单次文本模型调用而不涉及子代理分派,则可以跳过。

注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。没发现明显的坑。

锐评 — 我会装它,因为它让 Claude Code 看到 DSH 代理像原生子代理一样工作,同时 harness 仍控制工具和沙箱。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

DSH-vison

hisence999

33

DSH-vison 是一个 DeepSeek Harness 插件,为不支持多模态的模型补充图片理解能力。agent 仍可直接接收图片;插件调用 DSH 中已配置的视觉模型生成文字描述,再把描述交给纯文本模型。原始图片会保留在会话历史中,UI 仍可显示图片;模型侧则通过替换后的消息看到描述文字。readimage 工具也会采用同样的处理方式,多模态模型则自动放行,不重复识别。

我们跑过,装得上

GitHub 源码JavaScript3 天前

AI 锐评

DSH-vison

是什么 — DSH-vison 为纯文本模型提供图片理解,通过配置的视觉模型将图像转为描述文字。

谁该装 — 当你使用纯文本模型处理包含图片的用户消息时,需要图片理解能力。 如果你使用支持图片的模型,可以不安装此插件。

注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。没发现明显的坑。

锐评 — 我会安装它,因为沙箱测试通过且安装后全局生效。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
LINUX DO1详情