dsh-ears
WizisCool/dsh-ears
给 DSH 加语音输入:转写可以走浏览器原生 Web Speech、本机 Whisper、Groq、阿里云百炼,或任意 OpenAI 兼容接口;转完能用 dsh 里已经接好的模型润色,提示词自定义。出来的是可编辑草稿,手动发送,不会替你说话。默认快捷键 Ctrl+Shift+Space。
安装
把 dsh-ears 装进 DeepSeek Harness
npm 方式
直接拉已发布的 tarball,不用克隆整个仓库,也不需要额外配置。如果你用的是别的 profile,把 `web` 换成对应的名字。
GitHub 方式 · npm 包
从 GitHub 装会执行项目自己的构建脚本,而 pnpm 默认拦着不让跑——先跑一次这条命令,pnpm 会打印出要加到 ~/.dsh/profiles/web/pnpm-workspace.yaml 里 `allowBuilds` 下面的那个 key。
安装前须知
装 dsh-ears 之前,先看这几条
- 源码在这里: WizisCool/dsh-ears——从社区帖子人工收录,没有进入 DSH 自带市场的那个精选库。
- 开源协议:MIT。
- 被收录在这里不代表通过了安全审计。插件是带着你 agent 的权限在跑。
dsh-ears 是做什么的

dsh-ears 是一个 DeepSeek Harness 插件,为 Web UI 增加语音输入。按下默认快捷键 Ctrl+Shift+Space 或点击麦克风后,插件把录音交给所选转写后端:浏览器原生 Web Speech、本机 whisper CLI、Groq、阿里云百炼,或指定的 OpenAI 兼容 /audio/transcriptions 接口。转写结果先放进输入框,成为可修改的草稿,必须由人工确认并发送,不会替 agent 自动发言。
它也可以调用 dsh → 设置 → 模型 中已经配置的模型进行润色。插件保存所选提供方、模型名和提示词,并复用 DSH 已有的 LLM key;润色失败或取消时保留原始转写。这个设计适合需要口述输入、但不希望语音直接触发会话发送的场景。
如果音频不能离开本机,远程 Groq、阿里云百炼或自定义接口就不合适;本地方案还要求预装 openai-whisper。Web Speech 依赖 Chromium 内核浏览器,且音频可能由浏览器厂商处理。本机 Whisper 在停止录音后才开始转写,较大的模型纯靠 CPU 也可能很慢。运行插件需要 DeepSeek Harness 0.1.0-rc.6 或 rc.7,以及 Node.js ^22.19.0 || >=24.0.0。
dsh-ears 的文档
行为说明
刷新 Web UI 后,输入框右侧会出现麦克风图标。默认使用 Ctrl+Shift+Space 录音,处理流程为“录音→转写→可选润色→可编辑草稿→手动发送”。草稿不会自动发送。润色可去除口头禅、修正 ASR 错字,也能处理自我纠正和口头列举;润色失败或取消时保留原始转写。
转写后端
| 后端 | 工作方式 | 要求 |
|---|---|---|
Web Speech |
浏览器实时识别 | Chromium 内核浏览器;音频可能经浏览器厂商处理 |
本地 Whisper |
停止录音后由 Host 调用本机 whisper CLI |
预装 openai-whisper,并在设置页下载模型 |
Groq |
Host 调用 Groq Whisper API | Groq API key |
阿里云百炼 |
使用 DashScope 同步转写 | HTTPS 源站、API key、模型名;单次最多 300 秒 |
自定义 OpenAI 兼容 |
向指定端点发送 POST |
端点、API key、模型名,并提供 /audio/transcriptions |
Whisper 权重不随插件打包。免费额度和限流以提供商最新文档为准。
润色配置
润色模型从 dsh → 设置 → 模型 的已有列表中选择。插件保存提供方、模型名和提示词,LLM key 复用 DSH 配置。提示词留空时使用内置默认值,可在设置页查看。
环境要求与命令
需要 DeepSeek Harness 0.1.0-rc.6 或 rc.7,以及 Node.js ^22.19.0 || >=24.0.0。卸载使用 dsh plugin --profile web remove dsh-ears,完成后刷新 Web UI。源码开发还提供 pnpm install、pnpm check、pnpm test、pnpm build、pnpm dev:config、pnpm dev:web 和 pnpm dev:watch。
根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README
同一分类
dsh-ears 的同类插件
agent-vision-toolkit
Anionex
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
我们跑过,装得上
dsh-vision-router
ysr666
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
我们跑过,装得上
dsh-crew
ZSeven-W
DeepSeek Harness (DSH) plugin: dispatch work to DSH agents from Claude Code / Codex — native subagent progress, in-host worker sessions with per-tier presets, and a multimodal bridge that lends the text-only harness vision and image generation.
我们跑过,装得上
DSH-vison
hisence999
DSH-vison 是一个 DeepSeek Harness 插件,为不支持多模态的模型补充图片理解能力。agent 仍可直接接收图片;插件调用 DSH 中已配置的视觉模型生成文字描述,再把描述交给纯文本模型。原始图片会保留在会话历史中,UI 仍可显示图片;模型侧则通过替换后的消息看到描述文字。readimage 工具也会采用同样的处理方式,多模态模型则自动放行,不重复识别。
我们跑过,装得上