DSH Marketplace
EN

dsh-ears

WizisCool/dsh-ears

面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。

安装

把 dsh-ears 装进 DeepSeek Harness

npm 方式

直接拉已发布的 tarball,不用克隆整个仓库,也不需要额外配置。如果你用的是别的 profile,把 `web` 换成对应的名字。

GitHub 方式 · npm 包

从 GitHub 装会执行项目自己的构建脚本,而 pnpm 默认拦着不让跑——先跑一次这条命令,pnpm 会打印出要加到 ~/.dsh/profiles/web/pnpm-workspace.yaml 里 `allowBuilds` 下面的那个 key。

我们跑过之后

我们跑过,装得上

这里每条命令都在一次性容器里、对着干净 profile 真跑过,结果取自 harness 自己的记录,不是读源码猜的。 最近一次 11 天前.

挂进你的 README

实测可装 — dshmarketplace

给维护者的:badge 取这条 listing 最近一次 sandbox 实测的结果,重跑之后它自己会变,读者点开就是这页的完整记录。

安装前须知

装 dsh-ears 之前,先看这几条

  • 源码在这里: WizisCool/dsh-ears——已进入社区精选库,DSH 自带的插件市场就是从这儿装的。
  • 开源协议:MIT。
  • 被收录在这里不代表通过了安全审计。插件是带着你 agent 的权限在跑。

AI 锐评

是什么 — dsh-ears 为 DeepSeek Harness 提供语音转写与润色支持,通过多种后端实现识别并生成可编辑草稿。

谁该装 — 在浏览器环境下进行文本对话的用户适合安装。 主要依赖键盘输入的用户不必安装。

注意 — 安装后刷新 Web UI 才能显示麦克风图标。 沙箱实测通过:在全新 profile 里装上并被注册。 没发现明显的坑。

锐评 — 我会装,因为它允许保留原始转写并手动编辑草稿。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。

dsh-ears 是做什么的

Sound waves flow through transcription and polishing channels into an editable draft.

dsh-ears 是一个 DeepSeek Harness 插件,为 Web UI 增加语音输入。按下默认快捷键 Ctrl+Shift+Space 或点击麦克风后,插件把录音交给所选转写后端:浏览器原生 Web Speech、本机 whisper CLI、Groq、阿里云百炼,或指定的 OpenAI 兼容 /audio/transcriptions 接口。转写结果先放进输入框,成为可修改的草稿,必须由人工确认并发送,不会替 agent 自动发言。

它也可以调用 dsh → 设置 → 模型 中已经配置的模型进行润色。插件保存所选提供方、模型名和提示词,并复用 DSH 已有的 LLM key;润色失败或取消时保留原始转写。这个设计适合需要口述输入、但不希望语音直接触发会话发送的场景。

如果音频不能离开本机,远程 Groq、阿里云百炼或自定义接口就不合适;本地方案还要求预装 openai-whisper。Web Speech 依赖 Chromium 内核浏览器,且音频可能由浏览器厂商处理。本机 Whisper 在停止录音后才开始转写,较大的模型纯靠 CPU 也可能很慢。运行插件需要 DeepSeek Harness 0.1.0-rc.6 或 rc.7,以及 Node.js ^22.19.0 || >=24.0.0。

dsh-ears 的文档

行为说明

刷新 Web UI 后,输入框右侧会出现麦克风图标。默认使用 Ctrl+Shift+Space 录音,处理流程为“录音→转写→可选润色→可编辑草稿→手动发送”。草稿不会自动发送。润色可去除口头禅、修正 ASR 错字,也能处理自我纠正和口头列举;润色失败或取消时保留原始转写。

转写后端

后端 工作方式 要求
Web Speech 浏览器实时识别 Chromium 内核浏览器;音频可能经浏览器厂商处理
本地 Whisper 停止录音后由 Host 调用本机 whisper CLI 预装 openai-whisper,并在设置页下载模型
Groq Host 调用 Groq Whisper API Groq API key
阿里云百炼 使用 DashScope 同步转写 HTTPS 源站、API key、模型名;单次最多 300 秒
自定义 OpenAI 兼容 向指定端点发送 POST 端点、API key、模型名,并提供 /audio/transcriptions

Whisper 权重不随插件打包。免费额度和限流以提供商最新文档为准。

润色配置

润色模型从 dsh → 设置 → 模型 的已有列表中选择。插件保存提供方、模型名和提示词,LLM key 复用 DSH 配置。提示词留空时使用内置默认值,可在设置页查看。

环境要求与命令

需要 DeepSeek Harness 0.1.0-rc.6 或 rc.7,以及 Node.js ^22.19.0 || >=24.0.0。卸载使用 dsh plugin --profile web remove dsh-ears,完成后刷新 Web UI。源码开发还提供 pnpm install、pnpm check、pnpm test、pnpm build、pnpm dev:config、pnpm dev:web 和 pnpm dev:watch。

根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README

同一分类

dsh-ears 的同类插件

dsh-omi-voice

PolinniZhong

74

DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。

我们跑过,装得上

npm 包Swift1 个月前

AI 锐评

dsh-omi-voice

是什么 — 插件为 DeepSeek Harness 提供 AI 回复点读功能,使用 Omi 引擎合成豆包 TTS 自然中文音色。

谁该装 — 如果你在 DeepSeek Harness 对话中需要自然音色的 AI 回复,且已配置 macOS 上的 Omi 引擎并有豆包 API Key,那么此插件适合你。 如果不在 macOS 系统上使用 DeepSeek Harness,则此插件不适用。

注意 — 沙箱实测通过,在全新 profile 里装上,并被 harness 注册进 profile。 需要 macOS Apple Silicon 平台并启动 Omi 引擎,豆包 TTS 按字符计费但有内存 LRU 缓存与去重。

锐评 — 如果我在 macOS 上使用 DeepSeek Harness,我会安装它,因为它只读最终答案并过滤代码表格,同时支持暂停继续,且插件零密钥,但前提是接受豆包按字符计费。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码
34

面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。

我们跑过,装得上

npm 包JavaScript9 天前

AI 锐评

dsh-voice-scribe

是什么 — DeepSeek Harness 网页UI 的语音输入插件。

谁该装 — DeepSeek Harness 网页编辑界面中需要快速语音输入的用户适合此插件。 如果更注重提示词优化和文件转 Markdown 的用户可选用其他增强插件。

注意 — 沙箱实测通过,在全新 profile 中安装并注册。未发现其他运行问题。

锐评 — 我会装它,因为它支持可选 LLM 润色。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-plugin-tts

1624318455

21

用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。

我们跑过,装得上

npm 包JavaScript6 天前

AI 锐评

dsh-plugin-tts

是什么 — 为 DeepSeek Harness 助手回复集成 Edge TTS 与 RVC 语音朗读功能。

谁该装 — 在使用 DeepSeek Harness web 配置文件处理助手回复时,此插件可实现语音朗读。 如果用户不使用 DeepSeek Harness web 配置文件,此插件将无法正常工作。

注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。 没发现明显的坑。

锐评 — 我会安装它,因为沙箱测试通过并支持 RVC 自定义音色,但前提是使用 DeepSeek Harness web 配置文件。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-speak

Alan2Z

11

零外部依赖、事件驱动、无需额外模型、不消耗任何 token的语音播报插件。使用系统自带自然语音进行播报,支持win/mac双平台;最终回复、审批与提问提醒、可选事件播报(回合结束/命令完成/目标变更/工具出错/待办更新)、最终回复可重播、双语言可视化设置。

我们跑过,装得上

npm 包JavaScript7 天前

AI 锐评

dsh-speak

是什么 — DeepSeek Harness 插件,通过语音播报最终回复。

谁该装 — 在使用 DeepSeek Harness 处理长代码任务时,希望听到任务完成的语音提示。 如果你只想记录文本日志,而不需要语音提醒,就不需要安装。

注意 — 实测在全新 profile 中安装并被 harness 注册进 profile。未发现明显的坑。项目强调 best-effort 执行,不会中断会话。

锐评 — 我会装它,因为它提供已验证的语音方案,适合需要立即听到最终结果的用户。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-talk

PerryLink

11

DeepSeek Harness 的语音输入输出:麦克风语音转文字与文字转语音。

我们跑过,装得上

npm 包TypeScript12 天前

dsh-sound

AI-Galaxy-GPU

10

六类事件独立提示音:回合完成、审批、提问、计划评审、目标受阻、任务失败各有独立声音与音量,可在 Web 设置面板配置(内置合成音 / 静音 / 本地音频文件)。

我们跑过,装得上

npm 包JavaScript17 天前

AI 锐评

dsh-sound

是什么 — 在 DeepSeek Harness Web UI 中,为六个特定事件提供独立音效和音量配置。

谁该装 — 在使用 DeepSeek Harness 进行 AI 任务规划和审查时,需要区分完成、审批、问题、计划审查、目标阻塞和失败等事件提示的用户适合安装它。 如果不使用浏览器界面访问 DeepSeek Harness 的用户不必装,因为插件专为 Web UI 事件通知设计。

注意 — 安装此插件需要 DeepSeek Harness 支持 bundle-plugin 特性且系统上有 pnpm。实测在全新 profile 里成功注册并被 harness 使用。没发现明显的坑。

锐评 — 换成我,如果需要在 Web UI 中为多个事件独立设置音效和音量,我会装它,因为它提供了内置合成、静音和本地文件三种音源选项。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码