dsh-omi-voice
PolinniZhong
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
我们跑过,装得上
WizisCool/dsh-ears
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
安装
npm 方式
直接拉已发布的 tarball,不用克隆整个仓库,也不需要额外配置。如果你用的是别的 profile,把 `web` 换成对应的名字。
GitHub 方式 · npm 包
从 GitHub 装会执行项目自己的构建脚本,而 pnpm 默认拦着不让跑——先跑一次这条命令,pnpm 会打印出要加到 ~/.dsh/profiles/web/pnpm-workspace.yaml 里 `allowBuilds` 下面的那个 key。
我们跑过之后
我们跑过,装得上
这里每条命令都在一次性容器里、对着干净 profile 真跑过,结果取自 harness 自己的记录,不是读源码猜的。 最近一次 11 天前.
挂进你的 README
给维护者的:badge 取这条 listing 最近一次 sandbox 实测的结果,重跑之后它自己会变,读者点开就是这页的完整记录。
安装前须知
是什么 — dsh-ears 为 DeepSeek Harness 提供语音转写与润色支持,通过多种后端实现识别并生成可编辑草稿。
谁该装 — 在浏览器环境下进行文本对话的用户适合安装。 主要依赖键盘输入的用户不必安装。
注意 — 安装后刷新 Web UI 才能显示麦克风图标。 沙箱实测通过:在全新 profile 里装上并被注册。 没发现明显的坑。
锐评 — 我会装,因为它允许保留原始转写并手动编辑草稿。
grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。

dsh-ears 是一个 DeepSeek Harness 插件,为 Web UI 增加语音输入。按下默认快捷键 Ctrl+Shift+Space 或点击麦克风后,插件把录音交给所选转写后端:浏览器原生 Web Speech、本机 whisper CLI、Groq、阿里云百炼,或指定的 OpenAI 兼容 /audio/transcriptions 接口。转写结果先放进输入框,成为可修改的草稿,必须由人工确认并发送,不会替 agent 自动发言。
它也可以调用 dsh → 设置 → 模型 中已经配置的模型进行润色。插件保存所选提供方、模型名和提示词,并复用 DSH 已有的 LLM key;润色失败或取消时保留原始转写。这个设计适合需要口述输入、但不希望语音直接触发会话发送的场景。
如果音频不能离开本机,远程 Groq、阿里云百炼或自定义接口就不合适;本地方案还要求预装 openai-whisper。Web Speech 依赖 Chromium 内核浏览器,且音频可能由浏览器厂商处理。本机 Whisper 在停止录音后才开始转写,较大的模型纯靠 CPU 也可能很慢。运行插件需要 DeepSeek Harness 0.1.0-rc.6 或 rc.7,以及 Node.js ^22.19.0 || >=24.0.0。
刷新 Web UI 后,输入框右侧会出现麦克风图标。默认使用 Ctrl+Shift+Space 录音,处理流程为“录音→转写→可选润色→可编辑草稿→手动发送”。草稿不会自动发送。润色可去除口头禅、修正 ASR 错字,也能处理自我纠正和口头列举;润色失败或取消时保留原始转写。
| 后端 | 工作方式 | 要求 |
|---|---|---|
Web Speech |
浏览器实时识别 | Chromium 内核浏览器;音频可能经浏览器厂商处理 |
本地 Whisper |
停止录音后由 Host 调用本机 whisper CLI |
预装 openai-whisper,并在设置页下载模型 |
Groq |
Host 调用 Groq Whisper API | Groq API key |
阿里云百炼 |
使用 DashScope 同步转写 | HTTPS 源站、API key、模型名;单次最多 300 秒 |
自定义 OpenAI 兼容 |
向指定端点发送 POST |
端点、API key、模型名,并提供 /audio/transcriptions |
Whisper 权重不随插件打包。免费额度和限流以提供商最新文档为准。
润色模型从 dsh → 设置 → 模型 的已有列表中选择。插件保存提供方、模型名和提示词,LLM key 复用 DSH 配置。提示词留空时使用内置默认值,可在设置页查看。
需要 DeepSeek Harness 0.1.0-rc.6 或 rc.7,以及 Node.js ^22.19.0 || >=24.0.0。卸载使用 dsh plugin --profile web remove dsh-ears,完成后刷新 Web UI。源码开发还提供 pnpm install、pnpm check、pnpm test、pnpm build、pnpm dev:config、pnpm dev:web 和 pnpm dev:watch。
根据项目自己的文档整理,会跟着上游更新。两边对不上时以源码仓库为准—— 去 GitHub 看原始 README
同一分类
PolinniZhong
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
我们跑过,装得上
PensiveFei
面向 Web UI 的语音输入插件:点按 Alt(或 Alt+空格)开始/停止听写,支持浏览器内置 Web Speech(零配置)或 OpenAI 兼容云端 ASR,可选经 DSH 已配置模型润色,带设置页。
我们跑过,装得上
1624318455
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
我们跑过,装得上
Alan2Z
零外部依赖、事件驱动、无需额外模型、不消耗任何 token的语音播报插件。使用系统自带自然语音进行播报,支持win/mac双平台;最终回复、审批与提问提醒、可选事件播报(回合结束/命令完成/目标变更/工具出错/待办更新)、最终回复可重播、双语言可视化设置。
我们跑过,装得上
AI-Galaxy-GPU
六类事件独立提示音:回合完成、审批、提问、计划评审、目标受阻、任务失败各有独立声音与音量,可在 Web 设置面板配置(内置合成音 / 静音 / 本地音频文件)。
我们跑过,装得上