DSH Marketplace
EN

插件索引

语音与音频

这些 DSH 插件同步自社区精选库和 GitHub 的 dsh-plugin topic。Star 数、最近推送时间直接取自 GitHub。

45 个插件

99% 实测可装

dsh-omi-voice

PolinniZhong

61

DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。

我们跑过,装得上

npm 包Swift5 天前

AI 锐评

dsh-omi-voice

是什么 — 这是一个 DeepSeek Harness 语音朗读插件,使用豆包 TTS 自然音色点读 AI 回复。

谁该装 — 如果你在 DeepSeek Harness 桌面端想要使用自然音色朗读 AI 回复,并且有 macOS Omi 引擎,可以安装此插件。 Windows 用户可以不安装此插件,因为它不支持 Windows。

注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。 使用需在 Omi 引擎中保存豆包 API Key 并承担按字符计费的成本。 没发现明显的坑。

锐评 — 如果我在 macOS 上使用 DeepSeek Harness 我会安装它,因为它支持点读暂停继续并过滤非文本内容,但前提是 macOS Apple Silicon 且有 Omi 引擎。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-ears

WizisCool

12

面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。

我们跑过,装得上

npm 包TypeScript2 天前

AI 锐评

dsh-ears

是什么 — dsh-ears 为 DeepSeek Harness 提供语音转写与润色支持,通过多种后端实现识别并生成可编辑草稿。

谁该装 — 在浏览器环境下进行文本对话的用户适合安装。 主要依赖键盘输入的用户不必安装。

注意 — 安装后刷新 Web UI 才能显示麦克风图标。 沙箱实测通过:在全新 profile 里装上并被注册。 没发现明显的坑。

锐评 — 我会装,因为它允许保留原始转写并手动编辑草稿。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
LINUX DO详情

dsh-plugin-tts

1624318455

11

用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。

我们跑过,装得上

GitHub 源码JavaScript6 天前

AI 锐评

dsh-plugin-tts

是什么 — 为 DeepSeek Harness 助手回复集成 Edge TTS 与 RVC 语音朗读功能。

谁该装 — 在使用 DeepSeek Harness web 配置文件处理助手回复时,此插件可实现语音朗读。 如果用户不使用 DeepSeek Harness web 配置文件,此插件将无法正常工作。

注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。 没发现明显的坑。

锐评 — 我会安装它,因为沙箱测试通过并支持 RVC 自定义音色,但前提是使用 DeepSeek Harness web 配置文件。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-speak

Alan2Z

7

零外部依赖、事件驱动、无需额外模型、不消耗任何 token的语音播报插件。使用系统自带自然语音进行播报,支持win/mac双平台;最终回复、审批与提问提醒、可选事件播报(回合结束/命令完成/目标变更/工具出错/待办更新)、最终回复可重播、双语言可视化设置。

我们跑过,装得上

npm 包PowerShell15 天前

AI 锐评

dsh-speak

是什么 — DeepSeek Harness 插件,通过语音播报最终回复。

谁该装 — 在使用 DeepSeek Harness 处理长代码任务时,希望听到任务完成的语音提示。 如果你只想记录文本日志,而不需要语音提醒,就不需要安装。

注意 — 实测在全新 profile 中安装并被 harness 注册进 profile。未发现明显的坑。项目强调 best-effort 执行,不会中断会话。

锐评 — 我会装它,因为它提供已验证的语音方案,适合需要立即听到最终结果的用户。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-voice

3274375092

6

语音输入插件:对着麦克风说话,识别后的文字作为普通聊天消息发送(本地模型或浏览器语音识别)。

我们跑过,装得上

npm 包TypeScript10 天前

AI 锐评

dsh-voice

是什么 — DeepSeek Harness 语音输入插件,通过麦克风捕捉音频并提交识别文本作为聊天消息。

谁该装 — 使用 DeepSeek Harness 进行实时对话的人可以安装它。使用 DeepSeek Harness 进行纯键盘输入的人不必装,因为他们可能有其他输入方式优先。

注意 — 实测在全新 profile 里安装后被 harness 注册进 profile。没发现明显的坑。

锐评 — 如果需要通过麦克风提交聊天消息,我会装它,因为它提供了不同于预设的输入方法。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码

输入框麦克风:点击持续监控、按住对话;浏览器语音识别逐字上屏,回复由 host Edge TTS 边生成边朗读,朗读时暂停识别防回声,点击可停止。

我们跑过,装得上

npm 包TypeScript9 天前

AI 锐评

dsh-voice-input-plugin

是什么 — 集成语音输入至 DeepSeek Harness Web UI 的 Composer 工具栏,支持 tap-to-monitor 连续输入和 hold-to-talk 语音聊天。

谁该装 — 在使用 DeepSeek Harness Web UI 进行对话时需要实时语音辅助输入的用户适合安装此插件。 键盘输入为主的用户无需此插件。

注意 — 沙箱测试通过,在全新 profile 中安装并注册成功。未发现明显的坑。 安装完成后需搭配主机 Edge TTS 插件才能获得回复的 Edge TTS 朗读支持。

锐评 — 我会安装它,因为它提供了 Composer 的语音输入功能,但只有在实时语音交互场景下才值得。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码

通过 CallKit 打电话到你的手机:`call_me` 与 `text_me` 工具,并可在回合结束或等待审批时来电,语音回答转写后送回会话。

我们跑过,装得上

GitHub 源码JavaScript6 天前

AI 锐评

dsh-plugin-call-me

是什么 — 这个插件通过 CallKit 实现电话呼叫,提供 call_me 和 text_me 工具,并在 turn-end 和 approval 调用时通过语音转录回会话。

谁该装 — 在长时间运行的任务中,需要手动确认或语音回复时,此插件适合搭配 DSH 使用。无需手动确认的用户无需安装,因为他们可以依赖其他输入方式完成任务。

注意 — 实测通过:在全新 profile 里装上,并被 harness 注册进 profile。没发现明显的坑。

锐评 — 我认为值得安装它,因为它支持语音 turn-end 回复,但前提是能接受电话呼叫的潜在延迟。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码

dsh-voice-mode

qishuilalala

6

DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。

没有一行式安装命令——这个插件在一个大仓库的子目录里,也没发 npm 包。

GitHub 源码JavaScript昨天

明日方舟终末地佩丽卡主题分级提示音:计划出方案 / 任务完成 / 需要你回应 / 出错四档独立音效,普通问答保持安静;系统级播放(窗口在后台也响),跨平台(Windows/macOS/Linux),支持自定义 TTS 语音。

我们跑过,装得上

npm 包JavaScript15 天前

AI 锐评

dsh-perlica-ding

是什么 — 佩丽卡主题的 DeepSeek Harness 提示音插件,在任务状态变更时播放对应终端提示音。

谁该装 — 在使用 DeepSeek Harness 执行 agent 任务的用户适合安装此插件。 那些希望完全静音的用户可以不装,因为他们可能更专注纯文本交互。

注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。 插件会执行 shell 命令来播放声音,未发现明显的坑。

锐评 — 对于涉及工具调用的 agent 工作流,我会安装此插件,因为它提供了状态专属的音频提示,但前提是用户允许后台播放。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-ding

CAOGGL

5

对话完成提醒:Agent 空闲(idle)时播放提示音并弹 Windows 原生通知,可配 ding.mp3、音量与防抖节流。

我们跑过,装得上

GitHub 源码JavaScript10 天前

AI 锐评

dsh-ding

是什么 — dsh-ding 插件在 DeepSeek Harness 对话完成时提醒你,播放提示音并弹出 Windows 通知。

谁该装 — 当你使用 DeepSeek Harness 让 agent 处理长对话任务时,它适合安装在 profile 中。那些只在浏览器内查看对话而不需 Windows 通知的用户不必装。

注意 — 从源码安装时需要先手动放行它的构建脚本。实测在全新 profile 里装上并被 harness 注册进 profile,没发现明显的坑。

锐评 — 我会装它,因为它在 agent 空闲时提供了声音和通知提醒。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

为 DSH Web 助手回复提供小米 MiMo 语音朗读,支持预置音色和自定义音色。

我们跑过,装得上

npm 包TypeScript3 天前

dsh-sound

AI-Galaxy-GPU

4

六类事件独立提示音:回合完成、审批、提问、计划评审、目标受阻、任务失败各有独立声音与音量,可在 Web 设置面板配置(内置合成音 / 静音 / 本地音频文件)。

我们跑过,装得上

GitHub 源码JavaScript15 天前

dsh-plugin-notify

huguangyu666

4

通知出口:agent 主动通过桌面通知 / 中文语音 / 音效(炸裂、胜利、警报)联系你,60 秒确认窗口后语音呼叫,音量增强,设置面板。

我们跑过,装得上

npm 包JavaScript10 天前

AI 锐评

dsh-plugin-notify

是什么 — 通知插件:agent 主动推送 toast 桌面通知、中文 TTS 语音和音效,带 60 秒确认窗口及语音回叫。

谁该装 — 当 agent 使用 notify_user 工具主动报告任务状态或出错时,用户适合安装此插件。 如果不运行在 Windows + PowerShell 5.1+ 的系统上,用户可能无法使用语音功能。

注意 — 实测通过:在全新 profile 装上并被 harness 注册进 profile。没发现明显的坑。

锐评 — 我会安装它,因为它支持 agent 主动语音呼叫提醒,但前提是使用 Windows + PowerShell 5.1+。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-stt-input

baisama-cloud

4

Web UI 语音输入:输入框旁麦克风按钮语音转文字填入输入框;支持浏览器 Web Speech API 本地识别(零配置、无需密钥)与 OpenAI 兼容 Whisper API(OpenAI/Groq),模型与语言可在设置中选择。

我们跑过,装得上

GitHub 源码JavaScript11 天前

AI 锐评

dsh-stt-input

是什么 — 本插件让 DeepSeek Harness web GUI 输入框支持通过麦克风将语音转为文字。

谁该装 — 在使用 DeepSeek Harness web GUI 的 composer 进行对话时,希望通过麦克风说话直接输入文本的用户。 如果您使用 Firefox 浏览器且偏好键盘输入的用户可通过其他方式完成输入。

注意 — 沙箱实测通过:在全新 profile 里装上,并被 harness 注册进 profile。 未发现明显的坑。

锐评 — 我会装它,因为它支持 Chrome / Edge 上的浏览器本地引擎无需 API Key。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

输入框麦克风语音输入:浏览器 Web Speech API 实时转写,自动去重/续听、智能标点,支持语言与自动发送设置。

我们跑过,装得上

GitHub 源码JavaScript15 天前

AI 锐评

dsh-mic-input

是什么 — 为 DeepSeek Harness 添加麦克风语音输入,支持浏览器 Web Speech API 实时转录。

谁该装 — 适合需要在 DeepSeek Harness Web UI 的作曲器中使用麦克风语音输入的用户。 如果不使用支持 Web Speech API 的浏览器,或不运行在浏览器环境中,用户无需安装此插件。

注意 — 实测在全新 profile 中安装并通过沙箱测试,并被 harness 注册进 profile。没发现明显的坑。

锐评 — 会装它,因为它能 dedupe 重复文字并 auto-continue 长句,且零服务器依赖。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码

基于 uisfx 的语义化 UI 音效:任务开始/成功/失败、不同按钮情景 cue,设置页即时试听,12 种音色包,Host 持久化,并提供 `ctx.uisfx` 服务给其他插件。

我们跑过,装得上

npm 包JavaScript16 天前

AI 锐评

dsh-plugin-uisfx

是什么 — 为 DeepSeek Harness 集成 uisfx 音效系统,提供任务和按钮的语义化音效。

谁该装 — 在使用 DeepSeek Harness 执行 AI 代理任务时,需要任务状态和按钮交互音效的用户。 不执行任何代理任务的用户无需安装此插件。

注意 — 沙箱实测通过,在全新 profile 里装上,并被 harness 注册进 profile。 未发现静态检查问题。

锐评 — 我会装它,因为它支持 ctx.uisfx 服务 API 可以被其他插件使用,但前提是使用 dsh 0.1.0-rc.6。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码

dsh-voice

haoku123

3

Web UI 全双工语音对话:点按切换或按住说话(发送键或 `Ctrl`)并显示实时字幕,宿主端 SenseVoice(sherpa-onnx)转写,回复按句流式朗读,开口说话即打断播放与正在运行的回合(真 barge-in),无需 API key。

我们跑过,装得上

npm 包TypeScript8 天前

AI 锐评

dsh-voice

是什么 — 为 DeepSeek Harness Web UI 提供全双工语音模式。

谁该装 — 在使用 DeepSeek Harness Web UI 进行中文语音对话时,需要 SenseVoice ASR 进行转录的用户适合安装此插件。 如果使用非中文语音模型的用户可以选择其他插件。

注意 — 没发现明显的坑,沙箱测试通过。安装需 Node.js 版本不低于 22.19,且从源码安装时需要手动允许构建脚本。

锐评 — 我会装它,因为它提供了 true barge-in 且无需 API key,但前提是使用支持的语音模型。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码

dsh-gsv

TaoruiLiu19

3

将本地高性能 TTS 引擎 GSV-TTS-Lite 实时接入 DeepSeek Harness:语音预设、自动朗读、引擎配置助手、朗读按钮与设置面板。

我们跑过,装得上

npm 包TypeScript3 天前

dsh-voice

Jesse-njx

2

语音输入、语音输出:把口述音频转写为用户消息(transcribe),让 agent 朗读回复(speak),本地优先,音频存于 ~/.dsh/voice。

装得上,但要先放行构建脚本

GitHub 源码TypeScript17 天前

AI 锐评

dsh-voice

是什么 — dsh-voice 提供 transcribe 和 speak 工具,在 DeepSeek Harness 中支持语音笔记转为用户消息以及代理朗读回复。

谁该装 — 在使用 DeepSeek Harness 处理需要口述指令或代理用 speak 工具朗读回复的终端任务时,适合安装 dsh-voice。 如果你仅依赖模型的文本能力,不需要语音工具。

注意 — 实测显示插件能装入沙箱,但构建脚本被 pnpm 拦下,由 github:Jesse-njx/dsh-voice 触发,用户需手动允许才能完成注册。未发现其他明显问题。

锐评 — 我会装它,因为它实现了本地语音交互,但必须先手动允许构建脚本。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

voco-input-sh

Nothree-code

2

Web UI 语音输入:输入框麦克风按钮驱动本地 VocoType 离线识别,识别结果自动插入输入框(自动部署/防重复/持续输入)。

我们跑过,装得上

GitHub 源码JavaScript13 天前

AI 锐评

voco-input-sh

是什么 — 该插件为 DeepSeek Harness Web UI 的聊天输入框右侧添加麦克风按钮,驱动本地 VocoType 离线语音识别并自动插入识别文本到输入框。

谁该装 — 在使用 DeepSeek Harness Web UI 聊天界面且需要频繁通过语音输入中文文本的用户适合安装此插件。那些主要在桌面应用中输入或不依赖实时语音功能的用户可采用其他输入方式。

注意 — 安装需将插件放入 profile packages 目录并执行 pnpm add file: 命令,随后在 cordis.patch.yml 中添加挂载行并重启界面。首次运行 VocoType 需下载约 25MB 安装包及 1.6GB 模型文件。实测在全新 profile 中可正常注册使用。

锐评 — 如果需要在 DeepSeek Harness Web UI 中进行离线中文语音输入且机器存储空间充足,则值得安装;否则下载模型的耗时不值得。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码
2

agent 主动打来的语音电话:`offer_call` 向人类振铃(接听/拒接/稍后再说),接听后由本地 CrispASR + Qwen3-TTS 合成并播放(9 个音色,含 2 个中文方言);拒接则把决定返回给 agent。

我们跑过,装得上

npm 包TypeScript14 天前

AI 锐评

dsh-voice-call

是什么 — 提供 agent 主动发起语音通话的功能,使用 offer_call 工具联系人类。

谁该装 — 当 agent 使用 offer_call 工具主动联系人类时,需要在来电上决定接听或拒接。 不适合只依赖文本工具调用而不涉及语音交互的用户。

注意 — 需在 cordis.patch.yml 中配置 CrispASR 引擎路径和音色。实测在全新 profile 里装上并被 harness 注册进 profile。没发现明显的坑。

锐评 — 我会安装它,因为它允许 agent 主动来电,但前提是需要本地语音引擎支持,否则配置成本不值得。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

dsh-voice

STARDUSTLC666

2

语音五工具:edge-tts 免费微软神经语音合成、OpenAI 兼容 ASR 转写、音色清单、批量音色试听与健康自检。

我们跑过,装得上

npm 包TypeScript13 天前

AI 锐评

dsh-voice

是什么 — dsh-voice 插件为 DeepSeek Harness agent 提供 edge-tts 语音合成与 OpenAI 兼容 ASR 转写功能。

谁该装 — 在使用 DeepSeek Harness 构建需要 agent 进行语音对话的场景中,可以安装此插件。 如果项目仅涉及纯文本交互而不需语音功能,则可跳过此插件。

注意 — 沙箱测试通过,在全新 profile 里安装并被注册。未发现明显的坑。会执行 shell 命令。

锐评 — 我会装它,因为它提供免费的 edge-tts 语音合成能力。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
1源码

按工作区定制的任务完成铃声,以及审批、提问、计划评审、目标受阻、任务失败等需要人介入事件的注意提示音,支持内置合成音、语音播报与自定义音频。

我们跑过,装得上

npm 包JavaScript17 天前

AI 锐评

dsh-plugin-notify-sound

是什么 — 在 DeepSeek Harness Web UI 中提供 per-workspace 完成铃声和人工干预提醒音。

谁该装 — 在使用 DeepSeek Harness Web UI 管理任务时,需要 per-workspace 完成铃声和人工干预提醒的用户适合安装此插件。 不使用 bundle-plugin 支持的 DSH 用户可以不安装此插件。

注意 — 沙箱实测通过:在全新 profile 安装后注册成功。安装需具备 bundle-plugin 支持和 pnpm 环境。从源码安装时需手动放行构建脚本。未发现明显的兼容性问题。

锐评 — 会装它,因为它支持 per-workspace 完成铃声和人工干预提醒,但前提是 DSH 版本支持 bundle-plugin 且有 pnpm。

grok-4.6 写的,只当参考,不当结论。里面说装得上或装不上,是在干净 profile 里真跑过的;其余都是读仓库读出来的。以实际运行为准。去看源码
源码
2

国内可用的输入框语音输入。需要先启动本地 Python bridge(pip install dashscope websockets,运行 bridge/voice-bridge.py)——只装插件不可用。浏览器麦克风采集 16kHz PCM 流式转发给 bridge,由阿里云 DashScope ASR(paraformer-realtime-v2)识别;识别文字在光标处实时填入草稿,静音自动停止,可选识别后自动发送。

我们跑过,装得上

npm 包JavaScript10 天前