dsh-omi-voice
PolinniZhong
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
我们跑过,装得上
插件索引
这些 DSH 插件同步自社区精选库和 GitHub 的 dsh-plugin topic。Star 数、最近推送时间直接取自 GitHub。
45 个插件
99% 实测可装
PolinniZhong
DeepSeek Harness 对话内朗读:点一下即可朗读、暂停、继续 AI 回复,豆包 TTS 自然音色(BYOK),只读最终回答并过滤代码、表格与图形,本地引擎,插件零 Key。
我们跑过,装得上
WizisCool
面向 DeepSeek Harness (dsh) 的语音输入插件:输入框的麦克风按钮把语音转成草稿文本,支持多种语音识别后端,可选经 dsh 自有 LLM 路由润色,并带原生设置页。
我们跑过,装得上
1624318455
用免费 Edge TTS 或你自己的 RVC 音色朗读 AI 回复:消息朗读与自动朗读、长文自适应分块渐进播放(无缝衔接)、音色包仓库一键安装、便携 RVC 运行时。
我们跑过,装得上
Alan2Z
零外部依赖、事件驱动、无需额外模型、不消耗任何 token的语音播报插件。使用系统自带自然语音进行播报,支持win/mac双平台;最终回复、审批与提问提醒、可选事件播报(回合结束/命令完成/目标变更/工具出错/待办更新)、最终回复可重播、双语言可视化设置。
我们跑过,装得上
Zhangbo-cn
输入框麦克风:点击持续监控、按住对话;浏览器语音识别逐字上屏,回复由 host Edge TTS 边生成边朗读,朗读时暂停识别防回声,点击可停止。
我们跑过,装得上
radres
通过 CallKit 打电话到你的手机:`call_me` 与 `text_me` 工具,并可在回合结束或等待审批时来电,语音回答转写后送回会话。
我们跑过,装得上
qishuilalala
DeepSeek Harness Web UI 全双工语音对话:按钮或 Ctrl+Shift+V 进入,持续聆听(停顿自动发送)或按住说话,zipformer2 流式识别入可编辑草稿、可选唤醒词;回复按句 Edge TTS 朗读并显示实时字幕,开口即打断播放与回合(真 barge-in);识别模型本地推理、Edge TTS 在线合成,无需 API Key。
没有一行式安装命令——这个插件在一个大仓库的子目录里,也没发 npm 包。
117BS
明日方舟终末地佩丽卡主题分级提示音:计划出方案 / 任务完成 / 需要你回应 / 出错四档独立音效,普通问答保持安静;系统级播放(窗口在后台也响),跨平台(Windows/macOS/Linux),支持自定义 TTS 语音。
我们跑过,装得上
AI-Galaxy-GPU
六类事件独立提示音:回合完成、审批、提问、计划评审、目标受阻、任务失败各有独立声音与音量,可在 Web 设置面板配置(内置合成音 / 静音 / 本地音频文件)。
我们跑过,装得上
huguangyu666
通知出口:agent 主动通过桌面通知 / 中文语音 / 音效(炸裂、胜利、警报)联系你,60 秒确认窗口后语音呼叫,音量增强,设置面板。
我们跑过,装得上
baisama-cloud
Web UI 语音输入:输入框旁麦克风按钮语音转文字填入输入框;支持浏览器 Web Speech API 本地识别(零配置、无需密钥)与 OpenAI 兼容 Whisper API(OpenAI/Groq),模型与语言可在设置中选择。
我们跑过,装得上
XanthanL
基于 uisfx 的语义化 UI 音效:任务开始/成功/失败、不同按钮情景 cue,设置页即时试听,12 种音色包,Host 持久化,并提供 `ctx.uisfx` 服务给其他插件。
我们跑过,装得上
haoku123
Web UI 全双工语音对话:点按切换或按住说话(发送键或 `Ctrl`)并显示实时字幕,宿主端 SenseVoice(sherpa-onnx)转写,回复按句流式朗读,开口说话即打断播放与正在运行的回合(真 barge-in),无需 API key。
我们跑过,装得上
TaoruiLiu19
将本地高性能 TTS 引擎 GSV-TTS-Lite 实时接入 DeepSeek Harness:语音预设、自动朗读、引擎配置助手、朗读按钮与设置面板。
我们跑过,装得上
Jesse-njx
语音输入、语音输出:把口述音频转写为用户消息(transcribe),让 agent 朗读回复(speak),本地优先,音频存于 ~/.dsh/voice。
装得上,但要先放行构建脚本
Nothree-code
Web UI 语音输入:输入框麦克风按钮驱动本地 VocoType 离线识别,识别结果自动插入输入框(自动部署/防重复/持续输入)。
我们跑过,装得上
PandaPolo
agent 主动打来的语音电话:`offer_call` 向人类振铃(接听/拒接/稍后再说),接听后由本地 CrispASR + Qwen3-TTS 合成并播放(9 个音色,含 2 个中文方言);拒接则把决定返回给 agent。
我们跑过,装得上
ldchaowin
按工作区定制的任务完成铃声,以及审批、提问、计划评审、目标受阻、任务失败等需要人介入事件的注意提示音,支持内置合成音、语音播报与自定义音频。
我们跑过,装得上
Schumchanvi
国内可用的输入框语音输入。需要先启动本地 Python bridge(pip install dashscope websockets,运行 bridge/voice-bridge.py)——只装插件不可用。浏览器麦克风采集 16kHz PCM 流式转发给 bridge,由阿里云 DashScope ASR(paraformer-realtime-v2)识别;识别文字在光标处实时填入草稿,静音自动停止,可选识别后自动发送。
我们跑过,装得上