近日,一款名为“dsh-ears”的 DeepSeek 语音输入插件在开源社区引发关注,旨在为 DeepSeek 网页版增加高效的语音交互能力。该插件由开发者 WizisCool 发布,通过简单的命令即可集成到 DeepSeek Chat 的 Web 界面中,在输入框旁生成麦克风图标,实现“即装即用”。
技术实现上,dsh-ears 的核心亮点在于构建了“语音转写”与“文本润色”的双重处理流水线。它首先利用 ASR(自动语音识别)技术将语音转为文字,随后创新性地调用 DeepSeek 界面中已配置的大模型,对转写后的文本进行二次处理。这一步能够有效去除口语中的语气词、口头禅,修正口误,甚至根据用户自定义的系统提示词将杂乱的口语整理为规范的书面语,从而显著提升后续 AI 对话的输入质量和 Token 利用效率。
在兼容性方面,该插件展现出了极高的灵活性。目前支持的识别后端包括免费的 Groq 云端服务、阿里云百炼 DashScope API、本地运行的 openai-whisper 模型、浏览器原生的 Web Speech API 以及自定义 OpenAI 兼容接口。这种多后端设计兼顾了注重隐私的本地部署用户与追求低延迟的云端用户需求。
事件分析
从生态视角观察,该项目的出现标志着 DeepSeek 社区生态的快速成熟。作为热门的推理模型平台,DeepSeek 在 Web 端的原生功能相对克制,社区开发者迅速填补了语音交互这一空白。多后端的设计策略(特别是支持本地 Whisper 与低成本 Groq)也精准击中了开发者对于成本控制与数据隐私的敏感点。未来,此类“输入预处理”逻辑极有可能成为 AI 原生应用提升交互体验的标配功能。
核心观点:利用 LLM 润色 ASR 结果解决口语痛点,dsh-ears 展示了前端 AI 交互的高效新范式。
原文链接:V2EX 分享发现