实测Qwen3-ASR吊打Whisper:粤语客服场景下国产模型展现统治力
一份针对香港粤语客服场景的硬核实测报告显示,阿里 Qwen3-ASR-1.7B 在处理粤英语码混合及方言识别时,对 OpenAI Whisper-large-v3 构成了“降维打击”。在 96 条真实客服录音的测试中,Qwen3-ASR 的...
标签索引 / 第 2 页
这个标签下有 33 篇文章。按时间回看相关判断与实践记录。
标签精选
一份针对香港粤语客服场景的硬核实测报告显示,阿里 Qwen3-ASR-1.7B 在处理粤英语码混合及方言识别时,对 OpenAI Whisper-large-v3 构成了“降维打击”。在 96 条真实客服录音的测试中,Qwen3-ASR 的...
近日,一款名为 Typeless 的语音识别与 AI 修饰工具在社区引发关注。用户实测反馈,该工具在语音转文字及 AI 修改环节速度惊人,全程不到一秒,准确率与流畅度均完爆市面同类竞品。针对其极致的响应速度,社区猜测其背后可能采用了本地模型...
近日,技术社区对豆包输入法的拆解揭示了字节跳动在语音识别领域的技术策略。测试发现,豆包输入法采用了一种“流式+文件”的混合识别机制:在用户语音输入时,利用流式识别技术实时上屏文字,确保交互的低延迟感;而在用户结束说话后,系统会利用文件识别技...
近日,有技术爱好者在 V2EX 社区分享并开源了一个项目,通过逆向工程手段,成功提取了字节跳动旗下“豆包输入法”背后的在线语音识别(ASR)接口。该 GitHub 仓库展示了如何直接调用这一接口,使得开发者能够绕过官方客户端限制,利用豆包的...
近期用户反馈发现,字节跳动旗下的豆包浏览器与豆包输入法虽然同属一个品牌生态,但两者的语音输入功能在识别率上存在显著差异。通过对比测试可以看出,豆包输入法的识别准确度远超浏览器内置的语音功能。这种明显的体验割裂现象引发了社区热议,暗示了两者可...
作者为解决中文声调学习难题,基于Conformer和CTC技术训练了一款小型语音模型。通过数据优化与架构调整,模型参数从7500万压缩至900万,量化后仅11MB,可在浏览器端流畅运行,验证了边缘AI在特定教育场景下的高性价比与实用性。 原...
Obsidian社区推出了一款名为Multi ASR的强大插件,旨在为用户提供集成的语音识别服务。该插件不仅全面兼容OpenAI和Gemini的各类模型接口,还集成了智谱AI、阿里云、火山云等五大主流ASR服务商。用户支持自定义模型、提示词...
言犀键盘发布3.0版本,重点引入本地ASR模型SenseVoice Small,有效解决用户隐私顾虑。该版本提供int8和全量两种模型,在骁龙8Gen3机型上实测延迟低至70ms,并利用NNAPI加速。软件层面新增ASR供应商Prompt调...
作者在对比语音输入工具时发现,微信输入法的表现优于本地运行的LLM工具。微信方案在处理中英混合及专有名词时识别更准,且已引入AI优化。其产品理念尤为亮眼:无账号、无登录、无广告,支持跨设备剪贴板,主打轻量化“不粘人”。尽管暂缺电脑端语音输入...
本文介绍了如何将AI记忆中枢Nowledge Mem与语音输入工具Spokenly结合。通过在语音转录后、AI处理前运行Bash脚本调用NMEM的语义搜索功能,系统能自动召回历史记录中的项目名、变量名和专有名词。这种集成方案大幅提升了专业术...