免费开源语音转文本工具 Handy 登场,挑战闭源竞品
GitHub 上发布了一款名为 Handy 的免费开源语音转文本应用程序,引发了社区关注。该工具采用了先进的 Parakeet V3 模型,配备图形用户界面(GUI),旨在降低普通用户的使用门槛。与 Superwhisper、MacWhis...
标签索引 / 第 3 页
这个标签下有 33 篇文章。按时间回看相关判断与实践记录。
标签精选
GitHub 上发布了一款名为 Handy 的免费开源语音转文本应用程序,引发了社区关注。该工具采用了先进的 Parakeet V3 模型,配备图形用户界面(GUI),旨在降低普通用户的使用门槛。与 Superwhisper、MacWhis...
OpenMOSS推出MOSS-Transcribe-Diarize模型,这是一款创新的AI语音处理工具,能够自动识别最长90分钟视频或音频中的不同说话者,并添加精确时间戳标记。该模型通过深度学习算法实现多人声分离与转录,极大提升字幕制作效率...
随着AI技术快速发展,国内许多AI厂商如科大讯飞、字节跳动等在文本模型上已兼容OpenAI的chat/completions端点。然而,在语音转录领域,用户普遍关注是否有类似兼容OpenAI Whisper的/audio/transcrip...
开发者推出Linux本地离线语音输入法VocoType-ibus,基于VocoType-cli引擎,支持Wayland和GNOME环境。采用PTT交互模式,按住F9键即可语音输入,松开立即上屏,延迟仅0.1秒。完全离线运行,保护隐私,中文识...
DeepSeek App在手机端最新版本悄然上线了语音识别功能,支持语音转文字。用户在Linux.do论坛讨论中提到,DeepSeek发布的模型中似乎没有语音识别能力,因此推测该功能可能采用了公司未公开的自家语音识别ASR技术。这一更新可能...
Qwen3-ASR是一个开源的语音识别工具,兼容OpenAI API接口,提供免费使用方案,适合开发者和研究人员。用户可通过Docker快速安装,支持多种模型如qwen3-asr和qwen3-asr:itn,后者启用逆文本标准化。文章详细介...
豆包软件在语音识别方面表现出色,能够准确识别快速说话和低声内容,识别速度快,用户体验良好。尽管该软件整体能力被评价为’有点拉胯’,但其语音识别功能却赢得了用户称赞。用户在实际使用中发现,豆包对’悄悄话&#...
作者分享了使用豆包AI的实战经验,指出其在OCR识别速度与准确度、语音转文字质量以及代码生成方面的显著优势。通过实际案例对比,豆包在处理中文和英文文本、尤其是手写识别方面表现优异。在修改刷机脚本的具体应用中,豆包成功生成了可用代码,而Cha...
豆包输入法凭借出色的语音识别功能引起用户关注。该输入法内置约150MB的本地模型,支持离线使用,即使在网络断开的情况下仍能保持高性能。用户在配置较低的红米14c设备上测试发现,其语音识别能够实现瞬时同步,识别准确度高,运行流畅。这种在低端设...
本文介绍了一种免费使用Qwen3-ASR语音识别服务的方法,该服务兼容OpenAI端口,可与Spokenly语音转文字应用完美集成。文章提供了两种免费使用途径:一是通过阿里云百炼官方赠额使用,二是通过API中转免密使用。详细介绍了部署步骤、...