跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
赞助推荐 开放可编程的智能路由
赞助推荐 开放可编程的智能路由

标签索引 / 第 3 页

语音识别

这个标签下有 33 篇文章。按时间回看相关判断与实践记录。

标签精选

相关内容

前沿哨所

OpenMOSS发布多人声转文本模型,支持90分钟视频处理

OpenMOSS推出MOSS-Transcribe-Diarize模型,这是一款创新的AI语音处理工具,能够自动识别最长90分钟视频或音频中的不同说话者,并添加精确时间戳标记。该模型通过深度学习算法实现多人声分离与转录,极大提升字幕制作效率...

1 分钟阅读323 阅读
前沿哨所

国内AI厂商能否兼容OpenAI Whisper音频接口?

随着AI技术快速发展,国内许多AI厂商如科大讯飞、字节跳动等在文本模型上已兼容OpenAI的chat/completions端点。然而,在语音转录领域,用户普遍关注是否有类似兼容OpenAI Whisper的/audio/transcrip...

1 分钟阅读221 阅读
前沿哨所

Linux本地语音输入法开源:低延迟PTT交互

开发者推出Linux本地离线语音输入法VocoType-ibus,基于VocoType-cli引擎,支持Wayland和GNOME环境。采用PTT交互模式,按住F9键即可语音输入,松开立即上屏,延迟仅0.1秒。完全离线运行,保护隐私,中文识...

1 分钟阅读473 阅读
前沿哨所

DeepSeek App悄然上线语音识别,疑用自研ASR技术

DeepSeek App在手机端最新版本悄然上线了语音识别功能,支持语音转文字。用户在Linux.do论坛讨论中提到,DeepSeek发布的模型中似乎没有语音识别能力,因此推测该功能可能采用了公司未公开的自家语音识别ASR技术。这一更新可能...

1 分钟阅读334 阅读
前沿哨所

开源Qwen3-ASR免费语音识别模型发布

Qwen3-ASR是一个开源的语音识别工具,兼容OpenAI API接口,提供免费使用方案,适合开发者和研究人员。用户可通过Docker快速安装,支持多种模型如qwen3-asr和qwen3-asr:itn,后者启用逆文本标准化。文章详细介...

2 分钟阅读215 阅读
前沿哨所

豆包AI实战体验:在OCR、语音识别与代码生成中的优势

作者分享了使用豆包AI的实战经验,指出其在OCR识别速度与准确度、语音转文字质量以及代码生成方面的显著优势。通过实际案例对比,豆包在处理中文和英文文本、尤其是手写识别方面表现优异。在修改刷机脚本的具体应用中,豆包成功生成了可用代码,而Cha...

1 分钟阅读187 阅读
前沿哨所

豆包输入法语音识别体验:离线精准,低配设备也能流畅运行

豆包输入法凭借出色的语音识别功能引起用户关注。该输入法内置约150MB的本地模型,支持离线使用,即使在网络断开的情况下仍能保持高性能。用户在配置较低的红米14c设备上测试发现,其语音识别能够实现瞬时同步,识别准确度高,运行流畅。这种在低端设...

1 分钟阅读359 阅读