拒绝订阅制,开发者自研上下文感知语音输入法 AriaType
为打破现有语音输入工具高昂的订阅壁垒,开发者开源了名为 AriaType 的客户端。该工具最大亮点在于支持“上下文感知”,能实时读取当前活动窗口内容,提取高频词优化 STT 识别与 LLM 润色效果,显著提升专业术语输入准确率。技术上采用 ...
标签索引
这个标签下有 27 篇文章。按时间回看相关判断与实践记录。
标签精选
为打破现有语音输入工具高昂的订阅壁垒,开发者开源了名为 AriaType 的客户端。该工具最大亮点在于支持“上下文感知”,能实时读取当前活动窗口内容,提取高频词优化 STT 识别与 LLM 润色效果,显著提升专业术语输入准确率。技术上采用 ...
OpenLess 是一款完全开源的语音输入工具,旨在成为商业软件 TypeLess 的免费替代方案。它支持“按住说话、松开即得”的交互模式,能够将用户的语音实时转换为经过 AI 润色的文本或 Prompt。目前该工具已具备语音识别、Prom...
这款名为 Voilà 的 macOS 语音输入工具专为解决开发者编码时的痛点而生。作者因厌倦频繁打字且不满现有工具在多语言支持及终端兼容性上的缺陷,耗时 6 个月自主开发。该工具核心亮点在于完美支持中英法等多语种混合识别,并集成了 Soni...
针对 Claude Code 及各类 AI Agent 使用中长文本输入繁琐的痛点,开发者推出了开源工具 Sayd Desktop。该工具结合云端实时转录与内置 LLM 润色技术,能直接将语音转化为干净、结构化的文本,有效解决了用户因打字疲...
本文基于作者每月二十万字的语音输入实战经验,指出语音输入法应明确区分为“聊天用短语音”与“创作用长语音”两类。短语音追求速度与实时性,以豆包为代表;长语音则依赖大模型润色、格式化及意图表达,SuperWhisper与Typeless更为专业...
近日,有网友发现微信 PC 版迎来了一项重要功能更新。在新版本中,微信自带的语音输入法已支持全局调用,用户可以在 Windows 系统的任何界面直接使用该功能进行文字输入,打破了仅限于微信聊天框的使用限制。据发帖者实际体验,使用该语音输入法...
本文分享了一种将字节跳动“豆包”PC客户端改造为Windows系统全局语音输入法的技术方案。作者通过对比发现,相较于微信语音输入,豆包的大模型能力能更智能地去除语气词并润色文本,更适合笔记和文档场景。针对豆包PC端缺乏全局输入支持的问题,作...
针对传统语音输入法识别准确率低、格式调整繁琐的痛点,开源项目“ByeType”提出了一种新范式:利用Qwen 3.5 Omni等多模态大模型直接处理音频,跳过传统语音识别环节。用户通过编写Markdown文件定义词汇表和转录规则,即可实现人...
针对传统语音输入无法准确识别技术术语(如PostgreSQL、Kubernetes)的痛点,开发者推出了开源工具ByeType。该工具摒弃了传统的ASR纠错模式,直接利用多模态大模型处理音频。用户可通过Markdown配置自定义词汇表(如同...
开发者开源了一款名为 VoiceInput 的 Windows 全局语音输入工具,旨在解决在使用 Cursor 等 AI 编程工具时打字效率低下的问题。该工具支持全局快捷键(默认 Ctrl+Shift+R),可将语音实时转换为文本并直接输入...