谷歌正式推出了 Gemini 3.5 Transcribe,这是一款迄今为止最精确的语音转文字模型。该模型旨在处理复杂的语音交互场景,能够克服背景噪音、专业术语识别以及语言不流利等传统难题,直接将原始音频转换为经过润色和格式化的准确文本。与上一代 Chirp 3 相比,该模型在延迟上降低了 70%,实时流式的词错率(WER)仅为 4.0%,非流式场景更是低至 2.6%。除了基础的转录功能,Gemini 3.5 Transcribe 引入了“智能转录”能力,能自动过滤填充词(如“呃”、“啊”)并处理说话人的自我修正。更重要的是,该模型支持“函数调用”功能,能够将任务指令(如图片生成、文件分析)通过语音指令委派给其他 Gemini 模型执行。开发者现可通过 Gemini API 中的 Live API(实时双向流式传输)和 Interactions API(预录制音频处理)来集成该模型。此外,该技术已通过 Rambler 功能集成到 Android Gboard 中,并将在 macOS 版 Gemini 应用及 Chrome 浏览器中上线,支持结合屏幕上下文进行更精准的语音交互,标志着语音交互向“Vibe Coding”和自动化办公迈出了重要一步。
事件分析
此次发布标志着语音交互技术从单一的“声学转录”向“语义理解与任务执行”的关键跃升。Gemini 3.5 Transcribe 的核心竞争力在于其结合了“屏幕上下文”与“函数调用”能力,这使得语音不再仅仅是输入文本的媒介,而是直接操作系统的指令入口。产业层面,谷歌通过在 Android (Gboard Rambler)、macOS 及 Antigravity 等多端深度集成该模型,展示了构建 AI 原生操作系统的野心,即利用多模态上下文(语音+视觉)来消除歧义,实现比传统键盘更自然的交互效率。对于开发者而言,低延迟流式 API 的开放降低了构建实时语音 Agent 的门槛,未来基于语音的“Vibe Coding”和自动化客服工具将迎来爆发。
核心观点:谷歌通过融合屏幕上下文与函数调用能力,将语音从被动转录工具升级为 AI Agent 交互的核心入口。
原文链接:Hacker News