跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
前沿哨所

谷歌发布 Gemini 3.5 Transcribe:支持实时流式与上下文感知的智能语音模型

3 分钟阅读阅读()
赞助推荐 团队协作里的 AI 办公工作台

谷歌正式推出了 Gemini 3.5 Transcribe,这是一款迄今为止最精确的语音转文字模型。该模型旨在处理复杂的语音交互场景,能够克服背景噪音、专业术语识别以及语言不流利等传统难题,直接将原始音频转换为经过润色和格式化的准确文本。与上一代 Chirp 3 相比,该模型在延迟上降低了 70%,实时流式的词错率(WER)仅为 4.0%,非流式场景更是低至 2.6%。除了基础的转录功能,Gemini 3.5 Transcribe 引入了“智能转录”能力,能自动过滤填充词(如“呃”、“啊”)并处理说话人的自我修正。更重要的是,该模型支持“函数调用”功能,能够将任务指令(如图片生成、文件分析)通过语音指令委派给其他 Gemini 模型执行。开发者现可通过 Gemini API 中的 Live API(实时双向流式传输)和 Interactions API(预录制音频处理)来集成该模型。此外,该技术已通过 Rambler 功能集成到 Android Gboard 中,并将在 macOS 版 Gemini 应用及 Chrome 浏览器中上线,支持结合屏幕上下文进行更精准的语音交互,标志着语音交互向“Vibe Coding”和自动化办公迈出了重要一步。

事件分析

此次发布标志着语音交互技术从单一的“声学转录”向“语义理解与任务执行”的关键跃升。Gemini 3.5 Transcribe 的核心竞争力在于其结合了“屏幕上下文”与“函数调用”能力,这使得语音不再仅仅是输入文本的媒介,而是直接操作系统的指令入口。产业层面,谷歌通过在 Android (Gboard Rambler)、macOS 及 Antigravity 等多端深度集成该模型,展示了构建 AI 原生操作系统的野心,即利用多模态上下文(语音+视觉)来消除歧义,实现比传统键盘更自然的交互效率。对于开发者而言,低延迟流式 API 的开放降低了构建实时语音 Agent 的门槛,未来基于语音的“Vibe Coding”和自动化客服工具将迎来爆发。

核心观点:谷歌通过融合屏幕上下文与函数调用能力,将语音从被动转录工具升级为 AI Agent 交互的核心入口。

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库

原文链接:Hacker News

赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 谷歌发布 Gemini 3.5 Transcribe:支持实时流式与上下文感知的智能语音模型
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型