谷歌推出Gemini 3.1 Flash Live:专为实时语音与视觉AI Agent打造
谷歌AI负责人Logan Kilpatrick正式发布了代号为“Gemini 3.1 Flash Live”的新模型。这是一款专为构建具备实时语音和视觉能力的AI Agent而打造的底层技术。据官方透露,团队在过去一年多时间里,专注于模型架...
标签索引
这个标签下有 3 篇文章。按时间回看相关判断与实践记录。
标签精选
谷歌AI负责人Logan Kilpatrick正式发布了代号为“Gemini 3.1 Flash Live”的新模型。这是一款专为构建具备实时语音和视觉能力的AI Agent而打造的底层技术。据官方透露,团队在过去一年多时间里,专注于模型架...
这篇文章分享了作者从零构建低延迟语音助手的实测经验。不同于以往依赖 LiveKit 等现成框架,本次尝试完全基于纯 API 调用搭建,旨在探索性能极限。测试结果显示,得益于 Google Gemini 2.5 Flash Lite 的出色推...
Tavus的技术专家发布了一款实时多模态感知系统,旨在解决现有对话式AI过度依赖“逐字稿”的痛点。目前的绝大多数语音系统会将对话降维为文本,丢弃了大量非语言信号,而现有的情绪模型又难以在实时性和丰富度上兼顾。该新系统充分利用语音和视频信号,...