OpenAI 当地时间周四宣布对其桌面版 ChatGPT 应用进行重大更新,正式引入了备受期待的 ChatGPT Voice 语音交互功能。此次更新基于 OpenAI 本月早些时候推出的全新 ChatGPT-Live 语音模型系列,核心突破在于赋予了 AI 强大的本地任务执行能力,使其从单纯的对话助手进化为可操控电脑的智能体。
新增的语音功能支持 ChatGPT Work 和 Codex 两种模式,并能直接调用计算机操作系统层面的能力,访问各类网站和应用程序。在 macOS 平台上,通过名为 Appshots 的技术,ChatGPT 获得了屏幕感知能力,可以读取并理解屏幕显示的内容及图片的替代文本。这意味着用户可以通过语音下达包含多个步骤的复杂指令,例如要求 AI 创建新的代码线程、提交 Pull Request 或排查 Bug 根因。在执行过程中,若 AI 需要确认信息,用户可随时通过语音打断并回应,实现了真正的交互式自动化。
值得关注的是,OpenAI 并非唯一的探索者。竞争对手 Anthropic 同步更新了 Claude 的语音模式,该功能支持 Opus、Sonnet 和 Haiku 模型,并能在 Gmail、Slack、Notion 和 Canva 等主流生产力工具中直接执行操作。这标志着 AI 行业正加速从“生成内容”向“代理操作”转型,语音正逐渐成为控制数字世界的通用指令接口。
事件分析
对开发工作流而言,这种“零手触”的交互方式是革命性的。它不仅降低了编写代码和调试的门槛,更意味着未来的软件开发将更多地转向“语音指挥 AI”的模式。Anthropic Claude 在同期的类似更新也印证了这一趋势:AI 厂商正竞相填补生成内容与实际操作系统任务之间的鸿沟。未来,能够安全、精准地调用系统工具链将成为衡量 AI Agent 实用性的关键指标。
💡 核心观点:语音交互正从“对话”进化为“指令”,标志着 AI Agent 从内容生成迈向系统级操作的新纪元。
原文链接:Linux.do





