OpenAI 桌面版 ChatGPT 新增语音控制,可操控电脑执行多步骤任务

OpenAI 当地时间周四宣布对其桌面版 ChatGPT 应用进行重大更新,正式引入了备受期待的 ChatGPT Voice 语音交互功能。此次更新基于 OpenAI 本月早些时候推出的全新 ChatGPT-Live 语音模型系列,核心突破在于赋予了 AI 强大的本地任务执行能力,使其从单纯的对话助手进化为可操控电脑的智能体

新增的语音功能支持 ChatGPT Work 和 Codex 两种模式,并能直接调用计算机操作系统层面的能力,访问各类网站和应用程序。在 macOS 平台上,通过名为 Appshots 的技术,ChatGPT 获得了屏幕感知能力,可以读取并理解屏幕显示的内容及图片的替代文本。这意味着用户可以通过语音下达包含多个步骤的复杂指令,例如要求 AI 创建新的代码线程、提交 Pull Request 或排查 Bug 根因。在执行过程中,若 AI 需要确认信息,用户可随时通过语音打断并回应,实现了真正的交互式自动化。

值得关注的是,OpenAI 并非唯一的探索者。竞争对手 Anthropic 同步更新了 Claude 的语音模式,该功能支持 Opus、Sonnet 和 Haiku 模型,并能在 Gmail、Slack、Notion 和 Canva 等主流生产力工具中直接执行操作。这标志着 AI 行业正加速从“生成内容”向“代理操作”转型,语音正逐渐成为控制数字世界的通用指令接口。

事件分析

此次更新的核心在于将大语言模型从“被动对话者”转变为“主动执行者”。传统语音交互仅限于信息查询,而 OpenAI 桌面版通过集成系统级 API(如 macOS 的 Appshots 和屏幕读取能力),赋予了 AI 感知环境并操作系统的能力。这表明 AI Agent 正在从单一模态(文本/语音)向多模态融合(感知+决策+行动)演进。

对开发工作流而言,这种“零手触”的交互方式是革命性的。它不仅降低了编写代码和调试的门槛,更意味着未来的软件开发将更多地转向“语音指挥 AI”的模式。Anthropic Claude 在同期的类似更新也印证了这一趋势:AI 厂商正竞相填补生成内容与实际操作系统任务之间的鸿沟。未来,能够安全、精准地调用系统工具链将成为衡量 AI Agent 实用性的关键指标。

💡 核心观点:语音交互正从“对话”进化为“指令”,标志着 AI Agent 从内容生成迈向系统级操作的新纪元。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册