谷歌正式推出了 Gemini 3.5 Transcribe,这是一款迄今为止最精确的语音转文字模型。该模型旨在处理复杂的语音交互场景,能够克服背景噪音、专业术语识别以及语言不流利等传统难题,直接将原始音频转换为经过润色和格式化的准确文本。与上一代 Chirp 3 相比,该模型在延迟上降低了 70%,实时流式的词错率(WER)仅为 4.0%,非流式场景更是低至 2.6%。除了基础的转录功能,Gemini 3.5 Transcribe 引入了“智能转录”能力,能自动过滤填充词(如“呃”、“啊”)并处理说话人的自我修正。更重要的是,该模型支持“函数调用”功能,能够将任务指令(如图片生成、文件分析)通过语音指令委派给其他 Gemini 模型执行。开发者现可通过 Gemini API 中的 Live API(实时双向流式传输)和 Interactions API(预录制音频处理)来集成该模型。此外,该技术已通过 Rambler 功能集成到 Android Gboard 中,并将在 macOS 版 Gemini 应用及 Chrome 浏览器中上线,支持结合屏幕上下文进行更精准的语音交互,标志着语音交互向“Vibe Coding”和自动化办公迈出了重要一步。
事件分析
核心观点:谷歌通过融合屏幕上下文与函数调用能力,将语音从被动转录工具升级为 AI Agent 交互的核心入口。
原文链接:Hacker News

评论前必须登录!
立即登录 注册