谷歌发布Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking两款实时对话模型,称其为迄今最先进的实时对话模型。两款模型在智能与并行推理方面进行重大升级,已通过Gemini API和Google AI Studio向开发者开放。

两款模型虽同面向语音Agent,但分工不同:Gemini 3.8 Live侧重低延迟和规模化部署,Extended Thinking则为需要多步骤推理、调用多个工具的复杂任务增加后台思考能力。谷歌称,此次更新要解决语音Agent的常见问题——用户要求查数据、调用系统或完成预约时,对话往往停下来等待工具返回结果,文字界面可显示“正在处理”,但语音通话中的几秒沉默会让人难以判断它究竟在思考、执行任务还是已失去响应。

据Live API技术文档,Extended Thinking可在后台规划任务并异步调用工具,同时先给出“我来查一下”之类的语音回应,任务执行中还能口头报告进度,最后说出结果。这也改变了开发者判断“一轮对话结束”的方式,需根据Live API返回的IN_PROGRESS和IDLE状态判断任务是否真正完成。文档还规定其工具调用必须采用非阻塞方式,思考深度可设为低、中、高三档。

两款模型不只处理语音,还支持视觉输入。Gemini 3.8 Live可在近乎实时的对话中处理用户展示的画面并结合语音问题作答,支持在对话中识别并切换97种语言。开发者博客列出识别确认码、保险理赔编号等字母数字混合信息,将实时音频与结构化数据结合,以及在持续输出语音时执行API调用等能力。两款模型均支持文字、图像、音频和视频输入,输入上限为131072 Token。

据评测机构Artificial Analysis的语音到语音榜单,Gemini 3.8 Live Extended Thinking的High配置取得82.6分综合指数。