DeepMind 正式推出 Gemini 3.8 Live 系列实时音频模型,包含 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个版本,补齐大模型在实时音视频交互场景的能力缺口。
![]()
Gemini 3.8 Live 原生支持近实时视觉输入,同步覆盖 97 种语言的语音交互,模型可在对话过程中后台调用各类工具,一边接收语音、画面信息,一边完成信息检索、数据计算等动作,延迟表现适配实时对话、远程交互场景。
![]()
其中 Extended Thinking 版本,重点面向复杂长链路任务。不同于普通实时模型只做简短应答,该版本在保持低延迟语音交互的基础上,强化深度推理能力,语音相关评测指标实现大幅提升。用户可以用自然语音下达多步骤复杂指令,模型边听边思考,分步完成整套任务,不再局限于一问一答式简单沟通。
实时多模态交互,一直是 AI 落地远程协作、智能客服、现场辅助、实时翻译等场景的核心瓶颈。过往多数实时语音模型,推理能力偏弱;强推理大模型又很难做到低延迟音画同步。Gemini 3.8 Live 系列的发布,尝试平衡实时响应速度与深度推理能力。
![]()
在行业竞争层面,实时 Agent 交互正在成为巨头角逐新战场。语音、视觉、工具调用三者融合,意味着 AI 不再只能处理静态文本,能够同步感知现实世界画面与语音,实时参与人的工作流程。
不过实时多模态模型仍存在挑战,持续长时对话稳定性、复杂环境下语音识别抗干扰能力,以及大规模商用后的算力成本,依旧是后续需要持续优化的方向。这套模型的落地,将进一步推动实时 AI 交互从 Demo 走向产业场景。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.