返回 AI 情报
模型精选 702026-09-16 01:05Tom OuyangGoogle DeepMind:Blog(RSS)

Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking

Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

精选理由

原文给出两个语音对话模型的定位分工和多项基准数字,读者可以据此评估其推理、成本与工具调用能力。

AI 摘要

Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。

正文 · AI 翻译

Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 是我们迄今最先进的实时对话模型。智能与并行推理能力的重大升级,使它们在与用户协作以及通过语音执行复杂任务时更加直观。

Tom Ouyang

首席工程师

Malini Jaganathan

技术团队成员,代表 Gemini Audio 团队

今天,我们推出两款新模型,在近实时推理方面带来进步,从而更有效地赋能语音智能体,并让与 AI 的对话感觉更直观、更智能。

Gemini 3.8 Live:为规模化和成本效率而打造,将对话智能与流畅对话和视觉接地相结合。

Gemini 3.8 Live Extended Thinking:为高复杂度任务而打造,具备更强的智能和多步推理能力。

对于开发者和企业而言,这些模型提供了构建可靠、可投入生产的语音智能体的基础模块。它们还让用户在 Gemini 应用、Google Workspace 和 Search 中与 Gemini 对话更加流畅、更具协作性——帮助你仅用语音就能应对复杂任务。

体验更流畅、更智能的对话

Gemini 3.8 Live Extended Thinking 提供企业级的任务完成能力与智能水平,在 Artificial Analysis 的语音到语音质量指数(Speech to Speech Quality Index)上以 82.6 分拿下总榜第一,并在智能体任务完成方面领先,在 τ-Voice 上达到 68.6%,在 Sierra 的 τ-Voice-banking 基准上达到 35.1%。它还具备强大的推理能力,在 Big Bench Audio 上得分 97.7%,同时相较于其他前沿模型保持了极具竞争力的价格。

Gemini 3.8 Live 在用户中表现出很高的偏好度,在 Speech Agent Arena 中位列第二。除这一表现外,它依然极具成本效益——为开发者和企业提供了一个能力强、效率高、专为规模化而打造的模型。

在 ServiceNow 的 EVA-Bench(一个用于评估语音智能体的基准)上,我们的模型通过成功平衡准确性与对话质量,推动了复杂工作流的帕累托前沿。

注:该测试运行于 Gemini Enterprise Agent Platform 上的 Live API。

Gemini 3.8 Live 以近乎实时的速度处理视觉输入,为对话补充上下文,从而给出更有帮助的回复。它能在对话过程中自动检测并在 97 种支持语言之间切换。它会在后台执行工具调用和 API 调用,同时继续对话,因此模型可以在确认请求后继续聊天,而任务则在后台完成。

Gemini 3.8 Live 实时指导员工入职,利用视觉上下文回答现场提问。

观看 Gemini 3.8 Live 借助视觉上下文、推理和自然的对话流,近乎实时地下棋。

对于需要更深层推理的任务,3.8 Live Extended Thinking 能够边推理边说话。它为复杂工作流带来更强的智能,同时保持不间断的对话流——使用诸如“让我查一下……”这样的早期口头提示来自然地回应提示词,并通过实时进度叙述,让用户随时了解多步骤后台任务的进展。

观看 Gemini 3.8 Live Extended Thinking 将原始草图和近乎实时的语音反馈转化为可用的 React 组件。

看看 Gemini 3.8 Live Extended Thinking 如何协调多步骤预订和异步函数调用——全程不打断自然的实时对话。

观看 Gemini 3.8 Live 通过自然语音即时构建完整的商业计划和定制营销工具包。

在 Google Workspace 和 Search 中,我们的 Live 模型带来更直观、更具协作性的体验——尤其是在处理你最复杂的任务时。

在 Google Workspace 中通过 Docs Live、Gmail Live 和 Keep Live 试用 Gemini 3.8 Live Extended Thinking。

在 Search Live 中直接获取由 Gemini 3.8 Live 驱动的分步实时故障排查帮助。

赋能开发者与企业语音生态

通过使用 Gemini Live API,Agora、Fishjam、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台,开发者可以轻松构建和部署高性能的语音驱动界面。这些平台在后台管理复杂的实时媒体流基础设施,让开发者能够完全专注于打造用户体验。

我们还与 Salesforce、Genspark 和 Lumeris 等公司合作,它们对 3.8 Live 和 3.8 Live Extended Thinking 充满期待,并强调了其令人印象深刻的延迟、流畅性和工具调用能力。

通过 SynthID 水印确保透明度

我们的 AI 产品生成的所有音频都使用 SynthID 添加水印。这种不可感知的水印直接编织进音频输出中,确保 AI 生成的内容可被检测,从而帮助防止错误信息传播。有关我们安全与责任方法的详细信息,请查阅模型卡。

开始使用我们最新的 Gemini Audio 模型:

3.8 Live 从今天开始逐步推出:

面向开发者:在 Gemini API 和 Google AI Studio 中

面向企业:在 Gemini Enterprise 中开启私密预览,并即将登陆 Gemini Enterprise for Customer Experience

面向所有人:在 Search Live 中

3.8 Live Extended Thinking 从今天开始逐步推出:

面向开发者:在 Gemini API 和 Google AI Studio 中

面向企业:在 Gemini Enterprise 中开启私密预览,并即将登陆 Gemini Enterprise for Customer Experience 以及 Google Workspace 企业客户

面向所有人:在 Gemini Live 中,以及面向 Workspace 中 Docs 的 Google AI Pro 和 Ultra 订阅用户,还有 Gmail 和 Keep 中的所有 Google AI 订阅用户

原文

Original Title

Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

Source

Google DeepMind:Blog(RSS)

Site

deepmind.google

Author

Tom Ouyang

Published

2026-09-16 01:05

阅读原文· deepmind.google

继续阅读