一周之内的第二步

据 Google Cloud 官方博客 9 月 24 日消息,Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 中正式开放,提供美国与欧盟端点,支持预置吞吐、企业合规与数据治理配置。就在一周前,谷歌刚发布原生语音到语音模型 Gemini 3.8 Live;而 Live Avatar 这个「会说话的脸」早在 Google Cloud Next 2026 上预览过,如今宣告进入企业生产可用状态。The Verge、unite.ai 等媒体当日跟进报道。

产品逻辑不复杂:语音底座负责听与说,Live Avatar 负责一张与语音实时同步的流式面孔,面向的典型场景是酒店前台终端、航司客服窗口、银行网页对话框——用户对着一张脸讲话,而不是一个输入框。

四层能力,一层一层看

拆开这份发布,能力大致分四层。语音底座是 Gemini 3.8 Live 的原生语音到语音通道,不需要传统语音识别再转文本的管线,中断恢复时既不丢对话上下文、也不丢后台事务。视觉层是流式数字人:口型与表情跟随语音实时变化,官方称在 97 种语言之间自动检测与切换时「不降低视频保真度、不引入视觉漂移」。动作层是异步工具调用——模型可以边说「我帮您查一下」,边在后台执行接口查询,对话不中断。理解层则支持摄像头画面与屏幕共享和音频并行处理,客服场景里用户举起手机展示损坏的商品,系统同步完成登记。

从语音底座到治理层:Live Avatar 的四层结构语音底座:Gemini 3.8 Live 原生语音到语音,中断恢复不丢上下文视觉层:流式数字人对口型与表情,97 种语言自动检测切换动作层:异步工具调用,边对话边在后台执行查询与事务治理层:预置数字人库 + 自定义需企业白名单 + SynthID 全程水印仅限 Gemini Enterprise(美欧端点)· 模型卡自述连续交互仅数分钟
Gemini 3.8 Live with Live Avatar 的四层能力结构

治理是这次发布着墨最多的部分

数字人产品的滥用风险显而易见,谷歌的应对分三层:企业只能从预置数字人库中选用;要生成基于参考照片的定制面孔,必须进入企业白名单并通过审核流程;所有生成的音频与视频流都嵌入不可感知的 SynthID 隐形水印,便于事后验证「这是 AI 生成的」。

另一份坦诚来自模型卡:Live Avatar 连续交互仅能维持数分钟而非数小时,可能出现幻觉、变慢或超时;知识截止于 2025 年 1 月;前沿安全评估认为其相对上一代没有实质性的新能力跃升,预计不会触发 Frontier Safety Framework 的追踪或关键能力等级。Gemini 3.8 Live Extended Thinking 则仍在私测阶段。

谁在用,怎么算钱

官方博客列举了几家客户:Cox Automotive 为 Autotrader 构建了对话式购车助手,用自然语言替代筛选器完成车型搜索、对比与金融方案;Equal AI 的电话客服系统声称日均处理超百万通电话、覆盖九种印度语言(公司口径);Salesforce 也在探索将其与自家客服产品组合。定价方面,谷歌未公布公开单价,预置吞吐与定制部署需联系销售团队。

冷静看:有脸之后,难的是身份

这份发布的信号意义大于单点功能:企业语音 AI 的竞争坐标,正在从「听得清、答得快、成本低」转向「有脸、有身份、可治理」。真正的考题也随之变化——水印在录屏、转码与二次分发之后还能否被检测出来,谷歌的材料没有说明;数字人在多大程度上需要向用户主动披露「我不是真人」,目前各国规则也不统一。数分钟的连续交互上限意味着它暂时是前台门面而非长任务载体。目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。