问题
企业想部署“能听、能看、能说、边对话边调工具”的实时多模态对话代理(信号 1),但直接对接 Gemini 或 Meta 的新能力需要实时流式编排、唇形同步、工具调用和多语言语音链路,客服/运营团队自己搞不定,通用客服 SaaS 也还没跟上这波实时数字人形态。
目标用户
需要在线客服的中小企业客服/运营负责人,尤其是跨境、多语言场景(97 种语言语音直连是明确卖点);市场体量大(所有有线上客服的商家),但对新形态的真实付费意愿尚未验证。
解决方案
- 无代码数字人搭建:上传一张参考图生成自定义数字人形象,配置声音与性格
- 实时多模态会话:语音到语音直连,支持 97 种语言,带唇形同步的表情视频
- 对话中后台工具调用:客户说话的同时查订单、调 API、走异步工具
- 知识库与流程配置:把常见客服流程变成可视化的对话策略
- AI 的角色:调用大厂的实时多模态模型做语音/视觉/视频生成,产品自身负责编排、配置与企业工作流
为什么是现在
两周内 Google 与 Meta 相继发布了实时数字人能力:Gemini 3.8 Live 的 Live Avatar 支持“近实时视频生成+语音同步、对话中异步工具调用、97 种语言语音到语音”(信号 1、3),Meta 的 Muse Realtime Avatar 也把实时交互数字人开放给开发者(信号 2)。底层能力刚刚可用且被两家巨头同时供给,封装成企业易用产品的窗口刚刚打开。
MVP 范围
做:
- 接入 Gemini Live API(或 Meta Muse)的托管集成层:上传一张参考图生成品牌数字人形象
- 可视化配置对话流程、后台工具调用(查订单、改预约等)与知识库
- 网页嵌入式挂件 + 97 种语言的语音到语音自动切换
- 会话记录与转人工兜底
不做:
- 不自研视频生成或语音模型
- 不做本地部署/私有化
- 不做复杂数据分析后台
风险
- 平台依赖:核心能力完全押在 Google / Meta 的 API 上,价格、限额、接口变动随时可能吃掉利润空间
- 巨头挤压:Google 已经把 Live Avatar 直接打包进 Gemini Enterprise,Meta 也开放给开发者,封装层的差异化窗口可能很短
- 合规风险:数字人客服涉及身份披露与水印(信号中提到 SynthID),部分地区对合成形象有监管要求
- 实时成本:近实时视频生成的推理成本高,按量计费模式下定价不好做
已有产品
| 产品 | 定位 | 价格 |
|---|---|---|
| Gemini Enterprise | Google 面向企业的多模态对话代理方案,自带 Live Avatar 能力 | — |
| Live Avatar | Google 实时视频生成+语音同步的数字人形象功能,是本机会的核心底层能力 | — |
| Muse Realtime Avatar | Meta 的实时交互数字人技术,同样面向对话式 AI 开发者 | — |
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
TLDR AI9月25日新品发布
“Google launched Gemini 3.8 Live featuring a Live Avatar, enhancing user interaction.”
Google launched Gemini 3.8 Live featuring a Live Avatar, offering real-time responses and more personalized user experiences.原文
TLDR AI9月25日新能力
“Meta has introduced Muse Realtime Avatar, a technology that transforms conversations into expressive, interactive avatars in real time.”
Meta introduced Muse Realtime Avatar, a technology that transforms conversations into expressive, interactive avatars in real time.原文
Google DeepMind Blog9月24日新能力隐含付费意愿
“By pairing near real-time video generation with speech, the Live Avatar feature creates an experience that listens, sees, and speaks with a dynamic visual persona.”
Enterprises need live multimodal conversational AI that can generate a real-time visual avatar with synced speech, see and hear inputs, and execute tools in the background during dialogue.原文