形象克隆:一张照片,或一段视频
2D 路线面向“快速上线”——单张正脸照即可生成可实时驱动的超分形象;3D 路线面向“自由运镜”——通过多视角视频重建高斯人体,支持任意角度与形体动作。
- 素材质检:自动检测人脸角度、遮挡、光照与清晰度并给出补拍建议
- 形象微调:五官、肤色、发型、服装与背景可在线调整,无需重新建模
- 输出规格:最高 4K / 60fps,支持绿幕透明通道与自定义画布比例
- 授权校验:克隆前进行活体检测与肖像权授权确认,防止深度伪造滥用
形 象 路 线 对 比
| 对比项 | 2D 超分形象 | 3D 高斯人体 |
|---|---|---|
| 最少素材 | 1 张正脸照 | 3 分钟绿幕视频 |
| 建模耗时 | 3~5 分钟 | 15~30 分钟 |
| 运镜自由度 | 正面 ±25° | 360° 全自由 |
| 实时并发 | 单卡 20 路 | 单卡 6~8 路 |
| 适用场景 | 客服、导办、直播口播 | 展馆大屏、虚拟演播 |
声音克隆:听得出来是您,也能听得出情绪
5 秒样本即可完成音色复刻,20 秒样本达到商用级相似度。除了“像”,我们还解决“有感情”——支持 7 类情感风格与语速、停顿、重音的精细调节。
- 情感控制:中性 / 愉悦 / 亲切 / 严肃 / 关切 / 兴奋 / 遗憾
- 多语种与方言:普通话、粤语、川渝话等,以及英、日、韩、西、法、德等 40+ 语种
- 流式合成:支持边生成边播放,首包延迟低至 120ms
- 多音字与数字读法:按业务词典智能纠正,支持自定义发音词典
实时驱动:让口型、表情和语气在同一拍上
驱动引擎决定数字人“像不像活人”。我们从同步精度、打断响应与微表情三个维度做了工程化打磨。
音频驱动
输入任意语音流直接驱动口型与头部微动,兼容 TTS 合成音与真人录音,适合已有录音资产的存量内容数字化。
同步精度
音素级对齐模型,唇形同步误差峰值 <80ms,快速语速与绕口令场景仍可保持自然。
泛化能力
未在训练素材中出现过的口型与表情也能被合理推断,避免“固定几套口型循环播放”的机械感。
文本驱动
直接输入文本,由内置 TTS 合成语音并驱动口型,无需先生成音频文件,链路更短。
韵律控制
通过 SSML 或标记语法控制停顿、重音、语速与情感标签,让长文本播报不再单调。
流式输出
按句切分流式合成,首响时间比整段合成快 60% 以上,适合实时对话与直播场景。
真人动捕
通过普通 RGB 摄像头即可完成面部与上半身动作捕捉,无需专用动捕服与标记点。
表情迁移
把真人的微笑、皱眉、挑眉迁移到数字人脸上,适合虚拟演播与真人 + 数字人双主持形式。
动作生成
内置 200+ 手势与姿态资产,也可根据语义自动匹配讲解手势,减少手动 K 帧工作。
一句话打断
VAD 检测到用户开口即刻停止播报并转入聆听,不用等数字人把话说完,体验接近真人对话。
抢话处理
被打断后自动保留上下文,续答时从断点衔接,避免重复播报或丢失信息。
情绪反应
识别用户语气中的急、怒、疑、喜,动态调整语速与措辞,并触发转人工等策略。
智能体大脑:不只会聊天,还能把事办完
数字人的价值不在“能对话”,而在“能完成任务”。我们提供完整的智能体编排能力,把知识、工具与流程装配成可交付的业务能力。
- RAG 知识库:支持文档、表格、网页、数据库多源导入,混合检索 + 重排序,附引用溯源
- 工具调用:通过 Function Calling 对接内部系统,完成查询、办理、下单、预约等动作
- 工作流引擎:可视化编排多步骤任务,支持条件分支、人工审批与超时兜底
- 多轮记忆:会话级 + 用户级双层记忆,跨渠道识别老客户并延续上下文
- 安全护栏:敏感词拦截、话术边界约束、幻觉抑制与全量审计日志
# 智宇AI 智能体编排示例
agent:
name: 星瑶 · 网点柜员
model: zhiyu-chat-pro
persona: 亲切、专业、话术简洁,不承诺收益
knowledge:
- vault://bank/products/
- vault://bank/faq/personal-loan.md
tools:
- get_account_balance
- book_appointment
- transfer_to_human
guardrails:
blocklist: ["保本", "必赚"]
max_turns: 12
fallback: transfer_to_human
voice:
speaker: spk_xingyao
emotion: gentle
speed: 1.0
多模态感知
让数字人获得“感官”,才能从被动应答变成主动服务。
流式 ASR
边说边出字,安静环境准确率 98.6%,支持远场与降噪
VAD 打断
毫秒级人声检测,支持静音时长与灵敏度配置
视觉理解
摄像头输入识别到店、手势、证件与单据
情绪识别
7 类情绪 + 强度评分,驱动策略升级与转人工
全端接入与交付
一次建模,多端复用。所有信道共用同一套智能体与知识库。
| 交付方式 | 部署位置 | 数据边界 | 适用场景 |
|---|---|---|---|
| 标准 SaaS | 智宇公有云 | 平台隔离 | 快速验证、中小规模 |
| 专属云 | 独立 VPC | 独占资源 | 中大型企业、连锁机构 |
| 私有化 | 客户机房 | 数据不出域 | 金融、政务、军工 |
关键技术规格
以下为默认配置下的实测参考值,实际表现与素材质量、网络环境及部署方式相关。
| 能力项 | 指标 | 说明 |
|---|---|---|
| 形象建模耗时 | 3~5 分钟(2D)/ 15~30 分钟(3D) | 从素材上传完成到产出可驱动模型 |
| 最高输出分辨率 | 4K / 60fps | 1080P 为默认实时档位 |
| 唇形同步误差 | < 80ms(峰值) | 音频驱动模式下音素级对齐 |
| 端到端首响延迟 | 约 200ms | ASR + 大模型 + TTS + 驱动链路合计 |
| 单卡实时并发 | 20 路 1080P(2D) | NVIDIA A100 80G 参考值 |
| 音色克隆样本 | 5 秒起,20 秒达商用级 | 相似度与录音环境强相关 |
| 语种支持 | 40+ 语种,含 8 种中文方言 | 可定制行业专属词典 |
| 知识库单库容量 | 100 万文档 / 20 亿向量 | 支持分库与权限隔离 |
| 服务可用性 | 99.95% | 专属云及以上等级 SLA |
| 数据加密 | TLS 1.3 + AES-256 | 支持密钥托管与全量操作审计 |