首页 / 产品能力

把数字人开发,拆成可以直接调用的能力

形象、声音、驱动、大脑、感官、接入 —— 六个模块各自独立可用,组合起来就是一个完整的数字人智能体。

01 · Avatar Cloning

形象克隆:一张照片,或一段视频

2D 路线面向“快速上线”——单张正脸照即可生成可实时驱动的超分形象;3D 路线面向“自由运镜”——通过多视角视频重建高斯人体,支持任意角度与形体动作。

  • 素材质检:自动检测人脸角度、遮挡、光照与清晰度并给出补拍建议
  • 形象微调:五官、肤色、发型、服装与背景可在线调整,无需重新建模
  • 输出规格:最高 4K / 60fps,支持绿幕透明通道与自定义画布比例
  • 授权校验:克隆前进行活体检测与肖像权授权确认,防止深度伪造滥用
申请形象克隆试用

形 象 路 线 对 比

对比项2D 超分形象3D 高斯人体
最少素材1 张正脸照3 分钟绿幕视频
建模耗时3~5 分钟15~30 分钟
运镜自由度正面 ±25°360° 全自由
实时并发单卡 20 路单卡 6~8 路
适用场景客服、导办、直播口播展馆大屏、虚拟演播
音色相似度96.4%
自然度 MOS4.62 / 5.0
情感还原度91%
首包合成延迟120ms
音色库容量无上限
02 · Voice Cloning

声音克隆:听得出来是您,也能听得出情绪

5 秒样本即可完成音色复刻,20 秒样本达到商用级相似度。除了“像”,我们还解决“有感情”——支持 7 类情感风格与语速、停顿、重音的精细调节。

  • 情感控制:中性 / 愉悦 / 亲切 / 严肃 / 关切 / 兴奋 / 遗憾
  • 多语种与方言:普通话、粤语、川渝话等,以及英、日、韩、西、法、德等 40+ 语种
  • 流式合成:支持边生成边播放,首包延迟低至 120ms
  • 多音字与数字读法:按业务词典智能纠正,支持自定义发音词典
03 · Realtime Driving

实时驱动:让口型、表情和语气在同一拍上

驱动引擎决定数字人“像不像活人”。我们从同步精度、打断响应与微表情三个维度做了工程化打磨。

音频驱动

输入任意语音流直接驱动口型与头部微动,兼容 TTS 合成音与真人录音,适合已有录音资产的存量内容数字化。

同步精度

音素级对齐模型,唇形同步误差峰值 <80ms,快速语速与绕口令场景仍可保持自然。

泛化能力

未在训练素材中出现过的口型与表情也能被合理推断,避免“固定几套口型循环播放”的机械感。

文本驱动

直接输入文本,由内置 TTS 合成语音并驱动口型,无需先生成音频文件,链路更短。

韵律控制

通过 SSML 或标记语法控制停顿、重音、语速与情感标签,让长文本播报不再单调。

流式输出

按句切分流式合成,首响时间比整段合成快 60% 以上,适合实时对话与直播场景。

真人动捕

通过普通 RGB 摄像头即可完成面部与上半身动作捕捉,无需专用动捕服与标记点。

表情迁移

把真人的微笑、皱眉、挑眉迁移到数字人脸上,适合虚拟演播与真人 + 数字人双主持形式。

动作生成

内置 200+ 手势与姿态资产,也可根据语义自动匹配讲解手势,减少手动 K 帧工作。

一句话打断

VAD 检测到用户开口即刻停止播报并转入聆听,不用等数字人把话说完,体验接近真人对话。

抢话处理

被打断后自动保留上下文,续答时从断点衔接,避免重复播报或丢失信息。

情绪反应

识别用户语气中的急、怒、疑、喜,动态调整语速与措辞,并触发转人工等策略。

04 · Agent Brain

智能体大脑:不只会聊天,还能把事办完

数字人的价值不在“能对话”,而在“能完成任务”。我们提供完整的智能体编排能力,把知识、工具与流程装配成可交付的业务能力。

  • RAG 知识库:支持文档、表格、网页、数据库多源导入,混合检索 + 重排序,附引用溯源
  • 工具调用:通过 Function Calling 对接内部系统,完成查询、办理、下单、预约等动作
  • 工作流引擎:可视化编排多步骤任务,支持条件分支、人工审批与超时兜底
  • 多轮记忆:会话级 + 用户级双层记忆,跨渠道识别老客户并延续上下文
  • 安全护栏:敏感词拦截、话术边界约束、幻觉抑制与全量审计日志
agent-config.yaml
# 智宇AI 智能体编排示例
agent:
  name: 星瑶 · 网点柜员
  model: zhiyu-chat-pro
  persona: 亲切、专业、话术简洁,不承诺收益
  knowledge:
    - vault://bank/products/
    - vault://bank/faq/personal-loan.md
  tools:
    - get_account_balance
    - book_appointment
    - transfer_to_human
  guardrails:
    blocklist: ["保本", "必赚"]
    max_turns: 12
    fallback: transfer_to_human
  voice:
    speaker: spk_xingyao
    emotion: gentle
    speed: 1.0
05 · Perception

多模态感知

让数字人获得“感官”,才能从被动应答变成主动服务。

流式 ASR

边说边出字,安静环境准确率 98.6%,支持远场与降噪

VAD 打断

毫秒级人声检测,支持静音时长与灵敏度配置

视觉理解

摄像头输入识别到店、手势、证件与单据

情绪识别

7 类情绪 + 强度评分,驱动策略升级与转人工

06 · Integration

全端接入与交付

一次建模,多端复用。所有信道共用同一套智能体与知识库。

Web 组件(<script> 一行引入) H5 / 公众号 微信小程序 iOS / Android SDK Windows / Android 一体机 RTMP / SRT 直播推流 SIP 电话信道 WebRTC 低延迟通话
交付方式部署位置数据边界适用场景
标准 SaaS智宇公有云平台隔离快速验证、中小规模
专属云独立 VPC独占资源中大型企业、连锁机构
私有化客户机房数据不出域金融、政务、军工
Specifications

关键技术规格

以下为默认配置下的实测参考值,实际表现与素材质量、网络环境及部署方式相关。

能力项指标说明
形象建模耗时3~5 分钟(2D)/ 15~30 分钟(3D)从素材上传完成到产出可驱动模型
最高输出分辨率4K / 60fps1080P 为默认实时档位
唇形同步误差< 80ms(峰值)音频驱动模式下音素级对齐
端到端首响延迟约 200msASR + 大模型 + TTS + 驱动链路合计
单卡实时并发20 路 1080P(2D)NVIDIA A100 80G 参考值
音色克隆样本5 秒起,20 秒达商用级相似度与录音环境强相关
语种支持40+ 语种,含 8 种中文方言可定制行业专属词典
知识库单库容量100 万文档 / 20 亿向量支持分库与权限隔离
服务可用性99.95%专属云及以上等级 SLA
数据加密TLS 1.3 + AES-256支持密钥托管与全量操作审计

想看这些能力在您业务里的实际效果

提供素材与场景说明,我们用 30 分钟做一次在线实机演示,并把可行性结论直接告诉您。