跳到主要内容

服务说明

1.概述

获得场景数字人服务包括视频数字人和互动数字人两个主要模块,视频数字人模块提供数字人分身、声音克隆和视/音频制作等功能,

互动数字人模块提供提供数字人的实时互动直播功能。利用该API能够与获得场景数字人服务进行对接,使用获得场景视频数字人和互动数字人功能。

目前,视频数字人模块API提供项目管理、数字人管理、背景管理、贴纸管理、PPT管理、音频和字幕管理等功能的接口。

互动数字人模块API提供创建直播、开启直播、直播接管排队、直播接管排队取消、关闭直播等接口。

如果您有使用该API的需求,请通过获得场景视频管理后台申请API Key,获取到API Key之后,才能正常使用该API进行对接。

2.通信约定

获得场景数字人API基于HTTP协议实现远程通信,并有以下约定:

2.1.公共参数

请求获得场景视频数字人API,需要在请求URL中携带以下公共参数:

参数名类型必需说明
accountIdString账号ID。
timeLong发送请求时的Unix时间戳,精确到秒。如:1291879392。
hashString请求接口时的签名,使用 THQS 算法计算生成。

2.2.接口参数

获得场景数字人API服务根据功能需要定义了支持HTTP GET和HTTP POST请求方式的接口。

  • HTTP GET:所有参数通过URL的QueryString传递,包含公共参数和接口定义参数。
  • HTTP POST:通过URL的QueryString传递公共参数和接口定义的Query参数;接口定义的Body参数以JSON格式,通过HTTP POST的请求体传递。

2.3.接口版本

获得场景数字人API服务提供的接口存在版本定义,需要使用version参数指定使用的接口版本。

参数名类型必需说明
versionString指定使用接口的版本号,具体版本支持在各接口中定义。

2.4.通信加密

获得场景数字人API的所有接口通信都是加密的,加密的核心思想是将原始的QueryString转换成和请求时间相关的HashedQueryString,然后再发送请求。

我们把这种通信加密的算法叫作THQS算法。关于THQS算法的说明,可以参考官网 THQS算法 的说明。

目前获得场景数字人API服务加密通信仅支持MD5方式。

2.5.响应格式

获得场景数字人API的所有接口均以 JSON 格式返回响应结果,对于不同的接口,正确的响应数据格式在每个接口定义中的详细的说明。

所有接口使用统一的错误响应格式,示例如下:

{
"error": "ERROR_CODE"
}

ERROR_CODE表示具体的错误原因,目前支持的ERROR_CODE如下:

ERROR_CODE说明
INVALID_REQUEST请求参数错误
PROCESS_FAIL服务端处理失败
SERVICE_EXPIRED数字人服务已过期
PERMISSION_DENY无数字人服务权限
LIMIT_EXCEEDED请求频率超限
NO_RESOURCES无数字人资源
...

2.6.数据编码

获得场景数字人API的所有接口只接受 UTF-8 编码的参数,响应数据同样采用 UTF-8 编码。

请求接口,在QueryString中传递参数时,参数值需要进行URLEncode之后再传递。

2.7.访问频率

获得场景数字人API使用令牌桶算法控制接口访问频率,限流策略如下:

  • 允许短时间的突发请求,峰值是100次。
  • 访问限流后每秒释放10次请求限制。

建议请求速度控制在10次/秒以内。

3.名词解释

  • 账号ID:用户注册获得场景视频服务时分配的唯一身份标识,可以在获得场景视频管理后台的个人信息中查看。
  • API Key:使用获得场景视频数字人API时的通信密钥,可以在获得场景视频管理后台的云点播-密钥管理页面查看。
  • 项目:用于保存制作视/音频时需要的属性参数的结构。
  • 作品:基于项目的参数制作的视/音频内容。
  • 数字人:使用人像或声音素材文件定制出来的人像或声音的模型,称为数字人。数字人分为人像数字人和声音数字人两个类型。
    • 人像数字人:使用人像口播素材定制出来的数字人模型。可用于合成包含人物形像的视频内容。
    • 声音数字人:使用声音素材定制出来的数字人模型。可用于合成特定音色的音频内容。
  • 模特人像:由数字人服务预先训练好的人像数字人,无需客户定制,直接使用。
  • 定制人像:由客户提供人像口播素材定制出来的人像数字人,定制成功后,在有效期内才能使用。可分为专属口型人像、通用口型人像和图片数字人。
    • 专属口型人像数字人:原人像数字人,为区分各类不同人像数字人,更名为专属口型人像数字人。是由客户提供一段真人视频素材,经过训练,定制出来的人像数字人。定制成功的人像数字人的外貌、动作与真人一致,合成视频时,使用真人专属的唇形播报内容。
    • 通用口型人像数字人:同样是由客户提供一段真人视频素材,经过训练,定制出来的人像数字人。定制成功的人像数字人的外貌、动作与真人一致,但是合成视频时,使用大模型生成的通用唇形播报内容。
    • 图片数字人:由客户提供一张包含人像的图片,不需要训练即可制作视频内容。合成视频时,图片数字人无肢体动作。
  • AI声音:由数字人服务预置的声音数字人,无需客户定制,直接使用。
  • 定制声音:由客户提供声音素材定制出来的声音数字人,定制成功后,在有效期内才能使用。可分为多语言版声音模型和专属定制版声音模型。
    • 多语言版声音模型:声音数字人的一种模型版本,特点:外语能力更出众。
    • 专属定制版声音模型:声音数字人的一种模型版本,特点:风格更像训练素材原人。