帮助中心 · 工位指南

数字人口播:克隆声音 + 形象,批量出讲解视频

数字人口播怎么走通:声音克隆、形象上传、对口型成片三步,素材要求与计费口径,以及声音授权、肖像授权、背景音乐三条合规红线。

这篇讲怎么让"自己"出镜讲产品,又不必每条视频真人重录。入口在登录后顶部的「数字人口播」;没看到入口,说明当前用户组还没开通。

三步走通

  1. 声音克隆:传一段本人清晰人声,复刻成专属音色,一次性 50 积分,通常 1~2 分钟从「复刻中」变「可用」。不想克隆也可以直接用系统公共音色。
  2. 声音合成:选音色 + 粘文案(单次最多 10000 字),约每千字 3 积分,产出 mp3,可试听下载。
  3. 形象 + 生成口播视频:上传一段真人出镜视频当形象,让它把音频对口型说出来。按音频时长计费,标准档约 45 积分/分钟。

省事就用「✨ 一键成片」:填商品和诉求,AI 先给一份分镜表,你改完再逐镜自动配音、出画、合成。要逐步可控就用「手动流水线」:提取文案 → 改写(可指定语言,合成与标题跟着走)→ 合成语音 → 生成数字人 → 剪辑(字幕/去静音/背景音乐/画中画)→ 标题封面 → 打包导出。

素材要求

用途要求格式
声音克隆本人人声 10~20 秒,单人、无杂音最佳mp3 / wav / m4a
数字人形象正面、口部清晰的口播视频,10 秒以上、单人出镜mp4 / mov
口播音频可选「我合成的语音」,也可上传自己的录音mp3 / wav

样本质量基本决定成片质量:背景嘈杂、多人同声、侧脸或口部被遮挡,失败率明显更高。

要等多久

对口型渲染比出图慢,音频越长越久,1 分钟的音频通常要等好几分钟。提交前页面会显示预估扣费与预计等待,确认后才扣;任务在后台跑,关掉页面也不丢,稍后到「任务记录」取成片,失败自动退回积分。标准档之外还有高清档,能否使用取决于平台开通情况,价格以页面预估为准。

三条合规红线

  • 克隆前必须勾选已获得被复刻人的声音授权,不勾不能提交。
  • 添加形象时必须勾选已获得该人物的肖像与声音授权,见肖像授权
  • 背景音乐平台不提供曲库,需自备已获授权的曲目,见背景音乐与版权

平台不做自动发布——流水线最后一步是把成片连同标题、话题、简介打包下载,由你自己上传到目标平台。带商品原图的镜头同样受商品保真约束,计费口径见积分与计费

还没解决?写信给 [email protected]