数字人生成系统 形象管理   标签管理   耗时分析
🎬 生成数字人视频
🎵 仅合成音频

1. 选择音色(决定数字人的声音)

从已有音色里选一个,或上传一段参考音频克隆出新音色。

A 使用已有音色
或
B 上传新音频,克隆新音色
拖拽音频到此处,或 点击选择

支持 wav/mp3,建议 10 秒以上、清晰单人、无背景噪音。

音色管理 →
或
C 直接上传音频(仅本次使用,不进音色库)
拖拽音频到此处,或 点击选择

这段音频将直接作为口播音轨(无需填文案),用完不保存到音色库。选择后将忽略上方音色与文案。

2. 选择数字人形象(决定画面里的人)

点选一个下方形象,或上传一段正脸口播视频作为新形象。

A 从形象库中选择
或
B 上传新形象视频
拖拽视频到此处,或 点击选择

mp4 格式,正脸口播、清晰、时长足够的真人视频,效果最佳。

形象管理 →

3. 背景(可选,用于绿幕形象换背景)

若所选形象是绿幕视频,可挑一张背景图,系统会自动抠掉绿幕并叠加此背景。非绿幕形象请选“不替换背景”。

A 选择背景
或
B 上传新背景图
拖拽图片到此处,或 点击选择

jpg/png/webp;建议与视频同为竖屏比例,效果最佳。

4. 口播文案(数字人要说的话)

输入文字,用所选音色朗读;留空则直接用该音色的原始参考音频。

5. 生成

确认已选好音色与形象后点击开始,合成需数分钟,可在下方历史查看进度。

生成历史

创建时间开始/排队文案音色形象状态耗时成片操作

选择形象

选择音色