使用已经录好的声音
发音、停顿和语气已经满意时,可以直接上传录音。先听一遍背景噪声和人声重叠情况,确保主要内容清楚可辨。
用 Magnific AI 将人像与语音组合成口型同步的数字人口播视频。可以上传自己的录音,也可以在工作区输入脚本生成语音,再让照片中的人物说出来,适合开场介绍、课程讲解和角色台词。
先确定说什么、怎么说,再生成数字人视频。
发音、停顿和语气已经满意时,可以直接上传录音。先听一遍背景噪声和人声重叠情况,确保主要内容清楚可辨。
选择“生成语音”,选定音色后输入台词。这段文字用于生成数字人说出的声音;另一个动画提示词则用于描述画面中的表演。
人像决定面部与构图,尽量让需要活动的五官完整、清晰地出现在画面中。
选择面部清晰的人像,避免手、麦克风、浓重阴影或极端角度遮住五官。这些遮挡会增加说话动画的表现难度。
头肩构图时,在头部周围留一些空间。根据口播用途选择合适的风格,可以是人物介绍,也可以是插画角色说台词。
把人物的视觉表现与说出的台词分开描述,再选择 720p 或 1080p 输出。
在动画提示词中写明与内容相配的表情、姿势或小幅动作。让表演配合语音,不要加入与口播无关的动作要求。
边听语音边看嘴型、表情和头部运动。特别留意开头与结尾,让说话自然开始、完整结束。
先确定观众需要听到什么,再让数字人的形象与表达服务于内容。
制作欢迎语、商品介绍或简短通知。开头直接说明重点,不要依赖图片中的小字传达关键信息。
将长解释拆成便于听懂的小段,或让虚构角色说出台词。需要更长成片时,可分别生成各段,再在剪辑软件中排列组合。
口播和动作视频依赖的输入不同,按主要目标选工具。
口头表达是重点时,选择数字人工具。用文案或录音确定台词,以人像作为说话主体。
希望用文字描述动作时,可用图生视频;想跟随现成表演时,可用动作控制。不以说话为主的运动,这两种方式更直接。
了解照片、文案和录音的准备方法。
可以。在 Magnific AI 数字人工具中选择“生成语音”,选定音色并输入脚本。再上传人像、描述视觉表演,生成的语音会提供口播的台词与节奏。
可以。选择“上传音频”并提供录音文件。尽量使用人声清晰、背景噪声少的音频,生成前先确认完整录音中的用词、节奏与停顿。
支持最长 5 分钟的音频,文件大小需符合上传区显示的限制。这个时长限制与输入文字生成语音时的文本长度限制不同。
脚本填写数字人要说的台词,动画提示词描述说话时的表情、姿态或动作。如果选择上传音频,说出的内容就由录音提供。
尽量使用单人、五官清楚的人像,让眼睛和嘴巴可见,头部周围留有空间。使用插画时也应让面部特征容易辨认,并使表情和构图符合预期表演。
可以上传目标语言的录音,或选择合适音色生成语音。先准备好各语言版本的台词或音频;数字人工具依据提供的声音生成说话动画,不会自动翻译上传的录音。
支持。可在分辨率选项中选择 720p 或 1080p。使用清晰人像作为输入,生成后检查面部细节和嘴型,再使用成片。
上传人像,输入脚本或添加录音,用 Magnific AI 制作数字人口播。
制作口播视频