🎬 我只錄 10 秒,就用自己的聲音做出一支短片|Voicebox+Qwen3-TTS 實測
🎙️ 核心观点 Voicebox 搭配 Qwen3-TTS 的核心价值并非单纯模仿声音,而是提升制作效率。当脚本需修改、需多版本或不想重录旁白时,能快速完成后置工作。建议开场与结尾保留真人原声,中间资讯部分使用 AI 克隆,以兼顾效率与自然感。 💻 关键事实/论据 硬件环境:Windows 11 系统,搭载 NVIDIA Super 2070 显卡。 声音克隆前提:需录制 10-20 秒干净、无背景音的完整句子;参考文字须转为简体中文且与录音逐字稿完全一致,以确保稳定性。 生成策略:避免一次性生成整段旁白,建议按画面切分为五段单独输出,便于局部修正错误。 伦理规范:优先使用本人声音或已获授权的声音,避免冒充他人。 ✅ 结论与适用场景 该工作流适合需要快速产出短影音、且对旁白灵活性有需求的创作者。通过分段生成与真人/AI 混合剪辑,可有效降低重录成本并保证成片质量。