登录以后继续

工业5.0 场景实训视频

一个入口,四步走完:脚本 → 配音 → 渲染 → 发布。
本页只做编排,真正的合成/渲染/入库由各后端模块完成,任务状态存在服务器,随时可中断再续。
1
准备讲稿
2
形象与配音
3
视频渲染
4
发布同步

第 1 步 · 准备配音(脚本 + 语音)

本页只负责视频渲染。脚本编辑与音频合成统一走 对话配音 页 —— 那边有双角色、参考音频克隆、试听与历史记录。
在这里贴上它给你的一句话即可继续。(也可以直接手写台词,效果一样。)
逐行对话(角色名:台词,无冒号按旁白)或粘贴 JSON 数组([{"role":"操作员","text":"台词"}])。 最多 2 个说话人,单次上限 100 句 / 20000 字。

第 2 步 · 成片方式、画面与配音来源

图片轮播推荐
选 1~30 张图,按音频时长自动均分轮播,本地一步合成硬字幕。
几十秒出片,不消耗信用点;不需要口型对齐时用这个。
数字人口播
单张形象照 + 音频 → 云端口型对齐,人物真的会说话。
1 点/秒;单段最长约 3 分钟,超长自动分段拼接。
按点击顺序依次播放,图上的数字就是它在视频里出现的次序;再点一次可取消。 图片显示时长 = 音频总时长 ÷ 图片张数,自动计算。
正在加载形象…
在「对话配音」页完成合成后,把结果里的音频地址粘到下面;也可以直接从本机选文件上传, 或从你的配音记录里挑一条。

上传 srt / ass / vtt,图片轮播路线会把它硬烧进画面(时间轴以你上传的为准,最准)。 留空则由系统自己识别语音生成字幕。 数字人口播路线下只作配套文件登记、不烧录。
艾智语途 · 字幕效果预览 正在读取字体清单…
字体取自服务器已安装字体,成片里的字幕就是这里选的样子。 选「微软雅黑」最稳妥;投大屏或需要更醒目时用黑体;语文/人文类课程可用楷体或思源宋体。
由后端配音师按脚本自动合成(无参考音频则用默认音色)。 需要音色克隆或精细控制时,请回到「对话配音」页合成后再用上面的方式引用。

第 3 步 · 渲染进度

系统按「文案 → 语音 → 剪辑」顺序执行,中途设有确认节点。 每 5 秒自动刷新一次,页面可随时关闭。
① 文案 · 整理实训讲稿等待中
② 语音 · 准备配音音轨等待中
③ 剪辑 · 渲染视频等待中
✅ 渲染完成!可以进入下一步发布,或先预览确认。

第 4 步 · 发布与知识库同步

填写作品信息后发布:成片登记到作品库(VideoGenWorks), 讲稿同步到知识库(RAG 检索生效)。发布后可在「我的作品」中查看。
当前为游客浏览 · 填写与预览不受限,登录以后才能提交任务