艾智语途工场 · 使用指南

AI 赋能全场景教学与创新——深度对话、角色与情景对话、语音克隆、语音定制、语音识别、音频润色、音频切分、二维码、情景短片、图片生成、数字人视频、智能体协作、视频课程与广场、教师定制对话室,一站式说明书

艾智语途工场是干什么的?

这是一个 AI 赋能教学的一站式在线工场:您只需提供文稿、照片或一段录音, 平台就能帮您产出 配音音频、双语字幕、数字人讲课视频、PPT 课件、情景短片 等完整教学资源, 并可直接发布为带 AI 老师 7×24 小时答疑的在线课程。 从一份讲稿到一门「慕课 + AI 答疑」的课程,全程在这里完成。

声音:克隆/定制音色 · 语音识别 · 切分润色 视频:数字人讲课 · 情景短片 · 灵感复刻 课件:AI 绘图 · PPT 生成 · 二维码 课程:视频发布 · AI 答疑 · 学情数据 对话:深度交流 · 虚拟角色 · 情景口语
多数模块免登录即可体验;合成类功能按点数计费(注册会员每日有免费额度)。 下方思维导图可点击直达每个模块的详细说明。 也可以直接向平台咨询(在线留言或微信扫码联系客服)。

深度交流 · AI 智能对话 进入模块

AI 大语言模型驱动的智能对话助手。支持多轮上下文交流,可用于备课答疑、教学设计研讨、语言知识讲解、翻译与写作润色等场景。

三步上手

1
在底部输入框中输入您的问题(支持中英文)。
2
点击发送,AI 将流式输出回答,可中途停止。
3
继续追问可保持上下文;点击"新对话"清空重来。

常见问题

回答到一半可以停止吗?
可以。生成过程中点击"停止"按钮即可中断输出,已生成的部分会保留。
对话记录会保存吗?
当前页面会话在刷新后清空。重要内容请及时复制保存。

智能体协作 · CrewStudio 进入模块

多智能体(AI Agent)协作工作室。您可以定义多个角色各异的 AI 智能体(如撰稿人、审校员、翻译官),让它们围绕一个任务分工协作、接力完成,适合课程脚本创作、长文写作、多轮翻译润色等复杂任务。

三步上手

1
创建任务:用一句话描述您要完成的复杂任务。
2
组建团队:选择或自定义参与协作的智能体角色。
3
启动协作:观察各智能体接力工作,收获最终成果。

常见问题

和"深度交流"有什么区别?
深度交流是单个 AI 与您对话;智能体协作是多个 AI 之间互相配合完成任务,您更像"项目经理"而非对话者。
协作耗时多久?
视任务复杂度而定,多智能体接力通常需要几分钟,请耐心等待各角色依次输出。

视频制作流水线(编剧 → 配音师 → 剪辑师) 进入模块

模板 Crew 一条龙产出教学视频:编剧撰写文案(也可直接粘贴现成文案)→ 配音师合成配音(音色描述定制,或参考音频克隆)→ 剪辑师用数字人形象合成成片。每个阶段完成后由您确认再进入下一步,不满意可当场修改重来;任务在服务器上运行,支持断点续跑与多任务并行。目标时长 1~30 分钟(约 300 字/分钟),超 3 分钟自动分段渲染 + 叠化丝滑拼接。

三个阶段

1
编剧:填写视频主题,选择目标时长(1~30 分钟)与语言;AI 撰写口播文案,您审阅修改后点「确认文案」。有现成文案可直接粘贴(20~9000 字)跳过 AI 生成。
2
配音师:用文字描述想要的声音,或从参考音频库选择音色克隆;试听满意后确认。也可以直接上传现成配音音频(wav/mp3/m4a/ogg,≤100MB)跳过合成。
3
剪辑师:选择数字人形象(AI 生成 2 点/张,或本地上传照片)与分辨率,确认预扣费用后开始合成;完成后在线预览并下载成片。

常见问题

整条流水线费用怎么算?
文案撰写免费;AI 生成数字人形象 2 点/张;AI 配音 2 点/百字;视频合成(灵动人像)1 点/秒,2 分钟成片约 120 点,合成失败全额返还。视频合成前会显示预估费用,确认后才预扣。
中途关掉页面,任务会丢吗?
不会。任务在服务器上持续运行,重新打开流水线即可接着上次的阶段继续(断点续跑);还可以同时跑多个视频任务。
最长能做多长的视频?
目标时长 1~30 分钟(约 300 字/分钟);自备文案最长 9000 字,自备配音音频最长约 30 分钟(≤100MB)。超过 3 分钟的视频自动分段渲染再叠化拼接,长视频也能稳定出片。
和「数字人视频生成」(VideoGen)有什么区别?
VideoGen 是单步直出:填好文案和形象一次提交即成片,适合快速出活;视频制作流水线是分阶段确认式生产,文案、配音、形象每一步都能修改重来,适合精雕细琢的课程视频。

语音克隆合成 进入模块

AI 情感语音克隆。只需一段 3-9 秒的参考音频,AI 即可模仿该音色朗读您输入的任何文字,情感自然、相似度高,适合课件配音、课文范读、个性化语音素材制作。支持长文本自动分段拼接(最长约 30 分钟)、合成成功自动附赠 SRT 双语字幕、「克隆历史」随时回听下载。

三步上手

1
选参考音频:从参考音频库选择(或本地上传)一段清晰人声,并填写对应的参考文本。
2
输入合成文本:填写要朗读的内容(可粘贴或载入 txt 文件,实时字数统计),选择语种。
3
点击开始合成,等待生成后在线试听、下载音频与 SRT 字幕。

常见问题

参考音频有什么要求?
建议 3-9 秒、单人声、无背景音乐、无噪音的清晰录音。超过 9 秒的部分无法参与克隆。可以在"参考音频库"中预先管理您的音频。
为什么要填"参考文本"?
参考文本就是参考音频里说的那句话的原文。准确填写能显著提升克隆相似度;填错或留空会导致合成效果下降。
英文课文里的汉语拼音(如人名朝代)会读错吗?
不会。遇到拼音时用「拼音+声调数字」标注即可按中文发音,如 Tang2 念"唐"、Sui2 念"绥";点「一键标注」按钮可由 AI 自动完成拼音与停顿标注,标注符号不会进入合成语音和字幕。
合成一次要多久?
短文本几秒到几十秒;上万字的长文本由系统自动分段合成并无缝拼接(约 30 分钟上限),请耐心等待进度完成,不要重复点击。
附赠的 SRT 字幕有什么用?
与合成音频逐段对应、时间轴精准,行长可控;直接导入剪映即可生成字幕轨道,省去手动打轴。

智能语音定制合成 进入模块

AI 声音设计合成。不需要任何参考音频——用自然语言"描述"您想要的声音(如"一位亲切的女教师,语速适中"),AI 即可凭空创造出符合描述的音色并朗读文本,适合快速尝试不同风格的配音。

三步上手

1
描述声音:在"音色描述"框写出您想要的声音特征(性别、年龄感、情绪、语速等)。
2
输入文本:填写要合成的内容(最长 1500 字),选择语种。
3
点击生成语音,稍候即可试听;满意后可下载保存。

常见问题

音色描述怎么写效果好?
越具体越好。推荐组合:性别年龄 + 情绪语气 + 语速节奏,例如"沉稳的中年男声,语气温和,语速偏慢,适合讲故事"。
和"语音克隆"选哪个?
想模仿某个真实人物的声音,用"语音克隆";想快速创造新风格的声音、不需要像谁,用"语音定制"。
页面右上角显示"未连接"怎么办?
说明语音服务暂时不可用,请稍等片刻刷新;若持续未连接,请联系管理员。

双角色对话配音 进入模块

把一段双人对话脚本一键合成为完整的多角色对话音频。两个角色可各自指定音色:上传参考音频走「语音克隆」,或用自然语言描述走「语音定制」,两种方式可混用。没有现成脚本也能用——填一句提示词(可附带参考文件或图片)让 AI 帮你写对话,写完还能再润色。系统逐句合成后自动拼接、统一音质,并按轮次插入自然停顿,同时附赠时间轴精准的 SRT 字幕,适合课文对话朗读、情景剧配音、听力素材与口语课件制作。

三步上手

1
设置两个角色的音色:角色 A、B 各自上传参考音频(3-10 秒)或填写音色描述;都不填则使用默认中性音色。可调语速、音调、音量。
2
准备对话脚本(三种方式任选):① 直接手写,每行一句「角色名:台词」(中英文冒号都可以);② 点「上传」导入 txt / doc / docx / pdf;③ 点「生成对话脚本」——填一句提示词(如「老师和学生讨论人工智能,6 句」),可点左侧 📎 附一份参考材料、或 🖼️ 传一张图片,AI 据此自动写对话。然后点「解析脚本」生成台词清单,可逐句编辑、调整说话人或删除;点「保存文本」可把当前脚本下载为 .txt 备份。
3
需要时先点AI 润色(结果确认后才回填,原脚本随时可恢复),再点开始合成,等待逐句完成后在线试听、下载 MP3 与 SRT 字幕。

常见问题

脚本必须是什么格式?
每行一句「角色名:台词」,例如「老师:同学们好。」。角色名按首次出现的顺序自动对应角色 A 和角色 B。没写角色名的行会被当作「旁白」并标黄,请在表格里为它指定说话人,否则该行不参与合成。
只能用两个角色吗?
是的。检测到第三个角色名时会提示拆分脚本。如确需多角色,建议分段合成后在剪辑软件中拼接。
两个角色用不同方式(一个克隆、一个描述)可以吗?
可以。拼接时系统会把所有片段统一到同一采样率与声道,不会出现变速变调;不同引擎的音质差异属正常现象。
AI 润色会打乱我的对话结构吗?
不会。润色只改台词措辞,保留行数与角色前缀。系统还会把结果与原文逐行比对,一旦发现角色顺序对不上,会自动回退为原文并且本次不计费。
某一句合成失败了会怎样?
该句自动重试一次;仍失败则用 0.6 秒静音占位并继续合成后面的句子,最终结果页会明确列出失败的句子,便于修正台词后重新合成。只有全部句子都失败时才会整体报错。
单次合成的规模上限是多少?
100 句、20000 字。超过请在解析阶段按提示拆分脚本。超长单句(超过 1200 字)会自动按句末标点切分。
页面右上角显示引擎不可用怎么办?
「语音克隆」引擎为单并发,若正有其他合成任务在跑,健康检查可能短暂无响应,稍等片刻会自动恢复。若持续不可用请联系管理员。
没有现成脚本,AI 能帮我写对话吗?
可以。在「第二步 · 对话脚本」上方的提示词框里写一句你想要什么样的对话(越具体越好,比如「客服和顾客关于退换货的对话,8 句,口语化」),点「生成对话脚本」,AI 会逐字写出脚本并自动解析成台词清单。生成结果若格式不规范,系统会自动校正重试一次,仍不行会明确提示且不计费。
提示词旁边的 📎 和 🖼️ 是干什么的?
📎 上传参考文件(txt / md / 代码 / doc / docx / pdf):AI 会读取文件内容,据此编写对话,适合"把一篇课文/材料改编成对话"。🖼️ 上传图片:系统先用视觉模型识别图片内容,再据此写对话,适合"看着一张图编对话"。文件和图片一次只能带一份,可点 ✕ 移除。
生成脚本、上传附件、润色怎么收费?
合成音频 2 点/百字,AI 润色与 AI 生成脚本各 1 点/百字(生成按"产出+参考素材"字数计)。会员不限量;免费版先扣信用点,信用点不足可用每日 5 点免费额度;生成失败或润色结果未采用时不计费。管理员免费。
怎么保存或备份写好的脚本?
点第二步的「保存文本」,会把当前脚本框内容下载为 .txt 文件(带时间戳、中文不乱码)。下次想继续编辑,用旁边的「上传」把这个 .txt 传回来即可。

语音识别(语音转文字) 进入模块

AI 高精度语音识别。将课堂录音、演讲、采访等音频实时转成文字,支持中文、英文,自动加标点,适合课堂实录整理、听力材料转写、字幕制作。

三步上手

1
上传音频:选择要识别的音频文件(或使用麦克风实时录音)。
2
点击开始识别,识别结果逐句显示在页面上。
3
复制或导出识别文本,用于后续编辑。

常见问题

识别准确率受什么影响?
录音清晰度是第一要素:近距离录音、少背景噪音、发音清晰,准确率最高。背景音乐和多人混叠会明显降低准确率。
支持多长的音频?
常规课堂录音均可处理;超长音频建议切分成 10-30 分钟的片段分别识别,速度更快也更稳定。

音频润色坊 进入模块

音频的"修图软件"。上传音频后 AI 自动逐句转写,您像改 Word 一样在线改句,系统用原音色只重合成改过的句子并无缝替换回去;还有免费的一键美化、老音频批量翻新和 Seed-VC 音色升级,让旧录音焕发新生。

三种模式

单音频精修:上传音频 → AI 逐句转写(带时间戳)→ 点击文字直接改句(点 ▶ 可试听原句)→「重合成替换」只重做改过的句子,片段级叠化接回,接缝自然。适合修口误、改错词、删废话。
批量翻新:一次上传多个老音频,每个文件依次执行「转写 → 用它自己的声音克隆全篇重合成 → 自动美化导出」,内容不变,音质与一致性整体提档。适合批量升级旧课程录音。
音色升级(Seed-VC 语音转换):上传源音频 + 一段 3~30 秒的目标音色参考音频,保留源音频的内容、停顿与语气起伏,只把音色换成参考音色。与全篇重合成不同,韵律全部原样保留。

常见问题

如何计费?
转写 1 信用点/分钟;重合成 2 点/百字;一键美化(降噪+响度归一)完全免费;音色升级 1 点/分钟;批量翻新按文件逐个结算(转写 1 点/分钟 + 重合成 2 点/百字)。
精修和音色升级有什么区别?
精修改的是内容——改句子、修口误,改过的句子用原音色重新合成;音色升级改的是音质音色——内容一字不动,只把声音换成目标音色。想"改词"用精修,想"换声"用音色升级。
建议的处理顺序?
推荐:先「一键美化」(免费)提升底噪和响度,再在线改句精修,最后需要的话做音色升级。美化在前,转写和重合成的效果都更好。

音频切分器 进入模块

把长音频按文稿标记切成若干段。在文稿中需要切分的位置写上标记 &&&,上传音频后系统按文稿段落与语音对齐切分,打包下载各段音频——课件分句、听力材料切片的利器。

三步上手

1
上传音频:支持 wav / mp3 / m4a / flac / ogg,输出格式与源文件一致。
2
粘贴带标记的文稿:在切分点插入 &&&,每段对应一段音频。
3
切分并下载:逐段试听、逐段或打包保存到本地。

常见问题

什么样的音频切分效果最好?
句间停顿清晰的 TTS 合成音频效果最佳;真人连读较紧的录音,建议切分点选在明显的停顿处。
「剪映字幕文稿格式化」是什么?
页面下方的附赠工具:把整篇讲稿按剪映字幕要求重排——行长可设(默认 42)、编号不切分、引号不拆行、每约 4500 字空三行分段,一键复制后直接粘贴进剪映「文稿匹配」,弥补剪映不能定制行长的短板。

二维码生成器 进入模块

输入链接或文本,即时生成二维码图片,可下载用于课件、海报、班级群分享。纯前端工具,免登录、完全免费,内容不经过服务器。

三步上手

1
输入内容:粘贴网址(如课程分享链接)或一段文字。
2
即时预览:二维码随输入实时生成。
3
下载保存:PNG 图片插入 PPT 或打印张贴均可。

常见问题

视频号、抖音视频可以贴二维码吗?
可以。把课程链接生成二维码贴到视频画面或评论区引导图中,观众扫码即可直达课程页。

情景短片制片厂(Seedance 2.5) 进入模块

AI 电影级短片生成。一句创意(或一张首帧图)→ 最长 90 秒的有声情景短片:支持秒级时间戳分镜控制("0-3秒:…;3-6秒:…")、7 种画幅比例、480P~1080P 分辨率,适合课程导入情境、文化场景再现、创意演示片头。

三步上手

1
写创意提示词:描述场景、人物、动作、氛围、运镜;可用「AI 润色」让 AI 导演帮您丰富分镜(秒级时间轴会原样保留)。
2
选参数:分辨率、宽高比、时长(4~90 秒滑块)、是否生成有声视频;可上传首帧图锁定开场画面。
3
生成与下载:提交后云端渲染,页面实时显示进度;成品在「我的短片」播放、下载(MP4)。

常见问题

如何计费?
按分辨率预扣信用点:480P 11 点/秒、720P 25 点/秒、1080P 60 点/秒;生成成功按实际秒数多退,失败全额返还。管理员免费。
超过 30 秒会怎样?
自动分段生成:首段按提示词直接生成,后续每段由 Seedance 2.5「续写延长」自动衔接(主体、场景、比例保持一致)。提交前请为每段续写填一句「接下来会发生什么」;即使个别段失败,已完成的部分照常交付并退还未用余额。
中途关闭页面会怎样?
任务在云端继续执行。重新打开页面,在「我的短片」点「继续跟踪」即可恢复进度显示,不会重复扣费。
提示「密钥未生效」怎么办?
说明云端视频服务尚未配置完成,请联系管理员开通后重试。

灵感复刻(视频反推再创作) 进入模块

看到喜欢的短视频,想做一个同款?上传参考视频,AI 自动抽帧、逐幕分析主体、动作、运镜、光线与风格(并推测声音风格),还原成可直接生成的分镜提示词;改写后再由 Seedance 2.5 生成同款新短片。课件情境仿做、热门桥段翻拍、创意再创作一站完成。

四步上手

1
上传参考视频并反推:支持 mp4 / mov / webm,建议 60 秒以内(上限 90 秒 / 200MB);点「反推提示词」,AI 逐幕还原分镜脚本。
2
改写再创作:在反推结果上直接修改,或点「AI 润色」换一种剧情、场景与风格;支持秒级时间戳分镜("0-3秒:…;3-6秒:…")。
3
选参数:分辨率、宽高比、时长(4~90 秒滑块);可上传参考图作为首帧(图生视频,宽高比自动切「自适应」)。
4
生成与下载:提交后云端渲染;成品在「我的短片」里播放、下载(MP4)。

常见问题

如何计费?
反推提示词每次 2 点(失败自动退还);视频生成按分辨率预扣:480P 11 点/秒、720P 25 点/秒、1080P 60 点/秒,成功按实际秒数多退,失败全额返还。管理员免费。
超过 30 秒会怎样?
与情景短片制片厂相同:自动分段续写生成,请为每段填一句「接下来会发生什么」;部分失败时已完成的段落照常交付并退还未用余额。
反推的提示词包含声音吗?
包含「声音建议」——AI 会根据画面氛围推测背景音乐与环境音风格,供生成有声视频时参考。
中途关闭页面会怎样?
任务在云端继续执行。重新打开页面,在「我的短片」点「继续跟踪」即可恢复进度显示,不会重复扣费。

对话课堂(英语对话视频教学) 进入模块

把一段英语对话视频变成一节完整的微课(FilmMaker 成片下载后可直接上传,其他来源素材亦可):上面播对话视频,下面 AI 白板同步演示——正在说的那句英文大字呈现、中文译文随行,词汇卡、句型点在关键句自动弹出。白板内容由本地 Qwen3.6-35B 预生成、可逐条校对;9:16 竖版舞台播放时录屏,即得抖音/视频号风格的竖版教学视频。

五步上手

1
上传创建:上传一段 16:9 横版对话视频(mp4 / mov / webm / mkv,≤500MB),起个标题,创建对话课堂。本模块不做视频生成,素材请在 FilmMaker 或其他工具中事先准备好。
2
提取对白:AI 自动抽出音轨并听写(WhisperX 词级时间戳),每句对白精确到 0.1 秒;听写可能有个别错词,请在表格里直接改。
3
生成演示时间轴:Qwen 按对白行号设计译文(每句必有)、词汇卡(≤6)、句型点(≤4)、小贴士(≤2),时间自动锚定到对白,零漂移。
4
校对:时间轴表格里可改时间、类型、标题、内容,可增删行;改完点「保存时间轴」。
5
演播室录屏:进入演播室 → 点击播放键,9:16 舞台自动联播;用录屏软件只录画面,录完用 ffmpeg 把「原音频」合回去:ffmpeg -i 录屏.mp4 -i 原音频.wav -c:v copy -c:a aac -map 0:v:0 -map 1:a:0 -shortest 成片.mp4(编辑页可下载原音频)。

常见问题

如何计费?
v1 阶段暂免积分,仅需登录。若视频素材来自 FilmMaker,其生成费用已在该环节按标准收取。
为什么白板内容是预先生成的?
播放时现场调大模型会有延迟和不确定性,音画必然错位。预生成 + 人工校对后,播放时按视频时间轴精确驱动(±0.25 秒),保证声画严格同步。
录屏时视频没声音怎么办?
演播室播放是有声的;建议录屏只录画面,成片用上面的 ffmpeg 命令合入原音轨——零损耗、声画严格同步,避免扬声器内录的失真和底噪。
舞台比例不是 9:16?
舞台始终按 9:16 居中显示,四周黑边属正常;录屏时框选舞台区域即可得到标准竖版画面。

图片生成画室(Seedream 5.0) 进入模块

AI 高清图片生成。一句话描述 → 2K~4K 图片;也可上传参考图做"图生图"(换风格、改背景、调构图)。8 种画幅预设(含 16:9 课件背景、3:4 人像、21:9 横幅),支持 1~4 张组图连发,课件配图、人物场景图一站搞定。

三步上手

1
写画面描述:写清「主体 + 场景 + 风格 + 构图留白」;拿不准可点「AI 润色」让 AI 帮您丰富细节。
2
选画幅与张数:课件背景选 16:9,人物选 3:4,横幅选 21:9;组图最多 4 张。
3
生成与下载:云端绘制 1~2 分钟;每张图都有「下载」按钮,「我的画作」里可随时回看、再下载。

常见问题

如何计费?
5 信用点/张(约 0.5 元);组图按实际生成张数结算,少生成自动多退,失败或内容审核拦截全额返还。管理员免费。
图生图怎么用?
上传一张参考图,再用文字描述要改的部分(如"把背景换成图书馆,人物不变")。参考图越清晰,主体保持越稳定。
生成的图片打不开/转圈?
请先 Ctrl+F5 强制刷新一次页面(更新站点缓存组件),再点开大图即可。

PPT 智能生成(DeepPresenter 专用模型) 进入模块

输入主题,AI 自动完成「策划大纲 → 逐页设计版式 → Seedream 配图 → 合成 PPTX」全流程,直接产出可编辑的 PowerPoint 文件。生成引擎为本机部署的 DeepPresenter 9B 课件专用模型,全程内网运行,课件内容不出校。

三步上手

1
写主题与要求:写清「主题 + 受众 + 章节要点 + 风格偏好」;只有一句话想法时,点「AI 润色」自动扩成完整需求。
2
选页数:自动 / 6-8 页 / 10-12 页 / 15-20 页四档;拿不准就选自动,模型会按内容量安排。
3
提交后等待:生成通常 3~10 分钟,页面每 5 秒自动刷新进度,期间可切去做别的事;完成后点「下载 PPT」或在「我的课件」随时回看下载。

常见问题

如何计费?
每次 50 信用点(约 5 元);生成失败全额自动返还。管理员免费。
生成的 PPT 能再编辑吗?
可以,产出的是标准 .pptx 文件,用 WPS / Office 打开即可随意修改文字、替换图片。
为什么比图片/短片生成慢?
PPT 生成是多页连续创作:模型要逐页写内容、排版、自检、配图,页数越多耗时越长。15-20 页的大课件可能需要 10 分钟以上。
想让 PPT 用上我课程里的内容?
把讲稿或教材要点直接粘进「主题与内容要求」框(4000 字以内),模型会围绕这些材料组织幻灯片。

数字人视频生成 进入模块

AI 数字人视频生成。给它一张人物照片一段语音,AI 就能让照片中的人物开口"说话",口型同步、表情自然。一段数字人视频 = ① 写好文案 → ② 生成配音 → ③ 准备照片 → ④ 合成视频,前两步可分别借助本站的"语音克隆"和"语音定制"模块完成。页面顶部还有「我的作品」(管理已生成的视频)和「生产线」(直达视频流水生产线,批量自动化出片)两个快捷入口。

完整制作流程

1
准备文案:把数字人要在视频里说的话写成文字稿(如课文讲解、微课脚本)。
2
生成配音:到语音克隆(模仿指定音色)或语音定制(描述一个新声音)模块,输入文案合成语音,试听满意后下载保存音频文件。如果您已有现成的录音,可直接跳过此步。配音如有口误,可到音频润色坊在线改句修复。
3
准备照片:选一张正脸、五官清晰无遮挡、光线均匀的人物照片(证件照式效果最佳)。
4
合成视频:进入本模块,上传照片和第 2 步得到的音频,选定目标时长(1~30 分钟,请与音频实际时长相近),点击生成视频
5
预览下载:渲染完成后在线预览,确认口型和效果满意后下载成品视频;也可到「我的作品」统一管理。

常见问题

什么样的照片效果最好?
正面、五官清晰无遮挡、光线均匀的证件照式照片效果最佳。侧脸、低分辨率、戴墨镜会明显影响效果。
配音音频从哪里来?
三种途径:① 用本站"语音克隆"模仿某个音色朗读文案;② 用"语音定制"凭空创造一个新声音;③ 直接上传您自己录制的音频。前两种需在对应模块生成后先下载,再到本模块上传。
生成一段视频要多久?
与音频长度相关,一般每分钟音频需要数分钟渲染,请耐心等待,不要重复点击。
支持多长的视频?
目标时长可选 1~30 分钟。超过 3 分钟的视频,系统会自动分段渲染再叠化拼接,长视频也能稳定出片;请上传与目标时长相近的音频(视频时长 ≈ 音频时长)。长课程也可拆成多集分别生成,方便后期组合与更新。

视频流水生产线 进入模块

从主题到成片的全自动流水线:编剧 → 配音师 → 剪辑师三个阶段接力。您只需给一个视频主题(或粘贴现成文案),AI 自动写文案、配好声音、合成数字人视频,支持 1~30 分钟长片、多任务并行和断点续跑。数字人视频生成页面顶部的「生产线」按钮也可直达本模块。

三阶段接力

1
编剧(免费):输入视频主题,选目标时长(1~30 分钟,约 300 字/分钟)和语言;有现成文案可直接粘贴(20~9000 字),编剧阶段将直接使用,不再 AI 生成。文案可反复修改,满意后进入下一阶段。
2
配音师:在「音色描述」里写下想要的声音(如"温暖知性的女教师,语速适中"),AI 按描述合成配音(2 信用点/百字);想要自己的声音可点「🧬 声音克隆」跳转克隆音色。
3
剪辑师:合成数字人视频(1 信用点/秒,失败全额返还)。超过 3 分钟自动分段渲染 + 叠化拼接;支持多任务并行、断点续跑——中途关掉页面,回来还能接着跑。成品在任务列表查看下载。

常见问题

和「数字人视频生成」模块有什么区别?
「数字人视频生成」是手动模式:文案、配音、照片都自己准备,适合精细控制;「流水生产线」是自动模式:一个主题进去、成片出来,适合批量做课。两者产物相同,可搭配使用。
整体费用怎么估?
编剧免费;配音 2 点/百字(约 300 字/分钟);视频合成 1 点/秒;AI 形象 2 点/张。以 5 分钟视频为例:配音约 30 点 + 合成约 300 点。失败全额返还,费用全程透明。
中途断网或关页面会怎样?
流水线支持断点续跑:任务状态保存在服务器,重新打开页面即可从断点继续,不会重复计费。

数字人视频教学(进入课程) 进入模块

数字人教师课程入口。由数字人教师主讲的视频课程,结合课程内容进行讲解演示,为您提供沉浸式的学习体验。

三步上手

1
选择课程:在课程列表中找到您要学习的课程。
2
进入学习:点击课程进入数字人教学页面。
3
跟随讲解:按课程节奏学习,可随时暂停回放。

常见问题

视频卡顿怎么办?
请检查网络状况;校园网环境下如持续卡顿,可尝试切换网络或错峰学习。

课程知识库 · AI 答疑的"记忆力"

播放讨论页里的 AI 答疑教师之所以"懂这门课",靠的就是课程知识库:系统把每一讲的完整讲稿切分、向量化后存入本机知识库;学生提问时,先从该课程的全部讲稿中检索最相关的段落,再结合这些原文作答——回答始终锚定课程内容,而不是泛泛而谈。

它是怎么工作的

1
自动入库:教师在「视频信息管理(VideoMNG)」中填写课程代码并保存口播脚本,讲稿即刻同步进知识库,无需任何额外操作。修改后再次保存会自动覆盖旧内容,不会产生重复。
2
精准检索:学生提问时,系统按课程代码锁定本课程的知识库(如"良缘之美"只检索良缘之美 10 讲讲稿),找出最相关的段落。
3
锚定作答:AI 答疑教师参考检索到的讲稿原文回答,知识库服务即使临时不可用,也会自动降级为普通对话模式,答疑功能不受影响。

常见问题

新开的课程需要额外配置知识库吗?
不需要。只要在 VideoMNG 里给视频填好「课程代码」(格式:课程名(代码),如"电商英语(ENGL030)"),保存讲稿时知识库自动建立并同步。
讲稿修改后,AI 答疑会立即用上新内容吗?
会。保存即同步,覆盖式更新。建议讲稿定稿后再发布课程;500 字以下的过短脚本不会入库。
学生的提问和回答会被存进知识库吗?
不会。知识库只收录教师讲稿;答疑对话内容不会回写,检索结果也只在当轮回答中临时使用。

视频广场 进入模块

优秀数字人视频课程的公共展厅。这里汇集审核通过的公开作品,无需登录即可观看;点进任意视频可进入播放讨论页,与视频中的数字人主讲实时对话答疑。

三步上手

1
逛广场:浏览封面卡片,按课程或主题挑选感兴趣的视频。
2
看片学习:点击卡片进入播放页,支持逐句字幕同步高亮。
3
向主讲人提问:播放页下方可直接与数字人教师对话,追问课程内容。

常见问题

我的视频如何进入广场?
在「我的作品」中提交分享申请,管理员审核通过后即公开展示;课程分享页(MyCourse)链接也可直接转发微信好友。
广场上的视频能下载吗?
不能。广场面向最终观众,仅提供在线观看与对话互动。

语音对话 · 小语同学 进入模块

纯语音的 AI 对话伙伴"小语同学"。无需打字,开口即聊:您说话它倾听,它回答有声音有情感,是随身携带的口语练习搭档,特别适合英语听说训练和随时随地的问答互动。

三步上手

1
允许麦克风权限,进入对话界面。
2
按住或直接说话,小语同学会实时聆听。
3
聆听它的语音回答,像打电话一样自然交流。

常见问题

手机上能用吗?
可以。微信中打开或手机浏览器访问均可,建议佩戴耳机以获得更清晰的声音效果。
支持英文对话吗?
支持。直接用英语和它交流即可,是练习英语口语的理想语伴。

虚拟角色对话室 进入模块

与 AI 扮演的历史人物、文学角色、科学家实时对话,探究其思想与时代背景。支持语音(可免提)与文字两种交流方式;对话结束后自动生成"思维闪光点"报告,点出您提问中的亮点与可深化之处,让沉浸式学习可评估、可沉淀。

三步上手

1
选择人物:在人物大厅点击一位角色(苏格拉底、钱学森、莎士比亚……),进入对话房间。
2
开聊:打字或直接说话(可开免提像打电话一样自然交流);点击人物的开场白可收听语音。
3
生成报告:对话数轮后点击"思维闪光点报告",查看对您提问质量的点评与深化建议;报告可保存、可复制。

常见问题

角色的语音回复可以反复听吗?
可以。每条角色回复旁都有播放按钮,点击即可重听语音,方便跟读与模仿。
如何收费?
每个账号享有充裕的免费体验轮次;超出后登录用户按 1 信用点/条对话计费,页面顶部会实时显示剩余额度。
老师能定制自己课程需要的角色吗?
可以!这正是"教师定制对话室"服务——由您设定角色、教学目标,生成班级专属房间,学生扫码即用,对话全文为您沉淀。详见下方"教师定制对话室"版块。

语言情景对话模拟器 进入模块

沉浸式角色扮演口语陪练。机场值机、餐厅点餐、求职面试、酒店入住、生命健康、人工智能等 12 个情景主题:AI 扮演情景角色实时回应您说的内容,并即时纠正发音、语法与表达得体性;难度随您的水平自适应调节——外语口语课和职业场景实训的"无限陪练"。

三步上手

1
选择情景:在情景大厅点击一个主题(如"机场值机"),进入对话房间,收听 AI 的开场引导。
2
开口扮演:用语音(可免提)或文字进入角色,完成情景任务;AI 会即时回应并给出表达建议。
3
复盘提升:结束后生成总结报告,回顾自己的亮点表达与待改进之处。

常见问题

和"虚拟角色对话"有什么区别?
角色对话侧重探究人物思想(文史哲、思政场景);情景对话侧重语言技能训练,有明确的场景任务、纠错反馈与难度分级,更适合口语课与职业实训。
我英语基础弱,跟不上怎么办?
AI 会根据您的实际表达自动降低语速与用词难度;您也可以直接用中文夹英文过渡,它会耐心引导您完成场景任务。
老师能定制自己课程的情景吗?
可以!在"教师定制对话室"中描述您需要的场景(如"医学英语问诊""外贸谈判"),AI 将为您生成班级专属情景房间。详见下方"教师定制对话室"版块。

教师定制对话室(付费服务) 进入模块

面向教师的专属定制服务:您设定角色/情景与教学目标,AI 生成班级专属对话房间;可上传您的照片(显示在房间顶部)与 9 秒声音样本(克隆专属音色)。学生扫码即用、无需下载 App;每个学生的对话全文为您沉淀,是过程性评价与教学科研的一手素材。

深度阅读《从微信群到自主学习室——为什么每位教师都需要一间专属 AI 对话室》,一份写给教师的产品说明书,欢迎转发给同事。

三步完成定制

1
填写定制表单(约 5 分钟):选房型(角色/情景),写教学目标与设定,可选上传照片与声音样本。
2
AI 生成,预览确认:AI 生成角色人格与开场白,您满意后再发布;含 3 次免费重新生成。
3
发布分享码:链接/二维码发到班级群,学生扫码即用;在"我的定制"后台查看学生对话全文、管理房间。

常见问题

价格是多少?
单个定制 ¥180(首年,含 AI 生成 + 3 次重新生成);三室套餐 ¥399(单个低至 ¥133);次年续费 ¥99/年。
学生需要注册吗?会产生费用吗?
学生无需下载 App,免登录即可体验 50 轮;继续学习需登录,之后按 1 信用点/条在学生自己账户计费,与您的定制费无关。您本人使用自己的房间永久免费。
学生的对话数据谁能看到?
只有您(房间创建者)能在"我的定制"后台查看本房间学生的对话全文;学生之间互相不可见。
对上传的照片和声音有什么要求?
照片:JPG/PNG 不超过 5MB。声音:WAV 格式、16000Hz、单声道、16 位、5~9 秒清晰人声(无背景音乐),可用剪映或 Audacity 导出。上传即视为您确认拥有合法授权。

对话中国 · AI口语教练 进入模块

专为《理解当代中国》课程打造的 AI 学习语伴。围绕课文内容陪您自主学习:答疑解惑、词汇讲解、跟读练习、观点讨论,让课本学习从"自己啃"变成"有人陪"。

三步上手

1
选择单元:进入正在学习的课文单元。
2
开始互动:就课文内容提问、跟读或讨论。
3
巩固复习:根据语伴的反馈针对性强化薄弱点。

常见问题

语伴的回答都依据课文吗?
语伴优先围绕所选单元的课文内容展开,也可以适度拓展相关背景知识,帮助您加深理解。
适合课前预习还是课后复习?
都适合。课前用它扫清生词和背景障碍,课后用它讨论观点、巩固表达。

参考音频库 进入模块

语音克隆的"音色仓库"。这里集中管理可用于克隆的参考音频,每条音频配有昵称、性别、描述和试听。在"语音克隆"页面点击"更多参考音频"即可跳转到本库挑选。

三步上手

1
试听:点击每条的播放按钮,找到满意的音色。
2
选取:点击"选取",系统自动跳回语音克隆页并载入该音频。
3
回到克隆页继续正常合成流程即可。

常见问题

音频时长为什么都不超过 9 秒?
语音克隆模型对参考音频长度有上限要求,过长的部分无法参与克隆,因此库中音频统一裁剪至 9 秒以内以保证最佳效果。
可以上传自己的音频吗?
可以。建议录制 3-9 秒清晰人声(无背景音乐、无噪音),上传后同样需要填写准确的参考文本。

我的账户 进入模块

账户中心。查看您的使用情况、消费明细和账户余额,管理个人服务。

三步上手

1
登录后从导航栏进入"我的账户"。
2
查看明细:余额、消费记录一目了然。
3
如需充值或咨询,请联系管理员

常见问题

看不到"我的账户"菜单?
该入口仅对已登录用户显示,请先登录。

系统答疑(AI 客服 · 免费) 进入答疑室

7×24 小时在线的 AI 系统答疑员。它已经学习过本站的使用指南与功能文档,关于"某个功能怎么用""为什么报这个错"的问题,随时可以问它——完全免费、所有访客可用

三步上手

1
点击导航栏「答疑」进入答疑室。
2
直接提问:如"语音克隆的参考音频有什么要求?""视频生成失败了怎么办?"。
3
AI 依据本站文档作答;答不了的问题会建议您联系管理员。

常见问题

答疑员知道哪些内容?
本使用指南的全部内容,以及各功能模块的说明文档。涉及账户、计费等个人数据的问题,它无法代查,请联系管理员。

通用问题

推荐用什么浏览器?
推荐 Chrome、Edge 最新版;手机端可用微信内置浏览器。语音类功能需要浏览器支持并授权麦克风。
生成的语音/视频可以商用吗?
平台生成的内容供教学与学习使用。请确保您使用的参考音频、照片等素材已获合法授权,勿用于侵犯他人声音权、肖像权的用途。
功能异常时怎么办?
先刷新页面重试;若多次失败,请记录:哪个模块、操作到哪一步、页面提示什么,然后联系管理员排查。
找不到答案怎么办?
试试系统答疑——官方答疑助手 7×24 在线,功能用法、账号计费、教师定制,有问必答,完全免费。
可以把平台推荐给同事吗?
欢迎!在微信中打开本指南,点右上角即可把"使用指南"分享给朋友,他们可以从这里直达各功能模块。

在线咨询 · 人工服务 进入模块

需要人工帮助时使用。填写您的联系方式和要咨询的问题,提交后系统会立即通过邮件 + 短信双路通知管理员,管理员将尽快通过您留下的手机或邮箱回复。页面右侧还有微信客服二维码(企业微信 · 微信客服活码,长期有效),微信扫码即可与客服即时对话。免登录可用。

三步上手

1
填写称呼手机号或邮箱(至少一项,作为回复通道),选择咨询类型。
2
描述您的问题(1000 字以内),未登录访客需完成一道算术验证。
3
提交后获得咨询编号(如 ZX20260915-3),管理员收到邮件+短信提醒后会尽快回复您。

常见问题

多久能收到回复?
工作时间(9:00–21:00)一般当天回复;非工作时间的留言次日处理。紧急问题建议直接扫码加微信群。
在线咨询和「系统答疑」有什么区别?
系统答疑是 AI 助手 7×24 秒回,适合功能用法类问题;在线咨询是真人管理员服务,适合账号异常、合作洽谈、复杂故障等需要人工介入的问题。
提交太频繁被限制了?
为防止恶意刷屏,同一 IP 每 60 秒限提交 1 次。请稍等片刻再提交,或扫码入群直接交流。

技术底座与致谢

艾智语途工场站在开源社区与云计算生态的肩膀上。平台在以下优秀项目与服务之上,完成了面向教学场景的工程化整合、计费体系与内容安全设计。我们尊重各项目的开源许可协议,并向所有为 AIGC 生态做出贡献的开发者致以诚挚谢意。

大语言模型阿里巴巴 Qwen 系列开源大模型、DeepSeek、Kimi(月之暗面)——为智能对话、智能体协作与内容生成提供理解与表达能力。
语音合成GPT-SoVITS(开源语音克隆框架)、Qwen3-TTS(开源声音设计模型)——支撑"语音克隆"与"语音定制"两大配音能力。
语音识别FunASR(阿里达摩院开源语音识别框架)——支撑语音转文字,也是语音对话模块的"耳朵"。
数字人视频阿里云百炼 · 灵动人像云端服务——让一张照片开口讲课,口型同步、表情自然。
基础生态PyTorch、FFmpeg、FastAPI、vLLM 等开源基础设施——是整套系统稳定运转的地基。
平台生成的内容仅供教学与学习使用。请为您上传的参考音频、人物照片等素材取得合法授权,勿用于侵犯他人声音权、肖像权的用途。