艾智语途工场 · 使用指南

AI 赋能全场景教学与创新——语音克隆、语音定制、数字人视频、角色与情景对话、教师定制对话室,一站式说明书

深度交流 · AI 智能对话 进入模块

AI 大语言模型驱动的智能对话助手。支持多轮上下文交流,可用于备课答疑、教学设计研讨、语言知识讲解、翻译与写作润色等场景。

三步上手

1
在底部输入框中输入您的问题(支持中英文)。
2
点击发送,AI 将流式输出回答,可中途停止。
3
继续追问可保持上下文;点击"新对话"清空重来。

常见问题

回答到一半可以停止吗?
可以。生成过程中点击"停止"按钮即可中断输出,已生成的部分会保留。
对话记录会保存吗?
当前页面会话在刷新后清空。重要内容请及时复制保存。

智能体协作 · CrewStudio 进入模块

多智能体(AI Agent)协作工作室。您可以定义多个角色各异的 AI 智能体(如撰稿人、审校员、翻译官),让它们围绕一个任务分工协作、接力完成,适合课程脚本创作、长文写作、多轮翻译润色等复杂任务。

三步上手

1
创建任务:用一句话描述您要完成的复杂任务。
2
组建团队:选择或自定义参与协作的智能体角色。
3
启动协作:观察各智能体接力工作,收获最终成果。

常见问题

和"深度交流"有什么区别?
深度交流是单个 AI 与您对话;智能体协作是多个 AI 之间互相配合完成任务,您更像"项目经理"而非对话者。
协作耗时多久?
视任务复杂度而定,多智能体接力通常需要几分钟,请耐心等待各角色依次输出。

语音克隆合成 进入模块

AI 情感语音克隆。只需一段 3-9 秒的参考音频,AI 即可模仿该音色朗读您输入的任何文字,情感自然、相似度高,适合课件配音、课文范读、个性化语音素材制作。

三步上手

1
选参考音频:从参考音频库选择(或本地上传)一段清晰人声,并填写对应的参考文本。
2
输入合成文本:填写要朗读的内容,选择语种(中/英/日等)。
3
点击开始合成,等待生成后在线试听、下载。

常见问题

参考音频有什么要求?
建议 3-9 秒、单人声、无背景音乐、无噪音的清晰录音。超过 9 秒的部分无法参与克隆。可以在"参考音频库"中预先管理您的音频。
为什么要填"参考文本"?
参考文本就是参考音频里说的那句话的原文。准确填写能显著提升克隆相似度;填错或留空会导致合成效果下降。
合成一次要多久?
通常几秒到几十秒,取决于文本长度。长文本建议分段合成以获得更稳定的效果。

智能语音定制合成 进入模块

AI 声音设计合成。不需要任何参考音频——用自然语言"描述"您想要的声音(如"一位亲切的女教师,语速适中"),AI 即可凭空创造出符合描述的音色并朗读文本,适合快速尝试不同风格的配音。

三步上手

1
描述声音:在"音色描述"框写出您想要的声音特征(性别、年龄感、情绪、语速等)。
2
输入文本:填写要合成的内容(最长 1500 字),选择语种。
3
点击生成语音,稍候即可试听;满意后可下载保存。

常见问题

音色描述怎么写效果好?
越具体越好。推荐组合:性别年龄 + 情绪语气 + 语速节奏,例如"沉稳的中年男声,语气温和,语速偏慢,适合讲故事"。
和"语音克隆"选哪个?
想模仿某个真实人物的声音,用"语音克隆";想快速创造新风格的声音、不需要像谁,用"语音定制"。
页面右上角显示"未连接"怎么办?
说明语音服务暂时不可用,请稍等片刻刷新;若持续未连接,请联系管理员。

语音识别(语音转文字) 进入模块

AI 高精度语音识别。将课堂录音、演讲、采访等音频实时转成文字,支持中文、英文,自动加标点,适合课堂实录整理、听力材料转写、字幕制作。

三步上手

1
上传音频:选择要识别的音频文件(或使用麦克风实时录音)。
2
点击开始识别,识别结果逐句显示在页面上。
3
复制或导出识别文本,用于后续编辑。

常见问题

识别准确率受什么影响?
录音清晰度是第一要素:近距离录音、少背景噪音、发音清晰,准确率最高。背景音乐和多人混叠会明显降低准确率。
支持多长的音频?
常规课堂录音均可处理;超长音频建议切分成 10-30 分钟的片段分别识别,速度更快也更稳定。

音频润色坊 进入模块

音频的"修图软件"。上传音频后 AI 自动逐句转写,您像改 Word 一样在线改句,系统用原音色只重合成改过的句子并无缝替换回去;还有免费的一键美化、老音频批量翻新和 Seed-VC 音色升级,让旧录音焕发新生。

三种模式

单音频精修:上传音频 → AI 逐句转写(带时间戳)→ 点击文字直接改句(点 ▶ 可试听原句)→「重合成替换」只重做改过的句子,片段级叠化接回,接缝自然。适合修口误、改错词、删废话。
批量翻新:一次上传多个老音频,每个文件依次执行「转写 → 用它自己的声音克隆全篇重合成 → 自动美化导出」,内容不变,音质与一致性整体提档。适合批量升级旧课程录音。
音色升级(Seed-VC 语音转换):上传源音频 + 一段 3~30 秒的目标音色参考音频,保留源音频的内容、停顿与语气起伏,只把音色换成参考音色。与全篇重合成不同,韵律全部原样保留。

常见问题

如何计费?
转写 1 信用点/分钟;重合成 2 点/百字;一键美化(降噪+响度归一)完全免费;音色升级 1 点/分钟;批量翻新按文件逐个结算(转写 1 点/分钟 + 重合成 2 点/百字)。
精修和音色升级有什么区别?
精修改的是内容——改句子、修口误,改过的句子用原音色重新合成;音色升级改的是音质音色——内容一字不动,只把声音换成目标音色。想"改词"用精修,想"换声"用音色升级。
建议的处理顺序?
推荐:先「一键美化」(免费)提升底噪和响度,再在线改句精修,最后需要的话做音色升级。美化在前,转写和重合成的效果都更好。

数字人视频生成 进入模块

AI 数字人视频生成。给它一张人物照片一段语音,AI 就能让照片中的人物开口"说话",口型同步、表情自然。一段数字人视频 = ① 写好文案 → ② 生成配音 → ③ 准备照片 → ④ 合成视频,前两步可分别借助本站的"语音克隆"和"语音定制"模块完成。页面顶部还有「我的作品」(管理已生成的视频)和「生产线」(直达视频流水生产线,批量自动化出片)两个快捷入口。

完整制作流程

1
准备文案:把数字人要在视频里说的话写成文字稿(如课文讲解、微课脚本)。
2
生成配音:到语音克隆(模仿指定音色)或语音定制(描述一个新声音)模块,输入文案合成语音,试听满意后下载保存音频文件。如果您已有现成的录音,可直接跳过此步。配音如有口误,可到音频润色坊在线改句修复。
3
准备照片:选一张正脸、五官清晰无遮挡、光线均匀的人物照片(证件照式效果最佳)。
4
合成视频:进入本模块,上传照片和第 2 步得到的音频,选定目标时长(1~30 分钟,请与音频实际时长相近),点击生成视频
5
预览下载:渲染完成后在线预览,确认口型和效果满意后下载成品视频;也可到「我的作品」统一管理。

常见问题

什么样的照片效果最好?
正面、五官清晰无遮挡、光线均匀的证件照式照片效果最佳。侧脸、低分辨率、戴墨镜会明显影响效果。
配音音频从哪里来?
三种途径:① 用本站"语音克隆"模仿某个音色朗读文案;② 用"语音定制"凭空创造一个新声音;③ 直接上传您自己录制的音频。前两种需在对应模块生成后先下载,再到本模块上传。
生成一段视频要多久?
与音频长度相关,一般每分钟音频需要数分钟渲染,请耐心等待,不要重复点击。
支持多长的视频?
目标时长可选 1~30 分钟。超过 3 分钟的视频,系统会自动分段渲染再叠化拼接,长视频也能稳定出片;请上传与目标时长相近的音频(视频时长 ≈ 音频时长)。长课程也可拆成多集分别生成,方便后期组合与更新。

视频流水生产线 进入模块

从主题到成片的全自动流水线:编剧 → 配音师 → 剪辑师三个阶段接力。您只需给一个视频主题(或粘贴现成文案),AI 自动写文案、配好声音、合成数字人视频,支持 1~30 分钟长片、多任务并行和断点续跑。数字人视频生成页面顶部的「生产线」按钮也可直达本模块。

三阶段接力

1
编剧(免费):输入视频主题,选目标时长(1~30 分钟,约 300 字/分钟)和语言;有现成文案可直接粘贴(20~9000 字),编剧阶段将直接使用,不再 AI 生成。文案可反复修改,满意后进入下一阶段。
2
配音师:在「音色描述」里写下想要的声音(如"温暖知性的女教师,语速适中"),AI 按描述合成配音(2 信用点/百字);想要自己的声音可点「🧬 声音克隆」跳转克隆音色。
3
剪辑师:合成数字人视频(1 信用点/秒,失败全额返还)。超过 3 分钟自动分段渲染 + 叠化拼接;支持多任务并行、断点续跑——中途关掉页面,回来还能接着跑。成品在任务列表查看下载。

常见问题

和「数字人视频生成」模块有什么区别?
「数字人视频生成」是手动模式:文案、配音、照片都自己准备,适合精细控制;「流水生产线」是自动模式:一个主题进去、成片出来,适合批量做课。两者产物相同,可搭配使用。
整体费用怎么估?
编剧免费;配音 2 点/百字(约 300 字/分钟);视频合成 1 点/秒;AI 形象 2 点/张。以 5 分钟视频为例:配音约 30 点 + 合成约 300 点。失败全额返还,费用全程透明。
中途断网或关页面会怎样?
流水线支持断点续跑:任务状态保存在服务器,重新打开页面即可从断点继续,不会重复计费。

数字人视频教学(进入课程) 进入模块

数字人教师课程入口。由数字人教师主讲的视频课程,结合课程内容进行讲解演示,为您提供沉浸式的学习体验。

三步上手

1
选择课程:在课程列表中找到您要学习的课程。
2
进入学习:点击课程进入数字人教学页面。
3
跟随讲解:按课程节奏学习,可随时暂停回放。

常见问题

视频卡顿怎么办?
请检查网络状况;校园网环境下如持续卡顿,可尝试切换网络或错峰学习。

语音对话 · 小语同学 进入模块

纯语音的 AI 对话伙伴"小语同学"。无需打字,开口即聊:您说话它倾听,它回答有声音有情感,是随身携带的口语练习搭档,特别适合英语听说训练和随时随地的问答互动。

三步上手

1
允许麦克风权限,进入对话界面。
2
按住或直接说话,小语同学会实时聆听。
3
聆听它的语音回答,像打电话一样自然交流。

常见问题

手机上能用吗?
可以。微信中打开或手机浏览器访问均可,建议佩戴耳机以获得更清晰的声音效果。
支持英文对话吗?
支持。直接用英语和它交流即可,是练习英语口语的理想语伴。

虚拟角色对话室 进入模块

与 AI 扮演的历史人物、文学角色、科学家实时对话,探究其思想与时代背景。支持语音(可免提)与文字两种交流方式;对话结束后自动生成"思维闪光点"报告,点出您提问中的亮点与可深化之处,让沉浸式学习可评估、可沉淀。

三步上手

1
选择人物:在人物大厅点击一位角色(苏格拉底、钱学森、莎士比亚……),进入对话房间。
2
开聊:打字或直接说话(可开免提像打电话一样自然交流);点击人物的开场白可收听语音。
3
生成报告:对话数轮后点击"思维闪光点报告",查看对您提问质量的点评与深化建议;报告可保存、可复制。

常见问题

角色的语音回复可以反复听吗?
可以。每条角色回复旁都有播放按钮,点击即可重听语音,方便跟读与模仿。
如何收费?
每个账号享有充裕的免费体验轮次;超出后登录用户按 1 信用点/条对话计费,页面顶部会实时显示剩余额度。
老师能定制自己课程需要的角色吗?
可以!这正是"教师定制对话室"服务——由您设定角色、教学目标,生成班级专属房间,学生扫码即用,对话全文为您沉淀。详见下方"教师定制对话室"版块。

语言情景对话模拟器 进入模块

沉浸式角色扮演口语陪练。机场值机、餐厅点餐、求职面试、酒店入住、生命健康、人工智能等 12 个情景主题:AI 扮演情景角色实时回应您说的内容,并即时纠正发音、语法与表达得体性;难度随您的水平自适应调节——外语口语课和职业场景实训的"无限陪练"。

三步上手

1
选择情景:在情景大厅点击一个主题(如"机场值机"),进入对话房间,收听 AI 的开场引导。
2
开口扮演:用语音(可免提)或文字进入角色,完成情景任务;AI 会即时回应并给出表达建议。
3
复盘提升:结束后生成总结报告,回顾自己的亮点表达与待改进之处。

常见问题

和"虚拟角色对话"有什么区别?
角色对话侧重探究人物思想(文史哲、思政场景);情景对话侧重语言技能训练,有明确的场景任务、纠错反馈与难度分级,更适合口语课与职业实训。
我英语基础弱,跟不上怎么办?
AI 会根据您的实际表达自动降低语速与用词难度;您也可以直接用中文夹英文过渡,它会耐心引导您完成场景任务。
老师能定制自己课程的情景吗?
可以!在"教师定制对话室"中描述您需要的场景(如"医学英语问诊""外贸谈判"),AI 将为您生成班级专属情景房间。详见下方"教师定制对话室"版块。

教师定制对话室(付费服务) 进入模块

面向教师的专属定制服务:您设定角色/情景与教学目标,AI 生成班级专属对话房间;可上传您的照片(显示在房间顶部)与 9 秒声音样本(克隆专属音色)。学生扫码即用、无需下载 App;每个学生的对话全文为您沉淀,是过程性评价与教学科研的一手素材。

深度阅读《从微信群到自主学习室——为什么每位教师都需要一间专属 AI 对话室》,一份写给教师的产品说明书,欢迎转发给同事。

三步完成定制

1
填写定制表单(约 5 分钟):选房型(角色/情景),写教学目标与设定,可选上传照片与声音样本。
2
AI 生成,预览确认:AI 生成角色人格与开场白,您满意后再发布;含 3 次免费重新生成。
3
发布分享码:链接/二维码发到班级群,学生扫码即用;在"我的定制"后台查看学生对话全文、管理房间。

常见问题

价格是多少?
单个定制 ¥180(首年,含 AI 生成 + 3 次重新生成);三室套餐 ¥399(单个低至 ¥133);次年续费 ¥99/年。
学生需要注册吗?会产生费用吗?
学生无需下载 App,免登录即可体验 50 轮;继续学习需登录,之后按 1 信用点/条在学生自己账户计费,与您的定制费无关。您本人使用自己的房间永久免费。
学生的对话数据谁能看到?
只有您(房间创建者)能在"我的定制"后台查看本房间学生的对话全文;学生之间互相不可见。
对上传的照片和声音有什么要求?
照片:JPG/PNG 不超过 5MB。声音:WAV 格式、16000Hz、单声道、16 位、5~9 秒清晰人声(无背景音乐),可用剪映或 Audacity 导出。上传即视为您确认拥有合法授权。

《理解当代中国》智能语伴 进入模块

专为《理解当代中国》课程打造的 AI 学习语伴。围绕课文内容陪您自主学习:答疑解惑、词汇讲解、跟读练习、观点讨论,让课本学习从"自己啃"变成"有人陪"。

三步上手

1
选择单元:进入正在学习的课文单元。
2
开始互动:就课文内容提问、跟读或讨论。
3
巩固复习:根据语伴的反馈针对性强化薄弱点。

常见问题

语伴的回答都依据课文吗?
语伴优先围绕所选单元的课文内容展开,也可以适度拓展相关背景知识,帮助您加深理解。
适合课前预习还是课后复习?
都适合。课前用它扫清生词和背景障碍,课后用它讨论观点、巩固表达。

参考音频库 进入模块

语音克隆的"音色仓库"。这里集中管理可用于克隆的参考音频,每条音频配有昵称、性别、描述和试听。在"语音克隆"页面点击"更多参考音频"即可跳转到本库挑选。

三步上手

1
试听:点击每条的播放按钮,找到满意的音色。
2
选取:点击"选取",系统自动跳回语音克隆页并载入该音频。
3
回到克隆页继续正常合成流程即可。

常见问题

音频时长为什么都不超过 9 秒?
语音克隆模型对参考音频长度有上限要求,过长的部分无法参与克隆,因此库中音频统一裁剪至 9 秒以内以保证最佳效果。
可以上传自己的音频吗?
可以。建议录制 3-9 秒清晰人声(无背景音乐、无噪音),上传后同样需要填写准确的参考文本。

我的账户 进入模块

账户中心。查看您的使用情况、消费明细和账户余额,管理个人服务。

三步上手

1
登录后从导航栏进入"我的账户"。
2
查看明细:余额、消费记录一目了然。
3
如需充值或咨询,请联系管理员

常见问题

看不到"我的账户"菜单?
该入口仅对已登录用户显示,请先登录。

通用问题

推荐用什么浏览器?
推荐 Chrome、Edge 最新版;手机端可用微信内置浏览器。语音类功能需要浏览器支持并授权麦克风。
生成的语音/视频可以商用吗?
平台生成的内容供教学与学习使用。请确保您使用的参考音频、照片等素材已获合法授权,勿用于侵犯他人声音权、肖像权的用途。
功能异常时怎么办?
先刷新页面重试;若多次失败,请记录:哪个模块、操作到哪一步、页面提示什么,然后联系管理员排查。
找不到答案怎么办?
试试系统答疑——官方答疑助手 7×24 在线,功能用法、账号计费、教师定制,有问必答,完全免费。
可以把平台推荐给同事吗?
欢迎!在微信中打开本指南,点右上角即可把"使用指南"分享给朋友,他们可以从这里直达各功能模块。

技术底座与致谢

艾智语途工场站在开源社区与云计算生态的肩膀上。平台在以下优秀项目与服务之上,完成了面向教学场景的工程化整合、计费体系与内容安全设计。我们尊重各项目的开源许可协议,并向所有为 AIGC 生态做出贡献的开发者致以诚挚谢意。

大语言模型阿里巴巴 Qwen 系列开源大模型、DeepSeek、Kimi(月之暗面)——为智能对话、智能体协作与内容生成提供理解与表达能力。
语音合成GPT-SoVITS(开源语音克隆框架)、Qwen3-TTS(开源声音设计模型)——支撑"语音克隆"与"语音定制"两大配音能力。
语音识别FunASR(阿里达摩院开源语音识别框架)——支撑语音转文字,也是语音对话模块的"耳朵"。
数字人视频阿里云百炼 · 灵动人像云端服务——让一张照片开口讲课,口型同步、表情自然。
基础生态PyTorch、FFmpeg、FastAPI、vLLM 等开源基础设施——是整套系统稳定运转的地基。
平台生成的内容仅供教学与学习使用。请为您上传的参考音频、人物照片等素材取得合法授权,勿用于侵犯他人声音权、肖像权的用途。