[开源推荐] AuK-语音编辑模型
Author: ZhikangNiuCreated Sep 15, 2026Updated Sep 15, 2026
项目地址
https://github.com/Tencent-Hunyuan/AuK
类别
Python
项目标题
一款通过自然语言指令完成语音生成与编辑的模型。
项目描述
项目团队自荐一个开源项目:AuK,一款通过自然语言指令完成语音生成与编辑的模型。
一段配音录好后,可能需要修改几个字、调整说话情绪,或者清理背景噪声。AuK 将这些能力整合进同一个模型,让使用者通过文字描述需要怎样生成或修改声音。
项目地址:Tencent-Hunyuan/AuK 在线体验:ModelScope · Hugging Face 项目主页:AuK
可以做什么
- 修改台词:对已有录音中的文字进行替换、插入或删除,例如将“明天上午开会”改成“周五下午开会”。
- 调整说话方式:改变情绪、音色、语速、音高和音量,也支持耳语与正常说话之间的转换。
- 声音克隆与配音:提供一段参考音频,让模型用相似的声音朗读新文本;也可以直接描述声音特点生成语音,无需参考录音。
- 降噪与人声分离:去除噪声和混响,从多人对话中保留指定说话人,或从歌曲中提取人声。
- 歌词编辑:修改演唱录音中的歌词,并尽量保留原有旋律与声音特征。
其中,语音生成关注“让文字变成声音”,语音编辑关注“让已有声音按要求发生变化”。AuK 同时覆盖这两类任务,可用于配音制作、播客后期和语音应用开发等场景。
开源与使用方式
- 代码与模型权重均已公开,采用 MIT 协议。
- 提供 AuK Base 和 AuK-Flash 两个版本,分别侧重生成质量与推理速度。
- 提供 Python API、命令行工具、Gradio 网页界面和 ComfyUI 节点,支持本地部署。
- 提供微调代码与文档,便于开发者基于自己的数据继续适配。
项目当前主要面向中文和英文语音。读者可以先通过在线演示体验效果,再根据需要进行本地部署或二次开发。
项目团队欢迎试用反馈、问题报告和社区贡献。声音克隆与录音编辑请使用已获授权的素材。
亮点
可以做什么
- 修改台词:对已有录音中的文字进行替换、插入或删除,例如将“明天上午开会”改成“周五下午开会”。
- 调整说话方式:改变情绪、音色、语速、音高和音量,也支持耳语与正常说话之间的转换。
- 声音克隆与配音:提供一段参考音频,让模型用相似的声音朗读新文本;也可以直接描述声音特点生成语音,无需参考录音。
- 降噪与人声分离:去除噪声和混响,从多人对话中保留指定说话人,或从歌曲中提取人声。
- 歌词编辑:修改演唱录音中的歌词,并尽量保留原有旋律与声音特征。
其中,语音生成关注“让文字变成声音”,语音编辑关注“让已有声音按要求发生变化”。AuK 同时覆盖这两类任务,可用于配音制作、播客后期和语音应用开发等场景。
示例代码
截图或演示视频
No response
Source: 521xueweihan/HelloGitHub