3 分钟救回被噪音毁掉的录音:ClearerVoice-Studio AI 语音处理上手指南
【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio
如果你正被录音里的空调声、键盘声、背景人声折磨,这篇文章是写给你的。ClearerVoice-Studio 是一款开源的 AI 语音处理工具包,几行代码就能完成语音增强、人声分离、音质提升等操作,免费开源,新手也能快速上手。
先讲个真实场景:凌晨一点,录音"废"了
上周我熬夜剪一期播客,剪到凌晨一点导出,回放才发现整段人声背后全是空调的嗡嗡声和敲键盘的哒哒声。重新录?嘉宾档期约不上了。花钱找人修?报价高得离谱。后来同事丢给我一个开源项目,说"你跑两行命令试试"。试完我愣住了——那段以为要报废的录音,人声变得干净透亮,背景噪音像被橡皮擦擦掉了一样。这个项目,就是 ClearerVoice-Studio。
一句话看懂:它是声音界的"AI 修图师"
美图软件给照片"磨皮祛痘",ClearerVoice-Studio 则给声音做同样的事:自动识别并抹掉噪音、把混在一起的说话人分开、把模糊的音质变清晰。它由三部分组成:
- ClearVoice:开箱即用的推理入口,加载预训练模型,几行代码出结果;
- Train:面向开发者的训练与微调框架,想定制自己的模型就看这里;
- SpeechScore:客观评测工具,量化"处理完到底变好了多少"。
内容创作者、想给产品加语音能力的开发者、只想抢救老录音的普通用户,它都适用。
处理前 vs 处理后:一张表看懂它能做什么
| 你的痛点 | 对应任务 | 现成预训练模型 | 效果对比 |
|---|---|---|---|
| 背景噪音太重 | 语音增强 | FRCRN_SE_16K、MossFormerGAN_SE_16K、MossFormer2_SE_48K | DNS 测试集 PESQ 从 1.58 提到 3.57 |
| 多人说话分不清 | 语音分离 | MossFormer2_SS_16K | 一次输出两条音轨,LRS2-2Mix 上 SI-SNRi 达 15.5 |
| 老录音音质发闷 | 语音超分辨率 | MossFormer2_SR_48K | 16kHz/24kHz/32kHz 补全到 48kHz |
| 视频里只想要特定人声 | 目标说话人提取 | AV_MossFormer2_TSE_16K | 结合画面人脸与口型提取目标声音 |
换句话说:从"听不清"到"听清",从"混在一起"到"各归各位",它全包了。
四个真实场景,手把手带你跑通
开工前:两条命令装好环境
pip install clearvoice装好后在代码里写from clearvoice import ClearVoice即可开工。只处理 WAV 的话这步就够;要处理 MP3、AAC、FLAC 等格式,再补装一个 FFmpeg。想从源码安装或参与开发,可以git clone https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio后进入clearvoice/目录执行pip install --editable .。仓库自带的demo.py、demo_with_more_comments.py可直接运行,python demo.py就能看到完整效果。
场景一:会议录音去噪,让领导听清你的汇报
from clearvoice import ClearVoice myClearVoice = ClearVoice(task='speech_enhancement', model_names=['MossFormer2_SE_48K']) output_wav = myClearVoice(input_path='samples/input.wav', online_write=False) myClearVoice.write(output_wav, output_path='samples/output_enhanced.wav')大白话解释:第一行创建了一个"去噪器",指定使用全频带模型 MossFormer2_SE_48K;第二行把input.wav丢进去,模型返回处理后的音频数据;第三行把结果存成新文件。跑完直接播放对比,噪音基本消失、人声完整保留,模型文件会在首次运行时自动下载。这个语音降噪工具还提供 FRCRN_SE_16K、MossFormerGAN_SE_16K 两个 16kHz 版本,前者更轻快、后者效果更佳,按需挑选即可。
场景二:多人访谈人声分离,把两把声音拆开
myClearVoice = ClearVoice(task='speech_separation', model_names=['MossFormer2_SS_16K']) output_wav = myClearVoice(input_path='samples/input_ss.wav', online_write=False) myClearVoice.write(output_wav, output_path='samples/output_separated.wav')代码几乎没变,只是把任务换成了speech_separation。它会将混在一起的两路人声分别输出为..._s1.wav和..._s2.wav,相当于自动帮你"分轨"。在 LRS2-2Mix、WSJ0-2Mix 等公开基准上,MossFormer2_SS_16K 的分离指标超过了 Conv-TasNet 等经典模型,处于开源方案的第一梯队。
场景三:老旧录音的音频质量提升方法,从"糊"到"清"
采样率可以理解为声音的"清晰度档位":16kHz 相当于低清视频,48kHz 才接近高清。MossFormer2_SR_48K 能把低采样率音频"脑补"到 48kHz,让老录音丢失的高频细节回来。
myClearVoice = ClearVoice(task='speech_super_resolution', model_names=['MossFormer2_SR_48K']) output_wav = myClearVoice(input_path='samples/input_sr.wav', online_write=False) myClearVoice.write(output_wav, output_path='samples/output_sr_48k.wav')如果音频又旧又吵,可以先用增强模型去噪、再做超分辨率,两步串起来就是一条完整的"翻新流水线"。
场景四:视频里只留下想听的那个人的声音
多人同框说话时,怎么只提取其中一人的声音?AV_MossFormer2_TSE_16K 结合画面中的人脸与口型信息,把目标说话人的声音从混合音轨里"抠"出来。传入视频目录即可批量处理(支持 .avi/.mp4/.mov/.webm):
myClearVoice = ClearVoice(task='target_speaker_extraction', model_names=['AV_MossFormer2_TSE_16K']) myClearVoice(input_path='samples/path_to_input_videos_tse', online_write=True, output_path='samples/path_to_output_videos_tse')此外,项目还提供 Numpy 进 Numpy 出的接口(见 demo_Numpy2Numpy.py),方便把模型直接嵌进你自己的训练或推理管线。
效果好不好,让数字说话
光靠耳朵不够客观。SpeechScore 模块提供 18 种评测指标,最常用的四个:
- PESQ:感知语音质量,约 0.5~4.5,越大越好——MossFormerGAN_SE_16K 在 DNS-Challenge-2020 上把 PESQ 从 1.58 拉到 3.57;
- STOI:可懂度,0~1,越接近 1 越清楚;
- DNSMOS:神经网络打的 MOS 分,1~5 分制;
- SI-SDR:信号失真比(dB),越高代表分离与增强越干净。
评测代码同样一行启动:SpeechScore(['PESQ','STOI','DNSMOS','SISDR']),传入测试音频与参考音频即可。其中 DNSMOS、NISQA 这类"非侵入式"指标甚至不需要干净参考,直接给处理结果打分,相当方便。
进阶玩法与新手避坑指南
想让模型适配自己的数据?train/ 目录下有四类任务的完整训练脚本,配置集中在train/speech_enhancement/config/train/等目录,还附带自动合成带噪、带混响训练音频的数据生成脚本(train/data_generation/)。更硬核的是,目标说话人提取支持用参考语音、人脸口型、身体姿态乃至脑电信号(EEG)作为提取条件。
新手最常踩的坑有三个:
- 非 WAV 格式报错:处理 MP3/AAC/FLAC 前先装 FFmpeg,纯 WAV 不需要;
- 长音频卡顿或爆内存:建议先切成 30~60 秒片段,或用目录/列表批量处理(
online_write=True); - 模型下载失败:首次运行需联网自动拉取预训练模型,网络不稳时可手动从 ModelScope 下载放到
checkpoints目录。
你可能担心的 3 件事
① 不会写代码能用吗?能。复制上面的代码、改一下文件路径就行;demo_with_more_comments.py每步都有详细注释,照着读就能懂。
② 支持哪些系统和格式?Windows、macOS、Linux 都能跑;音频支持 wav、mp3、aac、flac、ogg、aiff 等十几种常见格式,视频支持 avi、mp4、mov、webm。
③ 效果真的靠谱吗?预训练模型出自阿里巴巴语音实验室团队,全部经过公开基准严格评测(上文指标就是证据);其中 FRCRN 去噪模型在 ModelScope 上已被调用超过 300 万次,口碑经得起检验。
现在就去试试:3 分钟体验 AI 语音处理
回到开头那个深夜剪播客的场景:如果你硬盘里也躺着"舍不得删又没法用"的录音,现在花 3 分钟就能给它第二次生命。装好clearvoice后跑一遍demo.py,用samples/里的示例音频对比"处理前 vs 处理后"的差别,你会回来收藏这篇文章的。
想第一时间获取新模型和使用教程?扫描下方二维码加入官方交流群,和开发者、同好一起聊语音增强与处理心得;如果你有更好的模型思路,也欢迎通过 train/ 框架贡献代码,让更多人用上更干净的声音。
【免费下载链接】ClearerVoice-StudioAn AI-Powered Speech Processing Toolkit and Open Source SOTA Pretrained Models, Supporting Speech Enhancement, Separation, and Target Speaker Extraction, etc.项目地址: https://gitcode.com/gh_mirrors/cl/ClearerVoice-Studio
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考