aifooler人声分离适用场景
适合双人采访、会议双人对话、影视片段对白、通话录音、直播切片素材处理;支持MP3、M4A、WAV、FLAC以及MP4视频文件。主要处理两个人交替说话、少量短暂重叠的录音;如果长时间两个人同时大声说话,会存在少量串音残留。
双人声音分离操作步骤
1、上传音频或者视频文件
打开AIFooler直接拖拽本地音频,也可以点击选择文件上传。如果原始录音底噪、杂音很大,建议先做AI降噪处理,再进行人声分离,提升分离效果。

2、选择重叠人声分离模型
上传完成后,选中重叠说话人声分离/男女声/和声三种模型,该模型专门针对不同的双人对话训练,区分不同人的音色特征。确认文件无误,点击开始处理,页面保持打开不要关闭,等待AI运算解析音频。

3、试听并下载两条独立人声轨道
处理完成后,会生成两条独立的人声音频,分别对应两个说话人。在线逐条试听,分辨哪一条对应哪个人的声音,确认效果之后,分别下载保存到本地。

人声分离不干净怎么办?
使用AI进行人声分离后,如果发现伴奏残留、杂音较多,或者另一位说话人的声音混在当前音轨中,不一定是分离失败。不同类型的音频问题,需要采用不同的处理方式。
1、伴奏或BGM残留
如果原始音频同时包含人声和背景音乐,导致分离后的人声中仍然残留音乐。那就先使用AIFooler进行人声与伴奏分离,先提取相对干净的人声,再使用重叠人声分离功能处理两个人的声音。

2、另一人的声音残留
如果分离后的一条人声音轨中还能听到另一人的声音,通常与两个人同时说话、声音重叠有关。
对于短时间的声音重叠,可以尝试重新处理;如果两个人长时间同时说话,或者两个人的音色非常接近,AI很难完全区分两个声源,可能会产生少量串音。
3、分离后出现杂音
人声分离过程中出现轻微杂音,可能与原始录音中的环境噪音、回声、混响以及音频压缩有关。如果主要是非人声的杂音,可以先对原始录音进行降噪处理,再重新进行人声分离。

4、声音出现失真或不自然
声音发闷、断续、金属音或者部分字词缺失,优先使用原始高质量音频进行处理,尽量避免使用经过多次转码、压缩或从社交平台下载后再次处理的文件。
5、混响和回声太严重
录音环境较空旷,或者使用带有明显混响效果的音频。可以先降低混响和回声,再进行人声分离。对于已经存在严重混响的录音,完全消除残留声音可能比较困难。

双人分离实用技巧
- 原始录音质量越高,分离效果越好,尽量使用原版高音质文件,不要用二次压缩后的音频。
- 音频混响过重、回声大,会降低分离精度,条件允许优先先去除混响,再做分离。
- 遇到短暂串音、另一人微弱声音残留,可以对分离后的音频再做轻度降噪优化。
- 如果音频时长很长,可以先裁剪截取关键片段,分段处理,减少处理耗时。
- 音色相似度很高的两个人,分离难度会提升,很难做到100%完全无残留。











