简介说明
RVC 2.3.260718 是这个项目三年来首次大更新。旧模型可以直接放进新版继续使用,界面操作更加简化,新加入了 FCPE 音高算法和 CUDA Graph 实时推理优化。
完整版整合包
整合包分为三档:
NVIDIA 50 系列以下显卡
下载 RVC20260718Nvidia.7z
NVIDIA 50 系列及以上显卡
下载 RVC20260718Nvidia50x0.7z
该版整合包需要先将显卡驱动升级到最新版本,再下载并默认安装 CUDA 12.8.1。
AMD / Intel GPU
下载 RVC20260718AMD_Intel.7z

主要升级功能
1. WebUI 操作更加简化
推理模型和特征索引文件可以自动关联。
支持拖拽、上传音频文件。
新增 FCPE 音高算法。

模型训练可以中途停止,恢复训练时能够从上一次检查点继续。

2. 实时变声功能变化
新版增加了 CUDA Graph 加速。使用 RTX 4060 实测时,开启加速后界面显示的实际延时变化并不明显;从后端推理耗时看,开启加速后每次推理约为 0.08 秒,关闭时约为 0.11 秒。

界面还增加了性别/声线调节功能,支持在变声过程中实时调整。

3. 人声伴奏分离增加新模型
人声伴奏分离新增模型:model_bs_roformer_ep_317_sdr_12.9755。
RVC AI 翻唱基本流程
1. 准备训练素材
建议准备至少 10 分钟的干净音频,说话录音或歌唱干声都可以。
2. 训练模型
建议勾选音高指导,基础模型选择 V2,音高提取算法选择 RMVPE。总轮数应根据训练素材时长决定,可参考下表:
| 训练素材时长 | 建议总轮数 | 保存频率 | 显存缓存 | 评价 |
|---|---|---|---|---|
| 少于 3 分钟 | 不建议正式训练;强行训练约 400~600 轮 | 25~50 | 可尝试 | 极易过拟合,歌唱音域覆盖严重不足 |
| 3~5 分钟 | 350~500 | 25 | 可尝试 | 只适合试验或非常单一的音色 |
| 5~10 分钟 | 280~450 | 20~25 | 8GB 建议关闭 | 可用,但需要注意过拟合 |
| 10~20 分钟 | 150~280 | 10~20 | 关闭 | 最常见且性价比较高 |
| 20~40 分钟 | 80~160 | 10 | 关闭 | 音色和音域覆盖通常更稳定 |
| 40~60 分钟 | 50~100 | 5~10 | 关闭 | 不必机械训练几百轮 |
| 60 分钟以上 | 30~80 | 5~10 | 关闭 | 应按实际训练 step 和试听结果停止 |
3. 分离人声与伴奏
第一轮使用 HP5 或 model_bs_roformer_ep_317_sdr_12.9755 进行人声伴奏分离。
不要采用 BS-Roformer → HP5 → HP2 这种连续分离方式;应该分别试听不同首轮模型的结果,选择效果最好的一份。

第二轮使用 VR-DeEchoDeReverb 去除回声和混响。

如果仍有残留混响,可以再用 FoxJoy 分离一次。不要分离三轮以上,否则原唱人声的细节会明显丢失。
4. 挑选训练好的模型
建议先从最后三轮保存的模型开始试听翻唱效果,不要默认使用最后一轮。
5. 调整翻唱效果
实测 RMVPE 和 FCPE 对高音的处理效果相差不大。如果翻唱后出现声音撕裂或哑音,可以调整“保护清辅音和呼吸声,防止电音撕裂等 artifact”参数,将默认值 0.33 调为 0.3 或更低再尝试。
实时变声参数说明
常规设置
| 选项 | 实际作用 | 调高/调低后的效果 |
|---|---|---|
| 响应阈值 | 输入端静音门,范围 -60~0 dB | 数值越高,越小的声音越容易被判定为静音 |
| 音调设置 | 整体升降音高,范围 -16~+16 个半音 | 正数升调,负数降调;+12 为升一个八度 |
| 性别因子/声线粗细 | 尽量保持音高不变,只移动共振峰,范围 -2~+2 | 正数更亮、更细;负数更暗、更粗 |
| Index Rate | 索引检索特征与原始特征的混合比例,范围 0~1 | 越高越贴近训练角色,越低越保留输入发音 |
| 响度因子 | 输入音量包络和模型原生音量之间的取舍,范围 0~1 | 0 跟随麦克风音量,1 保留模型原生响度 |
| 音高算法 | 选择 F0/基频检测方式 | 影响跑调、抖动、延迟和稳定性 |
性能设置
| 选项 | 主要影响 | 典型取舍 |
|---|---|---|
| 采样长度 | 每次处理多少秒音频 | 数值小则延迟低但压力大;数值大则延迟高但更稳定 |
| 淡入淡出长度 | 相邻输出块的衔接长度 | 长一些更平滑,但会增加延迟 |
| 额外推理时长 | 模型每次参考的历史上下文 | 长一些更连贯,但计算量更大 |
| 输入降噪 | 转换前清理麦克风噪声 | 减少底噪,也可能吃掉轻声 |
| 输出降噪 | 转换后清理模型输出噪声 | 减少嘶声,也可能损失细节 |
实际使用方法
RVC 的基本流程并不复杂,通常可以概括为:准备音频素材、训练声音模型、提取特征索引、选择模型进行转换,最后对结果进行试听和调整。
如果只是体验 AI 翻唱,建议先使用别人训练好的模型,熟悉音高、索引比例和音频处理流程之后,再尝试训练自己的模型。自行训练模型需要准备较干净的声音素材,前期素材质量往往比训练时长更重要。
训练自己的声音模型
训练素材建议满足以下条件:
尽量使用单人、单一音色的干声录音
避免背景音乐、混响、杂音和明显电流声
普通语音建议准备至少 10 分钟
如果用于 AI 翻唱,最好加入覆盖中低音和高音的清唱素材
不要把多人对话、多人合唱或带强烈伴奏的音频直接用于训练
音频音量尽量保持稳定,避免忽大忽小
如果训练素材只有普通说话声,模型通常可以较好地还原日常语音,但在高音、真假声转换和唱腔表现上可能不够稳定。想制作 AI 翻唱模型,就需要准备一定数量的清唱或干声演唱素材。
训练轮数不宜盲目拉高。可以先从 200 轮左右开始测试,再根据实际效果决定是否继续训练。训练过程中建议保留多个阶段的模型,不要只使用最后一个模型。部分模型在训练后期可能出现吐字变糊、音色发闷或高音破音等问题,反而是较早保存的模型效果更好。
AI 翻唱的推荐流程
制作 AI 翻唱时,建议先把歌曲分离为人声和伴奏,再使用 RVC 对人声进行音色转换,最后把转换后的人声与伴奏重新混音。
比较稳妥的流程如下:
准备目标歌曲。
使用人声分离工具提取干净的人声。
对人声进行降噪、去混响和音量整理。
在 RVC 中选择声音模型。
根据原唱音域调整变调参数。
设置索引比例并生成转换结果。
将转换后的人声与伴奏重新合成。
对最终音频进行音量、均衡和混响处理。
人声分离时不建议把所有模型全部重复处理。过度分离可能会损失齿音、尾音和细节,导致转换后的人声变得发闷。如果第一轮分离结果已经比较干净,可以直接进入 RVC 转换流程。
变调参数怎么设置
变调主要用于匹配原始人声和目标音色的音域。一般可以按照以下思路尝试:
男声转换为女声:通常需要适当提高音调
女声转换为男声:通常需要适当降低音调
同性别转换:可以先从 0 开始测试
高音破裂或声音发虚:先降低变调幅度,再更换模型试听
声音过于沙哑、发闷:可以尝试降低相关音高或调整索引比例
不要一开始就追求极端参数。建议每次只调整一个参数,并保留试听结果,这样更容易判断到底是哪项设置影响了音质。
索引比例如果设置为 0,索引文件通常不会真正参与推理。使用索引可以改善部分音色细节,但比例过高也可能带来吐字不清、声音发飘等问题。建议从较低比例开始逐步增加。
实时变声使用技巧
实时变声对显卡、音频驱动和虚拟声卡都有一定要求。使用前需要先选择模型和索引文件,再设置麦克风输入与音频输出设备。
如果需要在 OBS、直播软件或语音聊天软件中使用,通常需要借助 VB-CABLE 等虚拟音频设备,把 RVC 的输出转交给目标软件。设置时要注意输入和输出不要形成回路,否则容易产生啸叫或重复收音。
实时变声可以重点调整以下参数:
响应阈值过高,轻声说话可能无法被识别
采样片段越短,延迟越低,但显卡压力越大
普通显卡可以先从 0.25 到 0.3 左右的片段长度开始
淡入淡出参数不宜过大,否则声音衔接会变得明显
推理缓冲时间增加后,连续语音通常更稳定,但延迟也会增加
输入和输出降噪会增加计算量,设备性能有限时不建议同时开启
在 OBS 中,建议只采集变声后的虚拟音频设备,不要同时采集实体麦克风和变声输出,否则会出现原声与变声重叠的问题。
硬件与版本选择
RVC 对显卡有一定依赖,但并不意味着必须使用高端显卡。普通 NVIDIA 显卡也可以完成基础训练、音色转换和实时变声,只是训练速度和实时延迟会有所不同。
下载整合包时,需要根据显卡型号选择对应版本:
RTX 50 系列优先选择支持 CUDA 12.8 的专用版本
RTX 40、30、20 系列按照对应 CUDA 版本选择
AMD 和 Intel 显卡需要选择项目提供的兼容版本
没有独立显卡的设备可以尝试 CPU 模式,但训练和实时变声速度会明显降低
如果主要用途是 AI 翻唱,建议优先升级到新版,新的界面和处理流程更加方便。如果主要使用实时变声,旧版本已经能够满足基本需求,也可以先确认新版驱动和运行环境是否稳定后再升级。
常见问题
训练出来的声音不像本人,通常与训练素材质量、素材数量、音域覆盖和训练轮数有关。先检查素材是否包含杂音、混响和其他人的声音,不要只通过增加训练轮数解决。
高音容易破音,通常是训练素材中缺少相应音域,或者目标歌曲超出了模型的表现范围。可以补充高音清唱素材,也可以更换较早阶段保存的模型进行对比。
声音听起来发闷或吐字不清,可能是人声分离过度、索引比例过高、音频质量较差或变调幅度不合适。建议从原始素材和分离结果开始逐项排查。
实时变声没有声音时,应依次检查麦克风输入、RVC 输出设备、虚拟声卡选择以及目标软件的录音设备。确认设备采样率一致,也可以重新启动音频服务和 RVC。
使用时需要注意
RVC 本质上是声音转换工具,并不是普通意义上的文本转语音工具。它需要输入一段真实的人声或演唱音频,再将其转换为目标音色。
使用他人声音训练模型、制作翻唱或进行公开传播前,应获得本人授权,并遵守当地法律法规以及相关平台规则。未经授权模仿公众人物、歌手或其他个人的声音,可能引发肖像权、声音权益、版权和误导传播等问题。
歌曲本身也可能受到版权保护。AI 翻唱适合用于学习、测试和个人创作,公开发布或商业使用前,应确认歌曲版权、音源授权以及声音模型的使用许可。
总结
RVC 的优势不在于“点一下就得到完美结果”,而在于它给了用户一套可以自行训练、调整和部署的声音转换方案。素材准备得越干净,音域覆盖越完整,最终效果通常越稳定。
对于新手来说,最推荐的方式是先用现成模型体验音频转换,再逐步学习人声分离、模型训练、索引设置和实时变声。不要一次修改太多参数,保留每次试听结果,经过几轮对比后,很快就能找到适合自己的配置。
下载地址
https://github.com/RVC-Project/Retrieval-based-Voice-Conversion-WebUI
https://pan.baidu.com/s/1lzulItBLPbdfdr8ZkcTVyg?pwd=rx2s 提取码: rx2s
https://pan.quark.cn/s/d024bcd1a0e7
https://www.yuque.com/flowercry/hxf0ds
文章转自
https://aixplore.cc/posts/rvc-2-3-realtime-voice-ai-cover
有续写.







评论抢沙发