Last updated on

VoxCPMTTS


快速入门 - VoxCPM 2.0 文档

一、老规矩,新建文件夹,创立隔离环境

mkdir E:\voxcpm-project
cd E:\voxcpm-project

1.1、使用 3.12 创建虚拟环境

C:\Users\wrpsg\AppData\Local\Programs\Python\Python312\python.exe -m venv voxcpm_env

1.2、激活环境

.\voxcpm_env\Scripts\Activate.ps1

1.3、检查版本

python --version

日志示例:

环境检查示例

二、安装项目

2.1

pip install voxcpm

安装 VoxCPM

2.2

验证 CUDA 显卡加速:

python -c "import torch; print('Torch CUDA可用:', torch.cuda.is_available()); print('GPU型号:', torch.cuda.get_device_name(0))"

如果上一步出现错误,就是 Python 版本没有对应轮子,卸载 PyTorch 后再去这里找对应轮子:

python --version
nvidia-smi

CUDA 与 Python 版本检查

找到后记得:

  1. 先彻底卸载 CPU 版 torch 三件套
pip uninstall torch torchvision torchaudio -y
  1. 清理 pip 缓存,防止它偷懒用旧包
pip cache purge
  1. 从清华源 + 官方 nightly/cu130 安装
pip install --pre torch torchvision torchaudio -i https://pypi.tuna.tsinghua.edu.cn/simple --extra-index-url https://download.pytorch.org/whl/nightly/cu130 --timeout 1000 --no-cache-dir

成功后:

PyTorch 安装成功

三、下载模型并测试

先切换国内镜像:

$env:HF_ENDPOINT = "https://hf-mirror.com"

运行测试代码(会自动拉取模型):

python -c "
from voxcpm import VoxCPM
import soundfile as sf

model = VoxCPM.from_pretrained(
    'openbmb/VoxCPM2',
    load_denoiser=False,
)

wav = model.generate(
    text='Hello, this is a test of VoxCPM running on my RTX 5060 Ti GPU.',
    cfg_value=2.0,
    inference_timesteps=10,
)

sf.write('test_output.wav', wav, model.tts_model.sample_rate)
print('✅ 音频已保存为 test_output.wav')
"

如果拉取失败,从 ModelScope 下载所有文件,放到本地目录,例如:

E:\llama-models\models\voxcpm2\

请确保这 7 个文件都在该目录下:

  • model.safetensors
  • audiovae.pth
  • config.json
  • tokenizer.json
  • tokenizer_config.json
  • special_tokens_map.json
  • tokenization_voxcpm2.py

然后直接指定本地路径加载:

python -c "
from voxcpm import VoxCPM
import soundfile as sf

model = VoxCPM.from_pretrained(
    'E:/llama-models/models/voxcpm2',
    load_denoiser=False,
)

wav = model.generate(
    text='你好,这是使用本地模型文件的测试。',
    cfg_value=2.0,
    inference_timesteps=10,
)

sf.write('test_local.wav', wav, model.tts_model.sample_rate)
print('✅ 音频已保存为 test_local.wav')
"

成功后如图:

本地模型测试成功

测试音频文件:

测试音频结果

四、如果想要图形界面

git clone https://github.com/OpenBMB/VoxCPM.git
cd VoxCPM
pip install -e .
python app.py --port 8877 --host 127.0.0.1 --model-id E:/llama-models/models/voxcpm2

启动 Web 界面

五、补充说明

速度不满意? Triton 在 Windows 50 系列显卡上加速效果不太明显,只有大约 5% 左右。换其他项目,或用更低精度模型。

相关推荐