GitHub repo xịn · Vui Coding chọn
OpenBMB/VoxCPM
VoxCPM2 là hệ thống TTS không sử dụng tokenizer, chuyển đổi văn bản thành giọng nói đa ngôn ngữ tự nhiên và biểu cảm cao dựa trên kiến trúc diffusion tự hồi quy. Nó hỗ trợ 30 ngôn ngữ, tạo giọng theo mô tả, sao chép chính xác và phát ra âm thanh chất lượng phòng thu 48kHz.
Tóm tắt nhanh
Repo này làm được gì?
VoxCPM2 là hệ thống TTS không sử dụng tokenizer, chuyển đổi văn bản thành giọng nói đa ngôn ngữ tự nhiên và biểu cảm cao dựa trên kiến trúc diffusion tự hồi quy. Nó hỗ trợ 30 ngôn ngữ, tạo giọng theo mô tả, sao chép chính xác và phát ra âm thanh chất lượng phòng thu 48kHz.
Mô tả từ GitHub
VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning
Bắt đầu với repo
Cài đặt và sử dụng
Hướng dẫn cài đặt
1. Cài đặt môi trường Python ≥ 3.10 với PyTorch ≥ 2.5.0 và CUDA ≥ 12.0. 2. Chạy lệnh:
pip install voxcpmđể cài đặt. 3. (Tùy chọn) Nếu muốn dùng pretrained model từ ModelScope, chạy:
pip install modelscopevà sử dụng `snapshot_download` để lấy mô hình. 4. Tải mô hình về và sử dụng API theo hướng dẫn trong tài liệu.
Hướng dẫn sử dụng
1. Khởi tạo mô hình:
from voxcpm import VoxCPM
model = VoxCPM.from_pretrained('openbmb/VoxCPM2', load_denoiser=False)2. Chuyển đổi văn bản thành giọng nói:
wav = model.generate(text='VoxCPM2 is the current recommended release for realistic multilingual speech synthesis.', cfg_value=2.0, inference_timesteps=10, seed=42)3. Lưu file âm thanh:
import soundfile as sf
sf.write('demo.wav', wav, model.tts_model.sample_rate)4. Để dùng chế độ thiết kế giọng nói, clone giọng, hoặc phát trực tiếp, làm theo ví dụ trong hướng dẫn sử dụng API.
