Tủ GitHub repo xịn
Avatar OpenBMB

GitHub repo xịn · Vui Coding chọn

OpenBMB/VoxCPM

VoxCPM2 là hệ thống TTS không sử dụng tokenizer, chuyển đổi văn bản thành giọng nói đa ngôn ngữ tự nhiên và biểu cảm cao dựa trên kiến trúc diffusion tự hồi quy. Nó hỗ trợ 30 ngôn ngữ, tạo giọng theo mô tả, sao chép chính xác và phát ra âm thanh chất lượng phòng thu 48kHz.

37,4 NGitHub stars
4,2 NForks
118Open issues
4Lượt nhấp GitHub
PythonNgôn ngữ chính

Tóm tắt nhanh

Repo này làm được gì?

VoxCPM2 là hệ thống TTS không sử dụng tokenizer, chuyển đổi văn bản thành giọng nói đa ngôn ngữ tự nhiên và biểu cảm cao dựa trên kiến trúc diffusion tự hồi quy. Nó hỗ trợ 30 ngôn ngữ, tạo giọng theo mô tả, sao chép chính xác và phát ra âm thanh chất lượng phòng thu 48kHz.

Mô tả từ GitHub

VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning

Bắt đầu với repo

Cài đặt và sử dụng

Hướng dẫn cài đặt

1. Cài đặt môi trường Python ≥ 3.10 với PyTorch ≥ 2.5.0 và CUDA ≥ 12.0. 2. Chạy lệnh:

pip install voxcpm

để cài đặt. 3. (Tùy chọn) Nếu muốn dùng pretrained model từ ModelScope, chạy:

pip install modelscope

và sử dụng `snapshot_download` để lấy mô hình. 4. Tải mô hình về và sử dụng API theo hướng dẫn trong tài liệu.

Hướng dẫn sử dụng

1. Khởi tạo mô hình:

from voxcpm import VoxCPM
model = VoxCPM.from_pretrained('openbmb/VoxCPM2', load_denoiser=False)

2. Chuyển đổi văn bản thành giọng nói:

wav = model.generate(text='VoxCPM2 is the current recommended release for realistic multilingual speech synthesis.', cfg_value=2.0, inference_timesteps=10, seed=42)

3. Lưu file âm thanh:

import soundfile as sf
sf.write('demo.wav', wav, model.tts_model.sample_rate)

4. Để dùng chế độ thiết kế giọng nói, clone giọng, hoặc phát trực tiếp, làm theo ví dụ trong hướng dẫn sử dụng API.

Đối chiếu README gốc

Chủ đề liên quan

#audio#deeplearning#minicpm#multilingual#python#pytorch#speech#speech-synthesis#text-to-speech#tts#tts-model#voice-cloning
Mở trên GitHub

Cùng hệ sinh thái

Repo liên quan